
一位產品經理,給了工程師、科學家與哲學家每個人一個大語言模型 (LLM),要他們分別設計出一個具有商業競爭力的新產品出來。過了二週,約莫就是一個 Scrum Sprint ,產品經理再次走了過來。
他走進工程師的房間,已經有 POC 可以看了,工程師接著說:「結果很普通對吧?我發現這個模型無從優化,所以我打算去試試另一個 LLM!」他接著走進科學家的房間,白板上滿滿的圖表與數值,科學家說:「我的研究指出,這模型缺乏獨有資料集的話,就不容易做出有差異化的產品!」最後他走進哲學家的房間一看,我的媽呀,裏頭已經有滿滿的人在試用了!產品經理很驚訝,問哲學家怎麼回事。哲學家答道:「很簡單,我不是從產品開發下手,而是關注這個模型的智慧程度,所以我正在執行圖靈測試 (Turing test)!」
不同的人有不同的專業與職務,對於 LLM 與 AI 也就有不同的觀點與期待。最終大家貢獻不同的元素,會在 KKCompany 這個大傘下,逐步匯整出可提供價值、有潛力,同時帶來商業競爭力的產品。
這份電子報也是一樣的多元。從上上期開始,三個調性完全不同的主編群被組織起來:熱愛影像的、鍾情音樂的、熟稔資料的。三組輪流主筆不同期的電子報,帶來不一樣的觀點。想多一點 Data 取向的,可以去回顧 #15;想多點腦神經與智慧探討的,可以去翻閱 #16;而想知道更多 AI, music, multimedia, cloud 的資訊與觀點的,或是想分享給錯過的同事們的,就去翻閱之前的電子報吧!
延伸閱讀:
- #15 AI 會怎麼稱呼自己的爸爸?
- #16 心電感應:玄學還是科學?
- [YT] 2001: A Space Odyssey - Take A Stress Pill And Think Things Over

MusicGen produces diverse and long music samples from user provided text inputs.
AudioCraft: LLM即將影響下一個世代的音樂創作?
在這個擁抱人工智慧的時代,下一世代的音樂創作將展現前所未有的多元面貌。隨著 LLM 技術的崛起,音樂界也將迎來創新的可能性。Meta 近日推出的 AudioCraft 引發了音樂創作者對音樂創作的重新思考,如同 Midjourney 的使用情境,AudioCraft 讓創作者透過使用文字做為引導,一步步生成心中所想像的音樂。這似乎暗示著「prompting technique」可能成為未來音樂家必備的技能。然而,在帶來技術革新的同時,也引發了關於創意真正來源的問題。
無論如何,音樂創作將持續演變,與 LLM 的交融或許將引領我們進入嶄新的聲音世界。
延伸閱讀:
- Open sourcing AudioCraft: Generative AI for audio made simple and available to all
- Meta 發布新開源 AI 工具 AudioCraft,輸入文字就能創作出音樂與音效

AI Has Already Created As Many Images As Photographers Have Taken in 150 Years. Statistics for 2023
生成式 AI 的 1.5 年等於人類攝影師的 150 年
在過去的一年多裡,網路上湧現出數百個專注於生成式藝術的社群,從 Reddit, Twitter, Discord 再到 FB, IG。成千上萬名 AI artists 正在練習他們的技能,創作精確的提示 (prompt) 並與他人分享成果。有人試圖估算這一年半來產生的圖像創作數量:
- 生成式藝術演算法約產生了超過 150 億張圖像。放眼過去,攝影師從 1826 年第一次拍攝照片開始,直到 1975 年,才達到 150 億張的數量。
- 自 DALLE-2 推出以來,平均每天產生約 3400 萬張圖像。
- 僅一年半的時間 Midjourney 就擁有了 1500 萬用戶,專業如 Adobe Creative Cloud 則是擁有 3000 萬用戶。
- 約 80% (即 125 億張) 的圖像是使用基於開源軟體 Stable Diffusion 的工具所產生的。
延伸閱讀:
- AI Has Already Created As Many Images As Photographers Have Taken in 150 Years. Statistics for 2023
- [YT] 《全面啟動》喬瑟夫·高登-李維:If artificial intelligence takes your job, AI should pay you, argues actor
Technologies and Tools
- FFmpeg Bitrate Stats : 結合了 FFmpeg , numpy , pandas 以及 plotille ,輸出各種易於分析、檢視與進一步使用的結果。
- ceacle: High productivity tools for your image and video editing : 影像放大、去背、換背景、移除文字、轉換格式、點陣轉向量…等常見好用的工具集。
- Does your device really display 4K? : 一張用來測試 4k 螢幕與相關設備的圖片,能很簡易地判斷顯示器的解析度與清晰度。
- Rewind: Truly Personalized AI : 讓你在 Mac 和 iPhone 上所操作或所看到的一切,都可能在事後進行搜索與再利用。
- DashAI: ChatGPT Chrome Extension : 在任何頁面上,都能使用 ChatGPT 的超能力。
Inside ARC
由 ARC 的 Jocelyn Chang Chien 負責執行的「技術公司研究計劃」,目前已經探索超過二十家技術公司。DeepWave 是 ARC 最近感興趣的團隊:
- ARC Tech Firm Survey
- DeepWave 迪威智能由台大資工張智星教授領軍,與其門下學生於 2019 年成立,專注於一站式音樂與聲音分析辨識的雲端服務,於 2021 年獲得音訊處理晶片廠 驊訊 Cmedia 的投資。
- 以遊戲音樂出發,深耕音樂相關技術研究,以人聲分離技術獲得國際 MIREX 大獎多項肯定,並推出產品 SOVIA ,主打人聲、音樂聲的分離技術。
- 後期延伸至聲音/聲學技術,讓機器學習不同的聲音,應用至多元產業,甚至結合不同技術創造新市場,例如:Noise Eraser 可消除影片中的各種背景噪音、智慧製造解決方案 藉由辨識工廠生產線上不正常的聲音,發現機械運作異常或是汰除不良品。
延伸閱讀:
- 張智星教授領軍的 MIRLab
Others
- Google and Universal Music negotiate deal over AI ‘deepfakes’ : Google 與環球音樂針對深度偽造 (Deepfake) 的歌曲中使用藝術家旋律和聲樂的許可進行談判。 (also in Music Business Worldwide )
- Google reportedly building A.I. that offers life advice : Google 正在使用生成式 AI 開發至少 21 種用於生活建議、規劃和輔導的工具,並與一家負責訓練和驗證 AI 軟體的新創公司 Scale AI 合作測試這些工具。
- Spotify expands its AI-powered DJ feature globally : Spotify 先前基於 LLM 做的 DJ 功能,除了原先的美國、加拿大、英國與愛爾蘭,進一步進軍瑞典、澳大利亞、紐西蘭、新加坡…等國家。
- YouTube is making it easier for creators to choose that perfect thumbnail : YouTube 將推出縮圖的 A/B Testing 功能 “Test & Compare”,概念類似 Netflix AVA 的技術,透過提供不同的縮圖給使用者來進一步提高影片被發掘的機率。目前僅有少數使用者可使用,預計明年正式發佈這項新功能
- Study: Netflix #1 coolest brands for Kids : 一份歷經一年執行的問卷調查指出,在 7-14 (Alpha 世代) 中,Netflix 為最被喜愛的品牌。其它品牌包括像是 YouTube, Nintendo, Disney, 或是 Roblox。
- Netflix finally streams video games, too : 新益求新的 Netflix 正式啟動遊戲串流了!
Infographic
