
KDDI Research Activities on AI
KDDI Research 在人工智慧上的耕耘
在開發 KDDI VideoPass (Telasa 前生) 時,接觸到來自 KDDI Research 的 video codec researcher。對方對於 video codecs 的規格與能耐有很多經驗,同時具有理論、開發以及實際應用情境三方面,常常可以搬出一些整理好的資訊與觀點出來討論 (與爭論)。
在向前相容以及其它商業考量的限制前提下,我們一起討論並且制定出了 VideoPass 第一代的 bitrate profiles。過程中,這位研究人員會一直不厭其煩的拋出像是「為什麼提出這樣的 bitrate profiles?」「如何證明這樣的 bitrate 是好的設計?」「真的無法再壓出品質更好的影片了嗎?」「我們來拋開成見,重新直視 video bitrate profiles 真正要解決的問題是什麼吧」…
那是一個非常愉快又壓力如山大的三個月,特別是當後頭有明確的專案死線追趕著,同時還有嗷嗷待哺的同事們等著結論的時候。
I hope that everyone has the opportunity, whatever their work environment may be, to be surrounded by people that they respect and are inspired by.
2023 年才剛過了一半,KDDI Research 在 AI 方面的投入,已經在國際研究會議中發表了 7 篇論文。發表的論文內容涉及「推薦系統」、「時間序列資料的預測」、「網路遊戲對注意力偏誤的推論」…等。再往前看的話,KDDI Research 自 2018 年開始就有 AI 方面的論文發表,至今已經發表了 97 篇,差不多是每年 10 篇以上的研究被發表出來。
另一方面,我們可以用更廣意的角度來看「研究」。英文中的 Research 這個單字,源自於法語,由兩個字 re- 與 cerchier 的結合而成。不需要語言學家的身份,我們也可以立即理解到 research := re- + search,亦即再探索的意思。我們身處一個大家庭,每個人有不同的專業與經驗,在面對任務與挑戰時,即使是同樣的一件事,也都在透過不同方式的研究來得出更適切或更滿意的結果。
Research := re- + search
研究 := 反覆或再次地去尋找,直到得出更適切的道路或是更滿意的解方。
延伸閱讀:
- KDDI Research Activities in AI
- KDDI Technology Challenge seeks AI-enhanced devices and services
- NTT Research
- Spotify Research

AudioPaLM project page Demonstration
AudioPaLM:就像有一個夥伴一樣聽你講話
Google研究團隊近期提出一項名為AudioPaLM的大型自然語言模型 ,能實現語音內容聆聽理解,並且自動生成口說內容。AudioPaLM的背後是由 PaLM 2 與 AudioLM 兩種模型組合,使其能聆聽、理解語言內容,並且藉由自動生成式人工智慧產生口說內容。例如,輸入一段西班牙語音,模型直接轉成英文語音。甚至可以調整口音,維持口音或換成特定腔調。官方網頁 的展演值得你們把玩。
同時,我們注意到 YouTube 六月底在 VidCon 宣布即將採用的一項計畫 Aloud :由 AI 驅動的配音工具為創作者影音進行語音翻譯,並且產生配音版本。創作者不必再與第三方配音公司合作創建音軌,直接免費進行影片翻譯配音,吸引更廣泛的國際觀眾。
延伸閱讀:
- AudioPaLM project page
- the decoder - Google AudioPaLM can translate text with your voice
- Tech Crunch - YouTube integrates AI-powered dubbing tool

CoDi: Any-to-Any Generation via Composable Diffusion
CoDi: Any-to-Any 生成式 AI
除了 Text-to-Video, Video-to-audio 等各式各樣的生成之外,現在還出現了 Any-to-Any 生成:文本、圖像、影片、音訊全都行!
微軟和北卡羅來納大學提出了可組合擴散 (Composable Diffusion, CoDi) 模型,可處理模態轉換,使得從任何輸入和輸出模式的組合中都能進行生成。亦即不再受限於使用 text prompt 了,也不再只能單一產生圖像或是音訊了,而是各種組合都有可能。CoDi 的發展為現實世界的應用帶來了新的可能性,並代表了向更具沉浸感和互動性的人機交互方式邁出重要的一步。可以看連結中的 Demo 影片。
延伸閱讀:

Chart: How Old Are The Tech Companies?
How old are these tech companies & apps?
- Threads: 3 days
- Instagram: 13 years
- Spotify: 17 years
- Twitter: 17 years
- Facebook (Meta): 19 years
- KKBOX (KKCompany Technologies): 19 years
- Tesla: 20 years
- Google: 25 years
- Netflix: 26 years
- Amazon: 29 years
- Nvidia: 30 years
- Apple: 47 years
- Microsoft: 48 years
- Sony: 77 years
- IBM: 112 years
- Nintendo: 134 years
- Nokia: 158 years
Others
- Podcasting 2.0: it’s all about Interoperability — 由被稱為 podcast 之父的 Adam Curry (再)發起,提出了 1) podcast format (RSS) 2.0 spec 以及 2) 面向全球的 Podcast Index 服務。感興趣的,千萬不要錯過 FOSDEM ‘23 上的投影片介紹 。
- ChatGPT API 全面升級到 GPT-4 最新模型、全面開放 DALL-E / Whisper API — 已經訂閱了 ChatGPT Plus 的人,趕緊去試試喔。
- VideoReTalking: Audio-based Lip Synchronization for Talking Head Video Editing In the Wild — 只需輸入一段聲音,就能為影片中的人臉加上生動的表情和動作。它應用也能擴展到虛擬現實和增強現實領域,提升了互動體驗的真實感。
- NVIDIA H100 GPUs Set Standard for Generative AI in Debut MLPerf Benchmark — GPT-3 benchmark 上,Nvidia 用 11 分鐘就訓練完成!
- 「慘!美劇斷炊!」從美國編劇工會罷工,談 AI 科技背後的利益風暴 — 睽違 15 年,美國編劇工會以 97.85% 的壓倒性票數,宣布從 2023 年 5 月 2 日開始,代表超過 1 萬 1 千名成員發動罷工。訴求的要點之一為「AI 生成系統興起,應建立使用 AI 進行編劇的合理範圍,不能以 AI 取代編劇工作」。
Technologies and Tools
- 用 AI 抓 AI!叫 GPT-4 寫論文、公務員出差報告小心了 — 專注於論文抄襲比對,在全國大專院校擁有7成市占率的產品「快刀」,母公司雲書苑教育科技推出「快刀 AI 先生:中英文 ChatGPT 文章辨識系統解決方案」,該解決方案可用於辨識論文、書籍等內容創作是否由 ChatGPT 生成;根據快刀提供的數據,準確率達 94%。
- MovieNet: 一個專門為電影打造的多用途資料集 — 1,100 部電影,再加上 60K 預告片和 3.9M 電影海報和劇照等等組合出來的資料集,由香港中文大學的研究團隊提供。提供了相當多樣且豐富的文字描述和 metadata 標記,如角色、場景、動作、分鏡等等。這個資料集能夠為資料科學家們提供相當多目標的訓練工作,像是場景偵測、人物辨識、自動生成影片描述等等。
AI + Human := Creativity
Fun
