在過去的十年中,大型監督模型 (large supervised models) 在機器學習領域嶄露頭角,但是在 2020 年,大型預訓練模型 (large pretrained models) 成為了主導趨勢。預訓練模型是指事先在網際網路上學習各種不同的非結構化數據,例如文字、圖片和聲音。這些模型可以應用於很多不同的任務,比如閱讀、識別圖片和辨認聲音。

New trend := large pretrained models (foundation model) + your small labeled business data

最近的技術趨勢則是:大型預訓練模型 + 小型標記樣本。通過預先訓練未標記的數據和自我監督學習,接著輔以最少的自定樣本獲得良好的性能,這一轉變使得機器學習產品的快速開發和發布成為可能,即使沒有測試集也可以構建和發布產品。

有不少公司開始在驗證基於 foundation models 加上自家結構化且有標記的資料組合下,能帶來的新功能,包括這一期提到的:大型企業如 Adobe,或是新創如 Supertone。

這一期的內容主要是 1) AI 合成人聲與歌唱技術、2) 更專業導向的以文生圖技術。內容簡短而易懂;與 music, video, multimedia, cloud 有關;包含可實用的技術…等。


Change Your Voice to ANY CELEBRITY with This Free AI - YouTube

Cover image in Change Your Voice to ANY CELEBRITY with This Free AI

Voice acting is OVER: NaturalSpeech 2

兩週前,蘋果以「全球無障礙體認日」 (Global Accessibility Awareness Day) 為名,公佈了一些新功能,其中的 Personal Voice 非常有意思:用機器學習合成和自己高度相似的聲音,就可以代替你發聲。

由微軟亞洲研究院 (Microsoft Research Asia) 攜手 Microsoft Azure Speech 於上個月發表的一篇研究 NaturalSpeech 2,更是開創了文字轉語音 (Text-To-Speech, TTS) 技術的全新時代!傳統的 TTS 系統雖然在訓練的數據集上有出色表現,但無法清楚的捕捉到人類語音的多樣性,如口音、韻律和風格。然而,NaturalSpeech 2 打破了這個限制。它不僅能以驚人的逼真度模仿說話者聲音,而且在泛用性方面達到前所未有的高度。

想像一下,未來只需要對方的短語音,就能模仿他們的說話或唱歌風格。

Apple’s Personal Voice 需要使用者讀完約 15 分鐘的文章來完成訓練,而 NaturalSpeech 2 宣稱只需數秒的錄音即可。雖然”只需數秒”可能有點誇大,但一方面再次感受到科學研究者的野心與努力,另一方面倒也擔心起將會有更厲害的詐騙電話了 (你確定你年老時,能分辨出你孫女與 AI孫女的聲音差別嗎?)。也許這是為什麼微軟在頁面的最後,放上了一段道德聲明 (Ethics Statement) 。

強烈推薦點擊第一個連結,去實際體會一下它只需要幾秒的訓練結果。


Prompt-to-Prompt Image Editing with Cross-Attention Control

Prompt-to-Prompt:可微調的文字生圖

生成式圖片的技術 (text-to-image) 因為可以配合給定的提示詞 (prompt) 產生高度多樣化且高品質的圖片而紅了一波 (e.g. Midjourney , StableStudio )。然而,對這些生成模型來說,後續的圖片編輯是相當有挑戰性的,因為”編輯”的一個特性是更動原始圖片的部分內容,但同時保留其它部分。在現今 text-to-image 的模型中,即使對 prompt 進行微小修改,生成的結果通常也不盡如人意,或甚至完全不同。

Creative editing := edit partially + keep the rest

Strongly creative editing := add partially + edit partially + keep partially

Google Research 與以色列 Tel Aviv 大學於 2022 年合作的研究中,提出了一種直覺式的的生成式圖片編輯框架。只需要透過修改”部分”提示詞,例如替換單詞,或是添加額外的文字,甚至控制單詞在圖像中的反映程度,就能夠直接修改生成好的圖片。在不同的圖像和提示詞上使用不同的文本到圖像模型的結果,展示了高品質的合成技術和對提示詞的配合度。

更多的範例,請前往 Prompt-to-Prompt 的網頁。

Prompt-to-Prompt Image Editing with Cross-Attention Control


Dream bigger: Get started with Generative Fill … in Photoshop

Adobe Generative Fill

Adobe Photoshop 於上週釋出「生成填色」功能,為創意和設計工作流程帶來新的方式。它結合了Adobe Firefly 的生成式 AI 技術,讓使用者可以透過文字提示詞 (prompt) 創建非凡圖片。這是 Adobe 多年來在 Photoshop 中提供 AI 功能的延續,加速工作流程並提供最佳專業工具。

生成填色可以非破壞性地添加、擴展或移除圖像內容。這一功能融入每個選擇工具,並生成全新的「生成圖層」,讓您能夠無損地探索無限可能性。


Others


Technologies and Tools


Inside ARC

60 歲的演員;30 歲的聲音

Supertone 公司研究

除了 NaturalSpeech 2 外,一家專注於研究語音合成的 Startup — Supertone ,透過語音技術協助所有創作者製作出身臨其境的內容,創造出任何人都可以成為歌手或演員的世界。

Supertone 在 ICLR 2023 推出了 NANSY++,透過直接對語音分析其音準、語言、音色,加以合成和操縱,有效地達到四種應用 — 語音轉換、文字轉語音、歌聲合成和語音設計,文字難以形容此研究結果,直接來看 demo 。實際運用在戲劇上,配合戲劇角色的年齡設定,讓一位 60 歲的演員能夠擁有 30 歲的聲音。(原文 )

幾週前他們的技術也成功讓一位韓國歌手可以無違和的唱出六種語言版本的新歌,在韓國娛樂圈引起許多話題,請上 KKBOX 收聽 MIDNATT - Masquerad

PS. ARC 團隊自去年八月起啟動了一項技術公司研究計劃,由 Jocelyn Chang Chien 負責執行,目前為止已經研究過十來家技術公司,持續進行與深化中。