The Beatles

Paul McCartney says AI has enabled a ‘final’ Beatles song, BBC

AI 正在讓披頭四再次團聚!

多虧為披頭四紀錄片《Get Back》開發的技術,約翰.藍儂的聲音被從卡式錄音帶中取出與清理,並成為一張全新披頭四唱片的基礎。

保羅.麥卡尼表示:「這其中有好的一面,也有可怕的一面,我們只能等待看看會有什麼結果。」

Paul McCartney says AI tools helped rescue John Lennon vocals for ‘last Beatles record’


Meta’s open source AI MusicGen turns text and melody into new songs

Meta’s open source AI MusicGen turns text and melody into new songs

Meta MusicGen vs. Google MusicLM

Google 先是發佈了 MusicLM 這個生成式音樂模型,即使只是純粹的學術技術研究,仍舊引起了廣泛的注意,接著更進一步都對外開放整個服務,宣稱 “Experiment today by describing a musical idea and hearing it come to life “。現在,Meta 也開源 MusicGen了!

MusicGen 能將你的文字描述 (prompt) 轉化為約 12 秒的音樂。

MusicGen 模型以 20,000 小時的音樂進行訓練與調校,且對硬體要求不高,僅需要一個約有 16GB 記憶體的 GPU 就可以運作。

就性能而言,它的表現不錯,甚至能與 Google 的 MusicLM 一較高下。但我們也都曉得,它(還)不會取代真正的音樂作曲家。另一方面,它是通過學習現有的音樂創作來訓練的,並非每個人都會對此感到滿意,但只要研究繼續執行下去,就會有更多可以期待的發展。

另外,生成式音樂在一些法律和倫理上的灰色地帶還需要被解決。開始有一些由 AI 製作的音樂曲目正在走紅,引起了一些騷動。唱片公司聲稱這些 AI 音樂侵犯了智慧財產權,但是當涉及「深度偽造 (deepfake)」音樂時,智慧財產權法還有些模糊。

不過,Meta 對此採取了謹慎的態度。他們表示,所有的訓練音樂都是經過合法授權的,不需要擔心!


ControlVideo: Adding Conditional Control for One Shot Text-to-Video Editing

ControlVideo - 更優秀而有效的生成式影片調整方法

三週前在 Embedding #6 提到了 Prompt-to-Prompt,一個透過 prompt 的微調來調整產生出來的圖,像是把原來一張生成出來的 “a cat riding on a bicycle” 變成 “a cat riding on a car”,就是個非常有意思的嘗試型研究與驗證。但如果你只是想套用在影片上,並且想要在保有整個影片結構的前提下,只做風格或是材質的調整呢?

受到 ControlNet 的啟發,ControlVideo 通過使用視覺條件 (如邊緣、邊界或是深度圖) 作為額外的輸入來增強並且保有原來影片的結構,同時結合 prompt 的修改來做到微調。使用在擴散模型 (diffusion model) 上預訓練的 ControlNet 來處理這些視覺情境,結合以文本為驅動的視頻編輯方法 (prompt tuning)。透過這兩個方面的整合,ControlVideo 提供了一種更精確和靈活的影片修改與控制方式。

拿上圖為例,先以 “a cat” 生出一支花貓打哈欠的短片。接著透過 ControlVideo 的分析後,我們再微調它,把 prompt 修改成 “a black cat”,就能將原影片中的花貓替換成黑貓了。更多的範例,請參考以下的網頁。


Screen Shot 2023-06-18 at 08.07.06.png

Tracking Everything Everywhere All at Once India 影片的人物追蹤。拍攝途中經路人遮蔽後,OmniMotion (Ours) 依然準確地推估被遮當下與之後的對應位置。

媽的多重追蹤 - Tracking Everything Everywhere All at Once

位移估計 (Motion Estimation) 是指通過分析連續畫面的圖片或是影片,以估計物體或場景在時間上的變化,在電腦視覺領域具有廣泛的應用。例如降低手震 (video stabilization)、分析人物行為 (human motion analysis)、乃至於視訊的視覺效果或者影音壓縮。

Google, Cornell, 與 UC Berkeley 近日共同提出了一種稱為 OmniMotion 的位移估計方法。它使用準三維規範體來表示影片,並通過局部空間和規範空間之間的對應做到像素級的精細度。OmniMotion 提供更準確的位移估計,能夠克服以往方法不易跟蹤被遮擋物件的問題。研究結果表明,OmniMotion 比先前的最先進方法在定量和定性方面都有明顯的改進。

想像 VR 和 AR 是其中一項可能的應用,OmniMotion 的準確的位移估計能力對於虛擬實境和擴增實境應用非常重要。它可以用於捕捉人類的動作和姿態,並即時的將虛擬與現實世界對齊,提供更真實和沉浸式的體驗。


Imagen Editor & EditBench

Google 為 Imagen 推出圖片編輯功能 Imagen Editor

也許你用過最近很紅的幾個文字-圖片生成器,如 Midjourney, Stable Diffusion 等等。當圖片生成的結果不如你的預期時,大多時候你能做的就是給一段新的文字而重新生成一遍。在今年的 CVPR 2023 大會中,Google Research 發表了其中一個技術 Imagen Editor,爲自家的圖片生成器 Imagen 附加上了文字-圖片的編輯功能。只需要把你想要修改的地方框出來,並給它一串你想怎麼修改的指令,Imagen Editor 就有能力在維持其他地方不變的情況下依照你的指令修正圖片。


Others


Technologies and Tools

It’s all about FFmpeg.

  • FFmpeg 6.0 — 不論是 KKBOX 還是 BlendVision 都會使用到的核心工具與技術 FFmpeg,剛在今年上半年的 FOSDEM 2023 釋出 6.0 版了。特別值得關注的是 multithreading muxer, AV1 hw decoding (dav1d), 以及 Fast Fourier transform (FFT) 的進一步最佳化。這幾個功能都與 FFmpeg 的效能高度相關。
  • FFmpeg Cookbook for Archivists — 給影音檔案員的 FFmpeg 使用手冊,特別是作者清楚易懂的分類方式以及簡單到剛剛好的說明,雖然沒有 ChatGPT 的好文筆,但卻提供了長度適中的內容,非常的 FAQ。
  • video-compare — 基於 FFmpeg 與 SDL2 開發的分屏影片 (split screen video) 比較播放器,讓你可以輕易的開啟兩支影片,一左一右,同步播放,然後做分析與比較。macOS 下只要簡單的 brew install video-compare 就安裝完成。

Inside ARC

來自特派員 Willy Huang 剛剛分享過來的一張照片 — KKCompany in CVPR 2023!


Fun

Sky’s the limit

Apple 開始大舉進軍金融科技了。這代表什麼呢?表示你可以向它借貸,然後再去購買它的產品。如果你未能按時還款,你貸款買來的 AirPods 或是 Apple Vision Pro 會給你一個電擊震撼,絕對讓你記得要還款。

這就叫做垂直整合 (vertical integration)。