Wallfacer - Single - Album by Chris Pandolfi

因為身處在網路產業,所以比大多數人來得更容易注意到雲端運算、大數據、資安、人工智慧……等的發展與技術;又因為 KKBOX 是自己所服務的公司的主力產品,所以論音樂串流產業,是相對容易累積不少經驗、觀點與品味。那麼結合前兩者,結合人工智慧與音樂,更深入的音樂研究,擴大到更寬廣的多媒體服務,似乎就是個很自然的發展方向了。

在我們三位沒有事先說好的情況下,Embedding 2024 第一期的主編說我們是被選出來的三位面壁者,會各自挑一個方向進行研究與撰寫。第一位 (面壁者) 立即選了五光十色的新視角合成 (Novel View Synthesis) ,因為它可能是電影與影音技術的下一個明日之星;第二位 (面壁者) 也立馬挑了大型語言模型 (LLM) ,因為現在非常火熱的生成式人工智慧幾乎都與它有關;毫無懸念地,第三位 (我) 只能硬著頭皮選智慧音樂 (Intelligent Music) 研究了,即使滿滿的未知在前方,即使環球音樂說不喜歡音樂 + 人工智慧~

當完成了路跑報名,你就已經跨過第一道難關,朝向成為一位馬拉松跑者邁進了。

老祖宗說鑑古知新,所以先來回顧 Embedding 2023 有哪些音樂新聞與技術,看裏頭有什麼寶可以挖來複習一下。另一方面,老祖宗又說萬丈高樓平地起,所以也列出今年一整年在智慧音樂這塊的研究主題是怎麼訂出來的,從音樂基礎技術開始,一路往上堆疊。


Embedding 2023 的音樂新聞與技術回顧

在去年總共 34 期的電子報中,共有 15 期分享了音樂產業的相關新聞與活動。包括 Embedding #1 來勢”兇兇”的環球音樂集團對於生成式音樂的表態Embedding #9 披頭四最後一張專輯重見天日 ;或是 Embedding #26 的 35,000 小時免費有聲書計畫

環球音樂集團的表態直接 (明) 示了 Music + AI 的破壞性對現有商業架構有高度的威脅,在它還沒搞清楚並且理出一條可行的新商業條件前,誰都不准踫它的”資產”;多虧了為披頭四紀錄片《Get Back》開發的技術,約翰.藍儂的聲音得以從卡式錄音帶中取出。保羅.麥卡尼說得更是巧妙:「這其中有好的一面,也有可怕的一面,我們只能等待看看會有什麼結果」;而古騰堡有聲書計畫,則是開放了一個龐大而多樣的典藏,讓每個人都能找到他們喜愛的 — 從亞瑟.柯南.道爾的《福爾摩斯歸來記》到愛德加.萊斯.巴勒斯的《泰山的回歸》*,*每個人都能找到適合自己的內容。

更多的 2023 音樂大事件回顧,請見以下列表。

Embedding 2023 音樂新聞:


另一方面,2023 年也分享不少的音樂研究與技術。我把去年 34 期全數看過一遍後數了一下,至少就有 20 個主題了。包括像是 Embedding #1 實驗性質的整合 ChatGPT 與 Spotify 來產生歌單的開源實作Embedding #6 韓國公司 Supertone 創造出任何人都可以成為歌手或演員的世界Embedding #20 的 SoundCloud 提出 TikTok 體驗來發現音樂的技術 ……等。

與 ChatGPT 結合?checked!給段影片配上音效?checked!擬真人聲合成?checked!生成式 AI 與音樂創作結合的生成式音樂?checked!

更多的音樂技術資訊回顧,請見以下列表。

Embedding 2023 音樂研究與技術:


Fundamentals of Music Processing by Meinard Müller

音樂研究之一步一腳印

根據最近十年人工智慧的發展,音樂研究可以被約略分成三個時期,分別是:

  1. 2011 年之前,歷經多年演化與累積的經典方法;
  2. 2011 年之後,深度學習 (Deep Learning) 帶來的新人工智慧方法;
  3. 2017 年之後,變換器 (Transformer 模型) 與 LLM 啟動的生成式 AI 與多模態 AI;

這三個時期,雖然解的問題很類似 (像是語音轉文字、語音辨識,或是音樂去人聲),但是方法大相逕庭。後面時期的研究與技術,大多是壓倒性勝出前期的方法。就是說,同樣一個問題,基於 Deep Learning 的方法勝出以前的方法,然後基於 Transformer / LLM 的方法則又更加勝出。「青出於藍」大抵很適合套用在這裏。

另一方面,如果我們就只看最新穎的 Music + AI 的研究與技術的話,那又有點不同了。譬如說,我們就只看 2023 年起最前沿的研究,那音樂研究可以被粗略畫分為以下幾個當紅炸子雞的子領域:

  1. 語音合成 / 文字轉語音 / Text-To-Speech / TTS;
  2. 音樂合成 / 音樂創作 / Music Synthesis / Music Composition;
  3. 聲部分離 / 歌聲分離 / 歌曲人聲分離 / Source Separation;
  4. 音樂(音效)生成 / 文字轉音樂 / Text-To-Audio / Text-To-Music;

最後,萬丈高樓平地起,從古典基礎的角度來切入音樂研究的話,那又是另一個世界了。借用《Fundamentals of Music Processing》這本書的章節分類 ,可以有以下幾個子領域的研究方向,每個方向會帶出不同的演算法與適合的情境。

  • 音樂樂譜的呈現方式 (Music Representations)
  • 音樂的合成 (Music Synchronization)
  • 音樂結構的分析 (Music Structure Analysis)
  • 和弦的辨識與抽取 (Chord Recognition)
  • 音樂節奏與節拍的偵測 (Tempo and Beat Tracking)
  • 基於聲音的內容搜尋 (Content-Based Audio Retrieval)
  • 樂器分離或人聲分離 (Music Decomposition)

以三種不同方式與切角,研究並且分析了音樂研究可能有的主題與子領域後,突然有種大敵當前的錯覺。畢竟,光是旗下的子領域就這麼多了,一顆腦袋瓜實在不夠用,一整年可能也消化不完。而且我們還想從中發掘出一些我們可以做的新研究,甚至是刻出一個新的 POC demo 與大家分享……Phew~ Fingers crossed~


A picture is worth a thousand words

The Economist Magazine | Nov 11Th-Nov 17Th 2023