
2023 年結束了嗎?還沒,即使今天是最後一天上班日,後面也還有兩天。2023 是一個質數嗎?也不是,雖然需要一點點計算,但它是可以被因式分解成 71 × 172 的。那 2023 年是生式式 AI 元年嗎?小編不曉得,因為被媒體稱為什麼元年的,大部分都……
Embedding 電子報第一期於 2023-04-25 發出,每週一刊,每過一兩週就會聽到編輯群有人說「我們要不就寫到這,然後無聲無息的停刊如何?畢竟我們比較擅長的是探索新技術、讀論文、寫程式、實作雛形的對吧?」就這樣一路到第 34 期,總算撐到年底了。這一期,每一位編輯會挑選過去一年中的一則出來,可能是遺珠之憾,也可能是舊瓶新裝。
常聽到別人說「外出取材」,小編也想來一下。這一期刊出後,會休刊一段時間,大概到農曆年過後。到時,我們會(希望)帶著新穎的面貌復刊。— Drake Guan
延伸閱讀:

回顧 2023 年 AI 治理與發展
Embedding #23 裏分享到,在今年的九月底大師們連袂來臺,分享彼此對於 AI 發展的看法。AI 是令人又愛又怕的新能源。Sam Altman 認同全球監管的必要,應避免產生毀滅性影響後,再思考管理辦法。讓我們一起回顧 AI 治理的重要事件。— Jing-Kai Lou
OpenAI 執行長赴美國聽證 (2023-05-16)
- 提到 AI 可能在未來導致的巨大問題——比如 ChatGPT 的接口有機會幫助犯罪行為;又比如大模型的政治操控能力引領輿論等。
- 馬庫斯教授 :我們已經「創造了一頭在瓷器店裏的公牛」。我們很難確定 AI 怎麼具體「思考」的,因此我們對於AI到底有多安全,其實無法說真的有把握。
G7 廣島 AI 進程:通往可信賴人工智能的道路 (2023-05-19)
- 指出生成式 AI 可能會被惡意操縱的危險,包括被濫用以破壞民主價值、壓制言論自由和威脅人權享有的方式。
- 為促進可信賴 AI,需強化治理框架互操作性,支持國際組織合作,如 OECD 和UNESCO,提供國家監管和責任參考。
全球首個人工智能監管峰會 (2023-11-01)
- Bletchley 宣言:承認 AI 的美好和風險,以及協作應對前沿 AI 安全的必要性。AI 所帶來的許多風險是國際性的,強調國際合作的重要性。
- 支持圖靈獎得主 Yoshua Bengio 領導的’科學現狀’報告,促進對前沿AI風險和能力的共享科學理解。
延伸閱讀:
- CSIS - The Path to Trustworthy AI: G7 Outcomes and Implications for Global AI Governance
- 端傳媒 - 全球首個人工智能監管峰會在英國召開,達成了什麼共識?
- Embedding #23: 助理;助你:AI 助理與技術新發展

Forever Today
1985 年時,一次病毒感染讓 Clive Wearing 的大腦受到嚴重的損傷:就像《記憶拼圖》裡的 Leonard 一樣,他沒辦法記住任何新的事物。每次睡醒時, Clive 會打開筆記本,畫掉舊的筆記「我醒過來了!」,然後補上新的筆記「我這次真的醒過來了!」雖然記不住新的事物,但是還記得熟悉的舊事物, Clive 永遠都像一開始一樣愛著自己的太太,看似浪漫卻也讓人感傷。雖然科學家已經慢慢瞭解人腦運作的方式,但是無法解釋的部份更多,這也是為什麼 Neuralink 的進展讓人如此期待。— Ironhead Chuang
延伸閱讀:

人類 vs. AI,比賽尚未結束?
從 1996 年超級電腦深藍 (Deep Blue) 試圖挑戰人類開始,人類對於計算智慧 (computational intelligence) 的討論就一直沒停過。20 年後深度學習的時代,Alpha Go 成功在被認為是最複雜的圍棋比賽中,以 4:1 擊敗世界頂尖高手李世乭 (Lee Sedol)。而現在,生成式 AI 也正在以超乎預期的品質在模擬人類創作,甚至威脅到部分專業人士的工作。然而 AI 發展的路線並不止於此,在第 16 期的 Embedding 中,也曾介紹過 AI 如何被用來學習並重建人類的認知。如果有一天,完全模擬人腦認知運作的 AI 被開發出來,是否就意味著再也不需要人類了呢?— Hung-Chang Huang
正當許多人認為或擔心人類已經被 AI 超越的時候,回首看深度學習的理論與發展,其實卻是源自於對於人類的模仿。不論是參考人腦結構建立的類神經網路,或是模仿人類視神經的卷積神經網路,還是模擬神經突觸的激勵函數 ReLU,都是出於腦科學對大腦的觀察和理論而設計出來的。除了神經結構之外,基於監督式與半監督式學習所使用的標記資料,從簡單的文字標籤,到語言的構成,甚至是繪畫和音樂,也不意外都是由人類產生。想想,在梵谷的沒有誕生的情況下,是否有 AI 能創作出梵谷的繪畫或風格?同時另一方面,人類似乎也慢慢從 AI 中學習更多東西,像是用 ChatGPT 找尋生活小知識,或是用 Copilot 自動撰寫程式。比起競賽,把 AI 當成是一個良師益友,似乎也未嘗不可。
在社會學中,社會建構主義 (social constructionism) 講述了人類的知識都是來自於和他人的共同發展。因此在人口組成鮮少變化的社會中,知識發展是有極限的。如果 AI 可以作為新的一種「人類」,那麼當終極的 AI 來臨的時候,人類也仍然可以從跟 AI 的互動中發展更多的知識,直到外星人來到地球那天為止。未來某些專業人士的角色甚至會轉變為 AI 的老師,負責「教」AI 更多事情,但是老師也不用一定要比學生更厲害,不是嗎?
延伸閱讀:

AI 養成手冊
還記得 AI 會怎麼稱呼自己的爸爸嗎?在第十五期的電子報中,我們探討了「Data」的主題,帶大家認識 Data-centric AI 的概念,說明高品質的「小數據」就足以訓練出高效的模型。那麼,這些高品質的數據又是如何取得的呢?根據不同的機器學習任務,我們需要使用各種不同類型的數據來訓練模型,這或許來自於一本教科書 ,或是標記了區塊位置的圖片,甚至在同一張圖上給予不同的標註,以獲得不同任務的訓練資料 。— Ya-Chun Tsai
根據 Research Reports World 的報告 指出,全球資料標注市場的價值預計將在 2028 年達到 60.9 億美元,預測複合年均成長率 (CAGR ) 為 27.72%。龐大的標註需求同時也帶動了眾多相應工具與服務 的崛起,加速高品質數據標註工作的進展。
延伸閱讀:
- Data Annotation: Everything You Need to Know
- Data Annotation in 2024: Shaping the Future of Computer Vision
- Embedding #15: AI 會怎麼稱呼自己的爸爸?

瘋狂 AI 時代的反思
真真假假,假假真真。充斥著我們 2023 年生活的,是那些 AI 生成的圖片、影片、音樂、文字、想法,相信 Embedding 的讀者對於這些內容都很熟悉,像是電子報第四期的穿著白色羽絨衣的教宗、Embedding #24 的最嘴假唱。當然也有相應而生的爭議,像是 Embedding #9 中的深偽音樂是否涉及智慧財權法。甚至相關的偵測技術也開始出現,例如 Embedding #28 的 Deepfake Detection。— Jocelyn Chang Chien
身處在以假亂真世界的人們,眼見與耳聽不一定為憑。我們無法第一時間正確判斷學生繳交的報告是否都是自己完成的?突然爆紅的某一首歌是不是真的由知名歌手所唱?那段網路上的搞笑熱門影片是不是真實發生?或是發布了30幾期的電子報其實都是 ChatGPT 寫的?「2023 年似乎陷入了某種真實性危機。質疑真實性的背後,意味著我們此時此刻更珍視『真實』」韋氏詞典總編輯索科洛夫斯基說。
在「深偽」和「後真相」時代的生成式 AI 元年,真實 “Authentic” 成為 2023 年的年度風雲字,在這虛實界線模糊的時代,真假難辨的一切開始讓大家感到厭倦與疲乏。也許在 2024 年時,創造完美、虛擬、仿真已不再令人感到新奇,如何把「真實」呈現出來才會是真正的難題。
延伸閱讀:
- Word of the Year 2023
- Embedding #4: 你的工作(可能)不會受到人工智能的威脅
- Embedding #9: 可駕馭、可控制、可依靠的人工智慧
- Embedding #24: 內容與 AI 的相愛相殺
- Embedding #28: AI × 隱私 × 黑鏡

十年磨一劍
電子報第八期的引言中,我們強調了人工智慧領域每週都有新的進展,包括研究、應用、新創以及企業級服務。特別以基於 LLM 的生成式人工智慧應用為例,我們追溯其發展歷程,透過列舉技術所帶來的關聯機制和影響,可以清晰看到前置技術如何成為後置技術的基礎,並提供系統流程,為問題提供全新的解決方案。— Chih-Pin Tan
同時,這樣的回顧也再次讓我們深刻體會到,儘管技術迭代似乎飛快,但每一個新技術的出現都是建立在先前技術的基礎之上。技術的演進是一個連續不斷的過程,是上一批技術的基礎上所進行的改進和演進。這種持續的技術發展,不僅加速了創新的步伐,也深刻影響著我們對科技發展的理解。
- 2012:AlexNet 開啟了深度學習的時代
- 2015:ResNet 與 LSTM 讓語言模型 (language model) 能夠處理長篇文字和演講
- 2017:Transformer 開啟了高效率 large language model (LLM) 的可行性
- 2018:GPT-1, GPT-2, BERT 基於 Transformer 進行規模擴展的首次嘗試
- 2020:GPT-3 在翻譯、問答、摘要等自然語言任務上達到近乎人類
- 2022:ChatGPT 經過更大量 RLHF 微調後誕生出了全方位的對話小幫手
- 2023:各式各樣基於 LLM 的商業應用問世
延伸閱讀:

打造資料世界的第二大腦
在 Embedding#31 中,我們分享了如何巧妙地對齊資料,為更進一步的資料管理奠定基礎。當資料量還相對較少的時候,我們還能夠依賴自己的記憶或簡單的文件來找到所需的資料。然而,隨著資料量的增長,找到正確的資料來解決特定問題變得越來越困難。— Iris Chen
就像人的大腦容易忘記未使用的知識一樣,曾學到的東西,如果沒有使用,很容易隨時間淡忘。最終,真的需要用到的時候,卻再也想不起來。同樣地,過去收集的資料,如果沒有好好整理和管理,當需要用到時可能就會難以尋找,甚至連資料的出處都無從參考。
Tiago Forte 提出的「建立第二大腦」的知識管理概念,正是為了解決這個問題。而在資料領域,Modern Metadata Platform 正是在 Metadata 領域的第二大腦,它可以有效管理和儲存不斷增長的數據。有了這個第二大腦,我們就像擁有了超能力,可以輕鬆應對數據中的各種挑戰,隨時找到需要的那份資料。
延伸閱讀:
- The Modern Metadata Platform: What, Why, and How?
- What Does an Ideal Metadata Platform Look Like?
- Embedding #31: 打造你的個人「超級大腦」 —— 從個人到公司,一起變聰明!
Inside ARC 2023
- Papers studied: 100
- Tech firms surveyed: 35
- Public talks: 11
- Publication papers: 3
- Blogs (internal + external): 4
- Pop2piano: 425 (out of 580) songs
- DataHub: 298k titles
- Video Super Resolution films: 12 videos (premium movies)