“Your job is (probably) safe from artificial intelligence” 是上一期《經濟學人》 的一長篇,它從經濟發展的歷史脈絡角度,包括經濟發展、工業革命、以及經濟學家的論點,指出這一波的 AI 熱潮可能被放大過多。另一方面,我們也開始受惠於 ChatGPT-like 的服務所帶來的便利,不管是草擬行銷文、客服應對、function docstring、或甚至是撰寫 test case。說 AI 對工作沒有影響,也與事實有違背。這也許是為什麼《經濟學人》的文章標題用了 “probably” 這個字眼。(原文 ) (David Chen 的中文摘要 )
An embedding is a relatively low-dimensional space into which you can translate high-dimensional vectors. Embeddings make it easier to do machine learning on large inputs like sparse vectors representing words.
從這期開始會不定時有 Technologies & Tools,內容是挑選出來一些與 AI 以及我們有相近的資源,像是開源計畫、git repo、dataset or models、或是 SaaS 都有可能。如果你有看到什麼想推薦給同事的技術資源,也歡迎回信分享給我們。
最後,電子報剛滿一個月,有兩個調整。一是電子報正式命名為 Embeddings,源自 Natural language processing (NLP),是 LLM 應用 (e.g. ChatGPT) 背後的重要概念之一,同時也有效傳達電子報是以 AI 相關資訊而發起的。

What Pope Francis’ AI puffer coat says about the future of fashion by CNN
Google will label fake images created with its A.I.
去年三月,有一張穿著白色羽絨衣的教宗照片在推特上瘋傳,後來證實並非真實照片,而是使用 Midjourney 生成的假照片。這一事件再次喚起人們對 Deepfake 的關注。
上週 Google 發佈了一份新聞稿,指出除了提供搜尋結果中圖片的資訊 (About this image) 外,還將進一步標示出哪些是 (自家) AI 生成的照片,讓使用者能夠有效判斷圖片的真假和出處。這個功能對開發者來說有哪些意義,還有待進一步發掘和想像。但可以確定的是,Google 開始把這功能給內化進它的日常產品裏頭了。
- 原文:Google will label fake images created with its A.I.
- About this image 功能介紹文:Get helpful context with About this image

Amazon acquires AI firm Snackable to boost podcast features
Amazon 透過收購來加碼 podcast 的服務
去年的聖誕月,Amazon 祕密收購了 Snackable AI,一家專門從事音樂智能技術的新創公司,當時引起的關注不多。
上週末,TechCrunch 報導了 Snackable AI 的技術可以 (即時) 掃描較長聲音檔案或是影音檔案,並從中自動生成 ”章節”、”重點 / highlight” 或是更多的結構化文本資訊到 metadata。這有助於聽眾更容易找到特定的資訊或是片段,而無需聽完或觀看整個內容 (應對資料爆炸的解方)。
這些由 AI 萃取出來的文本資訊,據說將進一步結合進 Amazon 自行研發的 LLM,提供更多吸引消費者的功能。畢竟,大量且高品質的文本是 LLM 成功的重要因素之一。
- 原文:Amazon quietly acquired audio content discovery engine Snackable AI to boost its podcast projects
- 中文:亞馬遜收購SNACKABLE AI 可自動產生音樂和視頻的亮點章節

synthesia : Say goodbye to cameras, microphones and actors.
Synthesia Research: 從 text2speech 到 text2human
於 2017 年推出的 Synthesia 是由四名分別來自 UCL (倫敦大學學院),Stanford,TUM (慕尼黑工業大學) 和 Cambridge 的 AI 研究者成立的。他們希望能夠鼓勵用戶在沒有相機、收音工具或工作室的情況下自由地進行影片創作。使用程式時只需要寫出文字稿,就能自動生成一支由 AI avatar 讀出脚本的影片。全程不需要錄影的拍攝方法顛覆了現今内容創作的模式,提升用戶的創作效率。 (原文出處) (demo 影片 ) (內部研究報告 )
Synthesia Research 最近在 SIGGRAPH 2023 的研究中釋出了 HumanRF,把原來只有臉部表情的上半身影片,進一步擴展到整個人身的表演。這可能是一個嘗試準備進入 metaverse 的研究計畫與產品實驗。(原文出處 )

Technologies and tools
Large Language Model (LLM) 再度讓人把目光聚焦在 foundation models,也由於 ChatGPT 的空前大成功,更多用來解決不同領域問題的 foundation models 也跟著出現。我們特別挑選了一個 LLM 列表,外加兩個成果非常好的 models 出來,它們夠接近到可以商用,但又還未氾濫到俯拾即是的地步。
- Open-LLMs
- A list of LLMs for Commercial Use.
收集了一些可供商用的 LLM,包括有名的 Bloom, StableLM-Alpha, StarCoder, 與 Free Dolly。 - YOLONAS
- A Next-Generation, Object Detection Foundational Model generated by Deci’s Neural Architecture Search Technology.
在電腦視覺領域裏幾乎所有的應用都與物件辨識有關,其中 YOLO 這一系列的研究最出名,它在物件辨識上有非常驚人的成效。月初來自 Deci AI 的 YOLONAS 則進一步又把它往前推了。(原文新聞稿 ) (Starter Notebook ) - Segment Anything
– A Foundation Model for Image Segmentation.
在電腦視覺領域裏另一個非常重要的基礎技術,就是影像分割。Segment Anything 是 Meta Research 所提出,現今最新的研究成果。(原文介紹 )
Inside ARC

Video bitrate 與 video quality 之間的隱性關聯的研究.
Video Quality 的進一步研究
Video 壓縮率與 video 品質之間的關係,是歷久不衰的一個需求與技術之間的平衡問題。我們都不喜歡看品質差的影片,而且我們愈來愈沒有耐心接受要等待或是播放不順的影片。如果再把人看的感覺給一併考量進來的話,那就是進一步的 perceptual video quality assessment & video bitrate 之間的問題了。
上圖是某次研究 video bitrate (上) 與 perceptual video quality (下) 之間的關聯性的研究結果,最終,它將貢獻進 Video Super Resolution 以及下一版的 video encoder 上頭。

Step into the future of the vending machine.
未來,說不定我們可以跟販賣機對話
E8 在週一進了新的販賣機,挺有意思的。下班前,一群同事本著「能否讓使用的體驗好一點」的目標下,對販賣機做了點研究。初步做出了點驗證,有了一個晚上的小進展。在輸入品項後,再發出一個 HTTP request 就結單了。那個 request 會自動帶你帶入員工編號,不需要你再手動輸入。如果再搭配個像是 HTTPBot 這類的 iOS App,體驗就又會稍為的好一點了。
最後,因為這台販賣機背後技術廠商的善意,是可以透過 pulling 約略取得大家投了什麼的。所以要做到像是「販賣機日榜」「販賣機週榜」「販賣機年度排行榜」都是做得到的。如果再結合很愛說話的 ChatGPT,是不是可以透過對話聊天,根據當時的心情,請它推薦一支飲料或是一個零食呢?!