Ten Years of AI in Review

人工智慧每週都有新的進展,不管是研究、應用、新創或是企業級服務。如果我們研究這些發展,循著脈絡,挖掘出背後的技術堆疊,就能有一個可依靠的方法來得知其可能的優劣、限制與能耐。

以基於 LLM 的生成式 AI 應用為例來往前回溯。我們把技術帶來的關聯機制與影響列出來,會看到前置技術成為後置技術的立基,提供了系統流程,帶來了新的解法。同時,也再次意識到技術迭代看似飛快,但卻也是一個接著一個,基於上一批技術的基礎演進而來的。

  • 2012:AlexNet 開啟了深度學習的時代
  • 2015:ResNet 與 LSTM 讓語言模型 (language model) 能夠處理長篇文字和演講
  • 2017:Transformer 開啟了高效率 large language model (LLM) 的可行性
  • 2018:GPT-1, GPT-2, BERT 基於 Transformer 進行規模擴展的首次嘗試
  • 2020:GPT-3 在翻譯、問答、摘要等自然語言任務上達到近乎人類
  • 2022:ChatGPT 經過更大量 RLHF 微調後誕生出了全方位的對話小幫手
  • 2023:各式各樣基於 LLM 的商業應用問世

更多的資訊:


CVPR 2023 by the Numbers

CVPR 2023:多視角、3D、影音合成與生成

Conference on Computer Vision and Pattern Recognition (CVPR) 即將到來。每年,來自全球各地的電腦視覺研究人員和工程師齊聚一堂,參與這一個重要盛事。CVPR 作為一個展示該領域最具開創性研究和精心撰寫論文的平台,它的 h5-index 在所有會議和出版物中排名第四,僅次於《自然》、《科學》和《新英格蘭醫學雜誌》。

今年投稿論文數超過 8,000 篇,最後由 2,359 篇論文、100 場 workshops、33 場 tutorials、以及來自業界的展覽組成。今年在「多視角與 3D」、「影像合成與生成」、以及「人像影音」有最多的研究出爐。其中 NeRF (Neural Radiance Fields) 系列的技術發展,是最吸引人眼球,也是與 VR/AR/MR 最相關的研究。

當手機有更厲害的夜拍;當一張大頭照就能生出栩栩如生的 3D avatar;當 NVIDIA 說你的手機影片可以被轉成 3D 好進入 metaverse 時,我們就曉得又一批來自 CVPR 的研究進入了市場。挑戰人類想像極限的同時,也提供了更多不同的商業應用與機會~


Markup 2023-06-12 at 18.38.43.png

Voyager: An Open-Ended Embodied Agent with Large Language Models

Voyager: Minecraft 迎來個了強大的自學機器人

NVIDIA 最近發佈以 GPT-4 為基礎創建了一個叫 Voyager 的機器人來玩 Minecraft 的研究。透過 GPT-4 解決問題並學習新技能,讓機器人的能力可以不斷自我學習與演進。Voyager 通過讀取遊戲狀態並使用 GPT-4 生成代碼來探索遊戲和提高技能。它還構建了一個代碼庫,並在物品收集、探索距離和構建工具方面表現出優勢。

例如,Voyager 可能會在附近的河流中看到一根釣魚竿,GPT-4 會建議它去釣魚以獲得經驗值。然後它將使用這個目標讓 GPT-4 生成要實現釣魚所需的代碼。如果最初建議的代碼運行不完美,Voyager 將嘗試使用錯誤消息、遊戲反饋和 GPT-4 生成的代碼描述來改善它。

這展示了GPT-4 在提升 AI 代理能力方面的潛力,克服了傳統 AI 訓練方法的限制。


Markup 2023-06-12 at 14.41.01.png

Boosting Monocular Depth Estimation Models to High-Resolution via Content-Adaptive Multi-Resolution Merging

神奇的景深估計能力揭示視覺世界

在 CVPR 2021 會議,Adobe 與 Simon Farseer University 合作提出一種景深估計的方法。作者指出在此之前,深度學習神經網絡從單張圖像中估計景深方面具有強大的能力。然而,推斷得到的深度圖通常低於一百萬像素的解析度,並且常常缺乏細節,這極大地限制了實用性。

作者發現且驗證了一致的場景結構 (consistent scene structure) 與高頻細節 (high-frequency details) 間存在一種權衡關係。具體而言,他們發現 MiDAS(預訓練模型)在低解析度下能更好地估計物件景深關係,但缺乏細節;在高解析度時則能夠展現更細節,但景深判斷不準。利用這種雙重性,作者提出了一種雙重估計方法,改善了整體圖像的深度估計。將圖片切成多張小塊,各自採低解析度和高解析度的估計結果,取其優點相結合,並提供了一種補丁選擇方法,添加局部細節到最終結果中。


Others


Technologies and Tools


Inside ARC

隨著 CVPR conference 2023 即將在 Vancouver 登場,主辦單位公布了完整的 accepted paper list 。而先前電子報提到的 NTIRE VQA 競賽,主辦方也將所有參賽者的演算法彙編成一篇 report paper ,揭曉各家絕招。

VQA (Video Quality Assessment) 任務是秀過訓練出一個模型,給與一段影片,能夠輸出代表「人類主觀感受」的品質分數。

表現名列前茅的 TB-VQA、QuoVadis 團隊提出的模型,皆拆分影片品質為「單張 frame 的畫質、扭曲程度」以及「多張 frames 的連續、流暢度」兩塊進行訓練。

The QuoVadis team proposed dual-branch VQA network for enhanced videos.

另外,為了提高計算效率,不少做法都使用了 FAST-VQA 提出的 frame sampling 技巧,包括 QuoVadis、IVL 以及我們團隊的 SB-VQA,都得到很好的表現。

Grid Mini-patch Sampling from FAST-VQA

我們接下來便會開始嘗試改良 VQA 引擎,並將它運用在各式各樣的視覺相關任務上!