Frontier AI / 前沿模型

多模態模型到底強在哪?從 Gemini 技術報告看「原生多模態」與長上下文的真實邊界

賴家榮 Andy Lai - FULLDOT news 發表文章的作者
賴家榮 Andy Lai
FULLDOT news 發表文章的作者 · SAIP-TAIWAN CAIO
2026-08-02 06:52:43 | 出處: Google DeepMind Gemini 技術報告 (arXiv:2312.11805)
FULLDOT news 甫東科技 全球 AI 新聞網
發表文章的作者 賴家榮 觀點劃重點

「看得懂圖、聽得懂聲音」聽起來很厲害,但多模態真正的技術分水嶺不在功能列表,而在模型是原生就吃多種訊號,還是外掛翻譯。本文拆解 Gemini 技術報告的基準數字該怎麼讀、長上下文有什麼沒被講的限制,以及製造業現場最適合切入的場景。

談多模態 AI,多數報導的寫法是列功能:能看圖、能聽聲音、能讀影片。但這種寫法幫不上判斷,因為現在幾乎每一家的模型都宣稱做得到。

真正該問的是兩個問題:它是原生多模態,還是外掛?以及那些基準分數,實際代表什麼?

原生多模態 vs 外掛翻譯:差在哪

早期的「多模態」多半是拼裝的:先用一個影像辨識模型把圖片轉成文字描述,再把文字餵給語言模型。使用者感覺得到它看懂了圖,但中間經過一次有損轉換

這個差別可以用生活裡的事情類比:外掛式多模態,像是請人幫你把電影口述成文字再讀給你聽。劇情你會知道,但演員一個猶豫的眼神、鏡頭停留的長度、背景音樂什麼時候進來,這些沒有被寫進口述稿的東西就永遠遺失了。

原生多模態則是在訓練階段就把文字、影像、音訊一起編碼成同一種內部表示,模型直接在這個共同空間裡推理。Google 在 Gemini 技術報告(arXiv:2312.11805)裡強調的就是這個設計取向。

實務上這個差別在什麼時候會現形?當答案藏在「非文字的細節」裡的時候。一段機台運轉聲音的頻率變化、一張 X 光片上的灰階漸層、一段影片裡動作發生的先後順序——這些轉成文字描述就消失了。

那些基準分數,該怎麼讀

Gemini 技術報告中最常被引用的兩個數字:在 32 項基準中的 30 項取得當時最佳成績,以及 MMLU 突破 90%。

這些數字是真的,但要理解它們代表什麼,得先知道 MMLU 是什麼:它是一組涵蓋 57 個學科的選擇題,從高中數學到法律、醫學都有。本質上是一份跨領域的紙筆測驗。

所以 90% 的正確解讀是「這個模型在跨領域選擇題上表現接近人類專家」,而不是「這個模型有 90% 的能力」。兩件事差很遠。

更重要的是三個實務上的但書:

  • 基準會飽和。當所有前沿模型都擠在 88~92% 之間,這個分數就失去了鑑別力。差距落在誤差範圍內時,拿它來選型沒有意義。
  • 資料污染難以排除。基準題目在網路上公開多年,很難確保沒有出現在訓練資料裡。這不是指控任何人作弊,是這類評測方法的結構性限制。
  • 選擇題測不出你要的能力。你的實際任務是「讀懂這份 80 頁的維修手冊並判斷該換哪個零件」,那跟答選擇題是不同的能力。

選型時,一份用你自己資料做的三十題小測驗,比任何公開基準都準。這件事花不到一天,但幾乎沒有企業做。

長上下文:好用,但沒有廣告說的那麼萬能

長上下文(能一次讀進大量內容)常被當成「不需要 RAG 了」的理由。這個推論太快了。

先講它真正解決的問題:當資料量在上下文塞得下的範圍內,直接塞進去確實比建一套檢索系統簡單得多。一本產品手冊、一份合約、一季的會議紀錄,直接丟給模型是最省事的做法,也不會有檢索漏抓的問題。

但有三個限制值得先知道:

  • 成本隨長度增加。每次提問都把整本手冊重讀一遍,跟只讀相關的三頁,費用差距在高頻使用時很可觀。
  • 中段容易被忽略。研究上反覆觀察到的現象是,資訊放在超長上下文的開頭與結尾時,模型抓得比較準;放在中間段落時準確率會下降。塞得進去不等於讀得同樣仔細。
  • 資料會變動。手冊改版、價目表更新的時候,長上下文的做法是每次都要重新送一份完整檔案;檢索系統則只要更新那幾筆。

比較務實的判準是:資料量小又穩定,用長上下文;資料量大又常變,用檢索。兩者不是取代關係。

製造業現場:一個具體的應用情境

以下是說明多模態能力的示範情境,不是已完成的導入案例——用來說明「原生多模態」在現場的價值落在哪裡。

假設一台 SMT 貼片機異常停機。傳統流程是:作業員打電話給維修工程師,口頭描述症狀,工程師憑經驗判斷可能原因,帶著零件過來,到現場才知道猜錯了。

多模態模型能改變的是症狀傳遞的失真

  • 影像:直接拍下電路板,讓模型辨識型號並指出電容鼓包位置——不必依賴作業員描述「有一個東西看起來怪怪的」。
  • 聲音:錄下運轉異音。軸承缺油、皮帶鬆脫、馬達負載過高在頻譜上是不同的特徵,而這些用文字幾乎無法描述。
  • 文件:把原廠手冊放進上下文,讓模型指出對應的排除步驟與零件料號。

價值不在於「AI 會修機台」——它不會。價值在於讓工程師出門前就知道要帶哪個零件。這個差別在深夜停機的時候,就是產線停三小時還是停一小時。

要注意的是,這類應用的落地門檻通常不在模型,而在現場拍得到、錄得到、傳得出去。無塵室能不能帶手機、廠內網路能不能連外、資料能不能出廠——這些會比模型選型更早決定案子做不做得成,和封測廠最後全部走地端是同一組限制。

常見問題

原生多模態和外掛式多模態,使用者分得出來嗎?

單看一般問答分不出來。差別會在答案藏於非文字細節時出現,例如判讀機台異音、辨識影片中動作的先後順序、或分析醫療影像的細微灰階變化。這類任務外掛式做法會明顯失準,因為資訊在轉成文字描述時就已經遺失。

MMLU 90% 代表這個模型可以取代專業人員嗎?

不代表。MMLU 是涵蓋 57 個學科的選擇題測驗,高分表示模型在跨領域紙筆測驗上接近人類專家水準,但實際工作任務(閱讀特定手冊、依公司規則判斷、承擔決策責任)與答選擇題是不同的能力。選型時應以自己的資料建立小規模測試集,比公開基準準確得多。

有了長上下文,還需要建 RAG 向量庫嗎?

視資料特性而定。資料量小且穩定(單一手冊、單份合約)時,直接使用長上下文較簡單。資料量大、更新頻繁、或需要控制每次查詢成本時,檢索式架構仍然較有優勢。此外超長上下文有中段資訊準確率下降的現象,塞得進去不等於讀得同樣仔細。

製造業導入多模態 AI,最常卡在哪裡?

多數情況卡在資料能不能取得與能不能外傳,而不是模型能力。無塵室的攝影限制、廠內網路是否對外連通、以及客戶保密協議是否允許資料傳給第三方服務,這些會比模型選型更早決定專案可行性。

出處

本文引用之基準數據出自 Google DeepMind 發布之 Gemini 技術報告(arXiv:2312.11805),該報告發表於 2023 年 12 月。長上下文中段準確率下降之現象,為多篇長上下文評測研究之共同觀察。文中製造業情境為說明用途之示範,非實際導入案例。

AI 講師 賴家榮 Andy Lai
專業 AI & 行銷講師

企業 AI 轉型、RAG 向量庫與數位行銷內訓 | 賴家榮 老師親授

樹德 / 輔英 / 屏東大學兼任講師!手把手帶領企業團隊打造專屬 AI 代理與高轉化品牌流量。

本篇文章出處來源聲明
MEDIA CITATION
原始發行媒體 Google DeepMind Gemini 技術報告 (arXiv:2312.11805)
發表文章的作者 賴家榮 Andy Lai