Frontier AI / 前沿模型

AI 解開了四個未解數學問題——但 Google DeepMind 自己說,還沒有一項算「重大進展」

賴家榮 Andy Lai - FULLDOT news 發表文章的作者
賴家榮 Andy Lai
FULLDOT news 總編輯 · SAIP-TAIWAN CAIO
2026-08-08 11:00:00 | 出處: Google DeepMind, "Gemini Deep Think: Redefining the Future of Scientific Research"
AI 解開了四個未解數學問題——但 Google DeepMind 自己說,還沒有一項算「重大進展」 | FULLDOT news
發表文章的作者 賴家榮 觀點劃重點

Google DeepMind 的 Gemini Deep Think 在數學、物理與計算機科學上取得多項具體成果,包括自主解出 Erdős 猜想資料庫中的四個未解問題。但團隊在同一篇文章中明確設限:「我們目前不主張任何第三級(重大進展)與第四級(里程碑突破)的成果。」

Google DeepMind 在 2026 年 2 月 11 日發表了 Gemini Deep Think 在科學研究上的成果。這套系統的運作方式是延長運算時間來反覆「產生、驗證、修正」解法,涵蓋數學、物理與計算機科學。

成果清單相當可觀,但這篇文章真正值得台灣讀者注意的,是 DeepMind 自己劃下的那條線。

具體成果

  • 數學競賽 隨推論時運算規模擴大,在 IMO-ProofBench Advanced 測試上最高達到 90%
  • 純數學 自主解出 Erdős 猜想資料庫中的四個未解問題;並對特徵權重、獨立多項式與複雜度界限等論文有所貢獻。
  • 計算機科學 解決了 Max-Cut 演算法與 Steiner Tree 最佳化的問題,並「解決了線上次模最佳化中一個懸置十年的猜想」
  • 物理 在宇宙弦重力輻射的計算上「找到了一個使用 Gegenbauer 多項式的新解法」
  • 博士級評測 在最高運算等級下,FutureMath Basic 基準達到 38%

參與方向指導的包含多位數學家、物理學家與計算機科學家,致謝名單中包括 Terence Tao。

DeepMind 自己劃的那條線

在這樣一份成果清單之後,團隊寫下:「目前,我們不主張任何第三級(重大進展)與第四級(里程碑突破)的成果。」

這句話比成果清單本身更有資訊量。它承認了一件事:解開未解問題、破除十年懸案,這些聽起來很像突破的成就,在該團隊自己的分級標準下仍屬於較低的層級。

成果的性質橫跨了「AI 自主貢獻」到「人機協作」,並非全部由模型獨立完成。這兩者在科學貢獻的認定上差別很大,但在新聞標題裡經常被混為一談。

對企業的意義:推論時運算是可買的變數

撇開學術意義,這份成果對企業有一個很務實的啟示。注意 IMO-ProofBench 那一項的措辭:「隨推論時運算規模擴大」達到 90%,以及 FutureMath 的 38% 是「在最高運算等級下」

這代表同一個模型,給它更多思考時間,能力上限會往上移。對企業的意涵是:模型能力不再是一個固定的規格,而是一條可以用成本換取的曲線。

實務上這帶來一個新的決策維度——對於高價值、低頻率的問題(合約風險分析、製程異常根因、法規適用判斷),投入更多推論運算可能比更換模型更划算。這與代理可靠度來自架構而非模型的發現方向一致。

需要保留的懷疑

這是 Google DeepMind 對自家系統的成果發表,非獨立第三方驗證。其中屬於「人機協作」的部分,AI 的實際貢獻比例無法從該文判定。

另外,基準測試分數與真實研究能力之間有落差。IMO-ProofBench 上 90% 不等於能做出同等級的原創研究——事實上團隊自己的分級就說明了這一點。

最後,本文發表於 2026 年 2 月,AI 領域變動快速,後續進展請以官方最新公告為準。

常見問題

Gemini Deep Think 真的解開了數學上的未解問題嗎?

依 Google DeepMind 的發表,它自主解出了 Erdős 猜想資料庫中的四個未解問題,並解決了線上次模最佳化中一個懸置十年的猜想。但團隊同時明確表示「目前,我們不主張任何第三級(重大進展)與第四級(里程碑突破)的成果」,且部分成果屬於人機協作而非模型獨立完成。

什麼是「推論時運算」?為什麼企業要在意?

指模型在回答問題時投入的運算量。DeepMind 的數據顯示同一系統「隨推論時運算規模擴大」,IMO-ProofBench Advanced 分數最高可達 90%。對企業的意義是:模型能力不是固定規格,而是可以用成本換取的曲線。對高價值低頻率的問題(合約風險分析、製程異常根因、法規適用判斷),加大推論運算可能比更換模型划算。

基準測試分數高,代表可以拿來做研發嗎?

不能直接畫等號。基準測試分數與真實研究能力之間存在落差,DeepMind 自己的分級制度就說明了這一點——即使在 IMO-ProofBench Advanced 達到 90%,團隊仍不主張達到重大進展等級。企業評估時應以自家實際任務測試,而非採信基準分數。

下一步

如何為高價值任務估算推論運算的投報,我們把評估方法整理在白皮書專區

出處

本文依據 Google DeepMind, "Gemini Deep Think: Redefining the Future of Scientific Research",發表於 2026 年 2 月 11 日:deepmind.google。加註引號者為該文原文之中譯。

本文為產業觀察,非學術評議。成果由 Google DeepMind 自行發表,未經獨立第三方驗證。

AI 講師 賴家榮 Andy Lai
專業 AI & 行銷講師

企業 AI 轉型、RAG 向量庫與數位行銷內訓 | 賴家榮 老師親授

樹德 / 輔英 / 屏東大學兼任講師!手把手帶領企業團隊打造專屬 AI 代理與高轉化品牌流量。

本篇文章出處來源聲明
MEDIA CITATION
原始發行媒體 Google DeepMind, "Gemini Deep Think: Redefining the Future of Scientific Research"
發表文章的作者 賴家榮 Andy Lai