AI 解開了四個未解數學問題——但 Google DeepMind 自己說,還沒有一項算「重大進展」
Google DeepMind 的 Gemini Deep Think 在數學、物理與計算機科學上取得多項具體成果,包括自主解出 Erdős 猜想資料庫中的四個未解問題。但團隊在同一篇文章中明確設限:「我們目前不主張任何第三級(重大進展)與第四級(里程碑突破)的成果。」
Google DeepMind 在 2026 年 2 月 11 日發表了 Gemini Deep Think 在科學研究上的成果。這套系統的運作方式是延長運算時間來反覆「產生、驗證、修正」解法,涵蓋數學、物理與計算機科學。
成果清單相當可觀,但這篇文章真正值得台灣讀者注意的,是 DeepMind 自己劃下的那條線。
具體成果
- 數學競賽 隨推論時運算規模擴大,在 IMO-ProofBench Advanced 測試上最高達到 90%。
- 純數學 自主解出 Erdős 猜想資料庫中的四個未解問題;並對特徵權重、獨立多項式與複雜度界限等論文有所貢獻。
- 計算機科學 解決了 Max-Cut 演算法與 Steiner Tree 最佳化的問題,並「解決了線上次模最佳化中一個懸置十年的猜想」。
- 物理 在宇宙弦重力輻射的計算上「找到了一個使用 Gegenbauer 多項式的新解法」。
- 博士級評測 在最高運算等級下,FutureMath Basic 基準達到 38%。
參與方向指導的包含多位數學家、物理學家與計算機科學家,致謝名單中包括 Terence Tao。
DeepMind 自己劃的那條線
在這樣一份成果清單之後,團隊寫下:「目前,我們不主張任何第三級(重大進展)與第四級(里程碑突破)的成果。」
這句話比成果清單本身更有資訊量。它承認了一件事:解開未解問題、破除十年懸案,這些聽起來很像突破的成就,在該團隊自己的分級標準下仍屬於較低的層級。
成果的性質橫跨了「AI 自主貢獻」到「人機協作」,並非全部由模型獨立完成。這兩者在科學貢獻的認定上差別很大,但在新聞標題裡經常被混為一談。
對企業的意義:推論時運算是可買的變數
撇開學術意義,這份成果對企業有一個很務實的啟示。注意 IMO-ProofBench 那一項的措辭:「隨推論時運算規模擴大」達到 90%,以及 FutureMath 的 38% 是「在最高運算等級下」。
這代表同一個模型,給它更多思考時間,能力上限會往上移。對企業的意涵是:模型能力不再是一個固定的規格,而是一條可以用成本換取的曲線。
實務上這帶來一個新的決策維度——對於高價值、低頻率的問題(合約風險分析、製程異常根因、法規適用判斷),投入更多推論運算可能比更換模型更划算。這與代理可靠度來自架構而非模型的發現方向一致。
需要保留的懷疑
這是 Google DeepMind 對自家系統的成果發表,非獨立第三方驗證。其中屬於「人機協作」的部分,AI 的實際貢獻比例無法從該文判定。
另外,基準測試分數與真實研究能力之間有落差。IMO-ProofBench 上 90% 不等於能做出同等級的原創研究——事實上團隊自己的分級就說明了這一點。
最後,本文發表於 2026 年 2 月,AI 領域變動快速,後續進展請以官方最新公告為準。
常見問題
Gemini Deep Think 真的解開了數學上的未解問題嗎?
依 Google DeepMind 的發表,它自主解出了 Erdős 猜想資料庫中的四個未解問題,並解決了線上次模最佳化中一個懸置十年的猜想。但團隊同時明確表示「目前,我們不主張任何第三級(重大進展)與第四級(里程碑突破)的成果」,且部分成果屬於人機協作而非模型獨立完成。
什麼是「推論時運算」?為什麼企業要在意?
指模型在回答問題時投入的運算量。DeepMind 的數據顯示同一系統「隨推論時運算規模擴大」,IMO-ProofBench Advanced 分數最高可達 90%。對企業的意義是:模型能力不是固定規格,而是可以用成本換取的曲線。對高價值低頻率的問題(合約風險分析、製程異常根因、法規適用判斷),加大推論運算可能比更換模型划算。
基準測試分數高,代表可以拿來做研發嗎?
不能直接畫等號。基準測試分數與真實研究能力之間存在落差,DeepMind 自己的分級制度就說明了這一點——即使在 IMO-ProofBench Advanced 達到 90%,團隊仍不主張達到重大進展等級。企業評估時應以自家實際任務測試,而非採信基準分數。
下一步
如何為高價值任務估算推論運算的投報,我們把評估方法整理在白皮書專區。
出處
本文依據 Google DeepMind, "Gemini Deep Think: Redefining the Future of Scientific Research",發表於 2026 年 2 月 11 日:deepmind.google。加註引號者為該文原文之中譯。
本文為產業觀察,非學術評議。成果由 Google DeepMind 自行發表,未經獨立第三方驗證。