同一份考題,只是改了作答時間,AI 的排名就翻盤了——而且有 3–19% 的題目「想越久錯越多」
我們習慣說「某某模型比較強」。這篇論文用 56,476 次推論證明,這句話少了一個前提:你讓它想多久。在三個測試集上,模型排名都會隨著 token 預算改變而反轉。
如果你曾經看著一張「模型能力排行榜」做採購決定,這篇論文會讓你有點不安。
它的結論很短:那張榜的名次,會因為你讓模型想多久而改變。不是差幾名,是直接反轉。
他們做了什麼
這篇論文(arXiv:2608.12150,2026 年 8 月 12 日投稿)挑戰一個大家預設成立、但很少有人驗證的假設:模型排名在不同推論條件下是穩定的。
做法很直接——固定題目,只改「token 生成預算」,也就是模型最多可以講多少字:
- 七個預算層級:從 64 一路到 4,096
- 四個模型、三個推理測試集
- 合計 56,476 次推論
用考試來理解
同一份考卷,考試時間從 10 分鐘到 100 分鐘不等。你會預期:時間越長,大家分數越高,而且名次大致不變——原本第一名還是第一名。
這篇論文發現的是:時間拉長後,班上第一名換人了。而且有些同學題目給越多時間,反而寫得越差。
四個發現
一、有 3–19% 的題目「想越久越錯」。論文稱之為非單調行為(non-monotone)——預算增加,準確率反而下降。研究者特別說明,這是在排除了「答案被截斷」的干擾之後仍然存在的現象。
而且這件事因模型而異:不同模型之間,會出問題的題目重疊率只有 6–14%。也就是說,每個模型有自己「想太多會壞掉」的題型,而且彼此不一樣。
二、排名會反轉,而且是全部反轉。論文寫得很明確:模型排名在所有三個測試集上都隨預算反轉,統計上顯著(McNemar 檢定,p < 0.01)。
三、模型之間有互補性,最高 +27.8 個百分點。如果每題都能挑到最適合的那個模型(論文稱為 oracle 分析),準確率最多可以再高 27.8pp。而且互補性在預算受限時最明顯——越是資源緊的場景,選對模型的價值越大。
四、但自動選模型沒那麼好做。研究者做了一個「預算感知路由器」去逼近那個上限,跨領域只抓到 14.1% 的差距。預算特徵在同領域內有幫助(+1.6 到 +5.7pp),但這些特徵是領域專屬的,換個領域用反而會扣分(−1.2pp)。
這對選型的實際意義
一、看排行榜之前,先問它是在什麼預算下測的。這是本篇最實用的一句話。如果榜單沒說,那個名次對你的使用情境不一定有效。
二、你的成本設定會改變誰是最佳模型。多數企業為了控成本會限制輸出長度。這篇告訴你:那個限制本身就在改變模型的相對強弱。在寬鬆預算下勝出的模型,在你的緊縮設定下可能是輸的那個。
三、「多給它想一下」不是免費的保險。有 3–19% 的題目會因此變差。這與我們在前沿模型的分歧回應模式一文中談到的現象可以對照著看。
四、自己測,用自己的題目和自己的預算。論文自己的路由器跨領域只抓到 14.1%,並明說預算特徵換領域會失效。這等於直說了:別人的結論搬不過來。
需要保留的懷疑
這是 arXiv 預印本,在本文寫作時尚無同儕審查紀錄。
- 只測了四個模型與三個推理測試集。摘要未列出是哪四個模型,因此無法判斷結論涵蓋哪些世代或哪些廠商。
- 測試集都是推理類。摘要式寫作、翻譯、分類這些任務是否也有排名反轉,論文沒有回答。
- 預算上限到 4,096 token。現在許多實務場景的輸出長度遠超過這個數字,更長的區間會不會又是另一種樣貌,不得而知。
常見問題
模型排行榜為什麼不能直接拿來選型?
因為這篇論文發現排名不是穩定的。在固定題目、只改變 token 生成預算(64 到 4,096 共七個層級)的條件下,四個模型在三個推理測試集上的排名全部出現反轉,且統計上顯著(McNemar,p<0.01)。所以看排行榜時要先確認它是在什麼輸出預算下測的,否則那個名次對你的使用情境不一定成立。
讓 AI 想久一點,答案一定比較好嗎?
不一定。論文發現 3–19% 的題目出現「非單調行為」——預算增加,準確率反而下降,而且這是在排除了答案被截斷的干擾之後仍然存在的。更麻煩的是這個現象因模型而異,不同模型之間會出問題的題目重疊率只有 6–14%,代表每個模型有自己「想太多會壞掉」的題型。
可以用自動路由器幫每題挑最好的模型嗎?
論文試過,效果有限。理想上每題都挑對模型最多可再提升 27.8 個百分點,但他們的預算感知路由器跨領域只捕捉到其中 14.1%。預算特徵在同領域內有幫助(+1.6 到 +5.7pp),但屬於領域專屬,換個領域使用反而會扣分(−1.2pp)。