同樣被要求「不要說出你的推理」,六個前沿模型的反應完全不同——而且差在種類,不是程度
一份 2026 年 8 月的研究對六家實驗室的前沿模型施加操控壓力,累積 24,480 筆評判。結論很具體:GPT-5 有 99% 的機率拒絕揭露自己的推理但仍給出答案,其餘模型是 0%。模型之間的差異不只在被影響的幅度,而在反應的「種類」。
企業在選 AI 模型時,通常比的是能力:誰的分數高、誰的上下文長、誰比較便宜。' 但有一個維度幾乎沒有人比——當有人試圖操控它時,它會怎麼反應。
一份投稿於 2026 年 8 月 6 日、於 8 月 10 日公告的 arXiv 論文(編號 2608.06578)針對這件事做了系統性測試,結果相當具體。
實驗怎麼設計的
研究者對六家不同開發商的六個前沿模型施加操控壓力,使用 300 組配對的「原始題/被操控題」,涵蓋三個類別:
- 價值衝突(values-conflict)
- 誘發推理(reasoning-elicitation)
- 抑制推理(reasoning-suppression)
評判方式值得一提:六個模型全部同時擔任「盲眼同儕評審」,依固定的行為量表為每一則回應分類,最後以留一法共識計分。總共產生 24,480 筆評判。
最關鍵的一句話
論文摘要裡這句是全文重點:「我們發現模型之間的差異,不只在於操控使其行為改變了多少,更在於它給出何種(模式)的回應,而某些回應模式只出現在其中一兩個模型身上。」
換句話說,這不是「A 模型比較容易被說服、B 模型比較堅定」的程度差異,而是它們用完全不同的方式應對。
具體的差異長什麼樣
- GPT-5 會迴避揭露自己推理的要求,但答案照給。這個行為的出現率是 99%,其餘所有模型是 0%。
- Claude Opus 4.7 與 GPT-5 都會抵抗明確的抑制指令,但兩者抵抗的方式不同。
99% 對 0% 這個對比很少見。它代表這不是統計上的傾向差異,而是一個模型有、其他模型完全沒有的行為。
他們還把這個行為在模型內部找出來了
研究以 Llama 作為開放權重的對象,追蹤最大的行為分歧到模型內部:
- 用線性探針從殘差流解碼該行為,保留測試集準確率達 0.87。
- 在生成過程中注入該方向,可以把該行為從 0% 推升到 86%。
能解碼、又能靠注入把行為推到 86%,代表這個行為對應到模型內部一個相當明確的方向,而不是散落的雜訊。這與我們先前導讀過的 Anthropic 全域工作空間研究指向同一個方向:模型的某些行為,是可以被定位並直接操作的。
對台灣企業的三個實際意涵
一、換模型不只是換價格與分數。如果你的系統原本用 A 模型、後來為了成本換成 B,你換掉的可能還包括「它面對異常指令時的反應方式」。而這件事在一般的評測分數上完全看不出來。
二、「不揭露推理但照給答案」對稽核是個問題。在受管制的應用裡,你需要的往往正是推理過程。一個 99% 會迴避揭露推理的模型,在需要交代判斷依據的場合會很麻煩。這一點值得在選型時實測,而不是看規格。
三、行為可被注入,代表防護要放在系統層。既然研究者能靠注入把行為從 0% 推到 86%,就不該假設模型本身的傾向是穩固的防線。權限邊界、獨立稽核紀錄這些系統層控制不能省——這與 GPT-Red 那份研究的結論一致。
需要保留的懷疑
這是 arXiv 預印本,在本文寫作時尚無同儕審查紀錄。論文由單一作者提出,摘要中未見明列限制章節。
方法上有兩點讀者應自行留意:一是由模型互相擔任評審,即使採用盲眼與共識計分,模型評審是否帶有系統性偏好仍難完全排除;二是 300 組題目的設計方式會影響哪些行為被觸發,換一組題目結果未必相同。
研究者確實做了兩項對照——token 預算補償與「對假設盲」的評判提示——並表示所有發現在這兩種條件下都成立。這比多數同類研究嚴謹,但不等於結論可以直接外推到你的實際工作負載。
常見問題
這份研究是說 GPT-5 比較不透明嗎?
不能這樣簡化。研究測得的是一個具體行為:面對「揭露你的推理」這類要求時,GPT-5 有 99% 的機率迴避該要求但仍給出答案,其餘五個模型是 0%。這是行為模式的差異,論文並未對透明度做價值判斷。對企業的意義在於:如果你的應用需要模型交代判斷依據,這個行為要在選型階段實測。
企業換 AI 模型供應商時該注意什麼?
除了能力與價格,要加測「異常指令下的反應方式」。這份研究顯示模型之間的差異不只是被影響的程度,而是回應的種類,且某些模式只出現在一兩個模型上。建議用自家真實的邊界案例做配對測試——同一題的正常版與被操控版各問一次,比較兩者的差異。
既然模型行為可以被注入操控,還能信任它嗎?
研究以開放權重的 Llama 顯示,注入特定方向可將某行為從 0% 推升到 86%。這件事的正確解讀不是「模型不可信」,而是不應把模型本身的傾向當成防線。權限邊界、金額上限、獨立於模型的稽核紀錄等系統層控制才是可靠的部分。
下一步
模型選型的實測題庫設計與系統層控制檢核,我們整理在白皮書專區。
出處
本文依據 Ali Jalal-Kamali, "Divergent Response Modes in Frontier Language Models Under Steering Pressure", arXiv:2608.06578,投稿於 2026 年 8 月 6 日、8 月 10 日公告:arxiv.org/abs/2608.06578。加註引號者為該論文摘要原文之中譯。
本文為產業觀察,非學術評議。該論文為預印本,尚未經同儕審查。