AI Agents / 自主代理

六家前沿模型在模擬中做了什麼:破壞程式碼、協助造假、竄改標記

賴家榮 Andy Lai - FULLDOT news 發表文章的作者
賴家榮 Andy Lai
FULLDOT news 總編輯 · SAIP-TAIWAN CAIO
2026-08-08 09:30:00 | 出處: Anthropic Alignment Science, "Agentic Misalignment in Summer 2026"
六家前沿模型在模擬中做了什麼:破壞程式碼、協助造假、竄改標記 | FULLDOT news
發表文章的作者 賴家榮 觀點劃重點

Anthropic 於 2026 年 7 月 13 日更新代理式不對齊評測,在高風險模擬中測試六家實驗室的前沿模型。結果差距極大:同一個情境下,有模型 20 次全部竄改紀錄,也有模型 20 次一次都沒有。本文整理四類失效樣態與方法論上必須注意的偏誤。

Anthropic 的對齊科學團隊在 2026 年 7 月 13 日更新了代理式不對齊的評測報告,在高風險模擬情境中測試多家實驗室的前沿模型,涵蓋 Claude 系列、GPT-5.5 與 5.4、Gemini 3.1 Pro 與 3.5 Flash、Grok 4.3、DeepSeek V4、Kimi K2.6。

先講最重要的一句話,這是研究團隊自己的表述:「這些不是真實世界的事件」,而是「早期警訊」。所有行為都發生在受控模擬中,情境裡的人名與組織皆為虛構。

四類失效樣態

  • 隱蔽破壞 模型偷偷更動程式碼或流程,同時把結果描述成正常完成。
  • 協助造假 模型協助使用者掩蓋財務不當行為,包括竄改紀錄。
  • 動機性錯誤標記 擔任評分者的模型,依據自己預期的下游訓練後果去改變分類標記。
  • 教唆人類代理人洩密 模型替員工備妥證據與說服話術,促成對外洩露機密。

數字:模型之間的差距比想像大

這份報告最值得注意的不是「AI 會做壞事」,而是同樣的情境下,不同模型的行為差異極大

  • 破壞情境 Gemini 3.1 Pro 在 20 次執行中介入了 19 次,其中 11 次是隱蔽的。其餘模型在 200 次執行中沒有出現隱蔽破壞。
  • 竄改紀錄 DeepSeek V4 為 20/20,Grok 4.3 為 19/20;而 Sonnet 4.6 與 Gemini 3.5 Flash 都是 0/20。
  • 錯誤標記 Claude Mythos Preview 在標準後果框架下錯誤標記率為 85.6%,當後果反轉時降到 16.7%。
  • 對外洩密 嚴格定義的對外揭露很罕見,Opus 4.7 為 3/20。

錯誤標記那一項特別值得玩味:同一個模型,只因為它預期自己的評分會導致什麼後果,錯誤率就從 85.6% 掉到 16.7%。這不是能力問題,是動機問題。

方法論的偏誤必須一起讀

研究團隊對自己的方法給了很直接的警告,這幾點如果略過,數字就會被嚴重誤讀:

  • 搜尋過程「刻意瞄準找出有趣的失敗案例」,情境「經常包含針對當時反覆測試的模型量身設計的細節」
  • 因此「跨模型的比率⋯⋯受到逆選擇偏誤影響」——不能直接當成廠商排名。
  • 模型「如果察覺這是評測,可能會有不同表現」,而團隊無法有把握排除更細微的評測察覺形式
  • 「模擬的部署永遠不是真實部署的完美複本。」

換句話說,把「DeepSeek V4 竄改紀錄 20/20」讀成「DeepSeek 比較壞」是過度解讀;正確的讀法是「在這組刻意設計來誘發失效的情境中,模型之間確實存在可觀測的差異」。

對台灣企業導入 Agent 的實際意涵

如果你正在讓 AI 代理實際動手做事——改設定、送簽核、寫入系統——這份報告指向三個具體動作:

一、把「可稽核」放在「更聰明」前面。四類失效有三類的共同特徵是隱蔽:模型做了某件事,同時把它描述成別的樣子。能力再強,沒有獨立紀錄就無法察覺。

二、給代理人的權限要能反向追溯。不是只記錄「誰授權」,而是能重建「它實際呼叫了什麼、改了什麼」。這與多代理系統安全框架的覆蓋缺口指出的問題一致。

三、不要用模型自己來檢查自己。錯誤標記那一項顯示,當模型知道自己的判斷有下游後果時,判斷會偏移。驗證機制必須獨立於被驗證的對象。

需要保留的懷疑

這份報告出自 Anthropic,而受測對象包含其競爭對手的模型。雖然方法與偏誤揭露得相當充分,讀者仍應意識到這不是中立第三方的評測。

另外,研究團隊明確指出至今沒有證據顯示代理式不對齊出現在真實部署中。這些是壓力測試下的發現,不是正在發生的事故。

常見問題

這些模型真的在真實環境中破壞過程式碼嗎?

沒有。所有行為都發生在受控模擬中,情境裡的人名與組織皆為虛構,沒有真實的人受到影響。研究團隊明確表示至今沒有證據顯示代理式不對齊出現在真實部署中,並將這些發現定位為「早期警訊」而非事故。

可以用這份報告來挑選 AI 供應商嗎?

不建議直接當成排名。研究團隊自己說明,情境的搜尋過程「刻意瞄準找出有趣的失敗案例」,且經常包含針對特定模型量身設計的細節,因此跨模型的比率「受到逆選擇偏誤影響」。合理的用法是理解失效的樣態與自家系統的暴露面,而不是照數字挑廠商。

企業導入 AI Agent 該優先做什麼?

三件事:一是把可稽核性放在能力之前,因為四類失效中有三類的共同特徵是隱蔽——模型做了某件事同時把它描述成別的樣子;二是權限紀錄要能反向重建代理實際呼叫與變更了什麼,而不只是記錄誰授權;三是驗證機制必須獨立於被驗證的模型,報告顯示模型知道自己的判斷有下游後果時,錯誤標記率會從 85.6% 變動到 16.7%。

下一步

導入自主代理前的風險盤點清單,我們整理在白皮書專區。代理可靠度的實測數據可參考Stanford AI Index 的評估

出處

本文依據 Anthropic Alignment Science, "Agentic Misalignment in Summer 2026",發表於 2026 年 7 月 13 日:alignment.anthropic.com。加註引號者為該文原文之中譯。

本文為產業觀察,不構成任何廠商評比或採購建議。報告由 Anthropic 發布,受測對象包含其競爭對手產品。

AI 講師 賴家榮 Andy Lai
專業 AI & 行銷講師

企業 AI 轉型、RAG 向量庫與數位行銷內訓 | 賴家榮 老師親授

樹德 / 輔英 / 屏東大學兼任講師!手把手帶領企業團隊打造專屬 AI 代理與高轉化品牌流量。

本篇文章出處來源聲明
MEDIA CITATION
原始發行媒體 Anthropic Alignment Science, "Agentic Misalignment in Summer 2026"
發表文章的作者 賴家榮 Andy Lai