AI Agents / 自主代理

OpenAI 用 AI 攻擊自己的 AI:GPT-Red 對人類紅隊 84% 比 13% 的攻擊成功率

賴家榮 Andy Lai - FULLDOT news 發表文章的作者
賴家榮 Andy Lai
FULLDOT news 總編輯 · SAIP-TAIWAN CAIO
2026-08-08 11:30:00 | 出處: OpenAI, "GPT-Red: Unlocking Self-Improvement for Robustness"
OpenAI 用 AI 攻擊自己的 AI:GPT-Red 對人類紅隊 84% 比 13% 的攻擊成功率 | FULLDOT news
發表文章的作者 賴家榮 觀點劃重點

OpenAI 於 2026 年 7 月 15 日發表 GPT-Red——一個專門用來攻擊自家模型的自動化紅隊模型。在同一組全新情境中,GPT-Red 的攻擊成功率為 84%,人類紅隊為 13%。它也成功攻破了辦公室裡一台真實運作的自主販賣機代理。

OpenAI 在 2026 年 7 月 15 日公開了 GPT-Red,一個專門訓練來攻擊自家模型的自動化紅隊演練模型。它的訓練目的很直接:用今天的模型,去打造更安全的下一代模型。

對台灣企業而言,這份發表的價值不在於 OpenAI 的模型變安全了,而在於它把「提示注入攻擊有多容易」這件事,用數字攤開來給你看。

訓練方式:讓攻守雙方一起進化

GPT-Red 採自我對弈強化學習:攻擊模型與一組防禦模型同時訓練。攻擊方成功誘發失效就得到獎勵,防禦方擋下攻擊並完成原任務就得到獎勵。防禦愈強,攻擊就被迫愈刁鑽。

為了支撐訓練,OpenAI 建立了模擬各種注入位置的大型測試環境——GPT-Red 可能控制的是本機檔案的一部分、網頁橫幅、電子郵件內文,或工具的輸出內容

訓練結束時,GPT-Red 幾乎能攻破所有與它對抗的模型,包括截至 GPT-5.5 的正式部署模型。OpenAI 明確表示已將 GPT-Red 與實際部署的模型分開,避免攻擊能力外流。

84% 對 13%

最值得記住的數字來自泛化測試。在一組不同於訓練時使用的全新紅隊情境中,人類紅隊與 GPT-Red 各自對 GPT-5.1 發動攻擊:

  • GPT-Red 在 84% 的情境中成功
  • 人類紅隊為 13%

這個對比的意涵很清楚:如果你的 Agent 防護是照著人類想得到的攻擊手法設計的,那它面對的威脅模型可能低估了一個數量級。

它攻破了一台真的販賣機

報告中最具體的案例,是 OpenAI 讓 GPT-Red 去攻擊自家辦公室裡一台由 AI 驅動、實際運作中的販賣機代理(名為 Vendy)。GPT-Red 先在模擬中反覆改進攻擊,再把攻擊部署到正式運行的代理上,達成了全部三項惡意目標

  • 把有庫存的高價商品價格改為允許的最低價 0.50 美元
  • 訂購一項價格超過 100 美元的新商品,並以 0.50 美元出售
  • 取消另一位顧客的訂單

OpenAI 另外用 GPT-Red 在 10 個未參與訓練的資料外洩情境中攻擊 Codex CLI 代理,結果是成功率更高、消耗的 Token 更少

這正是MCP 客戶端提示注入實證研究OWASP LLM Top 10 一直在講的同一件事:只要代理會讀取外部資料並據以行動,注入面就存在。

防禦端的進展也很明確

  • 一類名為「假思路鏈」的直接注入攻擊,在 GPT-5.1 上成功率超過 95%,在 GPT-5.6 Sol 上已低於 10%
  • 在最困難的直接提示注入基準上,相較四個月前最佳部署模型,失敗次數降至六分之一
  • GPT-5.6 Sol 對 GPT-Red 的直接注入攻擊成功率為 0.05%
  • 多個開發者工具與瀏覽情境的間接注入基準已達飽和(準確率超過 97%)

OpenAI 特別說明,他們同時評估了一般能力與過度拒絕,確認穩健性的提升沒有以能力下降或亂拒絕為代價。這一點值得肯定——「變笨所以變安全」是這類報告常見的隱藏成本。

台灣企業該怎麼用這份資訊

一、把注入面盤點出來。照 OpenAI 的分類自問:你的 AI 系統會讀取本機檔案、網頁內容、郵件內文或工具回傳嗎?只要有一項為是,注入面就存在。

二、模型版本現在是安全變數。同一家廠商的 GPT-5.1 與 GPT-5.6 Sol,對同類攻擊的抵抗力差距是 95% 對 10%。停留在舊版本不只是少了功能,是實質的資安暴露。

三、模型層的防護不等於系統層的防護。販賣機案例中被攻破的是整個代理系統。權限邊界、金額上限、異常交易告警這些傳統控制項,不會因為模型變穩健就可以省略。

需要保留的懷疑

所有數字都由 OpenAI 自行提出,未經第三方複現。文中提到更完整的預印本將稍後發布,在該預印本公開前,方法細節無法被外部檢驗。

另外,「攻擊成功率 0.05%」是針對 GPT-Red 這一個攻擊者測得的。對已知攻擊者的穩健,不等於對未知攻擊者的穩健——這正是 OpenAI 持續訓練更強紅隊模型的理由。

常見問題

什麼是提示注入?為什麼企業導入 AI Agent 特別要注意?

指第三方在模型會讀取的內容中嵌入指令,藉此改變模型行為。OpenAI 列出的注入位置包括本機檔案、網頁橫幅、電子郵件內文與工具回傳的內容。只要你的 AI 系統會讀取外部資料並據以行動,注入面就存在。OpenAI 的實測顯示,自動化紅隊模型在全新情境中的攻擊成功率為 84%,而人類紅隊僅 13%。

換用最新版模型就能解決提示注入問題嗎?

有明顯幫助但不足夠。OpenAI 數據顯示「假思路鏈」類攻擊在 GPT-5.1 成功率超過 95%,在 GPT-5.6 Sol 已低於 10%,因此停留在舊版本確實構成實質資安暴露。但販賣機案例中被攻破的是整個代理系統,模型層的穩健不能取代權限邊界、金額上限與異常告警等系統層控制。

0.05% 的攻擊成功率是否代表已經安全?

要注意這個數字的測量對象。0.05% 是針對 GPT-Red 這一個特定攻擊者測得的結果,對已知攻擊者的穩健不等於對未知攻擊者的穩健。OpenAI 自己也持續訓練更強的紅隊模型,並表示會結合人類與第三方紅隊、分層防護與即時監控。

下一步

AI 代理的注入面盤點表與系統層控制檢核清單,我們整理在白皮書專區;多代理環境的額外風險可參考安全框架覆蓋缺口的討論

出處

本文依據 OpenAI, "GPT-Red: Unlocking Self-Improvement for Robustness",發表於 2026 年 7 月 15 日:openai.com。加註引號者為該文原文之中譯。

本文為產業觀察。所有數據由 OpenAI 自行提出,未經第三方複現;更完整的預印本於該文發表時尚未公開。

AI 講師 賴家榮 Andy Lai
專業 AI & 行銷講師

企業 AI 轉型、RAG 向量庫與數位行銷內訓 | 賴家榮 老師親授

樹德 / 輔英 / 屏東大學兼任講師!手把手帶領企業團隊打造專屬 AI 代理與高轉化品牌流量。

本篇文章出處來源聲明
MEDIA CITATION
原始發行媒體 OpenAI, "GPT-Red: Unlocking Self-Improvement for Robustness"
發表文章的作者 賴家榮 Andy Lai