193 項威脅、16 套資安框架,沒有一套的單項覆蓋率過半
一篇 2026 年 3 月的論文盤點多代理系統的資安威脅,整理出 193 項、分為九大類,並比較了 16 套現有資安框架。結論很直接:「沒有任何一套受檢框架在任一類別達到過半覆蓋率。」這替 DeepMind 說的「缺乏工具」提供了量化證據。
我們先前報導過 Google DeepMind 投入一千萬美元徵求多代理安全研究,理由是「我們缺乏預測、衡量與監測這些轉變的工具」。
這句話聽起來有點抽象。有一篇論文把它量化了。
先界定:多代理系統的風險為什麼不同
Tam Nguyen 等人的〈Security Considerations for Multi-agent Systems〉(arXiv:2603.09002,2026 年 3 月 9 日投稿、4 月 26 日修訂)在摘要中定義:
「多代理人工智慧系統(MAS)是由自主代理組成的系統,這些代理行使被委派的工具權限、共享持久記憶體,並透過代理間通訊進行協調。MAS 引入了與單一 AI 模型在性質上不同的資安弱點。」
這段定義裡有三個危險來源,值得逐一拆開:
- 被委派的工具權限 代理能實際執行動作,不只是產出文字。
- 共享持久記憶體 一個代理寫進去的東西,另一個會讀到。汙染一處,影響全部。
- 代理間通訊 它們會互相下指令,而那些指令不經過人。
第二項最容易被低估。共享記憶體等於共享信任——如果任何一個代理被誘導寫入錯誤資訊,其他代理沒有理由懷疑它。
數字:193 項威脅,九大類
研究團隊整理出 193 項獨立威脅項目,歸為九大風險類別,並評估 16 套現有資安框架對這些威脅的覆蓋程度。
兩個最未被處理的領域是:
- 非決定性(Non-Determinism) 跨框架平均得分 1.231。指的是同樣的輸入不保證得到同樣的行為,這讓傳統的測試方法失效。
- 資料外洩(Data Leakage) 平均得分 1.340。
非決定性排第一並不意外。傳統資安測試的前提是「同樣的攻擊會得到同樣的結果」,所以能重現、能驗證、能確認修好了沒有。當系統本身有隨機性,這個前提就不成立——你修好了一次,不代表它不會再發生。
最關鍵的一句結論
論文對 16 套框架的比較結果是:OWASP Agentic Security Initiative 整體覆蓋率最高,達 65.3%。但作者同時指出:
「沒有任何一套受檢框架在任一單一類別達到過半覆蓋率。」
這句話要讀兩次。它說的不是「最好的那套有 65.3%」——那是整體平均。它說的是把 193 項威脅分成九類之後,任何一套框架,在任何一類裡,覆蓋的都不到一半。
論文也直接寫明:「既有的資安與治理框架並非為這些新興攻擊面而設計。」
邊界:這對你適不適用
「多代理系統」的定義比多數人以為的窄。依論文的定義,要同時具備三個條件:自主代理、被委派的工具權限、代理間通訊。
- 不適用 單一代理呼叫多個 API。工具不會自己發起行動,也不會互相對話。
- 不適用 多個獨立的 AI 功能各做各的,彼此不共享記憶體也不通訊。
- 適用 代理會把工作交給另一個代理、共用同一份記憶體或知識庫、且能實際執行動作(寫入、發送、呼叫外部服務)。
多數台灣企業目前落在前兩類。這篇論文的價值不在於現在就要行動,而在於它標示了什麼時候該開始擔心。
對台灣企業的意義
兩個實用的推論。
一、要挑框架的話,OWASP Agentic Security Initiative 目前覆蓋率最高。65.3% 不是好成績,但它是公開、免費、且針對代理場景設計的。比起自己從零發明,這是個合理的起點。
二、既然沒有框架能覆蓋過半,就不要依賴框架當唯一防線。務實的補強方向是把不可逆的動作隔離出來——寫入正式資料、對外發送、金流相關的操作,維持人工核可。這與我們談過的 MCP 的最小權限原則是同一件事:當你無法驗證系統安全時,就限制它能造成的損害範圍。
特別要注意「非決定性」那一項對驗收的影響。如果供應商說「這個問題我們修好了」,合理的追問是「你怎麼確認的、測了幾次」。單次測試通過,在非決定性系統上不構成證據。
需要保留的懷疑
這是 arXiv 預印本,投稿時尚未經同儕審查。193 項威脅的分類方式、九大類別的劃分,以及各框架的評分標準,均為作者團隊自行建立,非業界共識。
覆蓋率的評分方法也需留意:不同的評分標準會得出不同的排名。65.3% 這個數字反映的是作者所定義的評估架構下的結果,不宜當成絕對指標。
但「現有框架不足」這個大方向,與 DeepMind 投入資源建立測量工具的行動互相印證,兩個獨立來源指向同一結論,可信度較高。
常見問題
什麼樣的系統才算「多代理系統」?
依該論文定義需同時具備三個條件:由自主代理組成、代理行使被委派的工具權限、代理間透過通訊協調。單一代理呼叫多個 API 不算,因為工具不會自主發起行動;多個獨立 AI 功能各自運作、不共享記憶體也不通訊,同樣不算。需要代理間會互相交派工作、共用記憶體且能實際執行動作,才落入此範疇。
為什麼「非決定性」是最難處理的資安問題?
傳統資安測試的前提是相同輸入產生相同結果,因此能重現問題、驗證修復。多代理系統具隨機性,同樣的輸入不保證相同行為,此前提不成立——修復一次不代表問題不會再現。該論文評估顯示,非決定性是各框架覆蓋最不足的領域,跨框架平均得分 1.231。
企業現在該採用哪一套多代理資安框架?
依該論文評估,OWASP Agentic Security Initiative 整體覆蓋率最高,達 65.3%,且為公開免費、針對代理場景設計,可作為起點。但作者同時指出「沒有任何一套受檢框架在任一單一類別達到過半覆蓋率」,因此不宜將框架當作唯一防線。建議搭配將不可逆動作(寫入正式資料、對外發送、金流操作)維持人工核可。
下一步
在框架成熟之前,限制損害範圍比預防攻擊更實際。可參考依失敗成本篩選任務的作法,先確認哪些動作絕對不能交給代理自行執行。
出處
本文引述出自 Tam Nguyen、Moses Ndebugre、Dheeraj Arremsetty〈Security Considerations for Multi-agent Systems〉,arXiv:2603.09002,2026 年 3 月 9 日投稿、4 月 26 日修訂,arxiv.org/abs/2603.09002。加註引號者為論文摘要原文之中譯。
該論文為預印本,投稿時尚未經同儕審查。威脅分類、類別劃分與框架評分標準均由作者團隊建立,非業界共識;覆蓋率數字反映該評估架構下的結果。