AI Agents / 自主代理

AI 代理成功率從 12% 衝到 66%——但每三次仍失敗一次,這能上生產線嗎?

賴家榮 Andy Lai - FULLDOT news 發表文章的作者
賴家榮 Andy Lai
FULLDOT news 總編輯 · SAIP-TAIWAN CAIO
2026-08-03 13:30:00 | 出處: Stanford HAI, "The 2026 AI Index Report" (Ch.2 Technical Performance)
AI 代理成功率從 12% 衝到 66%——但每三次仍失敗一次,這能上生產線嗎? | FULLDOT news
發表文章的作者 賴家榮 觀點劃重點

史丹佛 2026 AI Index 記錄:AI 代理在 OSWorld 真實電腦任務基準上,成功率從 12% 躍升至約 66%。進步幅度驚人,但同一份報告也寫明它們「在結構化基準上仍約每三次失敗一次」。這個失敗率決定了哪些任務能自動化、哪些不能。

史丹佛 HAI《2026 AI Index》在技術效能章節記錄了一組對照鮮明的數字:AI 代理在 OSWorld(測試真實電腦操作任務的基準)上,成功率「從 12% 躍升至約 66%」

同一段話後面接著寫:這些代理「在結構化基準上仍約每三次嘗試失敗一次」。

兩句話都是事實,但只讀第一句和只讀第二句,會做出完全相反的決策。

先界定:66% 在生產環境是什麼概念

66% 聽起來像及格。但換算成日常工作就沒那麼樂觀了:你請一位助理處理事情,每三件就有一件要重做。

更關鍵的是,這 66% 是單次任務的成功率。如果一個流程由三個步驟串接,每步 66%,整條流程走完的成功率是 0.66³ ≈ 29%——不到三成。

這個乘法效應是評估自動化時最容易被忽略的地方。廠商展示的通常是單步驟的漂亮數字,實際導入卻是多步驟串接。

機制:為什麼進步這麼快,卻還是會失敗

從 12% 到 66% 是五倍以上的成長,代表這個領域確實有實質突破。但剩下的三分之一失敗,性質跟前面那 88% 不同。

容易的部分先被解決了:介面元素辨識、常見操作流程、標準格式處理。剩下的多半是需要判斷而非執行的情境——畫面出現預期外的彈窗、指令有歧義、環境狀態與訓練時不同。

這也解釋了為什麼「再等一年就好了」不一定成立。剩下的問題不是同一類問題的延續,難度曲線通常是後段更陡。

邊界:用失敗成本決定,不是用成功率決定

66% 這個數字本身無法告訴你能不能用。真正的判準是:失敗一次的代價是多少,以及失敗看不看得出來。

  • 適合現在就自動化 失敗成本低、且失敗立即可見。例如產生報表初稿——錯了看得出來,重跑一次成本趨近於零。
  • 需要人工守門 失敗成本中等但可回復。例如整理客戶名單、產生程式碼——讓代理做,但要有人複核才放行。
  • 目前不建議 失敗成本高或不可回復,例如直接寄信給客戶、修改正式環境資料、送出報價。這類任務即使成功率再高十個百分點也一樣不建議,因為問題在於失敗的後果不對稱

還有一類最危險:失敗成本高、但失敗不容易被察覺。例如讓代理修改資料庫裡的歷史紀錄——錯了不會報錯,可能幾個月後才發現。這類任務要優先排除。

對台灣企業的意義

製造業的品管觀念在這裡完全適用。三成不良率不會有人接受讓它直接出貨,但一定有人願意讓它進入下一站再檢驗。AI 代理現在的位置就是「需要下一站檢驗」的半成品。

務實的導入方式不是等成功率變高,而是設計一個能承受三分之一失敗的流程:讓代理處理量大但可複核的工作,人力從「執行」轉到「驗收」。這樣即使失敗率沒降,整體產出仍然提升。

這也呼應我們談過的架構層面的長期成本:如果現在為了補償失敗率寫了大量重試與檢查邏輯,模型變強後那些程式會變成技術債。比較好的作法是把「複核」設計成流程的一環,而不是寫死在程式裡。

需要保留的懷疑

OSWorld 是基準測試環境,與真實企業環境有落差。基準上的 66%,不代表在你公司的系統上也是 66%。企業內部系統通常有客製介面、非標準流程與權限限制,這些都會讓成功率下降。

反過來說也成立:如果任務範圍夠窄、環境夠穩定,實際成功率也可能高於基準。唯一可靠的方式仍然是用自己的任務實測,而不是引用別人的數字。

常見問題

AI 代理 66% 的成功率,可以用在正式流程嗎?

取決於失敗成本,而非成功率本身。失敗成本低且立即可見的任務(如產生報表初稿)現在就可自動化;失敗成本中等但可回復的任務(如整理名單、產生程式碼)應加入人工複核;失敗成本高或不可回復的任務(如直接寄信、修改正式資料)目前不建議。最需要避免的是失敗成本高但不易察覺的任務。

多步驟流程的成功率該怎麼估算?

需考慮乘法效應。若單步驟成功率為 66%,三個步驟串接的整體成功率約為 0.66 的三次方,約 29%。廠商展示的通常是單步驟數據,實際導入多為多步驟串接,因此規劃時應以整條流程的期望成功率評估,而非單步驟數字。

OSWorld 基準的分數能代表我公司的實際表現嗎?

不能直接套用。OSWorld 是標準化測試環境,企業內部系統通常有客製介面、非標準流程與權限限制,實際成功率可能低於基準。反之若任務範圍窄、環境穩定,也可能高於基準。可靠的做法是以自身任務建立小規模測試集實測。

下一步

要判斷哪些任務適合交給代理,關鍵是先盤點失敗成本。我們在封測廠導入案例中談過類似的任務篩選邏輯,可一併參考;需要完整的評估表單可洽白皮書專區

出處

本文數據出自 Stanford HAI《The 2026 AI Index Report》技術效能章節,hai.stanford.edu/ai-index/2026-ai-index-report。加註引號者為原文中譯。

三步驟成功率 0.66³ ≈ 29% 為獨立事件機率之推算,讀者可自行驗算;實際流程若步驟間有相關性,結果會有差異。

AI 講師 賴家榮 Andy Lai
專業 AI & 行銷講師

企業 AI 轉型、RAG 向量庫與數位行銷內訓 | 賴家榮 老師親授

樹德 / 輔英 / 屏東大學兼任講師!手把手帶領企業團隊打造專屬 AI 代理與高轉化品牌流量。

本篇文章出處來源聲明
MEDIA CITATION
原始發行媒體 Stanford HAI, "The 2026 AI Index Report" (Ch.2 Technical Performance)
發表文章的作者 賴家榮 Andy Lai