AI Agents / 自主代理

能不能把整套資料分析交給 AI?最強的做到 56.7%,開源的全部不到 1%

賴家榮 Andy Lai - FULLDOT news 發表文章的作者
賴家榮 Andy Lai
FULLDOT news 總編輯 · SAIP-TAIWAN CAIO
2026-08-12 15:20:00 | 出處: Rahman, Islam, Mahbub, Laskar, Joty & Hoque Prince, "DSAgentBench: Can Agents Automate End-to-End Data-Science Workflows in Real Computer Environm
能不能把整套資料分析交給 AI?最強的做到 56.7%,開源的全部不到 1% | FULLDOT news
Photo: sejio402 / Pexels · 示意圖,與文中所述之特定廠商無關
發表文章的作者 賴家榮 觀點劃重點

一份新的評測讓 AI 代理在真實的電腦環境裡做完整的資料科學工作——開 notebook、用終端機、查資料庫、產圖表。275 個任務跑下來,最強的 Claude-4.6-Sonnet 完成 56.70%,而所有開源代理都低於 1%

「AI 可以取代資料分析師嗎?」這個問題以前很難回答,因為多數評測只測「會不會寫程式」。

但真實的資料工作不是這樣。論文摘要說得很準:真實世界的資料科學是長時程的工作流程,橫跨資料整理、探索、建模、視覺化與驗證,而且需要協調使用 notebook、IDE、終端機、瀏覽器與資料庫——在真正的作業系統裡。

DSAgentBench(arXiv:2608.10366,2026 年 8 月 11 日投稿)就是把這整套搬進評測。

它怎麼測

  • 275 個任務,涵蓋資料科學的完整生命週期。
  • 每個任務都要求根據中間產出做判斷,並協調多種工具。
  • 評分用決定性的評估器,驗證的是分析正確性、視覺輸出與模型表現,而不是「程式跑得起來就算過」

最後這一點是關鍵差異。很多評測只看程式有沒有執行成功,但資料分析可以跑得很順、答案完全錯。

像考駕照

過去的評測是筆試:問你「看到紅燈該怎麼辦」,你答對就算過。

DSAgentBench 是路考:把你放進真的車裡,開上真的路,看你會不會換車道、會不會停紅燈、有沒有撞到東西。

兩種都通過的人比較少,這很正常。

電路板元件近拍
Photo: Jakub Pabis / Pexels · 示意圖,與文中所述之特定廠商無關

成績單

15 個開源與閉源模型的實測結果:

  • Claude-4.6-Sonnet(最強的那個) 任務成功率 56.70%
  • 所有開源代理 低於 1%

這個落差大到需要停下來想一下。不是「開源比較差」,而是「開源在這種任務型態上幾乎完全做不到」。

論文指出的失敗點集中在三處:工具編排、作業系統的操作定位、以及多步推理

對企業的三個實際判斷

一、56.7% 的意思是「一半以上會失敗」。如果你打算把資料分析工作交給代理,這個成功率代表必須有人複核,而且複核成本要算進去。這不是可以無人值守的環節。

二、開源模型在「代理型任務」上還不是選項。很多企業因為資料落地考量想用開源模型自架。在單純的問答與生成上,開源確實已經夠用;但這篇顯示一旦需要操作工具、跨步驟推理,差距是量級等級的

如果你的地端需求剛好是代理型任務,這個現實要納入規劃——可能的折衷是:讓開源模型做檢索與整理,把需要編排工具的部分留給人。

三、失敗點告訴你該補什麼。工具編排與作業系統操作的失敗,很多可以靠把環境簡化來緩解——不要讓代理面對整台電腦,給它幾個定義清楚的工具就好。這與代理可靠度來自鷹架那篇的結論一致。

需要保留的懷疑

這是 arXiv 預印本,尚無同儕審查紀錄。

兩點要提醒:

  • 模型評測的分數會過期得很快。這是 2026 年 8 月的測試結果,模型版本更迭快速,數字幾個月後就可能不同。有價值的是失敗型態,不是絕對分數。
  • 275 個任務的設計偏好會影響結果。任務怎麼選、怎麼評分,都會影響哪些模型看起來比較好。單一評測不宜當成採購依據。

常見問題

AI 代理現在能取代資料分析師嗎?

還不行。這份評測讓代理在真實電腦環境中執行端到端的資料科學工作(開 notebook、用終端機、查資料庫、產圖表),275 個任務中最強的 Claude-4.6-Sonnet 只完成 56.70%,代表接近一半會失敗。實務上必須有人複核,且複核成本要計入評估。

為什麼開源模型的成績只有不到 1%?

論文指出失敗集中在工具編排、作業系統的操作定位與多步推理三處。這不是「開源比較差」的程度問題,而是在這種需要跨工具、跨步驟協調的任務型態上幾乎完全做不到。值得注意的是,在單純的問答與生成任務上,開源模型的表現與閉源差距小得多——差異出現在代理型任務。

想用開源模型自架代理系統,該怎麼辦?

可考慮折衷:讓開源模型負責檢索與資料整理,把需要編排多種工具的部分留給人處理。另外可以簡化環境——不要讓代理面對整台電腦,而是提供幾個定義清楚、邊界明確的工具,這能顯著降低工具編排與作業系統操作的失敗率。

下一步

代理型任務的可行性評估與環境簡化原則,我們整理在白皮書專區

出處

本文依據 Mizanur Rahman, Mohammed Saidul Islam, Ridwan Mahbub, Md Tahmid Rahman Laskar, Shafiq Joty & Enamul Hoque Prince, "DSAgentBench: Can Agents Automate End-to-End Data-Science Workflows in Real Computer Environments?", arXiv:2608.10366,投稿於 2026 年 8 月 11 日:arxiv.org/abs/2608.10366。加註引號者為該論文摘要原文之中譯。

本文為產業觀察,非學術評議。該論文為預印本,模型評測分數會隨版本更迭而變動。

延伸來源

以下為與本文論點相關、且經實際查閱確認的外部來源。標示為預印本者尚未經同儕審查,引用時請留意。

  • Dastidar & the Leni Team, arXiv:2607.17044(2026-07-19,預印本):arxiv.org
  • Wang et al., "Self-evolving Agentic Customer Support System at LinkedIn", arXiv:2608.10224(2026-08-10,預印本):arxiv.org
  • Jalal-Kamali, "Divergent Response Modes in Frontier Language Models", arXiv:2608.06578(2026-08-06,預印本):arxiv.org
AI 講師 賴家榮 Andy Lai
專業 AI & 行銷講師

企業 AI 轉型、RAG 向量庫與數位行銷內訓 | 賴家榮 老師親授

樹德 / 輔英 / 屏東大學兼任講師!手把手帶領企業團隊打造專屬 AI 代理與高轉化品牌流量。

本篇文章出處來源聲明
MEDIA CITATION
原始發行媒體 Rahman, Islam, Mahbub, Laskar, Joty & Hoque Prince, "DSAgentBench: Can Agents Automate End-to-End Data-Science Workflows in Real Computer Environm
發表文章的作者 賴家榮 Andy Lai