能不能把整套資料分析交給 AI?最強的做到 56.7%,開源的全部不到 1%
一份新的評測讓 AI 代理在真實的電腦環境裡做完整的資料科學工作——開 notebook、用終端機、查資料庫、產圖表。275 個任務跑下來,最強的 Claude-4.6-Sonnet 完成 56.70%,而所有開源代理都低於 1%。
「AI 可以取代資料分析師嗎?」這個問題以前很難回答,因為多數評測只測「會不會寫程式」。
但真實的資料工作不是這樣。論文摘要說得很準:真實世界的資料科學是長時程的工作流程,橫跨資料整理、探索、建模、視覺化與驗證,而且需要協調使用 notebook、IDE、終端機、瀏覽器與資料庫——在真正的作業系統裡。
DSAgentBench(arXiv:2608.10366,2026 年 8 月 11 日投稿)就是把這整套搬進評測。
它怎麼測
- 275 個任務,涵蓋資料科學的完整生命週期。
- 每個任務都要求根據中間產出做判斷,並協調多種工具。
- 評分用決定性的評估器,驗證的是分析正確性、視覺輸出與模型表現,而不是「程式跑得起來就算過」。
最後這一點是關鍵差異。很多評測只看程式有沒有執行成功,但資料分析可以跑得很順、答案完全錯。
像考駕照
過去的評測是筆試:問你「看到紅燈該怎麼辦」,你答對就算過。
DSAgentBench 是路考:把你放進真的車裡,開上真的路,看你會不會換車道、會不會停紅燈、有沒有撞到東西。
兩種都通過的人比較少,這很正常。
成績單
15 個開源與閉源模型的實測結果:
- Claude-4.6-Sonnet(最強的那個) 任務成功率 56.70%
- 所有開源代理 低於 1%
這個落差大到需要停下來想一下。不是「開源比較差」,而是「開源在這種任務型態上幾乎完全做不到」。
論文指出的失敗點集中在三處:工具編排、作業系統的操作定位、以及多步推理。
對企業的三個實際判斷
一、56.7% 的意思是「一半以上會失敗」。如果你打算把資料分析工作交給代理,這個成功率代表必須有人複核,而且複核成本要算進去。這不是可以無人值守的環節。
二、開源模型在「代理型任務」上還不是選項。很多企業因為資料落地考量想用開源模型自架。在單純的問答與生成上,開源確實已經夠用;但這篇顯示一旦需要操作工具、跨步驟推理,差距是量級等級的。
如果你的地端需求剛好是代理型任務,這個現實要納入規劃——可能的折衷是:讓開源模型做檢索與整理,把需要編排工具的部分留給人。
三、失敗點告訴你該補什麼。工具編排與作業系統操作的失敗,很多可以靠把環境簡化來緩解——不要讓代理面對整台電腦,給它幾個定義清楚的工具就好。這與代理可靠度來自鷹架那篇的結論一致。
需要保留的懷疑
這是 arXiv 預印本,尚無同儕審查紀錄。
兩點要提醒:
- 模型評測的分數會過期得很快。這是 2026 年 8 月的測試結果,模型版本更迭快速,數字幾個月後就可能不同。有價值的是失敗型態,不是絕對分數。
- 275 個任務的設計偏好會影響結果。任務怎麼選、怎麼評分,都會影響哪些模型看起來比較好。單一評測不宜當成採購依據。
常見問題
AI 代理現在能取代資料分析師嗎?
還不行。這份評測讓代理在真實電腦環境中執行端到端的資料科學工作(開 notebook、用終端機、查資料庫、產圖表),275 個任務中最強的 Claude-4.6-Sonnet 只完成 56.70%,代表接近一半會失敗。實務上必須有人複核,且複核成本要計入評估。
為什麼開源模型的成績只有不到 1%?
論文指出失敗集中在工具編排、作業系統的操作定位與多步推理三處。這不是「開源比較差」的程度問題,而是在這種需要跨工具、跨步驟協調的任務型態上幾乎完全做不到。值得注意的是,在單純的問答與生成任務上,開源模型的表現與閉源差距小得多——差異出現在代理型任務。
想用開源模型自架代理系統,該怎麼辦?
可考慮折衷:讓開源模型負責檢索與資料整理,把需要編排多種工具的部分留給人處理。另外可以簡化環境——不要讓代理面對整台電腦,而是提供幾個定義清楚、邊界明確的工具,這能顯著降低工具編排與作業系統操作的失敗率。
下一步
代理型任務的可行性評估與環境簡化原則,我們整理在白皮書專區。
出處
本文依據 Mizanur Rahman, Mohammed Saidul Islam, Ridwan Mahbub, Md Tahmid Rahman Laskar, Shafiq Joty & Enamul Hoque Prince, "DSAgentBench: Can Agents Automate End-to-End Data-Science Workflows in Real Computer Environments?", arXiv:2608.10366,投稿於 2026 年 8 月 11 日:arxiv.org/abs/2608.10366。加註引號者為該論文摘要原文之中譯。
本文為產業觀察,非學術評議。該論文為預印本,模型評測分數會隨版本更迭而變動。
延伸來源
以下為與本文論點相關、且經實際查閱確認的外部來源。標示為預印本者尚未經同儕審查,引用時請留意。