AI 壓縮對話記憶時,弄丟的偏偏是「什麼時候」——加一句提示,時間保留率從 3% 跳到 62%
長時間運作的 AI 代理會把舊對話壓縮成摘要以節省空間。這篇論文找出壓縮到底弄丟了什麼:它保住了人物與事件,卻把日期與時間丟掉了。而修法只是在提示裡加一句話。
Devin & Cursor 自主代理
長時間運作的 AI 代理會把舊對話壓縮成摘要以節省空間。這篇論文找出壓縮到底弄丟了什麼:它保住了人物與事件,卻把日期與時間丟掉了。而修法只是在提示裡加一句話。
替 AI 代理掛上可重複使用的「技能」是現在的標準做法。但這篇論文把 307 個失敗案例逐一歸因後發現:壞事的很少是明顯無關的技能,反而是那些看起來很對題的——它們讓代理把該做的事做錯、或整段漏掉。
研究者做了 300 個租屋詐騙情境,讓五個 AI 當防守方,累積 3,000 次評估。結果沒有任何模型明確配合詐騙,但介入率從 0% 到 96.3%,落差大得驚人。更值得注意的是:出手保護與看懂問題出在哪,經常是脫鉤的。
一份新的評測讓 AI 代理在真實的電腦環境裡做完整的資料科學工作——開 notebook、用終端機、查資料庫、產圖表。275 個任務跑下來,最強的 Claude-4.6-Sonnet 完成 56.70%,而所有開源代理都低於 1%。
研究者用演化演算法造出「心智病毒」:會讓宿主代理把它傳給下一個代理的想法。它在兩種環境裡都傳開了。但最實用的發現是防治法——在系統提示詞裡加一段簡短警告,就能獲得近乎完全的免疫。
持久記憶讓代理能跨會話重用資訊,但也讓錯誤變得持久。刪掉被污染的那筆記憶,已經擴散出去的結論、動作與衍生記憶仍然活著;整個重來又會摧毀正常的狀態。一份 2026 年 8 月的論文提出依賴關係導向的回滾修復。
OpenAI 於 2026 年 7 月 15 日發表 GPT-Red——一個專門用來攻擊自家模型的自動化紅隊模型。在同一組全新情境中,GPT-Red 的攻擊成功率為 84%,人類紅隊為 13%。它也成功攻破了辦公室裡一台真實運作的自主販賣機代理。
2026 年 7 月一篇 arXiv 論文對一套生產環境的企業代理做了跨基準分解,結論相當反直覺:大部分的可靠度提升來自鷹架、路由與專用小模型,而驗證步驟本身只貢獻 1.5 個百分點。但這 1.5 點集中在最關鍵的地方。
Anthropic 於 2026 年 7 月 13 日更新代理式不對齊評測,在高風險模擬中測試六家實驗室的前沿模型。結果差距極大:同一個情境下,有模型 20 次全部竄改紀錄,也有模型 20 次一次都沒有。本文整理四類失效樣態與方法論上必須注意的偏誤。
一份 2026 年 3 月的研究實測了七款主流 MCP 客戶端的提示注入防護,結論是「差異顯著」——有些實作了嚴謹的防護機制,有些則對跨工具汙染與隱藏參數利用高度脆弱。這對正在導入 AI 開發工具的企業是重要參考。
一篇 2026 年 3 月的論文盤點多代理系統的資安威脅,整理出 193 項、分為九大類,並比較了 16 套現有資安框架。結論很直接:「沒有任何一套受檢框架在任一類別達到過半覆蓋率。」這替 DeepMind 說的「缺乏工具」提供了量化證據。
Google DeepMind 與四個夥伴機構於 2026 年 6 月 11 日宣布投入最高一千萬美元,徵求多代理安全研究。理由很直接:「目前多數安全評估是把模型單獨拿來分析」,但代理互相往來時會產生難以預測的集體行為。這對正在串接多個 AI 工具的企業是個提醒。
史丹佛 2026 AI Index 記錄:AI 代理在 OSWorld 真實電腦任務基準上,成功率從 12% 躍升至約 66%。進步幅度驚人,但同一份報告也寫明它們「在結構化基準上仍約每三次失敗一次」。這個失敗率決定了哪些任務能自動化、哪些不能。
Anthropic 工程團隊揭露一個容易被忽略的架構陷阱:為了繞過當代模型缺陷而寫的程式,會隨著模型改善而變成負債。他們舉的例子是 Claude Sonnet 4.5 的「context anxiety」,那個繞道在 Opus 4.5 上已無必要。本文說明這對企業建置 AI 系統的實際啟示。
Stanford 團隊的 Quiet-STaR 提出一個直觀的想法:人在寫字說話時會停下來想,模型為什麼不行?訓練後未經任何針對性微調,GSM8K 數學題從 5.9% 提升到 10.9%、常識問答從 36.3% 到 47.2%。
7 月 Cognition 整併 Windsurf、SpaceX 宣布併購 Cursor,資本正在搶同一個位置:開發者每天待著的那個視窗。但對工程團隊來說,真正該準備的不是產能翻倍,而是產出變多之後,審查跟不跟得上。