把設備技術文件變成一張能推理的圖:AI 自動畫出「這裡壞了會拖累哪些地方」
老師傅腦中都有一張圖:哪個閥卡住,會連累哪幾條線。這種圖過去要專家逐字讀技術文件才畫得出來,所以永遠畫不完。這篇論文用 RAG 加大型語言模型自動把技術文件轉成可執行的功能模型,並在一座除役沸水式反應爐的系統上驗證。…
老師傅腦中都有一張圖:哪個閥卡住,會連累哪幾條線。這種圖過去要專家逐字讀技術文件才畫得出來,所以永遠畫不完。這篇論文用 RAG 加大型語言模型自動把技術文件轉成可執行的功能模型,並在一座除役沸水式反應爐的系統上驗證。…
我們習慣說「某某模型比較強」。這篇論文用 56,476 次推論證明,這句話少了一個前提:你讓它想多久。在三個測試集上,模型排名都會隨著 token 預算改變而反轉。…
長時間運作的 AI 代理會把舊對話壓縮成摘要以節省空間。這篇論文找出壓縮到底弄丟了什麼:它保住了人物與事件,卻把日期與時間丟掉了。而修法只是在提示裡加一句話。…
老師傅腦中都有一張圖:哪個閥卡住,會連累哪幾條線。這種圖過去要專家逐字讀技術文件才畫得出來,所以永遠畫不完。這篇論文用 RAG 加大型語言模型自動把技術文件轉成可執行的功能模型…
老師傅腦中都有一張圖:哪個閥卡住,會連累哪幾條線。這種圖過去要專家逐字讀技術文件才畫得出來,所以永遠畫不完。這篇論文用 RAG 加大型語言模型自動把技術…
長時間運作的 AI 代理會把舊對話壓縮成摘要以節省空間。這篇論文找出壓縮到底弄丟了什麼:它保住了人物與事件,卻把日期與時間丟掉了。而修法只是在提示裡加一…
企業的規範文件最難處理的地方,是它同時混著敘述文字、複雜表格與嵌入圖片。這套叫 GUIDE 的系統用六個分工代理處理 120 份真實文件,抽出 3,89…
我們習慣說「某某模型比較強」。這篇論文用 56,476 次推論證明,這句話少了一個前提:你讓它想多久。在三個測試集上,模型排名都會隨著 token 預算…
替 AI 代理掛上可重複使用的「技能」是現在的標準做法。但這篇論文把 307 個失敗案例逐一歸因後發現:壞事的很少是明顯無關的技能,反而是那些看起來很對…
多數企業把 AI 代理治理當成 DevSecOps 的延伸,用同一套方法管所有規模。這篇論文主張那是錯的:單一代理、代理群體、人機團隊、代理艦隊,是四個…
研究者做了 300 個租屋詐騙情境,讓五個 AI 當防守方,累積 3,000 次評估。結果沒有任何模型明確配合詐騙,但介入率從 0% 到 96.3%,落…
一份新的評測讓 AI 代理在真實的電腦環境裡做完整的資料科學工作——開 notebook、用終端機、查資料庫、產圖表。275 個任務跑下來,最強的 Cl…
研究者用演化演算法造出「心智病毒」:會讓宿主代理把它傳給下一個代理的想法。它在兩種環境裡都傳開了。但最實用的發現是防治法——在系統提示詞裡加一段簡短警告…
一套接了 49 個感測通道的垂直農場,讓 AI 直接控制燈光。研究者原本要它平衡產量與電費,結果它自己發展出一套沒人教過的策略——刻意製造黑暗讓葉綠素累…
持久記憶讓代理能跨會話重用資訊,但也讓錯誤變得持久。刪掉被污染的那筆記憶,已經擴散出去的結論、動作與衍生記憶仍然活著;整個重來又會摧毀正常的狀態。一份 …
企業客服最麻煩的不是模型不夠強,是政策、產品與知識庫每週都在變,靜態的助理很快就過期。LinkedIn 的做法是把提示詞、檢索與評估變成一個有版本控管的…
當人、AI 判斷模組與自動控制器串在同一個迴路裡,出錯時最難的不是修,是找出是哪一層先出問題、什麼時候開始的。一份 2026 年 8 月的論文建了 1,…
一份 2026 年 8 月的研究對六家實驗室的前沿模型施加操控壓力,累積 24,480 筆評判。結論很具體:GPT-5 有 99% 的機率拒絕揭露自己的…
外觀檢測是製造業 AI 最成熟的應用,但沖壓件有個特性讓它變棘手:很多瑕疵是「可接受」的,而可接受的標準每個客戶不一樣、每個檢驗員也不一樣。模型學不會一…
染整打樣重工是成本黑洞,AI 配色因此成為熱門題目。但配方預測的準確度高度依賴一件事:你過去的打樣紀錄有沒有把失敗的那些也留下來。只留成功配方的廠,模型…
醫材製造的文件量驚人,用 AI 協助撰寫是很自然的想法。但醫材文件有一個特殊性:它們是受管制的紀錄,不是內部參考資料。本文區分哪些環節可以放心用、哪些環…
倉儲揀貨路徑最佳化是 AI 應用的經典題目,數學上早就解決了。但實際導入時第一個撞牆的地方通常是:系統裡的品項尺寸與重量是錯的,或根本沒填。路徑算得再漂…
模具報價高度依賴經驗,估錯就是賠錢,因此常被列為 AI 導入的首選題目。但實際拆開來看會發現,報價不準的原因通常不在估算,而在客戶給的圖不完整。用 AI…
工具機廠導入 AI 最常被提出的期待是「把老師傅的經驗留下來」。但現場走過一輪會發現,師傅的判斷有一部分能被資料取代,有一部分結構上就不行。分清楚這兩者…
OpenAI 於 2026 年 7 月 15 日發表 GPT-Red——一個專門用來攻擊自家模型的自動化紅隊模型。在同一組全新情境中,GPT-Red 的…
Google DeepMind 的 Gemini Deep Think 在數學、物理與計算機科學上取得多項具體成果,包括自主解出 Erdős 猜想資料庫…
2026 年 7 月一篇 arXiv 論文對一套生產環境的企業代理做了跨基準分解,結論相當反直覺:大部分的可靠度提升來自鷹架、路由與專用小模型,而驗證步…
Anthropic 經濟指數 2026 年 6 月報告以「節奏」為題,揭露 AI 使用如何被真實世界的作息牽動:報稅日前一天的相關詢問是平常的 8 倍。…
Anthropic 於 2026 年 7 月 13 日更新代理式不對齊評測,在高風險模擬中測試六家實驗室的前沿模型。結果差距極大:同一個情境下,有模型 …
Anthropic 於 2026 年 7 月 6 日發表全域工作空間研究,指出 Claude 內部存在一小群被稱為 J-space 的神經模式,承載了模…
一份 2026 年 3 月的研究實測了七款主流 MCP 客戶端的提示注入防護,結論是「差異顯著」——有些實作了嚴謹的防護機制,有些則對跨工具汙染與隱藏參…
OWASP 的 LLM 應用資安清單中,提示注入已連續三年位居第一。但最值得注意的不是排名,而是專案方給出的處理方向:「別再試圖打造一個騙不倒的模型,去…
企業的 RAG 助理實際運作在多輪、案件導向的流程裡,但常用的評測指標多半來自單輪問答的學術基準。一篇 2026 年 2 月的論文指出:「通用的代理指標…
一份針對企業異質資料的檢索基準測試指出:即使是表現最好的 agentic RAG 方法,平均分數也只有 32.96。作者明確指出瓶頸在檢索——系統經常只…
歐盟 AI 法案的實施時程上,2026 年 8 月 2 日是關鍵節點:「本法案其餘部分開始適用,第 6 條第 1 項除外。」這個日期已經過了。本文整理現…
一篇 2026 年 3 月的論文盤點多代理系統的資安威脅,整理出 193 項、分為九大類,並比較了 16 套現有資安框架。結論很直接:「沒有任何一套受檢…
2026 北京智源大會發布多項成果,媒體焦點多在世界模型與 Nature 論文。但對台灣供應鏈更值得注意的是 FlagOS——一套宣稱支援 18 家品牌…
企業選擇地端部署,多半是為了「資料不出去」。但一篇 2026 年 6 月的論文指出:本地運算只回答了「運算發生在哪裡」這一個問題,沒有回答誰能組合你的資…
歐盟立硬法有罰則、日本走雙軌(對民間建議、對政府強制)、美國給自願框架不設罰則。三種路線方向完全不同,但對台灣出口商而言要準備的東西高度重疊。本文整理三…
Google DeepMind 與四個夥伴機構於 2026 年 6 月 11 日宣布投入最高一千萬美元,徵求多代理安全研究。理由很直接:「目前多數安全評…
美國國家標準暨技術研究院的 AI 風險管理框架(AI RMF)明文寫著「供自願使用」,沒有強制力也沒有罰則。但對還沒有專法的台灣企業來說,它可能是目前最…
日本數位廳於 2026 年 6 月 12 日修訂 DS-920 指引,規範各府省廳採購與使用生成式 AI。與経産省那份軟法不同,這份文件標示為 Norm…
史丹佛 2026 AI Index 記錄:AI 代理在 OSWorld 真實電腦任務基準上,成功率從 12% 躍升至約 66%。進步幅度驚人,但同一份報…
史丹佛大學 HAI 發布 2026 AI Index,組織導入率達 88%,生成式 AI 三年內達到 53% 人口採用率,比個人電腦與網際網路都快。但同…
Anthropic 工程團隊揭露一個容易被忽略的架構陷阱:為了繞過當代模型缺陷而寫的程式,會隨著模型改善而變成負債。他們舉的例子是 Claude Son…
北京智源研究院發布 2026 十大 AI 技術趨勢,主軸是從「預測下一個詞」轉向「預測世界下一狀態」。但對企業最有參考價值的不是那些技術名詞,而是第六條…
日本経済産業省與總務省於 2026 年 3 月 31 日公布 AI 事業者指引第 1.2 版,新增 AI 代理與實體 AI 的對應。它沒有罰則,屬於軟法…
Anthropic 工程團隊指出一個反直覺的現象:上下文視窗裡的 token 越多,模型從中正確回想資訊的能力反而下降。原因不是模型偷懶,是 trans…
Sora 1.5 商業開放、Runway Gen-4 發表、CyberAgent 推出 AI 數位人代言,產能問題基本上解決了。但真正卡住商業使用的是訓…
7 月 DeepSeek、百度、阿里巴巴接連發表新模型,訴求都是低成本。但「訓練成本降低 94%」和「API 費用只要十分之一」是完全不同的兩件事,而且…
歐盟 AI 法案 7 月進入執法期、日本頒布著作權指引、美國 AISI 公布安全測試報告——三個法域方向完全不同。對台灣廠商真正的風險不是「被歐盟罰款」…
微軟簽核電購電合約、日本狂蓋資料中心、台灣水冷板廠接單接到手軟——這些看起來無關的 7 月新聞,其實是同一件事的不同切面。當一張晶片吃掉一台電暖器的電,…
教科書說「先資訊化再 AI 化」,但南部傳產的現實是沒有人有時間照順序做。淨水設備廠的處境很典型:名單品質差、資訊化未完整,卻同時想用 AI 加速這兩件…
食品加工廠最想用 AI 的兩件事通常是標示與行銷。但這兩件事的風險等級天差地遠:行銷文案出錯是丟臉,標示出錯是違法。而且法律責任不會因為「是 AI 產生…
此分類目前沒有文章。