Frontier AI / 前沿模型

拿專業資料微調模型,幻覺反而變多——而且它會「更沒把握,卻講得更肯定」

賴家榮 Andy Lai - FULLDOT news 發表文章的作者
賴家榮 Andy Lai
FULLDOT news 發表文章的作者 · SAIP-TAIWAN CAIO
2026-09-27 10:00:00 | 出處: Raia Abu Ahmad、Nikolas Rauscher、Ekaterina Borisova、Fabio Barth、Georg Rehm、Sebastian Möller,"Does Finetuning with Scientific Data Increase Hallucinatio
檔案架上成排貼有標籤的技術文件夾 | 科學領域微調與幻覺評測研究
Photo: João Jesus / Pexels · 示意圖,與文中所述之特定廠商無關
發表文章的作者 賴家榮 觀點劃重點

研究者建了一套涵蓋五個科學領域、2,500 題的基準測試,用最小配對設計比較 18 個模型:每個經科學資料微調的模型,都對上它自己的通用版本。結果兩項都不樂觀——微調後的模型在所有幻覺類型與領域上可靠度都退步,而且內部信心更低、語言上卻更斷定。

很多企業導入 AI 的第一個念頭是:「拿我們自己的專業資料去微調一個模型,它就會變準。」這篇論文的結果是:在科學領域的測試裡,微調之後反而更不可靠。

他們怎麼測的

研究者指出,過去的科學幻覺評測有三個缺口:大多侷限在生醫領域、把幻覺當成二元判斷、而且沒有檢驗日益增多的「科學微調模型」。

他們用 SciFactCheck 補這三個缺口——一套橫跨五個科學領域、共 2,500 題的基準測試,搭配模組化的評估框架,針對三種事實性幻覺分別評分:

  • 不可驗證(unverifiability)
  • 過度宣稱(overclaim)
  • 歸因錯誤(attribution)

這個實驗設計值得學起來

他們用的是受控的最小配對設計(controlled minimal-pairing design):評測 18 個模型,每一個經科學微調的模型,都對上它自己的通用基礎版本。

這樣才能乾淨地歸因——差異來自「微調」這件事本身,而不是來自模型架構或規模不同。多數廠商展示的微調成效,恰恰缺了這個對照組。

兩個結論

第一,經科學微調的模型,在所有幻覺類型與所有科學領域上,事實可靠度都退步了。注意這裡沒有例外——不是某些領域變好、某些變差,是全面退步。

第二,這句話最值得貼在牆上:微調後的模型「內部信心更低,語言上卻更斷定」(internally less confident yet linguistically more assertive)。

翻成白話就是:它其實更不確定,但講話更有自信。對使用者而言,這是最危險的組合——你失去了「它聽起來不太確定」這個天然的警示訊號。

還有一個附帶發現

論文另外做了人類試驗,結果顯示:現行的事實查核工具,與專家判斷之間只有中等程度的一致性;而且「什麼樣的科學主張值得查核」這件事,連人類標註者之間都還沒有共識。

這一點很誠實,也很重要——它等於承認:我們連「怎麼算幻覺」都還沒完全談攏。

對台灣企業的意義

一、先別急著微調。多數中小企業被建議的第一步常是「用你的資料微調一個專屬模型」。這篇提供了一個明確的反面證據:至少在科學領域,微調不但沒改善事實性,還全面退步。

二、檢索增強(RAG)與微調要分清楚。微調是把知識壓進模型權重;RAG 是讓模型去查有出處的資料。當你要的是「答案正確且可追溯」,後者的失敗模式明顯比較可控——答錯了你至少查得到它引了哪一段。

三、把「語氣」從驗收標準裡拿掉。這篇最實用的提醒是:講得越肯定,不代表越正確。如果貴公司驗收 AI 產出的方式是「讀起來很專業就過」,那你正在被這個現象直接命中。

現在可以怎麼準備

  • 建立自己的最小配對測試。不必做到 2,500 題。挑 30 到 50 題你公司真正會被問、而且你確知正確答案的問題,固定不變,任何模型或方案上線前都跑一次。
  • 要求供應商提供對照組。任何人跟你說「微調後準確率提升」,請他拿出「同一個基礎模型未微調」的數字。沒有對照組的成效宣稱無法驗證。
  • 縮短送進模型的上下文。用檢索只取相關段落,而不是把整份文件塞進去——這同時降低成本與降低出錯機率。
  • 把三種幻覺分開記錄。不可驗證、過度宣稱、歸因錯誤,處理方式完全不同。全部記成「答錯了」會讓你找不到改善方向。

可行的解決方案

若你的目的是讓系統「越用越好」,另一條不必動模型權重的路是把執行經驗沉澱成可重用的技能。對多數中小企業,務實的順序則是:先做 RAG(讓模型查你的文件並標出處),把答案的可追溯性建立起來;等到你累積了足夠的實際問答紀錄、也確定了失敗模式,再評估要不要微調。

順序反過來的專案,通常會在「無法解釋它為什麼這樣答」這一關卡住。

需要保留的懷疑

這是 arXiv 預印本,在本文寫作時尚無同儕審查紀錄。

  • 測試範圍是科學領域,不是企業客服或行銷。科學主張的事實性要求極高,結論能否外推到一般商業應用,摘要並未討論。
  • 摘要未提供退步的幅度。只說「across all hallucination types and scientific domains」都退步,但沒有給出數值,因此本文無法報導嚴重程度。
  • 摘要未列出 18 個受測模型是哪些。無法判斷涵蓋的規模與世代。
  • 「更沒把握卻更斷定」是如何量測的,摘要未交代方法。內部信心的衡量方式(例如機率分布或校準指標)會直接影響這個結論的解讀。

常見問題

那我到底還該不該做微調?

要看你的目的。如果目的是「讓模型學會你的格式、語氣、作業流程」,微調仍然有效;如果目的是「讓它回答得更正確」,這篇提供了明確的反面證據,建議優先考慮檢索增強。把這兩個目的分開談,決策會清楚很多。

RAG 就不會有幻覺嗎?

一樣會有,但失敗模式比較可控。RAG 的錯誤通常可以回溯到「檢索到錯的段落」或「引用了但總結錯誤」,你查得到原因;微調造成的錯誤則壓在權重裡,很難歸因。這是可維護性的差別,不是有無幻覺的差別。

要怎麼在驗收時看出「更沒把握卻更斷定」?

最實際的做法是準備一批「你確知答案」的題目,並且刻意混入幾題「正確答案是不知道或資料不足」的情境。會直接編出斷定答案的系統,就是被這個現象命中。只測它會答的題目,永遠測不出這個問題。

本文出處 Raia Abu Ahmad、Nikolas Rauscher、Ekaterina Borisova、Fabio Barth、Georg Rehm、Sebastian Möller,"Does Finetuning with Scientific Data Increase Hallucinations? A Multi-domain Factuality Evaluation of LLMs",arXiv:2606.21359,2026 年 6 月 19 日投稿。本文為中文編譯與評論,原始論點著作權屬原作者所有。

圖片出處 Photo: João Jesus / Pexels(免費授權)。

要導入 AI,但不確定該從 RAG 還是微調開始?

甫東科技會先看你的文件現況與實際問答場景,給出具體的順序建議與可驗收的交付項目。如果評估後認為現階段不適合導入,我們也會直接說明該先補什麼。

前往甫東科技官網洽談 →

AI 講師 賴家榮 Andy Lai
專業 AI & 行銷講師

企業 AI 轉型、RAG 向量庫與數位行銷內訓 | 賴家榮 老師親授

樹德 / 輔英 / 屏東大學兼任講師!手把手帶領企業團隊打造專屬 AI 代理與高轉化品牌流量。

本篇文章出處來源聲明
MEDIA CITATION
原始發行媒體 Raia Abu Ahmad、Nikolas Rauscher、Ekaterina Borisova、Fabio Barth、Georg Rehm、Sebastian Möller,"Does Finetuning with Scientific Data Increase Hallucinatio
發表文章的作者 賴家榮 Andy Lai