Frontier AI / 前沿模型

Anthropic 找到了 Claude 的「內心話」區域:J-space 與可稽核 AI 的距離

賴家榮 Andy Lai - FULLDOT news 發表文章的作者
賴家榮 Andy Lai
FULLDOT news 總編輯 · SAIP-TAIWAN CAIO
2026-08-08 09:00:00 | 出處: Anthropic, "A global workspace in language models"
Anthropic 找到了 Claude 的「內心話」區域:J-space 與可稽核 AI 的距離 | FULLDOT news
發表文章的作者 賴家榮 觀點劃重點

Anthropic 於 2026 年 7 月 6 日發表全域工作空間研究,指出 Claude 內部存在一小群被稱為 J-space 的神經模式,承載了模型「想到但沒說出口」的內容。研究團隊能讀取它,也能直接改寫它。本文說明這對企業 AI 稽核代表什麼,以及不代表什麼。

Anthropic 在 2026 年 7 月 6 日發表了一份可解釋性研究,指出 Claude 內部存在一小群特殊的神經活動模式。研究團隊稱之為 J-space,命名來自找到它的數學工具(Jacobian)。

值得注意的是研究團隊的一句描述:這套結構不是被設計出來的,而是在訓練過程中自己長出來的,推測是因為它是組織運算的有效方式。

J-space 是什麼

簡單說,它是模型「想到但還沒說出口」的地方。研究團隊為詞彙表中的每個詞,去找出那個會讓 Claude 在稍後更可能說出該詞的內部活動模式,這個方法叫做 J-lens。

關鍵在於:J-space 不只是反映輸出,它會因果地決定輸出。

四個證明因果關係的實驗

  • 可回報性 要 Claude 默想一種運動,J-lens 顯示「足球」。研究團隊把該模式換成「橄欖球」,Claude 接著就報告橄欖球。
  • 可調控性 要求 Claude 一邊抄寫無關文字、一邊在心裡算數學,它能把「九」「七」保留在 J-space 中。
  • 多步推理 問「會結網的動物有幾隻腳」,把「蜘蛛」換成「螞蟻」,答案從 8 隻變成 6 隻。
  • 跨任務共用 同一個「法國」表徵換成「中國」,關於首都、語言、貨幣的答案同步改變。

最後一項尤其重要:它顯示 J-space 是一個被多種任務共同存取的資訊區,而不是每個問題各自獨立的暫存。

對企業真正有意義的那一段

研究中有一項發現,和法遵、稽核直接相關:J-lens 揭露了 Claude 在回應之前,內部已經出現「fake」「fictional」「manipulation」這類詞。

換句話說,模型在輸出中沒有表達的疑慮,其實在內部出現過。在一個刻意設計的假勒索情境中,模型內部已經識別出這是假的;在資料造假的情境中,內部浮現了「操弄」。研究團隊也用它在刻意訓練成不對齊的測試模型上,挖出了隱藏的惡意目標。

這條線指向的方向是:未來的 AI 稽核,可能不只是看模型說了什麼,而是能檢查它「想過什麼」。對於受到歐盟 AI 法案NIST AI RMF約束的高風險應用,這是目前少數看得到的技術路徑。

需要保留的懷疑

這篇研究的自我設限寫得比多數論文清楚,四項限制都值得完整轉述:

  • J-lens 只能辨識對應到單一 token 的概念。複雜或多字詞的概念抓不到。
  • 它是「一個不完美的方法,只能近似地捕捉模型真正的工作空間」
  • J-space 佔不到 Claude 整體內部活動的十分之一。絕大部分處理仍在視線之外。
  • 研究處理的是「取用意識」(access consciousness)的功能性質,明確無法證明現象意識或主觀經驗

研究團隊自己強調:「這一切都無法告訴我們 Claude 是否像人一樣有意識,或者它是否感覺到任何東西。」把這份研究解讀成「AI 有意識了」,是對原文的誤讀。

另外要提醒的是,這是 Anthropic 對自家模型的研究。研究方法是否能推廣到其他架構的模型,目前沒有第三方驗證。

台灣企業現在該怎麼看

務實的判斷是:這是研究進展,不是可採購的產品。今天沒有任何供應商能賣你「模型內心話稽核」。

但它會影響兩件事的規劃前提。第一,如果你正在建立 AI 治理制度,「模型不可解釋」這個假設的有效期限可能沒有想像中長,制度設計上不必把它當成永久前提。第二,在與 AI 供應商議約時,可解釋性與稽核支援可以開始納入討論,而不是被當成不可能的要求。

常見問題

J-space 是什麼?和一般說的「模型可解釋性」有何不同?

J-space 是 Anthropic 在 Claude 內部發現的一小群神經活動模式,承載模型能夠回報、刻意想起並用於推理的內容。與一般可解釋性方法的差別在於因果性:研究團隊不只能讀取它,還能直接改寫——把「足球」的模式換成「橄欖球」,模型的回答就跟著改變。它佔模型整體內部活動不到十分之一。

這代表 AI 有意識了嗎?

沒有。研究處理的是「取用意識」的功能性質,也就是哪些資訊能被模型取用與回報,明確無法證明現象意識或主觀經驗。原文的措辭是:「這一切都無法告訴我們 Claude 是否像人一樣有意識,或者它是否感覺到任何東西。」

企業現在可以拿這個做 AI 稽核嗎?

不行。這是研究階段的成果,沒有可採購的產品,而且方法本身有明確限制:只能辨識單一 token 的概念、只是近似捕捉、僅涵蓋不到十分之一的內部活動。實務上的意義在於規劃前提——「模型不可解釋」不必再被當成永久假設,可解釋性與稽核支援可以開始納入供應商議約的討論範圍。

下一步

若你正在建立企業 AI 的治理與稽核制度,我們把跨法域的共同要求整理在白皮書專區;三個法域的路線對照可參考歐盟、日本、美國的比較

出處

本文依據 Anthropic, "A global workspace in language models",發表於 2026 年 7 月 6 日:anthropic.com/research/global-workspace。加註引號者為該文原文之中譯。

本文為產業觀察,非學術評議。研究方法能否推廣至其他架構的模型,目前尚無第三方驗證。

AI 講師 賴家榮 Andy Lai
專業 AI & 行銷講師

企業 AI 轉型、RAG 向量庫與數位行銷內訓 | 賴家榮 老師親授

樹德 / 輔英 / 屏東大學兼任講師!手把手帶領企業團隊打造專屬 AI 代理與高轉化品牌流量。

本篇文章出處來源聲明
MEDIA CITATION
原始發行媒體 Anthropic, "A global workspace in language models"
發表文章的作者 賴家榮 Andy Lai