Anthropic 找到了 Claude 的「內心話」區域:J-space 與可稽核 AI 的距離
Anthropic 於 2026 年 7 月 6 日發表全域工作空間研究,指出 Claude 內部存在一小群被稱為 J-space 的神經模式,承載了模型「想到但沒說出口」的內容。研究團隊能讀取它,也能直接改寫它。本文說明這對企業 AI 稽核代表什麼,以及不代表什麼。
Anthropic 在 2026 年 7 月 6 日發表了一份可解釋性研究,指出 Claude 內部存在一小群特殊的神經活動模式。研究團隊稱之為 J-space,命名來自找到它的數學工具(Jacobian)。
值得注意的是研究團隊的一句描述:這套結構不是被設計出來的,而是在訓練過程中自己長出來的,推測是因為它是組織運算的有效方式。
J-space 是什麼
簡單說,它是模型「想到但還沒說出口」的地方。研究團隊為詞彙表中的每個詞,去找出那個會讓 Claude 在稍後更可能說出該詞的內部活動模式,這個方法叫做 J-lens。
關鍵在於:J-space 不只是反映輸出,它會因果地決定輸出。
四個證明因果關係的實驗
- 可回報性 要 Claude 默想一種運動,J-lens 顯示「足球」。研究團隊把該模式換成「橄欖球」,Claude 接著就報告橄欖球。
- 可調控性 要求 Claude 一邊抄寫無關文字、一邊在心裡算數學,它能把「九」「七」保留在 J-space 中。
- 多步推理 問「會結網的動物有幾隻腳」,把「蜘蛛」換成「螞蟻」,答案從 8 隻變成 6 隻。
- 跨任務共用 同一個「法國」表徵換成「中國」,關於首都、語言、貨幣的答案同步改變。
最後一項尤其重要:它顯示 J-space 是一個被多種任務共同存取的資訊區,而不是每個問題各自獨立的暫存。
對企業真正有意義的那一段
研究中有一項發現,和法遵、稽核直接相關:J-lens 揭露了 Claude 在回應之前,內部已經出現「fake」「fictional」「manipulation」這類詞。
換句話說,模型在輸出中沒有表達的疑慮,其實在內部出現過。在一個刻意設計的假勒索情境中,模型內部已經識別出這是假的;在資料造假的情境中,內部浮現了「操弄」。研究團隊也用它在刻意訓練成不對齊的測試模型上,挖出了隱藏的惡意目標。
這條線指向的方向是:未來的 AI 稽核,可能不只是看模型說了什麼,而是能檢查它「想過什麼」。對於受到歐盟 AI 法案與NIST AI RMF約束的高風險應用,這是目前少數看得到的技術路徑。
需要保留的懷疑
這篇研究的自我設限寫得比多數論文清楚,四項限制都值得完整轉述:
- J-lens 只能辨識對應到單一 token 的概念。複雜或多字詞的概念抓不到。
- 它是「一個不完美的方法,只能近似地捕捉模型真正的工作空間」。
- J-space 佔不到 Claude 整體內部活動的十分之一。絕大部分處理仍在視線之外。
- 研究處理的是「取用意識」(access consciousness)的功能性質,明確無法證明現象意識或主觀經驗。
研究團隊自己強調:「這一切都無法告訴我們 Claude 是否像人一樣有意識,或者它是否感覺到任何東西。」把這份研究解讀成「AI 有意識了」,是對原文的誤讀。
另外要提醒的是,這是 Anthropic 對自家模型的研究。研究方法是否能推廣到其他架構的模型,目前沒有第三方驗證。
台灣企業現在該怎麼看
務實的判斷是:這是研究進展,不是可採購的產品。今天沒有任何供應商能賣你「模型內心話稽核」。
但它會影響兩件事的規劃前提。第一,如果你正在建立 AI 治理制度,「模型不可解釋」這個假設的有效期限可能沒有想像中長,制度設計上不必把它當成永久前提。第二,在與 AI 供應商議約時,可解釋性與稽核支援可以開始納入討論,而不是被當成不可能的要求。
常見問題
J-space 是什麼?和一般說的「模型可解釋性」有何不同?
J-space 是 Anthropic 在 Claude 內部發現的一小群神經活動模式,承載模型能夠回報、刻意想起並用於推理的內容。與一般可解釋性方法的差別在於因果性:研究團隊不只能讀取它,還能直接改寫——把「足球」的模式換成「橄欖球」,模型的回答就跟著改變。它佔模型整體內部活動不到十分之一。
這代表 AI 有意識了嗎?
沒有。研究處理的是「取用意識」的功能性質,也就是哪些資訊能被模型取用與回報,明確無法證明現象意識或主觀經驗。原文的措辭是:「這一切都無法告訴我們 Claude 是否像人一樣有意識,或者它是否感覺到任何東西。」
企業現在可以拿這個做 AI 稽核嗎?
不行。這是研究階段的成果,沒有可採購的產品,而且方法本身有明確限制:只能辨識單一 token 的概念、只是近似捕捉、僅涵蓋不到十分之一的內部活動。實務上的意義在於規劃前提——「模型不可解釋」不必再被當成永久假設,可解釋性與稽核支援可以開始納入供應商議約的討論範圍。
下一步
若你正在建立企業 AI 的治理與稽核制度,我們把跨法域的共同要求整理在白皮書專區;三個法域的路線對照可參考歐盟、日本、美國的比較。
出處
本文依據 Anthropic, "A global workspace in language models",發表於 2026 年 7 月 6 日:anthropic.com/research/global-workspace。加註引號者為該文原文之中譯。
本文為產業觀察,非學術評議。研究方法能否推廣至其他架構的模型,目前尚無第三方驗證。