Enterprise AI / 企業落地

Activation Beacon:把長上下文壓縮起來,KV cache 記憶體降到八分之一

賴家榮 Andy Lai - FULLDOT news 發表文章的作者
賴家榮 Andy Lai
FULLDOT news 發表文章的作者 · SAIP-TAIWAN CAIO
2026-08-02 06:52:43 | 出處: Zhang, Liu, Xiao, Shao, Ye & Dou, "Long Context Compression with Activation Beacon", arXiv:2401.03462
金色電路板特寫 | BAAI 發表 Activation Beacon 論文:突破大模型長上下文記憶
Photo: Tima Miroshnichenko / Pexels · 示意圖,與文中所述之特定廠商無關
發表文章的作者 賴家榮 觀點劃重點

長上下文很好用,但顯示卡記憶體吃不消。BAAI 團隊的 Activation Beacon 選擇壓縮啟動值而非提示詞,結果是推論加速 2 倍、KV cache 記憶體降低 8 倍,而且在 128K 長度上維持與未壓縮版本相當的表現——訓練長度只有 20K。

「長上下文」是這兩年最常被拿來當賣點的規格:128K、200K、甚至更長。但實際要在自家機房跑的人都知道一件事——上下文愈長,顯示卡記憶體吃得愈兇,而且是很兇。

BAAI 團隊的 Activation Beacon(arXiv:2401.03462,2024 年 1 月 7 日投稿,最新版 v3 為同年 10 月)處理的就是這個成本問題。

它的選擇:壓縮啟動值,不是壓縮提示詞

要縮短上下文,最直覺的做法是壓縮輸入的文字,或用「軟提示」(soft prompt)把一段內容濃縮成幾個向量。

Activation Beacon 走的是另一條路:它壓縮的是模型內部的啟動值(activations),而不是提示詞。這個選擇的差別在於,壓縮發生在模型已經理解過內容之後,而不是在它讀進去之前。

論文列出的幾個設計特點:

  • 漸進式壓縮 對輸入單元逐步壓縮,而非一次處理完
  • 以壓縮為基礎的自迴歸訓練
  • 可變壓縮比 不同情境可用不同的壓縮強度
電路板上的電容特寫
Photo: AlexandreP Junior / Pexels · 示意圖,與文中所述之特定廠商無關

結果:三個值得記住的數字

  • 128K 在長上下文任務上維持與未壓縮基準相當的表現,而訓練長度只有 20K
  • 2 倍 推論時間加速。
  • 8 倍 KV cache 記憶體成本降低。

第一項最值得注意:訓練用 20K,卻能在 128K 上維持表現,代表這個方法學到的是壓縮的通則,而不是背下特定長度的處理方式。

評測涵蓋文件理解、少樣本學習與 Needle-in-a-Haystack(大海撈針)任務。

對企業的實際意義

一、這一項直接影響地端部署的硬體預算。KV cache 是長上下文推論時記憶體的主要消耗來源。降到八分之一,意味著同一張卡能服務的併發數大幅增加,或者原本要買兩張卡的情境可能一張就夠。

對於因為保密義務只能走地端的產業,這種效率提升的價值比雲端用戶高得多——雲端用戶可以多付錢買算力,地端用戶要多買一張卡。

二、但它不能取代 RAG。這是最常見的誤解。長上下文讓你能把更多內容塞進去,但:

  • 塞進去的內容每次都要重新處理,成本隨長度增加
  • 資料更新時,整段都要重來
  • 無法標明出處——它不知道答案來自你貼的第幾段

RAG 的價值在於只取相關的片段、可增量更新、而且能追溯來源。這三件事長上下文都做不到。相關討論見企業 RAG 評估指標

三、評估時要看「壓縮後」的表現,不是規格表。可變壓縮比代表壓得愈狠、表現愈可能掉。供應商說支援 128K,你要問的是「在什麼壓縮比之下,掉多少」。

需要保留的懷疑

這是 2024 年 1 月的論文,不是最新研究。本站列入是因為它處理的成本問題至今仍在,而非時效性。此後長上下文的處理技術已有大量進展。

另外,論文的評測任務(文件理解、少樣本學習、大海撈針)與企業的實際工作負載不一定相符。大海撈針測的是「能不能在長文中找到一句話」,這比「讀完長文做出綜合判斷」容易得多。導入前應以自家實際任務測試。

常見問題

長上下文可以取代 RAG 嗎?

不能。三個結構性差異:一是塞進去的內容每次都要重新處理,成本隨長度線性增加;二是資料更新時整段都要重來,無法增量更新;三是無法標明答案來自哪一份文件的哪一段,也就沒有可追溯性。RAG 的價值正在於只取相關片段、可增量更新、且能追溯來源。兩者是互補而非替代。

KV cache 記憶體降低 8 倍,對企業代表什麼?

直接影響地端部署的硬體預算。KV cache 是長上下文推論時記憶體的主要消耗來源,降到八分之一意味著同一張顯示卡能服務的併發數大幅增加,或原本需要兩張卡的情境可能一張就夠。對於因保密義務只能走地端的產業(如半導體封測),這種效率提升的價值比雲端用戶更高——雲端可以多付錢買算力,地端要多買硬體。

供應商說支援 128K 上下文,該怎麼驗證?

問「在什麼壓縮比之下,表現掉多少」。Activation Beacon 支援可變壓縮比,代表壓得愈狠、表現愈可能下降。此外要注意評測任務的差異:常見的「大海撈針」測的是能否在長文中找到一句話,這比「讀完長文做出綜合判斷」容易得多。導入前應以自家實際任務測試,而非採信規格數字。

下一步

長上下文與 RAG 的選用判準、地端硬體需求估算,我們整理在白皮書專區

出處

本文依據 Peitian Zhang, Zheng Liu, Shitao Xiao, Ninglu Shao, Qiwei Ye & Zhicheng Dou, "Long Context Compression with Activation Beacon", arXiv:2401.03462,投稿於 2024 年 1 月 7 日(v3 為 2024 年 10 月 11 日):arxiv.org/abs/2401.03462。程式碼託管於 BAAI 的 FlagEmbedding 專案。

本文為產業觀察,非學術評議。

延伸來源

以下為與本文論點相關、且經實際查閱確認的外部來源。標示為預印本者尚未經同儕審查,引用時請留意。

  • Dastidar & the Leni Team, arXiv:2607.17044(2026-07-19,預印本):arxiv.org
  • Google DeepMind, "Gemini Deep Think"(2026-02-11):deepmind.google
AI 講師 賴家榮 Andy Lai
專業 AI & 行銷講師

企業 AI 轉型、RAG 向量庫與數位行銷內訓 | 賴家榮 老師親授

樹德 / 輔英 / 屏東大學兼任講師!手把手帶領企業團隊打造專屬 AI 代理與高轉化品牌流量。

本篇文章出處來源聲明
MEDIA CITATION
原始發行媒體 Zhang, Liu, Xiao, Shao, Ye & Dou, "Long Context Compression with Activation Beacon", arXiv:2401.03462
發表文章的作者 賴家榮 Andy Lai