Activation Beacon:把長上下文壓縮起來,KV cache 記憶體降到八分之一
長上下文很好用,但顯示卡記憶體吃不消。BAAI 團隊的 Activation Beacon 選擇壓縮啟動值而非提示詞,結果是推論加速 2 倍、KV cache 記憶體降低 8 倍,而且在 128K 長度上維持與未壓縮版本相當的表現——訓練長度只有 20K。
「長上下文」是這兩年最常被拿來當賣點的規格:128K、200K、甚至更長。但實際要在自家機房跑的人都知道一件事——上下文愈長,顯示卡記憶體吃得愈兇,而且是很兇。
BAAI 團隊的 Activation Beacon(arXiv:2401.03462,2024 年 1 月 7 日投稿,最新版 v3 為同年 10 月)處理的就是這個成本問題。
它的選擇:壓縮啟動值,不是壓縮提示詞
要縮短上下文,最直覺的做法是壓縮輸入的文字,或用「軟提示」(soft prompt)把一段內容濃縮成幾個向量。
Activation Beacon 走的是另一條路:它壓縮的是模型內部的啟動值(activations),而不是提示詞。這個選擇的差別在於,壓縮發生在模型已經理解過內容之後,而不是在它讀進去之前。
論文列出的幾個設計特點:
- 漸進式壓縮 對輸入單元逐步壓縮,而非一次處理完
- 以壓縮為基礎的自迴歸訓練
- 可變壓縮比 不同情境可用不同的壓縮強度
結果:三個值得記住的數字
- 128K 在長上下文任務上維持與未壓縮基準相當的表現,而訓練長度只有 20K。
- 2 倍 推論時間加速。
- 8 倍 KV cache 記憶體成本降低。
第一項最值得注意:訓練用 20K,卻能在 128K 上維持表現,代表這個方法學到的是壓縮的通則,而不是背下特定長度的處理方式。
評測涵蓋文件理解、少樣本學習與 Needle-in-a-Haystack(大海撈針)任務。
對企業的實際意義
一、這一項直接影響地端部署的硬體預算。KV cache 是長上下文推論時記憶體的主要消耗來源。降到八分之一,意味著同一張卡能服務的併發數大幅增加,或者原本要買兩張卡的情境可能一張就夠。
對於因為保密義務只能走地端的產業,這種效率提升的價值比雲端用戶高得多——雲端用戶可以多付錢買算力,地端用戶要多買一張卡。
二、但它不能取代 RAG。這是最常見的誤解。長上下文讓你能把更多內容塞進去,但:
- 塞進去的內容每次都要重新處理,成本隨長度增加
- 資料更新時,整段都要重來
- 無法標明出處——它不知道答案來自你貼的第幾段
RAG 的價值在於只取相關的片段、可增量更新、而且能追溯來源。這三件事長上下文都做不到。相關討論見企業 RAG 評估指標。
三、評估時要看「壓縮後」的表現,不是規格表。可變壓縮比代表壓得愈狠、表現愈可能掉。供應商說支援 128K,你要問的是「在什麼壓縮比之下,掉多少」。
需要保留的懷疑
這是 2024 年 1 月的論文,不是最新研究。本站列入是因為它處理的成本問題至今仍在,而非時效性。此後長上下文的處理技術已有大量進展。
另外,論文的評測任務(文件理解、少樣本學習、大海撈針)與企業的實際工作負載不一定相符。大海撈針測的是「能不能在長文中找到一句話」,這比「讀完長文做出綜合判斷」容易得多。導入前應以自家實際任務測試。
常見問題
長上下文可以取代 RAG 嗎?
不能。三個結構性差異:一是塞進去的內容每次都要重新處理,成本隨長度線性增加;二是資料更新時整段都要重來,無法增量更新;三是無法標明答案來自哪一份文件的哪一段,也就沒有可追溯性。RAG 的價值正在於只取相關片段、可增量更新、且能追溯來源。兩者是互補而非替代。
KV cache 記憶體降低 8 倍,對企業代表什麼?
直接影響地端部署的硬體預算。KV cache 是長上下文推論時記憶體的主要消耗來源,降到八分之一意味著同一張顯示卡能服務的併發數大幅增加,或原本需要兩張卡的情境可能一張就夠。對於因保密義務只能走地端的產業(如半導體封測),這種效率提升的價值比雲端用戶更高——雲端可以多付錢買算力,地端要多買硬體。
供應商說支援 128K 上下文,該怎麼驗證?
問「在什麼壓縮比之下,表現掉多少」。Activation Beacon 支援可變壓縮比,代表壓得愈狠、表現愈可能下降。此外要注意評測任務的差異:常見的「大海撈針」測的是能否在長文中找到一句話,這比「讀完長文做出綜合判斷」容易得多。導入前應以自家實際任務測試,而非採信規格數字。
下一步
長上下文與 RAG 的選用判準、地端硬體需求估算,我們整理在白皮書專區。
出處
本文依據 Peitian Zhang, Zheng Liu, Shitao Xiao, Ninglu Shao, Qiwei Ye & Zhicheng Dou, "Long Context Compression with Activation Beacon", arXiv:2401.03462,投稿於 2024 年 1 月 7 日(v3 為 2024 年 10 月 11 日):arxiv.org/abs/2401.03462。程式碼託管於 BAAI 的 FlagEmbedding 專案。
本文為產業觀察,非學術評議。
延伸來源
以下為與本文論點相關、且經實際查閱確認的外部來源。標示為預印本者尚未經同儕審查,引用時請留意。
- Dastidar & the Leni Team, arXiv:2607.17044(2026-07-19,預印本):arxiv.org
- Google DeepMind, "Gemini Deep Think"(2026-02-11):deepmind.google