讓大型語言模型自己操盤,結果它的進出場時機穩定地「做反」——而且餵它自己的筆記會更嚴重
研究者讓語言模型觀察匿名化的盤中股價歷史,反覆在做多與空手之間選擇。用曝險配對的衡量方式,發現跨模態、跨時間尺度、跨狀態、跨模型家族都出現持續的負向擇時。把行動序列打亂會大幅削弱這個效果,代表問題出在行動與後續報酬的對齊上。更值得注意的是,餵入自己寫的記憶會讓政策更固著。
這篇的結論對所有想把 AI 用在「自動決策」的人都有意義,不只是金融業:語言模型在連續決策中,會展現出穩定、可被還原的方向性結構——而這個結構的方向,在實驗裡是不利的。
實驗怎麼設計
論文的出發點是一個金融市場的老問題:一個對價格變動有系統性反應的連續策略,可能會對其他市場參與者變得可預測。
他們用 RetailAgent 這個框架來檢驗語言模型會不會出現這種結構。做法是:模型觀察匿名化的盤中股價歷史與允許的狀態,然後反覆在「做多(持有股票)」與「空手(不進場)」之間選擇,接著才揭露下一個區間的報酬。
關鍵的衡量方法
這裡有個設計很值得學:他們比較的是同一支股票、同一條盤中路徑上,做多區間與空手區間的報酬,並且先把「整體做多決策的比例」扣除掉。
這個曝險配對(exposure-matched)的衡量方式,排除了「因為多做多所以賺得多」這種單純的曝險差異,剩下的才是真正的擇時能力。
四個發現
- 跨模態、跨時間尺度、跨狀態、跨模型家族,都出現持續的負向擇時。不是某一個模型的問題。
- 把存下來的行動序列打亂,效果大幅削弱。這證明負分來自「行動與後續報酬之間的對齊」,而不是隨機波動。
- 把自己寫的記憶餵回決策,會進一步提高政策的固著度。也就是它會更堅持自己原本的做法。
- 在代理同時用了兩種行動的那些交易日上,擇時表現變得更負。
作者的結論是:這些結果揭示了語言模型連續決策中穩定且可還原的方向性結構,同時也是一個行為訊號,可用來研究另一個參與者會如何回應一個可預測的策略。
我讀完的感想
先說清楚:這篇不是在說「AI 選股會賠錢」,雖然結論看起來像。它真正有價值的是第二與第三點。
第二點告訴我們:模型的連續決策不是隨機的,而是有結構的。打亂順序效果就消失,代表那個結構真實存在。
第三點更值得所有人注意:讓代理讀自己的歷史紀錄,會讓它更固執,而不是更聰明。
這一點跟WikiSkill 那篇的「累積經驗有用」看似矛盾,其實不衝突——差別在於累積的是「經過整理與驗證的知識」,還是「未經篩選的自己過去的行動」。前者是學習,後者是自我強化。
對台灣企業的意義
若這些連續決策已經開始自動生效,執行期治理的五項要件是該一併補上的功課。
一、任何讓 AI 連續做決策的場景,都要檢查它會不會變得可預測。不只是交易。自動定價、自動排程、自動補貨都適用——一個可被預測的策略,會被對手利用。
二、「讓 AI 記住自己做過什麼」這個設計要非常小心。這篇提供了明確證據:未經篩選的自我記憶會提高固著度。要讓它學,就得有人先篩選過。
三、單看績效數字會被曝險差異騙。曝險配對這個方法值得借用——評估任何自動決策系統時,都要問:這個結果是因為它做對了,還是因為它做得比較多?
現在可以怎麼準備
- 盤點公司裡有哪些「AI 連續做決策」的流程。連續的意思是:這次的決策會影響下次的狀態。
- 檢查有沒有把歷史決策直接餵回去。如果有,加一道人工篩選,只留驗證過為正確的。
- 用配對的方式評估成效。不要只看總結果,要扣掉行動頻率的差異。
可行的解決方案
對連續決策場景,務實的做法是把「經驗」與「行動紀錄」分開:行動紀錄只用於稽核,不回餵;真正要回餵的,是經人工確認過的判斷原則。
這正好呼應 WikiSkill 的結構——原始執行經驗、累積知識、可執行技能,三者要分開。這篇則從反面證明了混在一起的代價。
需要保留的懷疑
這是 arXiv 預印本,在本文寫作時尚無同儕審查紀錄。
- 摘要未提供任何量化數字。「持續的負向擇時」有多負,摘要沒有給出數值,因此本文無法報導幅度。
- 摘要未說明受測的模型與資料期間。無法判斷涵蓋範圍與市場環境。
- 這是研究設定,不是可交易策略。實驗排除了交易成本、滑價與流動性,與真實操作差距很大。
- 本文不構成任何投資建議。研究關注的是語言模型的決策結構,不是投資方法。
常見問題
「負向擇時」是什麼意思?
指的是在做多的那些區間,報酬反而比空手的區間差。也就是它選擇進場的時機系統性地不利。研究者特別扣除了整體做多的比例,所以這不是「做太多或太少」造成的,而是時機選擇本身的問題。
為什麼把行動序列打亂,效果就消失了?
因為打亂之後,行動與後續報酬之間的對應關係被破壞了。如果負分是隨機雜訊造成的,打亂不該有影響;既然打亂後效果大幅削弱,就代表原本的負分來自行動與報酬之間真實存在的對齊關係。這是一個很漂亮的對照設計。
那到底該不該讓 AI 記住自己做過的事?
要分清楚記住的是什麼。記住「未經篩選的自身行動」會提高固著度,這篇提供了證據;記住「經過整理與驗證的知識」則有助於改善,這是 WikiSkill 那篇的發現。實務上的原則是:行動紀錄用於稽核,判斷原則才回餵,而且回餵前要有人確認過。
本文出處 Yupeng Zhang、Liuyuan Jiang、Hongyi Huang、Bingheng Li、Lisha Chen,"RetailAgent: Structured Adverse Timing in Self-Conditioned Multimodal LLM Trading Agents",arXiv:2608.28399,2026 年 8 月 28 日投稿。本文為中文編譯與評論,原始論點著作權屬原作者所有,且不構成投資建議。
圖片出處 Photo: Kimberly Alves / Pexels(免費授權)。
公司裡有讓 AI 連續做決策的流程嗎?
甫東科技可以協助你檢視自動決策流程的回饋設計:哪些紀錄該回餵、哪些只該留作稽核、以及成效評估有沒有被曝險差異誤導。這類問題通常不是模型換一換就能解決的。