Quiet-STaR:讓模型在每個字之前先想一下,數學題正確率從 5.9% 到 10.9%
Stanford 團隊的 Quiet-STaR 提出一個直觀的想法:人在寫字說話時會停下來想,模型為什麼不行?訓練後未經任何針對性微調,GSM8K 數學題從 5.9% 提升到 10.9%、常識問答從 36.3% 到 47.2%。
論文的開場是一句很樸素的觀察:「人在寫字與說話時,有時會停下來想一想。」
Quiet-STaR 這篇由 Stanford 團隊發表的論文(arXiv:2403.09629,2024 年 3 月 14 日投稿)就是把這件事變成訓練方法。它不是 2026 年的新研究,但它建立的觀念——讓模型在輸出之前先產生內部推理——是後來一整批推理型模型的基礎,值得回頭讀。
它想解決的問題
論文指出,過去的推理研究多半把推理框定為「回答問題」或「完成任務」的方法。但實際上「推理隱含在幾乎所有的書面文字之中」——證明過程中沒寫出來的步驟、對話底下的心智推測,都是推理。
前作 STaR 的做法是從少量範例中推斷理由,只保留那些導向正確答案的。這是一個高度受限的設定——它需要有標準答案。Quiet-STaR 要做的是讓模型從任意文字中學會推斷未言明的理由。
做法:在每一個 token 都想一下
Quiet-STaR 讓模型在每一個 token 生成理由,用來解釋接下來的文字,藉此改善預測。論文列出三個要克服的難題:
- 生成延續內容的運算成本
- 模型一開始根本不知道怎麼產生或使用內部思考
- 需要預測的範圍超出單一的下一個 token
對應的解法是:token 層級的平行取樣演算法、用可學習的 token 標示思考的開始與結束、以及延伸的 teacher-forcing 技術。
結果:不做針對性微調也有效
在網路文字語料上以 Quiet-STaR 繼續預訓練之後,零樣本條件下:
- GSM8K(數學文字題) 5.9% → 10.9%
- CommonsenseQA(常識問答) 36.3% → 47.2%
關鍵在最後一句:「這些提升不需要在這些任務上做任何微調。」也就是說,模型不是被教會解數學題,而是學會了「先想再答」這個一般性的習慣,順帶把數學題做得比較好。
論文還觀察到一個有意思的現象:生成的理由對「難以預測的 token」幫助不成比例地大。簡單的地方它不太用得上,難的地方才發揮作用。
對企業的意義
一、這解釋了為什麼「推理模式」要花更多錢。模型在輸出之前產生的內部思考是真的在跑運算。當供應商提供「延長思考時間」的選項時,那不是行銷詞。
二、該用在哪裡有明確判準。依這篇的發現,內部推理對困難的部分幫助最大、對簡單的部分幾乎沒差。所以不要對所有請求都開推理模式——把它留給合約風險判斷、製程異常根因、法規適用這類真正需要多步推論的任務。
三、5.9% → 10.9% 這個數字要正確讀。相對提升接近一倍,但絕對值仍然只有一成。這是 2024 年的實驗結果,用的是當時的模型規模。它證明的是方法有效,不是這個絕對數字可以拿來評估今天的產品。
需要保留的懷疑
這是 2024 年 3 月的論文,不是最新研究。本文將它列入是因為觀念上的重要性,而非時效性。此後推理型模型已有大量進展,相關的推論時運算討論可參考Gemini Deep Think 的成果。
另外,論文的實驗基於當時的模型與語料,絕對數字不應套用到目前的商用模型。
常見問題
Quiet-STaR 和一般的「思考鏈」提示有什麼不同?
思考鏈是在提示裡要求模型「一步一步想」,屬於使用方式;Quiet-STaR 是訓練方法——讓模型在繼續預訓練的過程中,學會在每一個 token 生成內部理由來解釋接下來的文字。差別在於前者是臨時要求,後者變成模型的固有習慣,因此在零樣本、未針對任務微調的條件下也能發揮作用。
企業該對所有請求都開啟推理模式嗎?
不建議。論文觀察到生成的理由對「難以預測的 token」幫助不成比例地大,對簡單的部分幾乎沒差。實務上應把推理模式留給合約風險判斷、製程異常根因分析、法規適用判斷這類需要多步推論的高價值任務,一般查詢與整理工作用標準模式即可,否則只是多付運算費用。
GSM8K 從 5.9% 提升到 10.9%,這個成績算好嗎?
要分兩層看。相對提升接近一倍,證明方法確實有效;但絕對值仍只有一成,代表當時的模型離可靠還很遠。更重要的是這是 2024 年 3 月的實驗,使用當時的模型規模與語料,這個絕對數字不能用來評估今天的商用產品。
下一步
推理模式的成本評估與適用任務判準,我們整理在白皮書專區。
出處
本文依據 Eric Zelikman, Georges Harik, Yijia Shao, Varuna Jayasiri, Nick Haber & Noah D. Goodman, "Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking", arXiv:2403.09629,投稿於 2024 年 3 月 14 日(v2 修訂於 3 月 18 日):arxiv.org/abs/2403.09629。加註引號者為該論文原文之中譯。
本文為產業觀察,非學術評議。
延伸來源
以下為與本文論點相關、且經實際查閱確認的外部來源。標示為預印本者尚未經同儕審查,引用時請留意。
- Google DeepMind, "Gemini Deep Think"(2026-02-11):deepmind.google
- Anthropic, "A global workspace in language models"(2026-07-06):www.anthropic.com
- Jalal-Kamali, "Divergent Response Modes in Frontier Language Models", arXiv:2608.06578(2026-08-06,預印本):arxiv.org