AI Agents / 自主代理

Quiet-STaR:讓模型在每個字之前先想一下,數學題正確率從 5.9% 到 10.9%

賴家榮 Andy Lai - FULLDOT news 發表文章的作者
賴家榮 Andy Lai
FULLDOT news 發表文章的作者 · SAIP-TAIWAN CAIO
2026-08-02 06:52:43 | 出處: Zelikman, Harik, Shao, Jayasiri, Haber & Goodman, "Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking", arXiv:2403.09629
幾何建築光影 | Stanford 團隊發表 Quiet-STaR 自主思考論文:讓 AI 代理在
Photo: Jan van der Wolf / Pexels · 示意圖,與文中所述之特定廠商無關
發表文章的作者 賴家榮 觀點劃重點

Stanford 團隊的 Quiet-STaR 提出一個直觀的想法:人在寫字說話時會停下來想,模型為什麼不行?訓練後未經任何針對性微調,GSM8K 數學題從 5.9% 提升到 10.9%、常識問答從 36.3% 到 47.2%。

論文的開場是一句很樸素的觀察:「人在寫字與說話時,有時會停下來想一想。」

Quiet-STaR 這篇由 Stanford 團隊發表的論文(arXiv:2403.09629,2024 年 3 月 14 日投稿)就是把這件事變成訓練方法。它不是 2026 年的新研究,但它建立的觀念——讓模型在輸出之前先產生內部推理——是後來一整批推理型模型的基礎,值得回頭讀。

它想解決的問題

論文指出,過去的推理研究多半把推理框定為「回答問題」或「完成任務」的方法。但實際上「推理隱含在幾乎所有的書面文字之中」——證明過程中沒寫出來的步驟、對話底下的心智推測,都是推理。

前作 STaR 的做法是從少量範例中推斷理由,只保留那些導向正確答案的。這是一個高度受限的設定——它需要有標準答案。Quiet-STaR 要做的是讓模型從任意文字中學會推斷未言明的理由。

螺旋筆記本上的原子筆
Photo: Katie Harp / Pexels · 示意圖,與文中所述之特定廠商無關

做法:在每一個 token 都想一下

Quiet-STaR 讓模型在每一個 token 生成理由,用來解釋接下來的文字,藉此改善預測。論文列出三個要克服的難題:

  1. 生成延續內容的運算成本
  2. 模型一開始根本不知道怎麼產生或使用內部思考
  3. 需要預測的範圍超出單一的下一個 token

對應的解法是:token 層級的平行取樣演算法、用可學習的 token 標示思考的開始與結束、以及延伸的 teacher-forcing 技術。

結果:不做針對性微調也有效

在網路文字語料上以 Quiet-STaR 繼續預訓練之後,零樣本條件下:

  • GSM8K(數學文字題) 5.9% → 10.9%
  • CommonsenseQA(常識問答) 36.3% → 47.2%

關鍵在最後一句:「這些提升不需要在這些任務上做任何微調。」也就是說,模型不是被教會解數學題,而是學會了「先想再答」這個一般性的習慣,順帶把數學題做得比較好。

論文還觀察到一個有意思的現象:生成的理由對「難以預測的 token」幫助不成比例地大。簡單的地方它不太用得上,難的地方才發揮作用。

對企業的意義

一、這解釋了為什麼「推理模式」要花更多錢。模型在輸出之前產生的內部思考是真的在跑運算。當供應商提供「延長思考時間」的選項時,那不是行銷詞。

二、該用在哪裡有明確判準。依這篇的發現,內部推理對困難的部分幫助最大、對簡單的部分幾乎沒差。所以不要對所有請求都開推理模式——把它留給合約風險判斷、製程異常根因、法規適用這類真正需要多步推論的任務。

三、5.9% → 10.9% 這個數字要正確讀。相對提升接近一倍,但絕對值仍然只有一成。這是 2024 年的實驗結果,用的是當時的模型規模。它證明的是方法有效,不是這個絕對數字可以拿來評估今天的產品。

需要保留的懷疑

這是 2024 年 3 月的論文,不是最新研究。本文將它列入是因為觀念上的重要性,而非時效性。此後推理型模型已有大量進展,相關的推論時運算討論可參考Gemini Deep Think 的成果

另外,論文的實驗基於當時的模型與語料,絕對數字不應套用到目前的商用模型

常見問題

Quiet-STaR 和一般的「思考鏈」提示有什麼不同?

思考鏈是在提示裡要求模型「一步一步想」,屬於使用方式;Quiet-STaR 是訓練方法——讓模型在繼續預訓練的過程中,學會在每一個 token 生成內部理由來解釋接下來的文字。差別在於前者是臨時要求,後者變成模型的固有習慣,因此在零樣本、未針對任務微調的條件下也能發揮作用。

企業該對所有請求都開啟推理模式嗎?

不建議。論文觀察到生成的理由對「難以預測的 token」幫助不成比例地大,對簡單的部分幾乎沒差。實務上應把推理模式留給合約風險判斷、製程異常根因分析、法規適用判斷這類需要多步推論的高價值任務,一般查詢與整理工作用標準模式即可,否則只是多付運算費用。

GSM8K 從 5.9% 提升到 10.9%,這個成績算好嗎?

要分兩層看。相對提升接近一倍,證明方法確實有效;但絕對值仍只有一成,代表當時的模型離可靠還很遠。更重要的是這是 2024 年 3 月的實驗,使用當時的模型規模與語料,這個絕對數字不能用來評估今天的商用產品。

下一步

推理模式的成本評估與適用任務判準,我們整理在白皮書專區

出處

本文依據 Eric Zelikman, Georges Harik, Yijia Shao, Varuna Jayasiri, Nick Haber & Noah D. Goodman, "Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking", arXiv:2403.09629,投稿於 2024 年 3 月 14 日(v2 修訂於 3 月 18 日):arxiv.org/abs/2403.09629。加註引號者為該論文原文之中譯。

本文為產業觀察,非學術評議。

延伸來源

以下為與本文論點相關、且經實際查閱確認的外部來源。標示為預印本者尚未經同儕審查,引用時請留意。

  • Google DeepMind, "Gemini Deep Think"(2026-02-11):deepmind.google
  • Anthropic, "A global workspace in language models"(2026-07-06):www.anthropic.com
  • Jalal-Kamali, "Divergent Response Modes in Frontier Language Models", arXiv:2608.06578(2026-08-06,預印本):arxiv.org
AI 講師 賴家榮 Andy Lai
專業 AI & 行銷講師

企業 AI 轉型、RAG 向量庫與數位行銷內訓 | 賴家榮 老師親授

樹德 / 輔英 / 屏東大學兼任講師!手把手帶領企業團隊打造專屬 AI 代理與高轉化品牌流量。

本篇文章出處來源聲明
MEDIA CITATION
原始發行媒體 Zelikman, Harik, Shao, Jayasiri, Haber & Goodman, "Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking", arXiv:2403.09629
發表文章的作者 賴家榮 Andy Lai