同一份考題,只是改了作答時間,AI 的排名就翻盤了——而且有 3–19% 的題目「想越久錯越多」
我們習慣說「某某模型比較強」。這篇論文用 56,476 次推論證明,這句話少了一個前提:你讓它想多久。在三個測試集上,模型排名都會隨著 token 預算改變而反轉。
OpenAI & Google 最新模型
我們習慣說「某某模型比較強」。這篇論文用 56,476 次推論證明,這句話少了一個前提:你讓它想多久。在三個測試集上,模型排名都會隨著 token 預算改變而反轉。
一份 2026 年 8 月的研究對六家實驗室的前沿模型施加操控壓力,累積 24,480 筆評判。結論很具體:GPT-5 有 99% 的機率拒絕揭露自己的推理但仍給出答案,其餘模型是 0%。模型之間的差異不只在被影響的幅度,而在反應的「種類」。
Google DeepMind 的 Gemini Deep Think 在數學、物理與計算機科學上取得多項具體成果,包括自主解出 Erdős 猜想資料庫中的四個未解問題。但團隊在同一篇文章中明確設限:「我們目前不主張任何第三級(重大進展)與第四級(里程碑突破)的成果。」
Anthropic 於 2026 年 7 月 6 日發表全域工作空間研究,指出 Claude 內部存在一小群被稱為 J-space 的神經模式,承載了模型「想到但沒說出口」的內容。研究團隊能讀取它,也能直接改寫它。本文說明這對企業 AI 稽核代表什麼,以及不代表什麼。
2026 北京智源大會發布多項成果,媒體焦點多在世界模型與 Nature 論文。但對台灣供應鏈更值得注意的是 FlagOS——一套宣稱支援 18 家品牌、32 款晶片的開源算力層。它要解的不是模型能力問題,是硬體綁定問題。
北京智源研究院發布 2026 十大 AI 技術趨勢,主軸是從「預測下一個詞」轉向「預測世界下一狀態」。但對企業最有參考價值的不是那些技術名詞,而是第六條直接承認企業應用正處於幻滅期——由一家研究機構說出這句話,值得認真看待。
7 月 DeepSeek、百度、阿里巴巴接連發表新模型,訴求都是低成本。但「訓練成本降低 94%」和「API 費用只要十分之一」是完全不同的兩件事,而且只有一件跟你的帳單有關。本文拆解 MoE 架構為什麼能同時做大又做便宜,以及台灣企業選用前該確認的四個問題。
「看得懂圖、聽得懂聲音」聽起來很厲害,但多模態真正的技術分水嶺不在功能列表,而在模型是原生就吃多種訊號,還是外掛翻譯。本文拆解 Gemini 技術報告的基準數字該怎麼讀、長上下文有什麼沒被講的限制,以及製造業現場最適合切入的場景。
AlphaFold 3 發表於 Nature(2024 年 5 月),以擴散式架構在單一框架內預測蛋白質、核酸、小分子與離子的聯合結構。它取代的是過去一整批各自為政的專用工具——這個「統一框架勝過專用工具集合」的模式,值得所有產業借鏡。
企業支出分析平台 Ramp 於 7 月 30 日發布的 AI 採購指數顯示,Anthropic 企業付費採購市佔達 34.4%,首度超越 OpenAI 的 32.3%。本文拆解這個數字實際量到什麼、代理原生架構在哪些情境會失效,以及台灣企業導入前該先確認的三件事。
每隔幾週就有新的前沿模型發表,分數更高、上下文更長、價格更低。但對企業而言,絕大多數的發表跟你完全無關。本文提供一套四個問題的判準,用來快速決定某一次發表值不值得你花時間評估。