中國模型說的「便宜」,其實是三件不同的事——談 MoE 架構與選用時該問的問題
7 月 DeepSeek、百度、阿里巴巴接連發表新模型,訴求都是低成本。但「訓練成本降低 94%」和「API 費用只要十分之一」是完全不同的兩件事,而且只有一件跟你的帳單有關。本文拆解 MoE 架構為什麼能同時做大又做便宜,以及台灣企業選用前該確認的四個問題。
2026 年 7 月,中國三家主要 AI 公司接連發表新模型:DeepSeek 推出 V4-Flash、百度升級 ERNIE 5.1、阿里巴巴展出 Qwen 3.8-Max。三則消息的共同賣點都是「便宜」。
但把三則的宣稱並排看,會發現它們講的便宜不是同一件事——而這個差別,直接決定了它跟你的成本有沒有關係。
先界定:三種「便宜」
AI 的成本至少要分成三層來看,而報導經常把它們混在一起:
- 訓練成本 把模型做出來要花多少錢。這是廠商的資本支出,跟你的帳單完全無關。百度宣稱的「預訓練成本降低 94%」屬於這一層。
- 推論成本 模型回答一次問題,廠商實際耗掉的運算資源。這決定了定價的地板在哪裡。
- API 售價 你實際付的錢。DeepSeek 與阿里巴巴宣稱的「美商的十分之一/五分之一」屬於這一層。
關鍵在於:售價可以低於推論成本,那叫補貼,不叫技術突破。搶市佔階段的定價策略在雲端與電商產業都上演過無數次。訓練成本下降是廠商的好消息,售價下降才是你的好消息,而後者不保證能維持多久。
這不是說中國模型不便宜。而是看到「成本降低 94%」時,要先問這是哪一層的成本。
MoE:為什麼能同時做大又做便宜
三家不約而同走向 MoE(Mixture of Experts,混合專家)架構,這是理解整件事的技術關鍵。
傳統模型每回答一個字,都要動用全部參數。MoE 則把模型拆成許多「專家」子網路,每次只啟動其中一小部分。
用醫院來理解:一間大型醫院有上百位專科醫師,但你掛號看診時,系統只會把你分派給其中兩三位。醫院的總編制很大,但你這一次看診動用的資源,跟小診所差不多。
所以「2.4 兆參數」講的是醫院的總編制,不是你看一次診的成本。兩個數字都是真的,但回答的是不同問題。看 MoE 模型的規格時,總參數量(total)與每次啟動的參數量(active)要分開看,後者才跟速度與成本相關。
這個架構選擇也有現實背景:在高階運算晶片取得受限的情況下,MoE 讓團隊能用有限的算力做出參數規模很大的模型。限制往往會逼出不同的技術路線,而不是單純落後。
便宜之後,什麼變得可行
推論成本下降真正的意義,不是同樣的事花更少錢,而是過去因為不划算而沒做的事,現在划算了。
當每次呼叫的成本高,你只會把 AI 用在少數高價值的地方。成本降一個量級之後,這類任務才進得了考慮範圍:
- 把過去三年所有客服對話跑一遍,找出重複出現的問題類型
- 每一封進來的詢價信都自動分類與初步回覆
- 所有出貨文件在寄出前都過一次一致性檢查
這些任務的共同點是量大、單筆價值低、但加總起來很可觀。它們是成本下降真正打開的空間。
邊界:什麼時候便宜的模型不夠用
低成本模型在多數日常任務上足夠,但有幾類情況仍要用最強的模型:
- 長鏈條推理 需要連續十幾步不出錯的任務。錯誤率會沿著步驟累積,單步 95% 正確,十步之後只剩約六成。
- 錯了代價很高的判斷 省下的 API 費用,遠小於一次判斷失誤的成本。
- 需要最新知識的任務 與模型強弱無關,看的是訓練資料截止時間與能不能連網檢索。
務實的做法是分流:量大而簡單的用便宜模型,關鍵判斷用強模型。這比全站統一用一個模型更省,也更穩。
對台灣企業的意義:選用前該確認的四件事
一、資料會不會被用於訓練,以及能不能寫進合約。這是所有問題裡最重要的一個,而且與國別無關——美商服務同樣要問。要的是白紙黑字的條款,不是說明文件上的一句話。
二、資料實際存放在哪個地區。API 服務的機房位置決定了資料落地與跨境傳輸的合規問題。有出口業務的公司尤其要確認,因為這會出現在歐美客戶的供應商問卷上。
三、模型是否開放權重。這一項的影響最容易被低估。如果模型可以下載自架,資料就完全不必離開公司——這對受客戶保密協議限制而只能走地端的封測廠來說,是可用與不可用的分界。純 API 服務再便宜,碰到這類限制也是零分。
四、客戶端有沒有技術來源的限制。部分歐美客戶會在供應商合約中對技術服務來源設條件。這與技術好壞無關,是商業與法遵層面的問題,但踩到了會影響訂單,值得事前確認而不是事後解釋。
需要保留的懷疑
三則發表都由廠商自行公布效能數據,尚未見到獨立第三方的驗證。廠商自評的基準結果在各國廠商身上都需要打折看待,這不是針對誰。
另一個觀察指標是價格的可持續性。若目前的低價包含搶市佔的補貼成分,值得留意的是:當你的流程已經建立在某個 API 之上,之後調價時的轉換成本有多高。降低這個風險最實際的方法,是在架構上保持模型可替換——把 API 呼叫集中在一層,而不是散落在各處程式碼裡。
常見問題
「訓練成本降低 94%」代表我用起來會便宜 94% 嗎?
不代表。訓練成本是廠商把模型做出來的資本支出,與使用者付費無關。使用者實際負擔的是 API 售價,而售價由市場策略決定,可能低於實際推論成本(補貼),也可能維持高毛利。看到成本相關的宣稱時,要先確認講的是訓練成本、推論成本,還是售價。
MoE 架構的「2.4 兆參數」跟一般模型的參數量可以直接比較嗎?
不能直接比較。MoE 模型每次推論只啟動一小部分參數,總參數量與單次啟動參數量是兩個不同的數字。與推論速度和成本直接相關的是啟動參數量。比較不同架構的模型時,看總參數量會產生誤導。
台灣中小企業可以用中國的 AI API 嗎?
技術上可行,但選用前應確認四件事:資料是否用於模型訓練(需有合約條款)、資料儲存與處理的地理位置、模型是否開放權重可自架、以及客戶合約中是否對技術服務來源設有限制。有出口業務的公司尤其需要確認第二與第四項,因為這些會出現在歐美客戶的供應商合規問卷上。
該全面改用低成本模型嗎?
建議分流而非全面替換。量大、單筆價值低、驗收標準明確的任務適合低成本模型;長鏈條推理、錯誤代價高的判斷仍建議使用最強模型。錯誤率會沿推理步驟累積,單步 95% 正確率在十個步驟後約僅剩六成,這類任務省下的 API 費用通常不足以抵銷失誤成本。
出處
本文彙整以下報導,各項效能與成本數據為廠商公布內容,請以原始報導及廠商官方文件為準:DeepSeek V4-Flash 發布與 API 定價(Wired AI)、百度 ERNIE 5.1 預訓練成本宣稱(Nikkei Asia Tech)、阿里巴巴 Qwen 3.8-Max 參數規模與定價(TechCrunch AI)。
文中關於 MoE 架構運作方式、成本分層與錯誤率累積的說明,為通用技術原理,讀者可自行查證與驗算。