八週落地一套企業 AI,前四週其實都不碰模型
「八週看到成效」聽起來像行銷話術,但拆開來看,前四週的工作幾乎與 AI 無關——都在處理題目定義與資料。真正決定成敗的也是那四週。本文完整說明每一週該完成什麼,以及每一步的失敗判準。
「八週落地」這種說法在市場上很多,多數是行銷話術。但如果把八週拆開來看,會發現一件事:前四週幾乎不碰模型。
這不是節奏安排的問題,而是因為導入失敗的原因九成不在模型,在資料與題目定義。這篇把每一週該完成什麼、以及怎麼判斷這一週有沒有做完,完整寫出來。
前四週:與 AI 無關的四週
第 1 週 收集 30~50 個真實問題
這是整個專案唯一的成績單。沒有它,你到第八週只能靠感覺說「好像有比較好用」,而感覺沒辦法拿去要下一期預算。
訣竅:不要開會問大家「你想問 AI 什麼」。大家想不出來。直接去翻客服信箱、內部通訊軟體的歷史訊息、新人的提問紀錄——那裡面才是真的問題。
成敗判準:這些問題必須是同仁真的問過的,不是想像出來的。
第 2 週 盤點文件來源、格式與更新頻率
每一份文件都要有明確的負責人。這一步最常發現的事情是:答案根本不在文件裡,而在 ERP 或某個人的腦子裡。
成敗判準:每份文件都能回答「誰維護、多久更新一次、更新後誰通知系統」。
第 3 週 文件清理與切段策略設計
切段(chunking)是最容易被輕忽也最容易搞砸的一步。切太大,找出來的內容夾雜太多雜訊;切太小,前後文斷掉。
表格、圖說、簽核欄位各需要不同處理。切段策略要照文件型態設計,沒有一體適用的參數。
成敗判準:抽 10 份人工檢查,切出來的每一段單獨看得懂。
第 4 週 建立向量庫、灌入第一批資料
到這一週才第一次碰到技術。選哪一套向量庫是最不重要但最常被最早問的問題——Qdrant、Milvus、pgvector 都足以應付中小企業的量級。
成敗判準:能用第 1 週的問題檢索到正確段落。注意這裡測的是檢索,不是回答。
後四週:模型、評估與上線
第 5 週 接上模型、做出可用的介面
成敗判準:同仁能自己操作,不需要教學。需要教學的介面,上線後不會有人用。
第 6 週 用第 1 週的問題集做評估
每一題人工評分,並且記錄錯在哪裡——是檢索沒找到、找到了但模型讀錯、還是格式不對。這三類的處理方式完全不同。
第 7 週 針對錯誤調整
調整切段、提示與檢索參數,然後用同一份問題集重跑。成敗判準是分數要有可見的提升;如果調完沒有變化,代表你調錯了地方。
第 8 週 小範圍上線、建立回饋機制
成敗判準:有人回報問題的管道,而且真的有人用。
一個必須誠實面對的前提
八週路線圖成立的前提是:你已經有一批數位化的文件。
如果文件還在紙本、報價在 Excel、工時在紙上、成本在會計系統三邊對不起來,那要先做的是資訊化,不是 AI 化。資訊化沒完成之前談 AI 化,會卡在同一個地方——這一點在淨水設備廠的案例裡有完整說明。
不要把預算全押在模型上
一篇 2026 年 7 月針對生產環境企業代理的研究(arXiv:2607.17044)做了可靠度來源的分解,結論相當明確:大部分的提升來自鷹架、路由與專用小模型,而不是驗證步驟本身,更不是換更大的基礎模型。
同一個前沿基礎模型,配上不同的系統架構,在 SpreadsheetBench 上的差距是 11.0 個百分點。完整導讀見此篇。
需要保留的懷疑
本文為賴家榮的顧問現場觀察,非編譯外電。八週為一般性的節奏建議,實際工期取決於文件數位化的起始狀態,差異可能相當大——文件若尚未數位化,前置作業本身可能就超過八週。
文中不含任何實測的效益比例或投報數字。
常見問題
為什麼前四週都不碰模型?
因為導入失敗的原因九成不在模型,在資料與題目定義。第 1 週收集真實問題(整個專案唯一的成績單)、第 2 週盤點文件與負責人、第 3 週設計切段策略、第 4 週才建向量庫。跳過這四週直接接模型,結果通常是系統回答得很好、但回答的都是沒人會問的問題。
八週真的夠嗎?
前提是你已經有一批數位化的文件。若文件仍在紙本、或報價、工時、成本分散在三個對不起來的系統,那要先做資訊化而非 AI 化,前置作業本身可能就超過八週。八週是節奏建議,不是承諾。
第 1 週的問題集怎麼收集才有效?
不要開會問大家想問 AI 什麼——多數人想不出來。直接翻客服信箱、內部通訊軟體的歷史訊息、新人的提問紀錄,那裡面才是真實發生過的問題。關鍵判準是:這些問題必須是同仁真的問過的,不是想像出來的。
下一步
八週路線圖的每週檢核表與文件盤點表單,我們整理在白皮書專區。
延伸來源
以下為與本文論點相關、且經實際查閱確認的外部來源。標示為預印本者尚未經同儕審查,引用時請留意。