Fine-Tuning
一句話定義
用特定任務或領域資料更新模型參數,讓模型在某類輸入 / 輸出上更符合需求;相對於 Prompt-Engineering、RAG 與 Harness-Engineering,它是更重、更難搬移、也更依賴資料品質的強化方式。
核心要點
不是商業 LLM 應用的預設解
2026-05-13-Stanford-AI系統課程 對 fine-tuning 的立場很保守:能不做就不做。主要原因:
- 需要大量高品質資料:如果沒有足夠、乾淨、標註好的資料,微調只會把噪音灌進模型。
- 容易 overfit:模型可能在特定任務上變強,但犧牲 base model 原本的廣度。
- 時效性差:微調週期可能比 base model 世代更新慢;下一代 base model 可能直接打贏微調版。
- 可攜性弱:prompt / workflow 多半可換模型重用;fine-tuned model 綁定某個模型與訓練結果。
因此多數 AI Builder 應先檢查:prompt 是否清楚、是否需要 RAG 補知識、是否該加工具、是否能用 Agentic-Workflow 拆步驟,而不是直接微調。
什麼時候值得做
Fine-tuning 仍可能適合:
- 法律、科學、醫療等需要重複高精度輸出的領域。
- Base model 在特定 domain 上穩定吃力,而且該 domain 有足夠訓練資料。
- 想改變模型某種純 prompt 難以穩定控制的行為,例如 Context-Engineering 相關研究中讓模型學會主動 fold / 壓縮自己的記憶。
- 對成本、延遲或格式穩定性有要求,且微調後能明確降低每次 prompt / retrieval 的負擔。
與 RAG 的取捨
| 問題 | Fine-Tuning | RAG |
|---|---|---|
| 知識更新 | 要重新訓練或增量訓練 | 更新文件 / index 即可 |
| 資料需求 | 需要高品質訓練樣本 | 需要可檢索文件與 chunking |
| 可追溯性 | 模型知道但不易指回來源 | 可附來源、章節、行號 |
| 模型可攜性 | 綁定特定模型 / checkpoint | 較容易換 base model |
| 適用 | 改行為、格式、風格、專門能力 | 補 domain knowledge、時效資訊、引用證據 |
若目標是把公司文件、產品規格、政策、醫療副作用等知識提供給模型,通常先用 RAG。若目標是讓模型長期形成某種輸出能力或操作偏好,且已有足夠資料,才考慮 fine-tuning。
與 verbalized feedback / textual gradient 的關係
Verbalized-Feedback 把 feedback 分成「放進 prompt 的廣義學習」與「真的調參的 textual gradient」。Fine-tuning 位在後者:它不只是下次 prompt 帶上回饋,而是把回饋轉成訓練資料更新模型參數。
這也解釋了 fine-tuning 的邊界:當任務只需要暫時修正行為,prompt / feedback loop 就夠;當行為需要跨 session、跨任務穩定內化,且資料品質足夠,才值得走參數更新。
與其他概念的關係
- 對比 Prompt-Engineering:prompt 是不改模型參數的最低成本控制方式;fine-tuning 是更重的參數層控制。
- 對比 RAG:RAG 把知識留在文件與索引中;fine-tuning 把模式 / 能力寫進模型參數。
- 對比 Harness-Engineering:harness 改工具、workflow、feedback loop 與常駐規則;fine-tuning 改 LLM 本體。
- 與 Lifelong-AI-Agent:長期 agent 能力成長可能有兩軸,參數軸是 fine-tuning,harness 軸是自寫 skill / 自改規範。
- 與 Context-Collapse / Sub-Agent:部分 context 管理行為可能不能只靠 prompt 教會,而需要 RL / fine-tuning 讓模型學會使用壓縮或 spawning 工具。
相關來源
- 2026-05-13-Stanford-AI系統課程 — Stanford 課程整理中的 fine-tuning 保守立場、四個成本 / 風險、與 RAG 的實務取捨
- 2026-05-02-Harness-Engineering駕馭工程 — fine-tuning 作為強化 agent 的「改 LLM」路徑,對比改 harness
- 2026-05-02-AI-Agent-Context-Engineering系統化 — AgentFold 等需要調參才能讓模型學會壓縮自己記憶的反例
- 2026-05-02-Harness-Engineering駕馭工程 / Verbalized-Feedback — textual gradient 與「真的調參」的學習信號階梯
備註
建頁理由:MOC-LLM-應用設計 已把 Fine-tuning vs RAG vs Long-Context 列為未來方向;本來源提供足夠清楚的取捨框架,且 vault 既有 Verbalized-Feedback / Harness-Engineering / Context-Engineering 已多次提到 fine-tune,但沒有共同錨點。
未來累積方向:(a) supervised fine-tuning / LoRA / RLHF / DPO 的細分;(b) domain adaptation 案例;(c) 成本與資料治理;(d) fine-tuning vs prompt caching / long context / RAG 的成本比較。