Fine-Tuning

一句話定義

用特定任務或領域資料更新模型參數,讓模型在某類輸入 / 輸出上更符合需求;相對於 Prompt-EngineeringRAGHarness-Engineering,它是更重、更難搬移、也更依賴資料品質的強化方式。

核心要點

不是商業 LLM 應用的預設解

2026-05-13-Stanford-AI系統課程 對 fine-tuning 的立場很保守:能不做就不做。主要原因:

  1. 需要大量高品質資料:如果沒有足夠、乾淨、標註好的資料,微調只會把噪音灌進模型。
  2. 容易 overfit:模型可能在特定任務上變強,但犧牲 base model 原本的廣度。
  3. 時效性差:微調週期可能比 base model 世代更新慢;下一代 base model 可能直接打贏微調版。
  4. 可攜性弱:prompt / workflow 多半可換模型重用;fine-tuned model 綁定某個模型與訓練結果。

因此多數 AI Builder 應先檢查:prompt 是否清楚、是否需要 RAG 補知識、是否該加工具、是否能用 Agentic-Workflow 拆步驟,而不是直接微調。

什麼時候值得做

Fine-tuning 仍可能適合:

  • 法律、科學、醫療等需要重複高精度輸出的領域。
  • Base model 在特定 domain 上穩定吃力,而且該 domain 有足夠訓練資料。
  • 想改變模型某種純 prompt 難以穩定控制的行為,例如 Context-Engineering 相關研究中讓模型學會主動 fold / 壓縮自己的記憶。
  • 對成本、延遲或格式穩定性有要求,且微調後能明確降低每次 prompt / retrieval 的負擔。

與 RAG 的取捨

問題Fine-TuningRAG
知識更新要重新訓練或增量訓練更新文件 / index 即可
資料需求需要高品質訓練樣本需要可檢索文件與 chunking
可追溯性模型知道但不易指回來源可附來源、章節、行號
模型可攜性綁定特定模型 / checkpoint較容易換 base model
適用改行為、格式、風格、專門能力補 domain knowledge、時效資訊、引用證據

若目標是把公司文件、產品規格、政策、醫療副作用等知識提供給模型,通常先用 RAG。若目標是讓模型長期形成某種輸出能力或操作偏好,且已有足夠資料,才考慮 fine-tuning。

與 verbalized feedback / textual gradient 的關係

Verbalized-Feedback 把 feedback 分成「放進 prompt 的廣義學習」與「真的調參的 textual gradient」。Fine-tuning 位在後者:它不只是下次 prompt 帶上回饋,而是把回饋轉成訓練資料更新模型參數。

這也解釋了 fine-tuning 的邊界:當任務只需要暫時修正行為,prompt / feedback loop 就夠;當行為需要跨 session、跨任務穩定內化,且資料品質足夠,才值得走參數更新。

與其他概念的關係

  • 對比 Prompt-Engineering:prompt 是不改模型參數的最低成本控制方式;fine-tuning 是更重的參數層控制。
  • 對比 RAG:RAG 把知識留在文件與索引中;fine-tuning 把模式 / 能力寫進模型參數。
  • 對比 Harness-Engineering:harness 改工具、workflow、feedback loop 與常駐規則;fine-tuning 改 LLM 本體。
  • Lifelong-AI-Agent:長期 agent 能力成長可能有兩軸,參數軸是 fine-tuning,harness 軸是自寫 skill / 自改規範。
  • Context-Collapse / Sub-Agent:部分 context 管理行為可能不能只靠 prompt 教會,而需要 RL / fine-tuning 讓模型學會使用壓縮或 spawning 工具。

相關來源

備註

建頁理由MOC-LLM-應用設計 已把 Fine-tuning vs RAG vs Long-Context 列為未來方向;本來源提供足夠清楚的取捨框架,且 vault 既有 Verbalized-Feedback / Harness-Engineering / Context-Engineering 已多次提到 fine-tune,但沒有共同錨點。

未來累積方向:(a) supervised fine-tuning / LoRA / RLHF / DPO 的細分;(b) domain adaptation 案例;(c) 成本與資料治理;(d) fine-tuning vs prompt caching / long context / RAG 的成本比較。