給 Agent 開發者的駕馭工程 (7): 進階: 自我改進 Harness, Meta-Harness 與爬坡
後設資料
- URL:https://blog.aihao.tw/2026/06/26/harness-engineering-7-self-improving/
- 作者:ihower
- 發表日:2026-06-26
- 語言:繁體中文
- 來源形式:愛好 AI 工程 Blog 系列文章;由 ihower Harness + Loop Engineering 演講整理成文。
一句話濃縮
自我改進 harness 的前提不是讓 agent 任意重寫自己,而是有可自動打分的 eval,才能把 production trace、harness 爬坡與 skillify 變成可驗證的改版迴圈。
提取要點
- Agent 持續學習可發生在模型層、harness 層與 context 層;在模型權重凍結時,harness 與 context 是最可被產品團隊改動的層。
- 三條路都以 eval 為共同前提:production trace 轉成新的 judge、agent 對 harness 程式碼做指標爬坡、把失敗經驗寫回帶測試的 skill。
- Production trace 之所以重要,是因為真實使用者會產生離線 dataset 想不到的 failure mode;prompt 中每條「請勿」多半都是事故史。
- Agent 當優化器時,對象從模型訓練腳本轉為 harness 本身;前提仍是有 holdout、regression gate 與不可被鑽漏洞的 metric。
- Skillify 把錯誤變成可重用技能包與測試,讓同樣錯誤不再重犯;這是 ratchet 心法的工程化版本。
- 不管是三條路或十層堆疊,瓶頸都是 eval:agent = fit(model, harness, evals),eval 的策展品質決定 harness 往哪裡改。
提取概念
連結到此來源衍生 / 更新的 wiki 頁:
Ingest 筆記
2026-07-06
- 本次從 2026-07-06-ihower-Harness-Engineering系列 挑出的 9 篇系列文逐篇入庫;此頁為其中一篇的摘要型來源頁。
- 本篇補入 Harness-Engineering 的自我改進軸與 LLM-Evaluation 的回流用途;不另建
Meta-Harness薄頁。 - 未保存完整原文;保留 canonical URL、後設資料、摘要與概念連結。理由:原文為公開網站長文,source note 以可回找與可整合為主,避免在 vault 中重製整篇文章。
原文(可選)
未貼入完整原文。若日後需要全文快照,請以使用者明確授權或短摘錄策略處理。