給 Agent 開發者的駕馭工程 (5): 回饋時機三: 單輪結束的驗收, Goal 與 Outcomes
後設資料
- URL:https://blog.aihao.tw/2026/06/26/harness-engineering-5-goal-and-outcomes/
- 作者:ihower
- 發表日:2026-06-26
- 語言:繁體中文
- 來源形式:愛好 AI 工程 Blog 系列文章;由 ihower Harness + Loop Engineering 演講整理成文。
一句話濃縮
Goal / Outcome 是單輪結束時的停止條件設計:不能讓模型自認完成就交差,而要對著終態、證據與限制驗收,沒過就把診斷回饋送入下一輪。
提取要點
- Goal 是 durable objective:它把完成狀態、驗證證據與過程限制寫成契約,比「改善效能」這類模糊 prompt 更能防止早收工。
- Codex /goal 是自我審計:沒有第二個模型裁判,而是靠
update_goal合約與 continuation prompt 要主模型把完成視為尚未證明、逐項找證據。 - Claude Code /goal 以獨立小模型讀刪減 transcript 判斷
ok/reason/impossible;它只認 transcript evidence,沒印出來的證據等於不存在。 - Claude Managed Agents Outcome 把獨立性推到全新 context 的 grader,甚至可用 Playwright 操作 artifact;可靠但成本與延遲高很多。
- 三者是獨立性與資訊量的 trade-off:Codex 資訊量最大但無獨立性,Outcome 獨立性最高但成本高且較晚發現錯誤,Claude Code 居中。
- 自建 agent 可混搭:用只讀 transcript judge 決定是否換訪談題目,再用每輪動態注入 time_control 管進度;語意檢查必須有重試上限和手動出口。
提取概念
連結到此來源衍生 / 更新的 wiki 頁:
Ingest 筆記
2026-07-06
- 本次從 2026-07-06-ihower-Harness-Engineering系列 挑出的 9 篇系列文逐篇入庫;此頁為其中一篇的摘要型來源頁。
- 本篇與既有 Goal-Prompt 高度重疊,本次以補強頁面為主,不另建
Outcome/Goal mode頁。 - 未保存完整原文;保留 canonical URL、後設資料、摘要與概念連結。理由:原文為公開網站長文,source note 以可回找與可整合為主,避免在 vault 中重製整篇文章。
原文(可選)
未貼入完整原文。若日後需要全文快照,請以使用者明確授權或短摘錄策略處理。