Evaluator-Optimizer
一句話定義
一種 workflow pattern:一個 LLM(generator / optimizer)生成回應,另一個 LLM(evaluator)提供評估與回饋;兩者構成迭代精煉迴路。
核心要點
- 形式:generator 出一稿 → evaluator 評論 → generator 改 → … → 收斂
- 適用情境:
- 有清楚的評估標準
- 迭代精煉確實能帶來可量測的改善(不是無限改改改)
- 範例:
- 文學翻譯(需要細緻的批評與修正)
- 複雜搜尋(多輪分析逐步逼近)
- 與 LLM-as-Judge 的分工:LLM-Evaluation 中的 LLM-as-Judge 可用來評分或比較輸出;Evaluator-Optimizer 則是把 evaluator 的判斷接回 generator,形成固定迭代 workflow。前者是評估手段,後者是工作流 pattern。
- Goal mode 是產品化版本:2026-05-25-Gary-Chen-AI-Agent-27小時-Goal功能 描述的
/goal類功能可視為 evaluator-optimizer 在 long-running agent 產品中的形態:實作者跑一輪,評審依 Goal-Prompt 判定是否完成;未完成就指出差距並要求下一輪。 - 質化任務也能使用:當 evaluator 的 rubric 來自 品味外化,此迴圈可用於寫作、前端設計、影片腳本等沒有單元測試的任務。
與其他概念的關係
- 是 Anthropic 在「Building Effective Agents」中歸納的 5 個 workflow pattern 之一。
- 與 Agent 的差異:evaluator-optimizer 流程固定(兩角色 + 迴圈);agent 自主決定何時停、何時換策略。
- 建在 Augmented-LLM 之上。
相關來源
- 2026-04-28-Anthropic-Building-Effective-Agents
- 2026-05-13-Stanford-AI系統課程 — 補入 LLM-as-Judge 四形式與本 pattern 的分工邊界
- 2026-05-25-Gary-Chen-AI-Agent-27小時-Goal功能 — 補入
/goal類長任務:實作者 / 評審 loop、goal prompt 與質化 rubric。