Evaluator-Optimizer

一句話定義

一種 workflow pattern:一個 LLM(generator / optimizer)生成回應,另一個 LLM(evaluator)提供評估與回饋;兩者構成迭代精煉迴路

核心要點

  • 形式:generator 出一稿 → evaluator 評論 → generator 改 → … → 收斂
  • 適用情境
    • 有清楚的評估標準
    • 迭代精煉確實能帶來可量測的改善(不是無限改改改)
  • 範例
    • 文學翻譯(需要細緻的批評與修正)
    • 複雜搜尋(多輪分析逐步逼近)
  • 與 LLM-as-Judge 的分工LLM-Evaluation 中的 LLM-as-Judge 可用來評分或比較輸出;Evaluator-Optimizer 則是把 evaluator 的判斷接回 generator,形成固定迭代 workflow。前者是評估手段,後者是工作流 pattern。
  • Goal mode 是產品化版本2026-05-25-Gary-Chen-AI-Agent-27小時-Goal功能 描述的 /goal 類功能可視為 evaluator-optimizer 在 long-running agent 產品中的形態:實作者跑一輪,評審依 Goal-Prompt 判定是否完成;未完成就指出差距並要求下一輪。
  • 質化任務也能使用:當 evaluator 的 rubric 來自 品味外化,此迴圈可用於寫作、前端設計、影片腳本等沒有單元測試的任務。

與其他概念的關係

  • Anthropic 在「Building Effective Agents」中歸納的 5 個 workflow pattern 之一。
  • Agent 的差異:evaluator-optimizer 流程固定(兩角色 + 迴圈);agent 自主決定何時停、何時換策略。
  • 建在 Augmented-LLM 之上。

相關來源

備註