Verbalized-Feedback

一句話定義

自然語言(人類點評、compiler 錯訊、evaluator 評語)作為 LLM 的學習信號——是 Harness-Engineering 中最容易取得也最難用好的 feedback 類型;可在不更新參數的「廣義學習」上即刻生效,也能透過 textual gradient 的方式去真的調參

核心要點

三類 feedback 從難取得到易取得

李宏毅2026-05-02-Harness-Engineering駕馭工程 整理的對位:

類型取得難度學習方式
標準答案(ground truth)最難監督學習 / fine-tuning(讓輸出靠近答案)
可量化 reward中等Reinforcement Learning(最大化 reward)
Verbalized feedback(本頁)最容易廣義學習(放進 prompt)+ textual gradient(真的調參)
  • Verbalized feedback 的常見形式
    • 人類點評:「good job」/「你這個笨蛋」/「寫得更 professional」/「不要 emoji」
    • 環境訊號:compiler error message、test runner 輸出、API 回應
    • LLM evaluator:另一個 LLM 對輸出的評論(Evaluator-Optimizer 的具體形式)

廣義學習:參數不變,行為改變

  • 基本做法:把 feedback 放進 prompt → 下一輪行為跟著變。可類比 Prompt-Engineering 但更動態(不是手寫 prompt,是任務過程中累積進來的)。
  • Iterative:跟 gradient descent 一樣常需要多輪——每輪把舊 feedback 帶進新生成、看下一輪 feedback 怎麼變。
  • Skill 化(永久化路徑):成功經驗讓模型自己寫進 skill.md,下次自動載入;Claude-Code 已能在解決問題後自動生成 / 修改 skill 檔(見 2026-05-02-Harness-Engineering駕馭工程 小金 YouTube 上傳事件)。

ACON:Verbalized Feedback 對抗 Context-Collapse

ACON paper(2026-05-02-AI-Agent-Context-Engineering系統化 引用):

  • 問題Context-Engineering 的壓縮 / 摘要會引發 Context-Collapse——任務真正在意的資訊被壓沒了。
  • ACON 解法(不調參)
    1. 拿失敗 trajectory(壓縮前對 / 壓縮後錯)給另一個 LLM 反省「為什麼壓縮會讓任務變差」→ 產出 feedback 文字。
    2. 下次摘要前把 feedback 給負責摘要的 LLM 看 → 它就知道哪些東西不能丟。
    3. 訓練 / 測試集分離但完全不調參 → 這是純 verbalized feedback 應用的代表案例。
  • AppWorld benchmark 結果:紫點(ACON)比黑點(無壓縮)和紅點(單純 LLM summary)同時 token 更省、正確率更高。

AgentFold:用 RL 訓練 LLM 自主使用壓縮工具

AgentFold paper(同來源):

  • 背景:LLM 天生不喜歡壓縮自己的記憶——純 verbalized feedback / prompt 教不會。
  • 解法:用 reinforcement learning fine-tune 模型,逼它學會用 fold(start, end, summary) 工具自主壓縮。
  • 意涵:本概念有極限——某些行為(壓縮自己記憶 / 主動 spawn Sub-Agent必須透過調參才能取得;純 verbalized feedback 不夠。

Textual Gradient:真的去調參

2024 中已有 paper 把 verbalized feedback 比作 gradient descent;2025-03 有兩篇 paper 不約而同採取下面的事後諸葛偵測法。

  • 怎麼判斷某句話是「真 feedback」(不是隨口說「好工作」):
    1. 假設原 trajectory 為 輸入 1 → 輸出 2 → 環境句 3 → 輸出 4
    2. 把環境句 3 移到前面作為「後見之明」:3 + 輸入 1 → ?
    3. 看 LLM 重產 2 的每個 token 機率變化。
    4. 變化大3 帶 feedback 信號;變化小3 是無關句。
  • 具體例子:給「請寫一封信」+ 後見之明「要寫得更 professional」 → Hey / Quick / Just 等 token 機率明顯下降;後見之明若是「27 × 4 = ?」(不相干)→ token 機率沒變化。
  • 應用:identified 為 feedback 的 3 句之後產生的「應該的輸出」2' 當 ground truth 微調語言模型 → 真正調參的 textual gradient

Verbalized Feedback 真的有效(兩個正反證)

  • 正證:人類偏好變化 1500 輪實驗(不要 emoji → 不要拍馬屁 → 講話直接)三段;模型在 verbalized feedback 下持續對齊各偏好。
  • 負證(極關鍵):給 LLM 隨機 feedback會讓它變得比沒有 feedback 還差——說明它真的有看 feedback 在動行為,不是在保留實力或自動進步;這同時為「verbalized feedback 是 causal 信號」提供反向證據。

Feedback 形式要符合任務真正在意的維度

來自 2025-02 模擬動畫 paper(生成物理模擬程式):

  • 原工作流:產生程式 → 看「程式能不能跑 / 語法對不對」做 feedback → 改程式。
  • 問題:模型寫出沒語法錯但物理不對的程式(電磁場模擬出錯誤行為)——因為它根本沒看到「模擬出來的視覺結果」。
  • 修正:在 feedback 階段真的把模擬跑出來、給 LLM 看視覺結果、由 LLM 自己評估「這像不像物理世界」→ 才能正向調整。
  • 教訓:「讓模型看的 feedback 應該對應任務真正在意的東西」——程式任務看執行 / 教學影片任務應看影片 / 介面任務應看渲染畫面。

用詞紀律:情緒字眼會反向

  • 來自 Steering-Vector 的因果機制證據:「你這個笨蛋」會 causally 推模型走向愚蠢行為;訓練資料的潛在分布裡,被罵笨蛋的人通常做出愚蠢決定。
  • 規則:feedback 應就事論事(行為 / 結果 / 標準),避免人格貶損;對應 Harness-Engineering 三大手段中的「控制行為」紀律層。

與 in-context learning 的歷史差異

  • 2023 年的早期 in-context learning(few-shot examples)研究發現:給模型錯的範例它仍會做得更好 → 那時的「學習」只是喚醒 pre-train 記憶,不是真的看範例學。
  • 2025 年語言模型已真的看 feedback 在改變行為——隨機 feedback 反而變差就是反證。LLM 已從「假學」進化到「真學」——這是本頁概念能成立的近年新基礎。

與其他概念的關係

  • 父概念:Harness-Engineering——本頁是 harness 中 feedback 機制的核心子議題。
  • 緊鄰:Steering-Vector——提供「為何用情緒字眼會傷模型」的內部因果機制證據。
  • 工具骨架:Ralph-Loop——本頁是 Ralph Loop 在 feedback 內容層的方法論;Ralph Loop 是結構,本頁是內容怎麼做
  • 升級路徑:Prompt-Engineering(廣義學習,不調參)→ 本頁 textual gradient(調參)→ 傳統 RLHF(量化 reward)→ 監督學習(標準答案):四級遞進在本 vault 視角下構成「LLM 學習信號的階梯」。
  • 自我演化的橋:本頁是 Lifelong-AI-Agent 的基礎機制——agent 不靠人類重新 fine-tune,僅靠日常 verbalized feedback 持續進化。

相關來源

備註

建頁理由:本頁是 Harness-Engineering 的關鍵子概念,但本身的內容密度(textual gradient + 後見之明偵測 + 三類 feedback 對位 + 用詞紀律)足以支撐獨立頁;未來如有 RLHF / RLAIF / 自我學習 / agent 自我演化等議題 ingest,本頁可作為核心錨點。

未來累積方向:(a) RLHF / RLAIF 與本頁的關係;(b) 自我演化 agent 的具體架構;(c) skill-based 永久化的更多案例;(d) 與 Steering-Vector 跨 mechanistic 與 behavioral 兩層的雙向對位。