Verbalized-Feedback
一句話定義
用自然語言(人類點評、compiler 錯訊、evaluator 評語)作為 LLM 的學習信號——是 Harness-Engineering 中最容易取得也最難用好的 feedback 類型;可在不更新參數的「廣義學習」上即刻生效,也能透過 textual gradient 的方式去真的調參。
核心要點
三類 feedback 從難取得到易取得
李宏毅 在 2026-05-02-Harness-Engineering駕馭工程 整理的對位:
| 類型 | 取得難度 | 學習方式 |
|---|---|---|
| 標準答案(ground truth) | 最難 | 監督學習 / fine-tuning(讓輸出靠近答案) |
| 可量化 reward | 中等 | Reinforcement Learning(最大化 reward) |
| Verbalized feedback(本頁) | 最容易 | 廣義學習(放進 prompt)+ textual gradient(真的調參) |
- Verbalized feedback 的常見形式:
- 人類點評:「good job」/「你這個笨蛋」/「寫得更 professional」/「不要 emoji」
- 環境訊號:compiler error message、test runner 輸出、API 回應
- LLM evaluator:另一個 LLM 對輸出的評論(Evaluator-Optimizer 的具體形式)
廣義學習:參數不變,行為改變
- 基本做法:把 feedback 放進 prompt → 下一輪行為跟著變。可類比 Prompt-Engineering 但更動態(不是手寫 prompt,是任務過程中累積進來的)。
- Iterative:跟 gradient descent 一樣常需要多輪——每輪把舊 feedback 帶進新生成、看下一輪 feedback 怎麼變。
- Skill 化(永久化路徑):成功經驗讓模型自己寫進 skill.md,下次自動載入;Claude-Code 已能在解決問題後自動生成 / 修改 skill 檔(見 2026-05-02-Harness-Engineering駕馭工程 小金 YouTube 上傳事件)。
ACON:Verbalized Feedback 對抗 Context-Collapse
ACON paper(2026-05-02-AI-Agent-Context-Engineering系統化 引用):
- 問題:Context-Engineering 的壓縮 / 摘要會引發 Context-Collapse——任務真正在意的資訊被壓沒了。
- ACON 解法(不調參):
- 拿失敗 trajectory(壓縮前對 / 壓縮後錯)給另一個 LLM 反省「為什麼壓縮會讓任務變差」→ 產出 feedback 文字。
- 下次摘要前把 feedback 給負責摘要的 LLM 看 → 它就知道哪些東西不能丟。
- 訓練 / 測試集分離但完全不調參 → 這是純 verbalized feedback 應用的代表案例。
- AppWorld benchmark 結果:紫點(ACON)比黑點(無壓縮)和紅點(單純 LLM summary)同時 token 更省、正確率更高。
AgentFold:用 RL 訓練 LLM 自主使用壓縮工具
AgentFold paper(同來源):
- 背景:LLM 天生不喜歡壓縮自己的記憶——純 verbalized feedback / prompt 教不會。
- 解法:用 reinforcement learning fine-tune 模型,逼它學會用
fold(start, end, summary)工具自主壓縮。 - 意涵:本概念有極限——某些行為(壓縮自己記憶 / 主動 spawn Sub-Agent)必須透過調參才能取得;純 verbalized feedback 不夠。
Textual Gradient:真的去調參
2024 中已有 paper 把 verbalized feedback 比作 gradient descent;2025-03 有兩篇 paper 不約而同採取下面的事後諸葛偵測法。
- 怎麼判斷某句話是「真 feedback」(不是隨口說「好工作」):
- 假設原 trajectory 為
輸入 1 → 輸出 2 → 環境句 3 → 輸出 4。 - 把環境句
3移到前面作為「後見之明」:3 + 輸入 1 → ? - 看 LLM 重產
2的每個 token 機率變化。 - 變化大 →
3帶 feedback 信號;變化小 →3是無關句。
- 假設原 trajectory 為
- 具體例子:給「請寫一封信」+ 後見之明「要寫得更 professional」 →
Hey / Quick / Just等 token 機率明顯下降;後見之明若是「27 × 4 = ?」(不相干)→ token 機率沒變化。 - 應用:identified 為 feedback 的
3句之後產生的「應該的輸出」2'當 ground truth 微調語言模型 → 真正調參的 textual gradient。
Verbalized Feedback 真的有效(兩個正反證)
- 正證:人類偏好變化 1500 輪實驗(不要 emoji → 不要拍馬屁 → 講話直接)三段;模型在 verbalized feedback 下持續對齊各偏好。
- 負證(極關鍵):給 LLM 隨機 feedback會讓它變得比沒有 feedback 還差——說明它真的有看 feedback 在動行為,不是在保留實力或自動進步;這同時為「verbalized feedback 是 causal 信號」提供反向證據。
Feedback 形式要符合任務真正在意的維度
來自 2025-02 模擬動畫 paper(生成物理模擬程式):
- 原工作流:產生程式 → 看「程式能不能跑 / 語法對不對」做 feedback → 改程式。
- 問題:模型寫出沒語法錯但物理不對的程式(電磁場模擬出錯誤行為)——因為它根本沒看到「模擬出來的視覺結果」。
- 修正:在 feedback 階段真的把模擬跑出來、給 LLM 看視覺結果、由 LLM 自己評估「這像不像物理世界」→ 才能正向調整。
- 教訓:「讓模型看的 feedback 應該對應任務真正在意的東西」——程式任務看執行 / 教學影片任務應看影片 / 介面任務應看渲染畫面。
用詞紀律:情緒字眼會反向
- 來自 Steering-Vector 的因果機制證據:「你這個笨蛋」會 causally 推模型走向愚蠢行為;訓練資料的潛在分布裡,被罵笨蛋的人通常做出愚蠢決定。
- 規則:feedback 應就事論事(行為 / 結果 / 標準),避免人格貶損;對應 Harness-Engineering 三大手段中的「控制行為」紀律層。
與 in-context learning 的歷史差異
- 2023 年的早期 in-context learning(few-shot examples)研究發現:給模型錯的範例它仍會做得更好 → 那時的「學習」只是喚醒 pre-train 記憶,不是真的看範例學。
- 2025 年語言模型已真的看 feedback 在改變行為——隨機 feedback 反而變差就是反證。LLM 已從「假學」進化到「真學」——這是本頁概念能成立的近年新基礎。
與其他概念的關係
- 父概念:Harness-Engineering——本頁是 harness 中 feedback 機制的核心子議題。
- 緊鄰:Steering-Vector——提供「為何用情緒字眼會傷模型」的內部因果機制證據。
- 工具骨架:Ralph-Loop——本頁是 Ralph Loop 在 feedback 內容層的方法論;Ralph Loop 是結構,本頁是內容怎麼做。
- 升級路徑:Prompt-Engineering(廣義學習,不調參)→ 本頁 textual gradient(調參)→ 傳統 RLHF(量化 reward)→ 監督學習(標準答案):四級遞進在本 vault 視角下構成「LLM 學習信號的階梯」。
- 自我演化的橋:本頁是 Lifelong-AI-Agent 的基礎機制——agent 不靠人類重新 fine-tune,僅靠日常 verbalized feedback 持續進化。
相關來源
- 2026-05-02-Harness-Engineering駕馭工程 — 三類 feedback 對位 + 廣義學習 / textual gradient / 後見之明偵測 + 1500 輪正證 + 隨機 feedback 負證 + 模擬動畫 paper
- 2026-05-02-AI-Agent-Context-Engineering系統化 — ACON paper 用 verbalized feedback 對抗 Context-Collapse 的具體應用 + AgentFold paper 為「verbalized feedback 不夠、必須調參」的反例案例
備註
建頁理由:本頁是 Harness-Engineering 的關鍵子概念,但本身的內容密度(textual gradient + 後見之明偵測 + 三類 feedback 對位 + 用詞紀律)足以支撐獨立頁;未來如有 RLHF / RLAIF / 自我學習 / agent 自我演化等議題 ingest,本頁可作為核心錨點。
未來累積方向:(a) RLHF / RLAIF 與本頁的關係;(b) 自我演化 agent 的具體架構;(c) skill-based 永久化的更多案例;(d) 與 Steering-Vector 跨 mechanistic 與 behavioral 兩層的雙向對位。