我的 AI agent 連續跑了 27 個小時,/goal 功能怎麼用?
後設資料
- URL:https://www.youtube.com/watch?v=PpeCur6fEXc
- 來源類型:YouTube 影片 / AI agent 工作法逐字稿(使用者貼入全文;yt-dlp metadata 與 zh-TW 字幕校準)
- YouTube metadata:title
我的 AI agent 連續跑了 27 個小時,/goal 功能怎麼用?;upload date2026-05-24;duration15:58;channel / uploaderGary Chen - 作者 / 講者:Gary-Chen
- 發表日:2026-05-24(yt-dlp metadata)
- 語言:繁體中文口語逐字稿
- 附件:完整 zh-TW 字幕保存於
10-來源/文章/2026-05-25-Gary-Chen-AI-Agent-27小時-Goal功能/PpeCur6fEXc.zh-TW.vtt - 主題:Goal-Prompt、品味外化、LLM-Evaluation、Evaluator-Optimizer、Ralph-Loop、Agentic-Workflow、完成的定義
一句話濃縮
這支影片把 long-running agent 的關鍵從「讓 AI 多跑一點」改寫成「先定義 outcome、verification、constraints、iteration policy 與 error handling,再用 rubric / evaluator 持續校正」,尤其指出質化工作也要先把人的品味外化成可被 AI 評審執行的標準。
提取要點
1. 自動化的後半段是移除注意力佔用
- 影片把 AI 自動化分成兩段:把任務從人手上移到 AI 手上,只是前半段;真正重要的是把任務從人的心上移開。
- 若使用者每隔幾分鐘就要回來確認進度、催促、改方向或審核下一輪,注意力仍被任務綁住。
- 這與 蔡格尼克效應 相鄰:未完成事項即使不在手上,也會維持 open loop,持續佔用認知資源。
- 因此 long-running agent 的目標不是「跑很久」,而是「讓人能放心把任務交出去,直到完成或遇到明確停損條件才回來」。
2. Goal 功能把 evaluator 放進長任務 loop
- 影片觀察 Claude-Code、OpenAI Codex 與 Hermes Agent 在同時期推出
/goal類功能:使用者設定目標後,agent 持續執行直到達成或卡住。 - 其基本結構是「實作者 + 評審」:實作者產出,評審檢查目標是否完成;若未完成,評審指出問題並要求下一輪。
- 這與 Evaluator-Optimizer / Ralph-Loop 同構,但 goal 功能把它產品化成長任務模式。
- 影片也把「做到一半停下來 wrap up」歸因到 context anxiety;此點與 Ralph-Loop / Context-Engineering 既有內容相符。
3. 好的 goal prompt 要有五個元素
影片用「把網站結帳頁反應速度降到 0.2 秒以內」示範 Goal-Prompt 的五要素:
| 元素 | 問題 | 例子 |
|---|---|---|
| Outcome | 完成後應該是什麼狀態? | 結帳頁反應速度 0.2 秒以內 |
| Verification | 怎麼證明真的完成? | 用速度測試工具驗證 |
| Constraints | 哪些不能動? | 只能改結帳區塊程式與相關測試 |
| Iteration policy | 每輪嘗試之間記錄什麼? | 改了什麼、速度多少、下一方向 |
| Error handling | 什麼情況要停下回報? | 測試工具跑不起來,或方法都試完仍失敗 |
這組五要素把 完成的定義 從一般專案管理推到 AI agent 任務設計:任務不只要能開始,還要能被驗證、被限制、被迭代、被安全停止。
4. 質化工作也需要 eval,而不是只靠感覺
- 影片指出白領工作大量是質化任務:圖好不好看、文案有沒有味道、網站有沒有品味、影片有沒有質感。
- 這些工作沒有單元測試,但可以透過 LLM-Evaluation 的主觀 rubric 變成可評分的維度。
- 影片轉述 Anthropic frontend design 相關做法:把「漂亮網站」拆成設計品質、原創性、技術執行、可用性四個維度,並加重模型平常較弱的維度。
- 評審不應只看程式碼,而要用 Playwright / screenshot 看到使用者實際看到的畫面,再根據 rubric 評分。
5. 品味要先被外化,AI 才能幫你守住它
- 影片的核心實務方法是先讓 AI 跑 baseline,再由人看出「皺眉點」,把皺眉原因聚合成維度與具體案例。
- 好 rubric 不是寫「避免 AI 味」這種抽象詞,而是點名可檢查的失敗模式,例如固定句型、常見起手式、空泛成語、缺少具體人名或數字。
- 為了避免 overfitting,rubric 不能只有單一美學範例;應提供多種可選風格或多組參考方向。
- 這形成 品味外化:把原本只存在於腦中的模糊標準寫成 AI 評審可執行的規則,再用迭代去校準 judge 與人的實際判斷。
提取概念
連結到此來源衍生 / 更新的 wiki 頁:
- Goal-Prompt(新建:讓 long-running agent 可持續執行的五要素任務提示)
- 品味外化(新建:把人的質化品味拆成 AI judge 可用 rubric)
- Gary-Chen(新建:第三份 Gary Chen AI / agentic source 後升格為輕量人物 entity)
- Agentic-Workflow(補入 goal mode 與長任務 self-check loop)
- Agentic-Engineering(補入 long-running agent 的 outcome / verification / constraints / stop rules)
- LLM-Evaluation(補入質化 work 的 rubric / visual eval / judge calibration)
- Evaluator-Optimizer(補入 goal 功能作為產品化 evaluator-optimizer)
- Ralph-Loop(補入 goal 功能與 context anxiety 的產品化語境)
- 完成的定義(補入 AI agent 任務的完成定義五要素)
- Prompt-Engineering(補入 goal prompt 作為長任務提示結構)
- MOC-LLM-應用設計(補入 Goal-Prompt / 品味外化 / Gary Chen)
- MOC-工程(補入 agent 長任務的驗證與停損規則)
觀察 / 待累積:
- Long-running Agent Goal 與品味 Rubric 引用來源叢集:本影片是二手整理與個人經驗;後續若取得 Claude Code / OpenAI Codex / Hermes Agent
goal功能官方文件、Anthropic frontend design skill / visual eval 研究、Ralph Loop 插件原始資料,可校準 Goal-Prompt / 品味外化 / LLM-Evaluation / Ralph-Loop 的術語與案例。 - Claude Code、OpenAI Codex、Hermes Agent、Ralph Loop plugin、Anthropic frontend design 研究均暫不因本二手來源新建 thin pages;有既有頁者只更新關聯。
Ingest 筆記
2026-05-25
本來源與 2026-05-13-Stanford-AI系統課程、2026-05-18-Karpathy-Software-3-Agentic-Engineering 同屬 Gary-Chen 的 AI / agentic system 實務整理,但這次焦點不是 LLM application stack 或工程師定位,而是 long-running agent 的「目標管理 + 評估迭代」方法。因此處理策略是:
- 不重建 agentic workflow 大框架:Agentic-Workflow、Agentic-Engineering、LLM-Evaluation 已能承接主要系統設計語境,本次以補強為主。
- 新建兩個高復用操作頁:Goal-Prompt 承接長任務 prompt 的五要素;品味外化 承接質化工作如何寫成 rubric。
- 把 Gary Chen 升格為輕量 entity:前兩份來源都保留「暫不建 Gary Chen」判斷;本次已是第三個 centered AI / agentic source,且其來源角色可作為二手中文 AI 系統整理者錨點,因此建 Gary-Chen,但仍標註「二手來源需一手校準」。
- 保持二手來源校準需求:影片提及的 goal 功能、Anthropic frontend design skill / research、Ralph Loop plugin、Karpathy auto research 等,都應放進觀察清單等待官方文件或原始材料。
元命題:long-running agent 的本質不是無限放任 AI 工作,而是把人的完成標準、驗證方法、限制邊界、迭代節奏與停損條件外化;質化任務也一樣,只有先把品味寫成 rubric,AI 才能在多輪迭代中替你守住它。
原文(YouTube 字幕 / 使用者貼入逐字稿)
本次使用者在對話中貼入完整逐字稿;另以 yt-dlp --write-subs --sub-langs zh-TW --sub-format vtt 取回 YouTube zh-TW 字幕並保存在附件:
10-來源/文章/2026-05-25-Gary-Chen-AI-Agent-27小時-Goal功能/PpeCur6fEXc.zh-TW.vtt
章節對應:
| 時間 | 章節 |
|---|---|
| 0:00 | 我的 AI 跑了 27 小時 |
| 1:48 | 三家同推 goal 功能 |
| 3:08 | goal 運行原理 |
| 4:10 | 好提示詞五要素 |
| 6:30 | 質化工作怎麼辦 |
| 10:28 | 六步驟寫 rubric |