Agentic-Engineering

一句話定義

設計讓 AI agent 能在清楚邊界內安全試錯的工程方法:先寫 spec、metric、限制與回滾策略,再讓一個或多個 agent 大量執行、驗證與迭代。

核心要點

從「叫 AI 寫 code」到「設計可驗證環境」

Agentic-Engineering 的重點不是 agent 取代工程師,而是工程師把任務環境設計成 agent 可以安全探索:

  • 目標清楚:agent 要做到什麼?
  • 驗證清楚:怎麼知道它做對?
  • 邊界清楚:它能改哪些檔案、用哪些工具、跑多久?
  • 回滾清楚:它失敗或變差時回到哪裡?

這使它與 Vibe-Coding 分開:vibe coding 偏自然語言生成;agentic engineering 偏環境、驗證與責任設計。

Long-running agent 需要 goal 邊界

2026-05-25-Gary-Chen-AI-Agent-27小時-Goal功能 將長任務 agent 的工作方式拆成 Goal-Prompt 五要素:outcome、verification、constraints、iteration policy、error handling。這組結構其實是 agentic engineering 的小型任務環境:

  • Outcome / verification 定義 agent 要追什麼分數或狀態。
  • Constraints 限制 agent 能改哪裡、不能破壞什麼。
  • Iteration policy 要求每輪記錄嘗試、結果與下一步。
  • Error handling 指定何時停止、回報卡點,而不是無限跑。

因此 long-running agent 不是「放任 AI 不眠不休」,而是把人的完成標準、驗證方法與停損條件外化後,讓 agent 在受控邊界內工作。

Karpathy Loop 的三個 constraint

2026-05-18-Karpathy-Software-3-Agentic-Engineering 轉述 Karpathy Auto Research / Karpathy Loop:

Constraint意義
One fileagent 只能改一個明確檔案,避免任意改動系統其他部分
One metric只有一個可比較的分數,避免評估漂移
One time budget每次實驗有固定時間上限,避免浪費 compute

在這個框架裡,關鍵不是 agent 天生多聰明,而是人把可試錯空間設計得夠乾淨。Agent 只能在小盒子裡探索;變好留下,變差回滾。

專業責任仍在人

Agent 可能寫出能跑但架構錯誤的 code。影片中的 Google login + Stripe credits 例子說明,若用 email 配對身份與資金歸屬,測試可能通過,但真實世界會因使用者付款 email 不同而出錯。正確設計應使用 persistent user ID。

因此 agentic engineering 的人類責任包含:

  • 系統模型:身份、權限、資金、資料一致性與風險邊界。
  • 代碼健康:抽象、重複、可讀性、可測試性與 Code-Review
  • 可觀測性:trace、metric、log、失敗樣本與 error analysis。
  • 回滾與治理:版本控制、實驗隔離、預算限制與人工審查。

Agent-first infrastructure 是瓶頸

Agent 能寫 code,但世界上大量部署、付款、DNS、OAuth、後台設定仍是人類 UI。這讓 Agent-Computer-Interface 成為 agentic engineering 的基礎設施問題:

  • 人類好用的 GUI 不一定適合 agent。
  • Agent 需要結構化介面、明確授權、可審計操作與防呆。
  • 在 agent-friendly API / CLI 普及前,computer use 是繞過人類 UI 的過渡方案。

與其他概念的關係

  • Agentic-Workflow:workflow 描述 LLM / tools / context / memory / eval 如何編排成任務流程;agentic engineering 更偏工程師如何設計可驗證試錯環境與責任邊界。
  • LLM-Evaluation:eval 是 agentic engineering 的核心,不是事後加上的報表。
  • Harness-Engineering:harness engineering 管 agent 的工具、context 與 feedback loop;agentic engineering 是把這些 harness 元素用在工程實驗與軟體交付上。
  • Jagged-Intelligence:因為 AI 能力鋸齒狀,任務要盡量被改寫到可驗證區域。
  • AI輔助開發:AI 輔助開發是使用場景;agentic engineering 是專業化後的上層治理方法。
  • MOC-工程:把 AI agent 產出納入工程成熟度,而不是把「AI 寫的」當作免責理由。

相關來源

備註

本頁目前以二手訪談解析建立概念入口;Auto Research、SkyPilot cluster 實驗與 Shopify 內部實驗數字需待一手來源校準。