MOC-LLM-應用設計

範圍

如何把大語言模型變成可用的應用——從 Software-3.0 的軟體範式轉換,到基本元件(Augmented-LLM)、Agentic-Workflow / 5 種 agentic 模式、協議層(Model-Context-Protocol / Agent2Agent)、評估層(LLM-Evaluation / AI模型評測 / 品味外化)、商業介面(智慧型API / 行動引擎)、平台權力(頂級聚合者)、基礎設施 / 資本層(AI算力資本循環);以及配套的 Prompt-Engineering / Goal-Prompt / Context-Engineering / Fine-Tuning / AI輔助開發 / Agentic-Engineering 等工程實踐。

核心命題

LLM 應用的核心不是模型本身,而是把模型放進系統中的方式——上下文怎麼填、工具怎麼接、流程怎麼編排、failure mode 怎麼處理,決定了能不能變成可靠的產品。

三個結構性轉變:

  1. 從 prompt 到 contextPrompt-EngineeringContext-Engineering 的概念升級——重點不是「怎麼問」,而是「用正確資訊填滿 context window」。
  2. 從 LLM 到 Agentic WorkflowAugmented-LLM + prompts / context / tools → Agentic-Workflow / Agent;agent 的關鍵不是模型聰明,而是任務拆解、工具邊界、Agent-Computer-InterfaceLLM-Evaluation 設計得好。
  3. 從 Demo 到 Production:能 deterministic 解的先 deterministic;fuzzy 部分用 LLM-Evaluation、trace、guardrail 與 human fallback 迭代,而不是只靠更長 prompt 或更強模型。
  4. 從 API 到 Aggregator智慧型API行動引擎頂級聚合者 的商業模式遞進——AI 助理可能成為新的需求入口,把既有聚合者再聚合一次。
  5. 從能做出來到能驗證Jagged-Intelligence 提醒模型能力邊界不是均勻的;可放大的任務通常要能被 LLM-Evaluation、測試、metric 或 trace 驗證,這也是 Agentic-Engineering 的起點。
  6. 從互動到管理:long-running agent 不是更長的聊天,而是用 Goal-Prompt 定義完成、驗證、限制、迭代與停損;質化工作則要先做 品味外化,讓 AI evaluator 能守住人的主觀標準。
  7. 從固定職能到工具調度普通人的老闆化 把 agentic workflow 的影響推到個人職涯層——人不只使用工具,而是發現問題、組裝工具、委派 agent、驗證結果,並決定哪些事不該被加速。
  8. 從模型能力到算力資本AI算力資本循環 提醒 LLM 應用供應商不是抽象 API 黑盒;其價格、可用性、模型路線與供應穩定性會受晶片、雲、資料中心、投資承諾與電力週期影響。
  9. 從 task 到 beyond task2026-07-30-VK-Make-Something-Wonderful 補上應用層的人機分工語言——可規格化的 service / task 會被 AI 壓低成本,但判讀、意圖、情境感、風險邊界與讓人感到被看見,仍是人要保留的工作。
  10. 從代打到陪練AI陪練 提醒 LLM 應用不只要問「能不能自動化」,也要問「這件事該不該保留給人練判斷」。有些流程適合委派,有些思考 reps 應讓 AI 變成反對、排練與回饋的陪練。

主軸(核心頁)

Umbrella

  • LLM-Wiki — Karpathy 提出的 LLM 維護 wiki 模式;同時也是 vault 的 paradigm
  • Memex — Vannevar Bush 1945 的個人知識策展設想(LLM 應用的歷史前身)

基本元件

  • Augmented-LLM — LLM + 檢索 + 工具 + 記憶;agentic 系統的基本單元
  • RAG — 每次查詢從原文檢索的傳統 LLM 生成模式
  • Fine-Tuning — 更新模型參數的重型強化方式;多數商業應用應先評估 prompt / RAG / tools / workflow 是否足夠
  • Prompt-Engineering — 設計指令以引導期望輸出
  • Context-Engineering — 為下一步以正確資訊填滿 context window 的工藝(比 prompt engineering 更上位

Agentic 系統與 5 patterns(出自 Anthropic

  • Software-3.0 — Karpathy 對 LLM 時代軟體範式的命名:programming 轉向 prompting、context 管理與 agent 指揮;也迫使產品重新判斷「這個 app 是否還該存在」
  • Agentic-Workflow — 把 prompts、context、tools、RAG、memory 與 eval 組成能完成任務的工作流程;Andrew Ng / Stanford 語境中避免濫用「Agent」一詞的 system-design umbrella
  • Agentic-Engineering — 設計 spec、metric、邊界、time budget 與 rollback,讓 agent 在可驗證環境中大量安全試錯
  • Goal-Prompt — long-running agent 任務提示結構:outcome / verification / constraints / iteration policy / error handling
  • Harness-Engineering — 駕馭 agent 的工具、context、feedback loop、單輪驗收與外層 loop;把 LLM 應用設計從 Prompt / Context 推到 Harness 層
  • Harness-Engineering — 駕馭 agent 的工具、context、feedback loop、單輪驗收與外層 loop;把 LLM 應用設計從 Prompt / Context 推到 Harness 層
  • Agent — 動態決定流程的 agentic 系統(umbrella)
  • Agent複雜度演化 — 縱向時序視角:API Call → Workflow → Agent → 工具 → Context-Engineering → Memory → Observability 的 7 階段升級路徑(補位 Agent > 自主程度光譜(從固定到完全自主) 的橫向 pattern 分類)
  • Agent-Computer-Interface — agent 與工具 / 環境的互動界面(ACI)
  • Prompt-Chaining — 把任務拆成依序執行的步驟,中間可加閘門驗證
  • Routing — 把輸入分類後導向專門化的後續處理
  • Parallelization — 並行跑多 LLM(sectioning / voting)
  • Orchestrator-Workers — 中央 LLM 動態拆解任務、委派 workers、合成結果
  • Evaluator-Optimizer — 生成 / 評估雙 LLM 的迭代精煉迴路

評估與可靠性

  • Jagged-Intelligence — LLM 能力呈鋸齒狀分佈;最能被放大的任務通常同時滿足可驗證與訓練分佈覆蓋
  • LLM-Evaluation — production agentic system 的評估框架:end-to-end / component、objective / subjective、quantitative / qualitative + LLM-as-Judge / error analysis / A-B testing
  • AI模型評測 — 非技術使用者的模型比較流程;用真實任務、固定提示、並排比較、多次重跑、幻覺查證與結果紀錄建立任務到模型的選型表
  • 品味外化 — 把質化偏好拆成 rubric、案例、反例與權重,讓 AI evaluator 能評估設計 / 寫作 / 創意品質
  • AI-幻覺 — 看似合理但不準確、無根據或虛構的內容;需用 RAG、工具查證、引用回溯與 eval 系統共同壓低風險

協議層

  • Model-Context-Protocol — Anthropic 提出的模型 / agent 與工具、資料源連接協議(MCP);2026-07-28 RC 後往 stateless core、routable / cacheable HTTP、first-class extensions 與 feature lifecycle 演進
  • Agent2Agent — Google 提出的 agent-to-agent 協作協議(A2A)

商業 / 平台層

  • 智慧型API — 把語言理解、生成、推理、規劃作為 API 提供
  • 行動引擎 — 把自然語言意圖轉成跨服務、跨工具、跨步驟的實際操作
  • 頂級聚合者 — 建立在既有聚合者之上的需求入口,聚合任務、交易與服務

基礎設施 / 資本層

  • AI算力資本循環 — 大模型公司、晶片商、雲商與資料中心商之間,以投資、算力採購、權證與雲服務合約互相綁定的資本循環;提醒應用層也受模型供應商背後的算力成本與基礎設施週期約束

資料供應鏈 / 勞動層

  • AI資料勞動 — 人把作品、聲音、表情、對話、專業判斷或生活情境授權 / 出售給 AI 訓練資料供應鏈;補上模型能力背後的資料取得、權利歸屬與勞動議價問題

模型行為與限制

  • 推理模型 — 強化邏輯分析、多步推演與複雜問題拆解的 LLM 類型

應用層

  • AI輔助開發 — 使用 LLM 協助程式碼轉換、配置、命令翻譯、技術選型與除錯(工程 / 有 ground truth 領域
  • Vibe-Coding — 用自然語言快速做出可跑軟體,拉高創作下限;需由 Agentic-Engineering / Code-Review 承接專業品質
  • 普通人的老闆化 — AI agent 與 AI 編程把一般人推向工具調度、任務編排與問題選擇的工作姿態;連接 Agentic-WorkflowVibe-CodingModel-Context-Protocol、task / beyond task 判讀與職涯焦慮。
  • AI輔助創意 — 使用 LLM 協助行銷 / 創意工作中的文案發想、內容撰寫、企劃靈感(創意 / 抽象主觀領域);與 AI輔助開發 形成「LLM 應用 × 領域」雙翼結構:共享 Prompt-Engineering / ChatGPT / AI-幻覺 上游,下游驗證機制不同(測試 / 文件 vs 人主觀判斷)
  • AI陪練 — 把 LLM 當成提問、反對、排練與回饋的協作者,讓人保留問題定義、價值取捨與最後判斷;補上「代打 vs 陪練」的人機互動姿勢。
  • 資料科學 — 從業者整體職涯觀察軸;vault 中第一個資料科學 umbrella;三圈交集(領域知識 × 數學 × 程式)+ 三角色分工(分析師 / 科學家 / 工程師)+ 「站在巨人肩膀上」哲學;構成應用層三角:開發 / 創意 / 資料科學職涯
  • 領域知識 — 跨領域工具;AI 時代下「最不被取代」的能力軸;對位 可遷移能力 / 切角 / STAR原則 在資料科學職涯的具體應用
  • 模型刷榜 — 圖榜 / 刷榜現象的價值判讀工具;對位 ChatGPT 為「真實力」反例;vault 第一個 LLM / ML 領域專屬的「篩什麼」工具
  • 知識喚醒 — 用 AI 提問與跨域連結激活人的隱性經驗

鄰接領域

實體

模型 / 公司

  • Anthropic — Claude 系列模型;Building Effective Agents 的提出者
  • OpenAI — ChatGPT、GPT 系列;頂級聚合者的代表案例
  • Google — Agent2Agent (A2A) 協議提出者
  • DeepSeek — 中國 AI 公司;推理模型推廣者
  • ChatGPT — OpenAI 對話式 AI 助理產品
  • DeepSeek-R1 — DeepSeek 開源推理模型

框架 / 工具

  • LlamaIndex — LLM 應用開發框架(資料連接、retrieval、context engineering)
  • Claude-CodeAnthropic 的 CLI 編程助理;CLI-agent 駐留在工作目錄的代表產品;MCP / Hooks / Custom slash commands / Headless mode 構成可被腳本呼叫的 build system 元件

思想源頭

  • Karpathy — ML 研究者,提出 LLM Wiki 模式
  • Vannevar-Bush — Memex 概念提出者,知識互連思想先驅

台灣 AI 教育生態

  • Jerry老師亞太智能機器 創辦人 / Google ML GDE / NVIDIA partner;「Money / Transformer is all you need」+「站在巨人肩膀上」哲學的代言人
  • Coco — Microsoft AI MVP / 大魔術熊貓工程師;「舊時王謝堂前燕」普及論 + 模型刷榜 圖榜警示的提出者
  • 資料科學家的工作日常 — 韋恩主理的多平台資料科學社群 + 數據職涯加值計畫系列活動;vault 中第一個資料科學主題的 publication / community
  • Gary-Chen — 中文 AI / agentic system YouTube 整理者;vault 中以 Stanford AI system、Karpathy agentic engineering 與 /goal 長任務工作法三份來源入圖譜

來源累積(reverse-chronological)

備註

此 MOC 是 vault 最大的單一 cluster——29+ 概念頁、13+ 實體、17+ 來源,跨「模型行為 / 工程實踐 / 系統設計 / 評估可靠性 / 協議 / 商業模式 / 應用層三角 / 人機互動姿勢 / 台灣 AI 教育生態 / 資料供應鏈與勞動」10 個層次(035 ingest 後新增「應用層雙翼」:開發 + 創意;數據職涯加值計畫 14 ingest 後擴展為「應用層三角」:開發 + 創意 + 資料科學從業者;曼報 #251 ingest 後補上「資料供應鏈 / 勞動層」;Zemith / Stanford 兩個 2026-05-13 來源補上模型評測、production eval 與 fine-tuning 取捨;2026-05-25 補入 long-running agent goal prompt 與質化品味 rubric;2026-07-30 補入 task / beyond task 與 AI陪練 的代打 vs 陪練邊界)。

特殊性質:這個 cluster 同時也是 vault 的「自我參照」場域——LLM-Wiki 既是 vault 的設計藍本,也是 LLM 應用的一種;vault 本身是這個 cluster 的具體實作案例。未來若 vault 走向 pipeline 自動化(CLAUDE.md §8 遠期目標),這個 MOC 的內容會直接指導 vault 的實作

未來累積方向:(a) Fine-tuning / RAG / Long-Context 的實證成本比較(本期已有 Fine-Tuning 入口,仍需一手技術來源);(b) Multi-modal LLM(vision / audio / video);(c) 正式 LLM eval / benchmark / model observability(本期已有 LLM-Evaluation / AI模型評測 入口);(d) AI agent 安全(alignment / red-teaming);(e) 邊緣 / 本地 LLM;(f) AI + 創作(generative content / 創作者經濟交叉)。