MOC-LLM-應用設計
範圍
如何把大語言模型變成可用的應用——從 Software-3.0 的軟體範式轉換,到基本元件(Augmented-LLM)、Agentic-Workflow / 5 種 agentic 模式、協議層(Model-Context-Protocol / Agent2Agent)、評估層(LLM-Evaluation / AI模型評測 / 品味外化)、商業介面(智慧型API / 行動引擎)、平台權力(頂級聚合者)、基礎設施 / 資本層(AI算力資本循環);以及配套的 Prompt-Engineering / Goal-Prompt / Context-Engineering / Fine-Tuning / AI輔助開發 / Agentic-Engineering 等工程實踐。
核心命題
LLM 應用的核心不是模型本身,而是把模型放進系統中的方式——上下文怎麼填、工具怎麼接、流程怎麼編排、failure mode 怎麼處理,決定了能不能變成可靠的產品。
三個結構性轉變:
- 從 prompt 到 context:Prompt-Engineering → Context-Engineering 的概念升級——重點不是「怎麼問」,而是「用正確資訊填滿 context window」。
- 從 LLM 到 Agentic Workflow:Augmented-LLM + prompts / context / tools → Agentic-Workflow / Agent;agent 的關鍵不是模型聰明,而是任務拆解、工具邊界、Agent-Computer-Interface 與 LLM-Evaluation 設計得好。
- 從 Demo 到 Production:能 deterministic 解的先 deterministic;fuzzy 部分用 LLM-Evaluation、trace、guardrail 與 human fallback 迭代,而不是只靠更長 prompt 或更強模型。
- 從 API 到 Aggregator:智慧型API → 行動引擎 → 頂級聚合者 的商業模式遞進——AI 助理可能成為新的需求入口,把既有聚合者再聚合一次。
- 從能做出來到能驗證:Jagged-Intelligence 提醒模型能力邊界不是均勻的;可放大的任務通常要能被 LLM-Evaluation、測試、metric 或 trace 驗證,這也是 Agentic-Engineering 的起點。
- 從互動到管理:long-running agent 不是更長的聊天,而是用 Goal-Prompt 定義完成、驗證、限制、迭代與停損;質化工作則要先做 品味外化,讓 AI evaluator 能守住人的主觀標準。
- 從固定職能到工具調度:普通人的老闆化 把 agentic workflow 的影響推到個人職涯層——人不只使用工具,而是發現問題、組裝工具、委派 agent、驗證結果,並決定哪些事不該被加速。
- 從模型能力到算力資本:AI算力資本循環 提醒 LLM 應用供應商不是抽象 API 黑盒;其價格、可用性、模型路線與供應穩定性會受晶片、雲、資料中心、投資承諾與電力週期影響。
- 從 task 到 beyond task:2026-07-30-VK-Make-Something-Wonderful 補上應用層的人機分工語言——可規格化的 service / task 會被 AI 壓低成本,但判讀、意圖、情境感、風險邊界與讓人感到被看見,仍是人要保留的工作。
- 從代打到陪練:AI陪練 提醒 LLM 應用不只要問「能不能自動化」,也要問「這件事該不該保留給人練判斷」。有些流程適合委派,有些思考 reps 應讓 AI 變成反對、排練與回饋的陪練。
主軸(核心頁)
Umbrella
- LLM-Wiki — Karpathy 提出的 LLM 維護 wiki 模式;同時也是 vault 的 paradigm
- Memex — Vannevar Bush 1945 的個人知識策展設想(LLM 應用的歷史前身)
基本元件
- Augmented-LLM — LLM + 檢索 + 工具 + 記憶;agentic 系統的基本單元
- RAG — 每次查詢從原文檢索的傳統 LLM 生成模式
- Fine-Tuning — 更新模型參數的重型強化方式;多數商業應用應先評估 prompt / RAG / tools / workflow 是否足夠
- Prompt-Engineering — 設計指令以引導期望輸出
- Context-Engineering — 為下一步以正確資訊填滿 context window 的工藝(比 prompt engineering 更上位)
Agentic 系統與 5 patterns(出自 Anthropic)
- Software-3.0 — Karpathy 對 LLM 時代軟體範式的命名:programming 轉向 prompting、context 管理與 agent 指揮;也迫使產品重新判斷「這個 app 是否還該存在」
- Agentic-Workflow — 把 prompts、context、tools、RAG、memory 與 eval 組成能完成任務的工作流程;Andrew Ng / Stanford 語境中避免濫用「Agent」一詞的 system-design umbrella
- Agentic-Engineering — 設計 spec、metric、邊界、time budget 與 rollback,讓 agent 在可驗證環境中大量安全試錯
- Goal-Prompt — long-running agent 任務提示結構:outcome / verification / constraints / iteration policy / error handling
- Harness-Engineering — 駕馭 agent 的工具、context、feedback loop、單輪驗收與外層 loop;把 LLM 應用設計從 Prompt / Context 推到 Harness 層
- Harness-Engineering — 駕馭 agent 的工具、context、feedback loop、單輪驗收與外層 loop;把 LLM 應用設計從 Prompt / Context 推到 Harness 層
- Agent — 動態決定流程的 agentic 系統(umbrella)
- Agent複雜度演化 — 縱向時序視角:API Call → Workflow → Agent → 工具 → Context-Engineering → Memory → Observability 的 7 階段升級路徑(補位 Agent > 自主程度光譜(從固定到完全自主) 的橫向 pattern 分類)
- Agent-Computer-Interface — agent 與工具 / 環境的互動界面(ACI)
- Prompt-Chaining — 把任務拆成依序執行的步驟,中間可加閘門驗證
- Routing — 把輸入分類後導向專門化的後續處理
- Parallelization — 並行跑多 LLM(sectioning / voting)
- Orchestrator-Workers — 中央 LLM 動態拆解任務、委派 workers、合成結果
- Evaluator-Optimizer — 生成 / 評估雙 LLM 的迭代精煉迴路
評估與可靠性
- Jagged-Intelligence — LLM 能力呈鋸齒狀分佈;最能被放大的任務通常同時滿足可驗證與訓練分佈覆蓋
- LLM-Evaluation — production agentic system 的評估框架:end-to-end / component、objective / subjective、quantitative / qualitative + LLM-as-Judge / error analysis / A-B testing
- AI模型評測 — 非技術使用者的模型比較流程;用真實任務、固定提示、並排比較、多次重跑、幻覺查證與結果紀錄建立任務到模型的選型表
- 品味外化 — 把質化偏好拆成 rubric、案例、反例與權重,讓 AI evaluator 能評估設計 / 寫作 / 創意品質
- AI-幻覺 — 看似合理但不準確、無根據或虛構的內容;需用 RAG、工具查證、引用回溯與 eval 系統共同壓低風險
協議層
- Model-Context-Protocol — Anthropic 提出的模型 / agent 與工具、資料源連接協議(MCP);2026-07-28 RC 後往 stateless core、routable / cacheable HTTP、first-class extensions 與 feature lifecycle 演進
- Agent2Agent — Google 提出的 agent-to-agent 協作協議(A2A)
商業 / 平台層
- 智慧型API — 把語言理解、生成、推理、規劃作為 API 提供
- 行動引擎 — 把自然語言意圖轉成跨服務、跨工具、跨步驟的實際操作
- 頂級聚合者 — 建立在既有聚合者之上的需求入口,聚合任務、交易與服務
基礎設施 / 資本層
- AI算力資本循環 — 大模型公司、晶片商、雲商與資料中心商之間,以投資、算力採購、權證與雲服務合約互相綁定的資本循環;提醒應用層也受模型供應商背後的算力成本與基礎設施週期約束
資料供應鏈 / 勞動層
- AI資料勞動 — 人把作品、聲音、表情、對話、專業判斷或生活情境授權 / 出售給 AI 訓練資料供應鏈;補上模型能力背後的資料取得、權利歸屬與勞動議價問題
模型行為與限制
- 推理模型 — 強化邏輯分析、多步推演與複雜問題拆解的 LLM 類型
應用層
- AI輔助開發 — 使用 LLM 協助程式碼轉換、配置、命令翻譯、技術選型與除錯(工程 / 有 ground truth 領域)
- Vibe-Coding — 用自然語言快速做出可跑軟體,拉高創作下限;需由 Agentic-Engineering / Code-Review 承接專業品質
- 普通人的老闆化 — AI agent 與 AI 編程把一般人推向工具調度、任務編排與問題選擇的工作姿態;連接 Agentic-Workflow、Vibe-Coding、Model-Context-Protocol、task / beyond task 判讀與職涯焦慮。
- AI輔助創意 — 使用 LLM 協助行銷 / 創意工作中的文案發想、內容撰寫、企劃靈感(創意 / 抽象主觀領域);與 AI輔助開發 形成「LLM 應用 × 領域」雙翼結構:共享 Prompt-Engineering / ChatGPT / AI-幻覺 上游,下游驗證機制不同(測試 / 文件 vs 人主觀判斷)
- AI陪練 — 把 LLM 當成提問、反對、排練與回饋的協作者,讓人保留問題定義、價值取捨與最後判斷;補上「代打 vs 陪練」的人機互動姿勢。
- 資料科學 — 從業者整體職涯觀察軸;vault 中第一個資料科學 umbrella;三圈交集(領域知識 × 數學 × 程式)+ 三角色分工(分析師 / 科學家 / 工程師)+ 「站在巨人肩膀上」哲學;構成應用層三角:開發 / 創意 / 資料科學職涯
- 領域知識 — 跨領域工具;AI 時代下「最不被取代」的能力軸;對位 可遷移能力 / 切角 / STAR原則 在資料科學職涯的具體應用
- 模型刷榜 — 圖榜 / 刷榜現象的價值判讀工具;對位 ChatGPT 為「真實力」反例;vault 第一個 LLM / ML 領域專屬的「篩什麼」工具
- 知識喚醒 — 用 AI 提問與跨域連結激活人的隱性經驗
鄰接領域
- MOC-創作者經濟:頂級聚合者 / 行動引擎 / ChatGPT 可能改變創作者的入口生態;AI 對 內容策略 與 變現 的衝擊(生成內容、推薦改變、平台政策)已開始影響創作者。
- MOC-行銷增長:ChatGPT 等 AI 助理成為新的搜尋 / 比較 / 任務執行入口時,品牌行銷需要面對「內容如何被 AI 解析」的新問題;同時 AI輔助創意 已直接進入行銷增長動作層,作為內容產出的加速工具(2026-04-30-Indie-Creative-035-AI行銷企劃 035 期確立任務分類 + 品質定位 + 人機分工 + prompt 迭代範式)。
- 個人知識管理(PARA / 第二大腦 cluster):LLM-Wiki 是 LLM 維護的個人知識庫,與 第二大腦 / CODE系統 / PARA 共享「Actionability > 囤積」的核心精神,但實作介面截然不同(人為組織 vs LLM 整理)。
實體
模型 / 公司
- Anthropic — Claude 系列模型;Building Effective Agents 的提出者
- OpenAI — ChatGPT、GPT 系列;頂級聚合者的代表案例
- Google — Agent2Agent (A2A) 協議提出者
- DeepSeek — 中國 AI 公司;推理模型推廣者
- ChatGPT — OpenAI 對話式 AI 助理產品
- DeepSeek-R1 — DeepSeek 開源推理模型
框架 / 工具
- LlamaIndex — LLM 應用開發框架(資料連接、retrieval、context engineering)
- Claude-Code — Anthropic 的 CLI 編程助理;CLI-agent 駐留在工作目錄的代表產品;MCP / Hooks / Custom slash commands / Headless mode 構成可被腳本呼叫的 build system 元件
思想源頭
- Karpathy — ML 研究者,提出 LLM Wiki 模式
- Vannevar-Bush — Memex 概念提出者,知識互連思想先驅
台灣 AI 教育生態
- Jerry老師 — 亞太智能機器 創辦人 / Google ML GDE / NVIDIA partner;「Money / Transformer is all you need」+「站在巨人肩膀上」哲學的代言人
- Coco — Microsoft AI MVP / 大魔術熊貓工程師;「舊時王謝堂前燕」普及論 + 模型刷榜 圖榜警示的提出者
- 資料科學家的工作日常 — 韋恩主理的多平台資料科學社群 + 數據職涯加值計畫系列活動;vault 中第一個資料科學主題的 publication / community
- Gary-Chen — 中文 AI / agentic system YouTube 整理者;vault 中以 Stanford AI system、Karpathy agentic engineering 與
/goal長任務工作法三份來源入圖譜
來源累積(reverse-chronological)
- 2026-08-18-DeepSeek-Harness四種模式 — X 長推文;補入 Standard / PTC / Minimal / Creator 四種 coding harness preset,將 AI 輔助開發中的 agent 使用細分為探索、批處理、明確短任務與 agent / preset 創作四種成本 / 權限包絡。
- 2026-07-30-閱讀前哨站-AI判斷力 — 閱讀前哨站文章;新建 AI陪練,補入 AI 使用邊界:成果 / 過程 × 內在 / 外在分界、好摩擦 / 反對票、代打 vs 陪練與判斷 reps 保留。
- 2026-07-30-VK-Make-Something-Wonderful — VK 科技閱讀時間 Substack 週報;用 TPM 被 AI 改寫、service / hospitality、Steve Jobs 流亡期與 AI-native 商業判斷案例,補入 task / beyond task、意圖與人類判讀邊界。
- 2026-07-28-MCP規格Release-Candidate — MCP 官方 2026-07-28 規格 RC;補入 stateless core、Mcp-Method / Mcp-Name routing、Extensions framework、MCP Apps、Tasks extension、OAuth / OIDC 授權硬化、JSON Schema 2020-12 與 Roots / Sampling / Logging deprecation。
- 2026-07-07-小Lin-AI巨頭資本混戰 — 小Lin說 AI 巨頭資本混戰影片;新建 AI算力資本循環,補上 OpenAI / Anthropic / Google 等模型公司背後的算力、晶片、雲、資料中心與投資承諾網路。
- 2026-07-06-ihower-Harness-Engineering系列 / 9 篇系列文 — ihower Harness + Loop Engineering 書面版;補強 Harness-Engineering 的四個 feedback 時機、Ralph-Loop 的外層 loop、LLM-Evaluation 的完成驗收與自我改進、Agentic-Workflow 的框架選型。
- 2026-05-29-Benzi-AI編程改造生活 — 本子在隔壁-Benzi AI 編程 / WorkBuddy 業配影片;新建 普通人的老闆化,補強 AI輔助開發 / Vibe-Coding 的一般人 personal tool 入口、Agentic-Workflow 的鏈路思維、Model-Context-Protocol 的工具連接語境與 心流 的 AI 比例控制。
- 2026-05-25-Gary-Chen-AI-Agent-27小時-Goal功能 — long-running agent
/goal功能與質化工作 eval;新建 Goal-Prompt / 品味外化 / Gary-Chen,補強 LLM-Evaluation / Evaluator-Optimizer / Ralph-Loop - 2026-05-18-Karpathy-Software-3-Agentic-Engineering — Karpathy 訪談解析;新建 Software-3.0 / Jagged-Intelligence / Vibe-Coding / Agentic-Engineering,補上 AI 工作者定位與 verifiability 軸
- 2026-05-13-Stanford-AI系統課程 — vault 第一份把 Stanford / Andrew Ng 語境的 AI system design 串成完整路線的來源;新建 Agentic-Workflow / LLM-Evaluation / Fine-Tuning,並回寫 RAG / Prompt / MCP / Agent 的 production 取捨
- 2026-05-13-Zemith-AI模型評測指南 — 非技術使用者的模型比較流程;新建 AI模型評測,把「LLM 評估方法」從 future direction 落成實務 eval 入口,並對位 模型刷榜 / AI-幻覺
- 2026-04-28-Google-A2A-MCP — A2A 協議與 MCP 的關係(協議層雙來源)
- 2026-04-28-ChatGPT-廣告 / 2026-04-28-OpenAI-頂級聚合者 — 頂級聚合者 / 行動引擎 / 智慧型API
- 2026-04-28-DeepSeek-從入門到精通 — 推理模型 / Prompt 元素 / AI 幻覺
- 2026-04-28-ChatGPT-Prompt-Guideline — AI 輔助開發的 5 種協作模式
- 2026-04-30-Indie-Creative-035-AI行銷企劃 — vault 中第一個行銷 / 創意視角的 AI 工具實測;新建 AI輔助創意;以假想品牌實測 ChatGPT 在 15 分鐘內完整跑過命名 / 標語 / 貼文 / 體驗文 / 企劃 / 短片腳本 / 活動創意;確立人機分工「創意核心 = 人 / 內容延伸 = AI」
- 2026-04-28-Anthropic-Building-Effective-Agents — 5 agentic patterns(ACI / agent 主來源)
- 2026-04-28-LlamaIndex-Context-Engineering — Context Engineering 概念升級
- 2026-04-28-Karpathy-LLM-Wiki-gist — vault 設計藍本(umbrella 主來源)
- 2026-04-30-Claude-Code完整教程 — Claude-Code 實作經驗(plan mode / CLAUDE.md / context 劣化 / MCP / Hooks / Headless mode / build system 飛輪);vault 中第一個 CLI-agent 工具實作來源
- 2026-05-01-AI時代資料科學技能樹 — 數據職涯加值計畫 14 / Jerry老師 + Coco + 韋恩座談;資料科學從業者視角的 AI 衝擊反思——確立 資料科學 umbrella + 三角色重新分工 + 領域知識 不被取代 + 模型刷榜 警示 + 「站在巨人肩膀上」哲學;應用層三角從「開發 + 創意」雙翼擴展為「開發 + 創意 + 從業者職涯」三軸
- 2026-05-02-Agent神文沒告訴你的事 — vault 中第一份從踩坑路徑反推「何時升級到下一階段」的來源;新建 Agent複雜度演化(縱向時序視角,補位 Agent > 自主程度光譜 橫向分類)+ 多頁時機紀律補入(Context-Engineering / Agent-Memory / Sub-Agent / Prompt-Engineering / Augmented-LLM)+ 「Anthropic 神文 = 畢業設計圖紙」閱讀紀律對位
- 2026-05-08-曼報-EP251-AI時代兩種命 — AI 時代新聞摘評;新建 AI資料勞動,把 LLM 應用設計從模型 / agent / 平台層往前補到資料供應鏈、創作者資產歸屬與人類資料勞動層
備註
此 MOC 是 vault 最大的單一 cluster——29+ 概念頁、13+ 實體、17+ 來源,跨「模型行為 / 工程實踐 / 系統設計 / 評估可靠性 / 協議 / 商業模式 / 應用層三角 / 人機互動姿勢 / 台灣 AI 教育生態 / 資料供應鏈與勞動」10 個層次(035 ingest 後新增「應用層雙翼」:開發 + 創意;數據職涯加值計畫 14 ingest 後擴展為「應用層三角」:開發 + 創意 + 資料科學從業者;曼報 #251 ingest 後補上「資料供應鏈 / 勞動層」;Zemith / Stanford 兩個 2026-05-13 來源補上模型評測、production eval 與 fine-tuning 取捨;2026-05-25 補入 long-running agent goal prompt 與質化品味 rubric;2026-07-30 補入 task / beyond task 與 AI陪練 的代打 vs 陪練邊界)。
特殊性質:這個 cluster 同時也是 vault 的「自我參照」場域——LLM-Wiki 既是 vault 的設計藍本,也是 LLM 應用的一種;vault 本身是這個 cluster 的具體實作案例。未來若 vault 走向 pipeline 自動化(CLAUDE.md §8 遠期目標),這個 MOC 的內容會直接指導 vault 的實作。
未來累積方向:(a) Fine-tuning / RAG / Long-Context 的實證成本比較(本期已有 Fine-Tuning 入口,仍需一手技術來源);(b) Multi-modal LLM(vision / audio / video);(c) 正式 LLM eval / benchmark / model observability(本期已有 LLM-Evaluation / AI模型評測 入口);(d) AI agent 安全(alignment / red-teaming);(e) 邊緣 / 本地 LLM;(f) AI + 創作(generative content / 創作者經濟交叉)。