品味外化
一句話定義
品味外化 是把原本只存在於人腦中的質化偏好、審美標準與「皺眉點」拆成可觀察維度、具體案例、反例與權重,讓 AI evaluator 能用 rubric 持續評估並校正產出。
核心要點
質化工作不是不能 eval,而是標準常常沒寫出來
寫作、網頁、簡報、影片、產品體驗、品牌文案等工作沒有單元測試,但不代表不能評估。2026-05-25-Gary-Chen-AI-Agent-27小時-Goal功能 的核心提醒是:若「好不好」只停留在人的模糊感覺裡,AI 只能猜;若標準被拆成 rubric,AI 才能在 Evaluator-Optimizer 或 Goal-Prompt 中持續往人的標準靠近。
這裡的「品味」不是 品味練習 的 savoring,而是審美 / 判準 / 風格偏好的外化。
品味先來自長期浸泡與社會回饋
2026-08-16-閱讀前哨站-超速進步 補上品味外化的上游:在寫作、畫畫、哲學、商業判斷這類沒有唯一標準答案的領域,人先要透過長期看好作品、觀察同行與讀者反應、理解某個社群如何評價作品,並持續創作和修正,才會逐漸形成「什麼是好」的判準。
這提醒品味外化不能只靠一開始憑空寫 rubric。比較穩的順序是:
- 先累積好作品、壞作品與模糊作品的樣本。
- 親自比較並說出皺眉點、亮點與社群回饋差異。
- 再把這些差異整理成維度、案例、反例與權重。
換句話說,rubric 不是品味的來源,而是品味被訓練、校準後的外化形式。若缺少長期浸泡與真實回饋,rubric 會變成漂亮但空洞的形容詞清單。
Anthropic 網頁設計例:把漂亮拆成四個維度
影片轉述 Anthropic frontend design 相關做法:不要讓 evaluator 只判斷「漂亮嗎」,而是拆成多個可評分維度:
| 維度 | 評估問題 |
|---|---|
| 設計品質 | 顏色、字體、排版是否形成整體設計語言與識別感? |
| 原創性 | 是否有刻意設計選擇,還是套用常見 AI 模板? |
| 技術執行 | 字體階層、間距、配色、對比是否一致且乾淨? |
| 可用性 | 使用者是否看得懂、找得到主要操作、能完成原本目的? |
更進一步,rubric 可以故意加重模型弱項的權重。例如模型在可用性還行、但設計品質與原創性平庸,就把 evaluator 的權重往弱項推,校正模型預設行為。
六步驟 SOP
| 步驟 | 動作 | 目的 |
|---|---|---|
| 1 | 先讓 AI 做一批 baseline | 看模型預設會犯什麼錯 |
| 2 | 人親自看,記下皺眉原因 | 把隱性品味轉成失敗樣本 |
| 3 | 把皺眉點分類成維度 | 形成 rubric 骨架 |
| 4 | 每個維度寫具體案例 / 反例 | 讓 evaluator 能一眼抓到錯誤 |
| 5 | 用多樣化案例避免 overfitting | 防止所有產出都長成同一種風格 |
| 6 | 把 rubric 餵給評審 agent 並校準 | 檢查 AI judge 與人眼判斷是否一致 |
這個流程的重點不是一開始就寫完美 rubric,而是用 AI 的壞產出逼自己說清楚:到底哪裡不好、為什麼不好、怎樣才算好。
具體反例比抽象形容詞有用
「避免 AI 味」太抽象,AI evaluator 無法穩定執行。較好的寫法是列出可掃描的失敗模式,例如:
- 不要用固定起手式。
- 不要用過度模板化句型。
- 不要讓整篇文章沒有具體人名、數字、場景或行動。
- 不要只寫「現代感、高質感」卻沒有獨特的字體、間距、構圖與互動選擇。
這與 LLM-Evaluation 的 rubric-based judge 一致:主觀標準要被拆成可觀察條件,才能被追蹤與迭代。
評審要看使用者看到的東西
對設計、前端、簡報、影片等視覺輸出,evaluator 不應只看原始碼或文字說明,而要看使用者實際接觸的畫面。例如用 Playwright 開頁面、截圖,再讓 judge 依 rubric 評分。這條紀律避免模型把「程式碼看起來合理」誤認成「使用者體驗真的好」。
與其他概念的關係
- 與 LLM-Evaluation:本頁是 subjective eval / rubric-based judge 的質化工作版本。
- 與 Evaluator-Optimizer:品味 rubric 是 evaluator 給 optimizer 方向的判準。
- 與 Goal-Prompt:質化 long-running task 的 verification 通常要靠品味外化後的 rubric。
- 與 Prompt-Engineering:prompt 不是多寫形容詞,而是把偏好拆成維度、案例、反例與限制。
- 與 AI輔助創意:創意 / 行銷工作可用本頁把「像不像我想要的風格」改成可迭代的檢查標準。
- 與 判讀力:品味是判讀力在創作、設計與商業判斷中的版本;AI 時代更需要人能驗收生成內容是否真的好。
- 與 AI陪練:AI 可用來產生樣本、反例與回饋,但人的品味仍需在親自比較與驗收中形成。
- 與 迭代設計:每輪產出都應回到具體回饋,而不是只說「再好看一點」。
- 與 設計系統 / 簡報設計:這些領域的既有原則可成為品味 rubric 的候選維度。
相關來源
- 2026-05-25-Gary-Chen-AI-Agent-27小時-Goal功能 — 提供「baseline → 皺眉點 → 分類 → 具體案例 → 多樣化案例 → 評審校準」六步驟 SOP,並轉述 Anthropic frontend design eval 維度。
- 2026-08-16-閱讀前哨站-超速進步 — 補入 Scott Young 對模糊領域學習的說法:品味 / 判斷力來自長期浸泡、好作品樣本、社群回饋與反覆修正。
備註
本頁目前以二手整理與實務 SOP 建立入口;Anthropic frontend design skill / visual eval 研究需待一手來源校準,對應追蹤項見 觀察清單.md 的「Long-running Agent Goal 與品味 Rubric 引用來源叢集」。