品味外化

一句話定義

品味外化 是把原本只存在於人腦中的質化偏好、審美標準與「皺眉點」拆成可觀察維度、具體案例、反例與權重,讓 AI evaluator 能用 rubric 持續評估並校正產出。

核心要點

質化工作不是不能 eval,而是標準常常沒寫出來

寫作、網頁、簡報、影片、產品體驗、品牌文案等工作沒有單元測試,但不代表不能評估。2026-05-25-Gary-Chen-AI-Agent-27小時-Goal功能 的核心提醒是:若「好不好」只停留在人的模糊感覺裡,AI 只能猜;若標準被拆成 rubric,AI 才能在 Evaluator-OptimizerGoal-Prompt 中持續往人的標準靠近。

這裡的「品味」不是 品味練習 的 savoring,而是審美 / 判準 / 風格偏好的外化。

品味先來自長期浸泡與社會回饋

2026-08-16-閱讀前哨站-超速進步 補上品味外化的上游:在寫作、畫畫、哲學、商業判斷這類沒有唯一標準答案的領域,人先要透過長期看好作品、觀察同行與讀者反應、理解某個社群如何評價作品,並持續創作和修正,才會逐漸形成「什麼是好」的判準。

這提醒品味外化不能只靠一開始憑空寫 rubric。比較穩的順序是:

  • 先累積好作品、壞作品與模糊作品的樣本。
  • 親自比較並說出皺眉點、亮點與社群回饋差異。
  • 再把這些差異整理成維度、案例、反例與權重。

換句話說,rubric 不是品味的來源,而是品味被訓練、校準後的外化形式。若缺少長期浸泡與真實回饋,rubric 會變成漂亮但空洞的形容詞清單。

Anthropic 網頁設計例:把漂亮拆成四個維度

影片轉述 Anthropic frontend design 相關做法:不要讓 evaluator 只判斷「漂亮嗎」,而是拆成多個可評分維度:

維度評估問題
設計品質顏色、字體、排版是否形成整體設計語言與識別感?
原創性是否有刻意設計選擇,還是套用常見 AI 模板?
技術執行字體階層、間距、配色、對比是否一致且乾淨?
可用性使用者是否看得懂、找得到主要操作、能完成原本目的?

更進一步,rubric 可以故意加重模型弱項的權重。例如模型在可用性還行、但設計品質與原創性平庸,就把 evaluator 的權重往弱項推,校正模型預設行為。

六步驟 SOP

步驟動作目的
1先讓 AI 做一批 baseline看模型預設會犯什麼錯
2人親自看,記下皺眉原因把隱性品味轉成失敗樣本
3把皺眉點分類成維度形成 rubric 骨架
4每個維度寫具體案例 / 反例讓 evaluator 能一眼抓到錯誤
5用多樣化案例避免 overfitting防止所有產出都長成同一種風格
6把 rubric 餵給評審 agent 並校準檢查 AI judge 與人眼判斷是否一致

這個流程的重點不是一開始就寫完美 rubric,而是用 AI 的壞產出逼自己說清楚:到底哪裡不好、為什麼不好、怎樣才算好。

具體反例比抽象形容詞有用

「避免 AI 味」太抽象,AI evaluator 無法穩定執行。較好的寫法是列出可掃描的失敗模式,例如:

  • 不要用固定起手式。
  • 不要用過度模板化句型。
  • 不要讓整篇文章沒有具體人名、數字、場景或行動。
  • 不要只寫「現代感、高質感」卻沒有獨特的字體、間距、構圖與互動選擇。

這與 LLM-Evaluation 的 rubric-based judge 一致:主觀標準要被拆成可觀察條件,才能被追蹤與迭代。

評審要看使用者看到的東西

對設計、前端、簡報、影片等視覺輸出,evaluator 不應只看原始碼或文字說明,而要看使用者實際接觸的畫面。例如用 Playwright 開頁面、截圖,再讓 judge 依 rubric 評分。這條紀律避免模型把「程式碼看起來合理」誤認成「使用者體驗真的好」。

與其他概念的關係

  • LLM-Evaluation:本頁是 subjective eval / rubric-based judge 的質化工作版本。
  • Evaluator-Optimizer:品味 rubric 是 evaluator 給 optimizer 方向的判準。
  • Goal-Prompt:質化 long-running task 的 verification 通常要靠品味外化後的 rubric。
  • Prompt-Engineering:prompt 不是多寫形容詞,而是把偏好拆成維度、案例、反例與限制。
  • AI輔助創意:創意 / 行銷工作可用本頁把「像不像我想要的風格」改成可迭代的檢查標準。
  • 判讀力:品味是判讀力在創作、設計與商業判斷中的版本;AI 時代更需要人能驗收生成內容是否真的好。
  • AI陪練:AI 可用來產生樣本、反例與回饋,但人的品味仍需在親自比較與驗收中形成。
  • 迭代設計:每輪產出都應回到具體回饋,而不是只說「再好看一點」。
  • 設計系統 / 簡報設計:這些領域的既有原則可成為品味 rubric 的候選維度。

相關來源

備註

本頁目前以二手整理與實務 SOP 建立入口;Anthropic frontend design skill / visual eval 研究需待一手來源校準,對應追蹤項見 觀察清單.md 的「Long-running Agent Goal 與品味 Rubric 引用來源叢集」。