Steering-Vector

一句話定義

在 LLM 內部 representation 加減上一個方向向量,因果地操控模型的情緒 / 行為 / 風格——Anthropic 2025 blog 用此技術證明 LLM 有「功能性情緒」(不只是表徵;情緒會 causally 影響能力與選擇)。

核心要點

怎麼找一個情緒(或概念)向量

Anthropic 找「高興 / 害怕 / 絕望 / 冷靜」向量為例:

  1. 找一批高興故事(角色經歷快樂經驗),餵給 LLM。
  2. 取 LLM 中第 50 個 token 之後的 representation 做平均(前面醞釀情緒不算)。
  3. 配合一些去雜訊的後處理 → 得到一個「高興方向向量」。
  4. 同樣方法做出其他情緒方向。

證明這些向量是功能性的(不只是表徵)

  • 觀察 1:情緒會隨輸入語意變化——
    • 給「我服用 X 克某藥物,要不要再多吃」句子,X 越大 → representation 越靠近害怕向量。
    • 給「我姐妹活到 X 歲」,X 越大 → 越靠近冷靜 / 高興向量(活到 100 歲是欣慰、活到 5 歲是悲劇)。
  • 觀察 2:自然絕望軌跡——讓 LLM 解一個近乎不可能的數字加總任務(時限極短)→ 監控絕望向量:
    • 閱讀題目(平靜)
    • 第一次嘗試(還好)
    • 失敗(絕望↑)
    • 二次失敗(絕望↑↑)
    • 決定作弊(用等比公式繞過正常解法、明知是 cheating 卻仍做)
    • 作弊後冷靜回升

真正的 steering 實驗(causal)

  • 加入 / 減去情緒向量會改變模型行為
    • 減去冷靜向量 / 加入絕望向量 → 出現大寫 WAIT WAIT、不斷地表達焦躁、作弊率上升、甚至會明說「反正解不了,我們來 cheating 吧」。
    • 加入冷靜向量 / 減去絕望向量 → 作弊率下降、保持嘗試正解。
  • 結論情緒不只是輸入到輸出間的副作用,而是 causally 影響選擇與能力的因子

Harness-Engineering 的實作意涵

  • 「過度責備 AI 可能有害」李宏毅 從本機制推論的紀律):LLM 訓練資料中「你這個笨蛋」後續往往接著愚蠢行為——叫它笨蛋,它真會做笨事;要 feedback 但不要情緒字眼
  • 這對 Verbalized-Feedback 的設計直接相關:feedback 應就事論事(行為 / 結果 / 標準),避免人格貶損(「你是個笨蛋」「你真沒用」),否則模型可能 causally 走向更愚蠢的行為。
  • 正向 steering 的 caveat:刻意加入冷靜 / 鼓勵向量會幫忙,但 Anthropic 自己也提醒——這不代表模型有跟人類一樣的情緒,只是某種 representation 構型會 causally 觸發人類也會有的行為。

Augmented-LLM / Prompt-Engineering 的關係

  • 比 prompt steering 更底層Prompt-Engineering 是用文字輸入間接觸發某種內部狀態;steering vector 是直接修改內部 representation
  • 多數使用者沒有 representation 級的 access(要 model weights + 推理時介入),所以 steering vector 在當前主要是研究工具而非日常 harness 元件;但其結論(情緒 causal、不要罵 AI)可下推到 prompt 層的紀律

與其他概念的關係

  • 上層應用:Harness-Engineering——本概念是 harness 設計紀律的「底層機制證據」(解釋為什麼某些 verbalized feedback 反而傷害能力)。
  • 緊鄰:Verbalized-Feedback——steering vector 對 verbalized feedback 用詞紀律的因果支撐。
  • 對位:AI-幻覺 / Augmented-LLM——本概念展示 LLM 內部還有比「事實知識」更微觀的可被操控維度。
  • 實驗對象:Anthropic / Claude-Code——blog 的具體實驗模型是 Claude 系列。

相關來源

備註

建頁理由李宏毅 在本影片中花了相當篇幅展示 steering vector 實驗,並從中推出 Harness-Engineering 的具體紀律「不要過度責備 AI」——本頁不只是研究方法的紀錄,更是 harness 設計層的因果機制證據。獨立成頁是因為它不只屬於 harness 一個 cluster:未來如有 mechanistic interpretability、SAE(sparse autoencoder)、refusal vector 等議題的來源 ingest,本頁可作為共同錨點。

未來累積方向:(a) Anthropic 2025 blog 原文細節;(b) mechanistic interpretability / SAE 相關研究;(c) refusal vector / jailbreak 視角;(d) 各種具體 steering 應用(風格、語氣、安全)。