功能性情緒不是 Claude 專利?Gemma 4 復現情緒向量,連人類情緒環模型都浮現出來
核心發現
這篇 Threads 是對 Anthropic「Claude 內部存在 171 個功能性情緒向量」論文的一次很有價值的開源復現。
作者的問題很直接:
這是 Claude 獨有的,還是所有語言模型只要讀夠多人類文字,都會長出類似的情緒幾何?
於是他在自己的機器上,用 Gemma4-E4B(4B 開源模型) 做最小可行實驗,結果得到一個很強的結論:
功能性情緒很可能不是某家模型的秘密,而是語言模型普遍會浮現的內部結構。
最直接的驗證:把情緒向量投回詞彙表
作者做的第一步驗證很聰明,也很直觀:
把情緒向量投射回詞彙表,看它會推高哪些詞。
結果在 Claude 與 Gemma4 上都看到類似現象:
- happy 會推高快樂、興奮、喜悅相關詞
- desperate 會推高絕望、急迫、 hopeless 類詞
- afraid 會推高恐懼、panic、paranoid 類詞
- angry 會推高 angry、rage、憤怒類詞
這代表情緒向量不是隨便取名字的抽象軸,而是真的與語言輸出方向有對應關係。
更有趣的一點:開源模型的情緒是多語言的
作者觀察到一個很漂亮的差異:
Claude 的情緒投射比較偏英文詞; Gemma4 則會推高:
- 韓文(如 불안)
- 中文(如 不安)
- 法文(如 triste)
- emoji(😨、💔、😡)
這個現象很重要,因為它暗示:
情緒向量不只存在,還帶有訓練資料分布的語言指紋。
也就是說,模型內部的情緒空間,不只是心理學結構,也會反映語料來源、語言覆蓋與文化痕跡。
第二層驗證:情緒空間會自然長出 Russell 情緒環
作者接著做 PCA,結果更精彩。
在人類心理學裡,有一個非常經典的模型:Russell circumplex model,把情緒攤在兩條軸上:
- 效價(valence):正面 vs 負面
- 激發度(arousal):平靜 vs 激動
而在 Gemma4 的情緒向量裡,作者發現:
- PC1 解釋 42.2% 方差 → 對應效價軸
- PC2 解釋 18.3% 方差 → 對應激發度軸
- 兩個主成分加起來解釋 60.5% 的情緒空間
更直白地說:
一個只有 4B 參數的開源模型,內部情緒結構竟然自然長出和人類心理學四十年研究非常接近的幾何。
最值得玩味的地方
作者有一句話很有力:
沒有人在損失函數裡寫「效價要在第一主成分」。
這就是整件事最值得思考的地方。
也就是說,這種情緒結構並不是研究者硬塞進去的,而比較像是模型在大量學習人類語言後,自然學會的一種壓縮方式。
換句話說:
只要你讀夠多人類寫的字,情緒的形狀就可能自己浮現。
這讓功能性情緒更像一種語言分布的深層幾何,而不是產品 marketing 詞彙。
這篇對前面 Anthropic 論文的真正補充
Anthropic 論文告訴你:Claude 裡有 171 個情緒向量。
這篇復現更往前一步,告訴你:
- 不是只有 Claude
- 小模型也有
- 開源模型也有
- 多語言模型甚至更顯示出訓練語料痕跡
- 而且其幾何形狀會和人類情緒理論對齊
所以更合理的理解應該是:
功能性情緒可能不是某家公司做出來的特殊能力,而是語言模型對人類文本做壓縮時,很容易長出的通用結構。
需要保留的邊界
當然,這不等於模型「真的有情緒」。
這篇最強的結論是:
- 模型內部有與情緒語言高度對應的功能性向量
- 這些向量會影響輸出行為
- 其幾何與心理學模型高度同構
但這仍然是在說:
模型學會了情緒的結構,不等於模型具有主觀情感經驗。
這個 distinction 很重要,否則很容易從結構相似直接滑到哲學擬人化。
結論
這篇最值得記的地方,不是「Gemma 很強」,而是它把一個更大的命題往前推了一步:
情緒向量可能是語言模型的普遍結構,而不是閉源大模型的專利。
如果這件事成立,代表:
- 你手機上跑的小模型可能也有情緒幾何
- 企業 chatbot 也可能內建功能性情緒結構
- 情緒相關 alignment / steering / safety 研究會變得更通用
這讓「情緒不是裝飾,而是模型內部的一種可測量結構」這件事,變得更可信了。