高露潔 × PyMC Labs:LLM 合成消費者真的能取代市場調研嗎?
Threads 熱文把高露潔/PyMC Labs 的 SSR 研究解讀成「90% 準確預測購買意願」。論文本身更精確的說法是:在 57 份個人護理產品問卷、9,300 位真人回應上,SSR 達到約 90% 的人類 test–retest correlation ceiling,並保留較真實的 Likert 分布;它適合做早期概念篩選,不等於全面取代真人研究。
論文 LLMs Reproduce Human Purchase Intent via Semantic Similarity Elicitation of Likert Ratings 由 PyMC Labs 與 Colgate-Palmolive 作者合作,使用 57 份美國個人護理產品概念調查,每份約 150–400 人,總計 9,300 位真人回應。
傳統消費者研究成本高、速度慢、樣本有 panel bias;LLM 可模擬 synthetic consumers,但直接要求模型填 Likert 數字會產生過窄、偏中間或不自然的分布。
SSR:先讓 LLM 以人口特徵與產品概念生成自由文字購買意願,再用 embedding cosine similarity 與五個 Likert anchor statements 比對,轉成 1–5 的機率分布。
| 方法 | 做法 | 論文觀察 |
|---|---|---|
| DLR:Direct Likert Rating | 直接叫 LLM 回答 1、2、3、4、5 | 概念排名相關性不差,但分布很假;模型常退到安全中間值,很少給 1 或 5。 |
| FLR:Follow-up Likert Rating | 先產生文字,再請同/另一模型當 Likert expert 給分 | 比直接打分更好,但分布相似度仍低於 SSR。 |
| SSR:Semantic Similarity Rating | 文字回應 → embedding → 與 Likert anchors 比相似度 → 產生分布 | GPT-4o 實驗達約 90.2% correlation attainment,KS similarity 約 0.88;Gemini 2.0 Flash 也有相近表現。 |
直接問分數會觸發模型的「安全、平均、禮貌」傾向,輸出看起來合理但沒有真人分布。SSR 的重點是讓模型先產生語義豐富的自然語言,再用 deterministic-ish 的語義映射回傳統量表。
論文發現沒有 demographic conditioning 時,分布可能看似接近真人,但概念排名訊號大幅下降;有年齡、收入等 persona 資訊時,模型比較能重現某些群體對價格與產品類別的反應。
SSR 產生的自由文字不只是中間產物,也能提供「為什麼想買/不想買」的理由、疑慮與價值主張。對早期產品概念,這可能比單一平均分更有用。