一句话看懂:一项 arXiv 新论文发现,用大模型模拟问卷受访者时,给它提供这个人过去的答题记录,比给它一段“你是谁”的人格描述更能预测其后续选择,个体预测准确度从 7-12% 提升到 28%。
事件核心:发生了什么
2026 年 10 月 7 日提交至 arXiv cs.AI 的论文(编号 2610.03998)研究了 LLM 合成受访者的有效性问题。研究团队使用 845 名美国成年人两轮面板数据,测量了 14 种行为偏差,涵盖风险偏好、时间偏好、过度自信和推理能力。实验设置五种逐步增加信息的条件:无个人信息、人口统计、人格特质、认知得分,以及受访者此前的答题记录作为行为历史。在行为历史条件下,所有用于计分目标偏差的项目都被剔除,以避免数据泄漏。
结果显示,在总体水平上,各条件平均偏差数量接近人类均值(7.1-8.1 个,人类为 7.1 个),但方差差异显著:基于描述的合成角色只能恢复 53-67% 的人类个体间差异,而加入行为历史后恢复至接近人类水平。个体层面差距更大:基于描述的合成角色仅达到人类重测响应信息量的 7-12%,加入行为历史后升至 28%。行为历史条件在全部 17 个人口统计组中信息量估计最高,而基于描述的条件对某些群体几乎没有提供有效信息。合成响应还表现出比人类响应更强的教育、收入相关差异。
为什么重要
随着大模型被越来越多地用于市场调研、用户画像和合成数据生成,这项研究直接挑战了“用一段人格描述就能模拟真实个体”的常见做法。研究结果表明,静态的角色设定可能产生看似合理但个体层面失真严重的预测,尤其在需要模拟具体人群决策的场景中。对于依赖 LLM 合成受访者替代真实调研的 AI 应用,这意味着数据源的选取和提示词设计需要根本性调整:行为历史比人格标签更具预测价值。目前公开信息仅为论文摘要,全文实验细节和同行评审状态尚未确认。
对用户/开发者/创作者的影响
对于开发调研工具或用户模拟系统的开发者,需要考虑在提示词或上下文中纳入目标用户的历史行为序列,而非仅依赖人口统计和性格描述。对于企业采购方,在评估合成数据产品时,应关注其是否利用行为历史进行校准,而非只提供“角色卡”式生成。对于内容创作者和产品经理,如果使用 LLM 模拟用户反馈,应当意识到静态人设可能系统性高估跨群体一致性,进而影响决策判断。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是该论文是否经过同行评审并有后续复现实验,验证 28% 信息量提升是否稳定;二是相关方法是否被主流 LLM 调研工具或合成数据平台采纳为产品功能;三是隐私与合规问题:行为历史通常涉及真实用户数据,如何在合成受访者中合法使用历史记录,可能影响落地节奏。
来源:arXiv cs.AI


