专家警告 ChatGPT 不再只是预测单词——它现在还可以预测人类的想法

希伯来大学研究团队发现,GPT-4能在真人作答之前,仅凭语言模式预测群体在人格测试中的平均反应,DSM-5题目预测相关度0.71,占星题目高达0.85——这引发了一个新问题:大模型是否已在统计意义上“理解”人类心理。

一句话看懂:希伯来大学研究团队发现,GPT-4能在真人作答之前,仅凭语言模式预测群体在人格测试中的平均反应,DSM-5题目预测相关度0.71,占星题目高达0.85——这引发了一个新问题:大模型是否已在统计意义上“理解”人类心理。

事件核心:发生了什么

研究团队让GPT-4基于两种截然不同的文本——DSM-5临床诊断手册和一本占星教科书——生成人格问卷,再将600名参与者的真实作答与模型事先预测的平均分数对比。结果显示,DSM-5类题目的预测相关度为0.71,占星类题目达到0.85;模型预测题目间关联结构的准确率也分别达到0.74和0.69。更出乎意料的测试是,研究者给GPT-4提供博世烤箱说明书和《指环王》中的风景描写,模型依然能产生类似人格测验的题目,尽管这类题目的语义较弱、结构松散。

为什么重要

传统人格测量依赖问卷作答和统计验证,而GPT-4展示的能力意味着,大模型无需针对心理学任务做专门训练,就能从语言分布中捕捉人群心理倾向的统计规律。占星文本预测相关度(0.85)反而高于DSM-5(0.71),但占星问卷的内部一致性更差——这说明“预测群体平均反应”与“有效测量个体特质”是两回事。研究团队明确警告,不能将二者混为一谈。对行业而言,这项研究为大模型在用户画像、市场调研等场景提供了“预回答”能力,但距离临床或个体评估还有明显鸿沟。

对用户/开发者/创作者的影响

对开发者来说,调用API做问卷设计或用户洞察时,需要区分“群体趋势预测”和“个体诊断”——前者已被证明可行,后者仍未被验证。对产品经理和内容创作者,GPT-4能在任意文本上生成看似专业的心理测验,这类AI生成内容若缺乏心理学验证,容易产出表面合理、实则无效的测评工具。普通用户则应对网络上由AI生成的“人格分析”保持警惕,不宜将其视为科学结论。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

目前公开信息显示,这项研究只验证了GPT-4,尚未覆盖GPT-4o、Claude或开源模型。后续值得观察三点:第一,模型规模是否直接影响预测精度,小参数模型能否复现类似结果;第二,当训练语料中混入更多心理学文本后,预测相关度是否会进一步提升;第三,若该能力被用于商业化用户画像、招聘筛选或心理健康筛查,是否会引发公平性与监管讨论。

来源:TechRadar

celebrityanime
celebrityanime
文章: 18306

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注