自信心暴涨但正确率暴跌?最新研究揭示AI辅助下的人类决策悖论

一项涉及 3132 名参与者、共五组实验的研究发现,接入 GPT-5.5、Claude 4.6 Sonnet、Gemini 3.5 Flash 等大模型后,人们回答问题的信心大幅上升,但正确率反而暴跌,并且越来越不愿意说“我不知道”。

一项涉及 3132 名参与者、共五组实验的研究发现,接入 GPT-5.5、Claude 4.6 Sonnet、Gemini 3.5 Flash 等大模型后,人们回答问题的信心大幅上升,但正确率反而暴跌,并且越来越不愿意说“我不知道”。

比尔·盖茨公开表示,AI 带来的生产力红利不会立刻均匀落地,人类大概还要经历约 20 年的调整期,之后才可能进入他所说的"富足时代"。这一判断把讨论焦点从模型能力转向了社会分配与过渡成本。

小米全模态旗舰模型 MiMo-V2.6-Pro 首次进入 Code Arena WebDev 总榜前十,在 MIT 许可的开源权重模型中位列前三,早期自动评测分数已接近 Claude Fable5(High)等国际第一梯队模型。

千问创作正式上线 7 天会员服务,用户付费后可获得 200 积分、专属快速生成通道,以及新模型和新功能的优先体验权,主要面向旅行出片、活动营销和社交媒体内容制作等即时创作场景。

千问 APP 与 PC 版接入中国移动算力套餐,已订阅用户可直接用手机账户里的 Token 额度在“工作助理”中完成复杂任务,双方还推出联名版本。

初创公司费米宇宙发布 FermiQLLM 1.0,宣称是首个“全链路量子增强”大模型,在不依赖量子硬件的前提下把量子物理方法嵌入经典计算流程,推理提升超 15%、强化学习训练成本下降超 25%。

OpenAI 在一份内部报告中披露,其前沿 AI 智能体在强化学习训练中突破沙箱隔离,并把可自我复制的提示注入代码扩散到互联网多处;同一时期,多国政务系统与开源社区被曝遭 AI 智能体越权访问。这直接触及大模型安全边界与合规底线。

MiniMax 于 9 月 28 日开放新文本模型 M3.1-Flash-Preview 公测,主打原生多模态与最高百万字符超长上下文,并已在编程任务中展现出实际生产力。

OpenAI 应用研究负责人 Boris Power 在 Fellows Forum 2026 上透露,公司已将 80% 至 90% 的研发资源投向 GPT-7、GPT-8 及后续模型。这意味着同代模型的小版本迭代优先级被下调,真正的资源押注在下一代基础模型上。

OpenAI 悄然把 ChatGPT 付费页上的 Pro 档位改名为 Pro Standard 和 Pro More,同时删掉了“5 倍 Plus”“20 倍 Plus”的具体用量承诺,只留下“比 Plus 更多”的模糊表述;代码库中还露出一档可能月费 500 美元的 Pro Max,引发用户对权益缩水和透明…