AI建议使人们准确性降低三倍,但自信提升两倍,研究人员发现

一项来自法国和意大利三所大学的研究显示,当人们依赖AI建议时,回答准确性从27%降至9%,但自信水平却从30%升至76%。AI并未提升判断力,反而抑制了人们“承认不知道”的本能。

一项来自法国和意大利三所大学的研究显示,当人们依赖AI建议时,回答准确性从27%降至9%,但自信水平却从30%升至76%。AI并未提升判断力,反而抑制了人们“承认不知道”的本能。

OpenAI 悄然将 Codex 模型的可用上下文大小从 372k 缩减到 272k,用户发现早期频繁出现的“模型上下文大小超限”错误已不再出现。随着上下文缩减,OpenAI 开始采用类似加密子代理日志的方式隐藏会话细节,引发部分高级用户对透明度和可控性的担忧。

ChatPlayground AI 推出 Unlimited Plan 终身订阅,限时售价 59.97 美元(原价 619 美元),用户可在单一界面内对比和调用 GPT-4o、Claude Sonnet、Gemini、DeepSeek、Llama、Perplexity 等 20 余个大语言模型,不再需要在多个…

Vercel CEO Guillermo Rauch 在 2026 年 7 月发布了一条引发讨论的观点:AI 在经济相关任务上远超人类,“AGI(通用人工智能)”这个术语已经过时,更准确的说法是“超级智能”。但他同时强调,AI 无法替代人类的独特性、关怀能力与创造性写作——尤其在社交媒体和产品文案中,AI 生…

Box CEO Aaron Levie 在2026年7月18日发帖指出,AI行业的价值并未仅被少数前沿实验室独占,一个由企业应用、垂直模型、新基础设施和服务商构成的多元生态系统正在成形,过去几个月是这一趋势的转折点。

Epoch AI 的最新研究显示,当 AI 模型被要求模仿特定作者的写作风格时,主流的 AI 文本检测器(如 Pangram、GPTZero 和 Originality.ai)的漏检率会从接近 0% 骤升至平均 13%。其中科学写作领域的漏检率最高,在 24% 至 29% 之间,这直接威胁到学术界和教育场景中…

OpenAI 正在频繁且有计划地重置其编程助手 Codex 和 ChatGPT Work 付费用户的用量限制,过去半年已重置 35 次,平均间隔不到 9 天。这些重置不仅是应对系统压力的临时措施,更被用来庆祝用户里程碑、推广新功能,甚至形成了一个被用户追踪的“重置文化”。

研究人员利用 GPT-5.6 和一个长达十页的专业提示词,在凸优化理论中解决了一个困扰学界30年的未解问题。这一成果并非简单的“AI 自动发现”,而是建立在大量前期人类研究之上的协作突破。

开发者社区中,Fable 5 模型在处理 NP 难问题时,通过结构化任务分解和“/protect your goal is...”指令,展现出比 GPT-5.6 Sol 更稳定的质量,但长上下文下的“降智”现象仍是共同痛点。

Talorr AI 今日在 Product Hunt 上线,这是一款专注于求职流程的 AI 副驾驶工具,能自动定制简历、评估 ATS 匹配度并辅助面试准备。它把求职中多个分散环节整合到一个平台,值得正在活跃求职的用户关注。