空货架还是丢钥匙?Google 研究:Recall 是参数化事实性的瓶颈

Google Research 的一项新研究发现,前沿大模型(如 Gemini 3 和 GPT-5)的许多事实性错误,并非因为模型"没学过"这些知识,而是因为它"想不起来"——即编码没有问题,问题出在回忆环节。这为理解和改善大模型幻觉问题提供了新的诊断思路。

Google Research 的一项新研究发现,前沿大模型(如 Gemini 3 和 GPT-5)的许多事实性错误,并非因为模型"没学过"这些知识,而是因为它"想不起来"——即编码没有问题,问题出在回忆环节。这为理解和改善大模型幻觉问题提供了新的诊断思路。

印度理工学院孟买分校与 Adobe Research 的研究人员提出了一种名为“Previous-Token Prediction”(PTP)的方法,仅凭大语言模型生成的输出文本,就能以近乎完美的准确率逆向还原原始提示词,整个过程无需访问模型权重,甚至对第三方模型也有效。这项研究把“提示词泄露”从理论风险变成…

xAI 今日发布 Grok 4.6,重点强化长时段自主代理(Agent)能力与交互式视觉项目执行,综合基准评分追平 GPT-5.6 Sol,并已在 Cursor、Grok Build 及 API 渠道开放使用。

一个名为“测试一下我的提示词”(Test My Prompt)的产品出现在 Product Hunt 上,它试图把“提示词测试”做成一个独立工具。这件事本身比产品功能更值得留意:提示词正在从随手输入的文本,变成需要被反复验证和优化的工程对象。

AI 博主“数字生命卡兹克”发布了一套零基础入门 AI 的实操流程,核心不是教工具,而是教人如何把“最不想干的活”完整交给 AI,并沉淀为可复用的 Skill。它折射出一个重要信号:AI 使用的最大门槛已经不再是技术,而是“敢不敢开始”。

谷歌CEO皮查伊在2026年8月11日通过X平台宣布,Gemini独立应用月活跃用户突破10亿,成为谷歌第14款"十亿级用户产品",与ChatGPT在用户规模上正式打平。

UmanWrite 是一款让 AI 生成文本变得更像真人写作的工具,目前以 79 美元终身买断的形式促销(原价 1799 美元)。它解决的问题很具体:Claude、GPT 生成的文字常带机器腔,需要人工润色才能发布。

OpenAI 的 Daybreak 网络安全模型正式登陆 AWS,通过 Amazon Bedrock 提供给企业客户。这意味着安全团队可以不必切换平台,在自己现有的 AWS 环境里调用顶级 AI 来完成漏洞研究、检测和应急响应。

OpenAI 将旗下 AI 安全插件 Codex Security 正式开源,以 npm 包形式向所有人开放,并支持接入第三方大模型。这意味着 AI 编程工具正在从“生成代码”走向“自动审计代码安全”,开发者可以低成本为任何 Agent 工具加上安全外挂。

据多位用户与内部人士爆料,AI 编程工具 Cursor 本周可能迎来密集更新,包括热门模型 Grok 4.6 上线、自研 Git 平台 Origin 发布,以及 Composer 3 功能更新。目前公开版本仍是 Grok 4.5,传闻尚未获得官方确认。