AllenAI 开源 Instruct Tulu 3 后训练:SFT、DPO、RLVR、GRPO 及基于验证器的评估

目前公开信息显示,AllenAI 开源了 Instruct Tulu 3 的完整后训练方案,覆盖 SFT、DPO、RLVR、GRPO 与基于验证器的评估,把一套可复现的大模型对齐流水线直接交到了开发者手中。

目前公开信息显示,AllenAI 开源了 Instruct Tulu 3 的完整后训练方案,覆盖 SFT、DPO、RLVR、GRPO 与基于验证器的评估,把一套可复现的大模型对齐流水线直接交到了开发者手中。

Google Research 的一项新研究发现,前沿大模型(如 Gemini 3 和 GPT-5)的许多事实性错误,并非因为模型"没学过"这些知识,而是因为它"想不起来"——即编码没有问题,问题出在回忆环节。这为理解和改善大模型幻觉问题提供了新的诊断思路。

DeepSeek V4 Pro 0813 的基准测试成绩在 Hacker News 曝光,多项编程与 Agent 任务指标相比前代大幅提升;与同期 Qwen 旗舰模型对比,多数核心项目占优,且价格明显更低,性价比成为最大看点。

AI 物流公司 ClearJet 完成 2500 万美元 B 轮融资,用算法把货主与商业航班闲置腹舱运力实时匹配。这件事值得关注,是因为它代表 AI 正在进入传统货运交易环节,用供需匹配创造可见的商业价值。

OpenAI 更新了 ChatGPT 的 Chrome 扩展,新增的“Side Chat”侧边对话窗口可以直接总结 YouTube 视频、跨多个标签页整合信息,还能解释网页中高亮选中的文本。这不是一次简单功能叠加,而是让 AI 从“对话窗口”进入“浏览器操作层”,意味着 AI 助手的交互方式正在向日常浏览行为…

Hacker News 上出现了标题为“Grok 4.6”的讨论帖,但 xAI 官方尚未发布正式公告。这可能是继 Grok 4.5 之后的一次快速迭代,说明 xAI 仍在以高频节奏推进大模型更新。

OpenRouter 推出针对实时网页搜索的基准测试,重点考察搜索能力与智能体场景的适配度,为开发者选择搜索方案提供可量化的参考依据。

谷歌在最新发布的 Pixel 11 系列中,把 Gemini AI 放进了相机流程:既能替你“看着”画面自动抓拍,也能用更快的夜景算法减少糊片。手机影像的竞争重点,正从镜片和传感器,转向端侧 AI 对拍摄过程的接管。

Google Pixel Watch 5 于 2026 年 8 月正式发布,价格涨至 399 美元,硬件小幅升级,但真正的变化来自 AI 与健康软件:离线 Gemini、主动式 AI 建议、呼吸紧急检测和非诊断性的健康趋势追踪,都表明 Google 正在把手表的竞争重心从传感器硬件转向 AI 服务与健康预警能…

Google 正在将医疗对话大模型 AMIE 引入临床视频问诊场景测试,试图把 AI 从“文字问答助手”推进到“参与真实诊疗流程”的阶段。这一动向值得关注,因为它直接触及医疗 AI 商业化最难的一环:临床信任与落地路径。