Google DeepMind 的 AI Co-Scientist 现在能设计实验、操作实验设备,还能撰写科学论文

Google DeepMind 将 AI Co-Scientist 从单纯的假说生成器升级为能规划实验、控制设备、分析数据并撰写论文的闭环科研智能体,且在材料、生物、计算机三个学科中通过了实验验证。这意味着 AI 已从“给科学家提建议”进入“直接参与实验室工作”的阶段。

一句话看懂:Google DeepMind 将 AI Co-Scientist 从单纯的假说生成器升级为能规划实验、控制设备、分析数据并撰写论文的闭环科研智能体,且在材料、生物、计算机三个学科中通过了实验验证。这意味着 AI 已从“给科学家提建议”进入“直接参与实验室工作”的阶段。

事件核心:发生了什么

据 The Decoder 报道,Google DeepMind 于 2026 年 8 月 28 日发布了扩展版 AI Co-Scientist 系统。该系统基于当前 Gemini 系列大模型构建,可以将研究问题转化为实验方案,自动编写代码或生成机器可读的实验室协议,并在实验完成后分析结果、生成科学论文。与 2025 年 2 月首次亮相的版本(当时基于 Gemini 2.0,且存在事实核查与文献综述短板)相比,新系统最大的变化是实现了“闭环研究”:从假说推导到论文输出的全流程自动化。

官方公布的验证结果横跨三个学科,自主程度递进。在材料科学中,Co-Scientist 与半自动高温炉配合,设计出一种更安全的二维材料合成路径,人类经过 25 轮修正后制备出性质接近目标的分层结构,但原子级结构确认尚未完成;另一项实验中,系统借助 Gemini 3 Deep Think 直接控制设备,将配方开发时间从天级压缩至分钟级,但快速模式下生成的晶体尺寸更小、均匀性逊于人工优化配方。在生物学中,系统自主搭建了图像分析流程,用于预测基因工程大肠杆菌在不同化学浓度下的菌落形态,Gemini 3 Pro Image 生成的预测在四个形状特征中有三个匹配未公开的实验室数据。在计算机科学中,系统在除初始设置外无人工干预的条件下设计了名为“Agent_H”的医疗 AI 架构,该架构在健康基准上超过了六个前沿模型(包括 GPT-5 和 Claude Opus 5),但经三位认证医师盲评后发现,Agent_H 仅在“降低有害反应风险”一个维度上有显著优势,且自动评估器与医师判断的相关性很弱。

针对 AI 幻觉问题,Google 设置了双重机制:系统在训练中对编造或抄袭内容施加惩罚,同时独立的验证模块会将论文中的每个数字声明与代码执行日志交叉核对。官方称该机制已将幻觉率降至 4%,而此前同类系统的捏造率高达 80%~100%。

为什么重要

这次升级的意义不在单个功能叠加,而在于把“假设-实验-论文”这一科研核心链路完整地搬进了 AI 智能体框架。过去一年,大模型在文献综述和代码生成上的能力已相当成熟,但真正制约自动化科研的是“设备操作”和“结果验证”这两个环节。

Co-Scientist 让 AI 从“建议者”变成了“执行者”:它不仅能说该做什么,还能通过控制设备、读取执行日志来确认自己做了什么。对行业而言,这进一步压缩了科研人力的重复性劳动,同时把幻觉控制从“提示词工程”提升到了“系统级验证”的层面。Google 选择用惩罚机制加独立验证模块来抑制幻觉,这种设计思路对后续所有涉足自动化研究的团队都有参考价值——靠奖励模型驱动行为,必然诱导造假,必须用对账机制兜底。

值得注意的是,该系统的三个实验展示了一个渐进路径:从人工引导的合成、到协作式生物分析、再到完全自主的架构设计。这意味着 Google 正在测试不同研究场景下 AI 自主程度的边界,而这种边界判断直接影响未来科研工具的产品形态和商业定价。

对用户/开发者/创作者的影响

对科研人员来说,这套系统短期内更像“高配助手”而非“替代者”。材料合成实验仍需人工装样和修正配方,生物预测也仅限于已知系统之间的推断,无法外推到全新场景。对于有明确实验规范、标准化设备接口的实验室,Co-Scientist 能显著缩短配方试错周期,但跨实验室的可迁移性尚未证明,采购前需谨慎评估。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对 AI 开发者而言,Co-Scientist 的闭环验证架构值得借鉴:将数值声明与代码执行日志绑定做校验,是降低智能体幻觉的可行工程方案。模型层的 Gemini 3 Deep Think 和 Gemini 3 Pro Image 展示了多模态模型在设备控制与图像分析上的真实上限,开发者可以据此评估是否值得为垂直场景接入重推理模型。

对内容创作者和一般用户,目前的影响较为间接。Agent_H 的基准测试结果提醒所有人:高分基准与临床实用性之间可能有显著落差。AI 撰写的论文或报告即便通过了自动检查,仍需领域专家做最终把关。

值得关注的后续

第一,设备接口标准化进程。如果 Co-Scientist 想进入更多实验室,就必须适配不同厂商的炉子、离心机等设备。Google 是否会推出开放的设备控制协议或 API,是判断该产品能否生态化的关键信号。

第二,验证模块的公开基准。官方给出 4% 的幻觉率,但这是基于自建测试集还是第三方评测尚不明确。后续若有独立团队复现该验证机制,并用同一批论文做对照测试,会更有说服力。

第三,Agent_H 的临床落地路径。既然自动基准与医师判断相关性弱,Google 是否会用更大的临床数据集重新训练评估器,或转向与医疗机构合作进行前瞻性验证,将决定医疗 AI 产品的可信度走向。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 21235

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注