OpenAI 发布 GeneBench-Pro:计算生物学研究级基准测试

OpenAI 于 2026 年 6 月 30 日正式发布 GeneBench-Pro,这是一个专为评估 AI 在计算生物学中处理模糊性、做出高阶判断能力而设计的研究级基准测试,旨在解决现有 AI 在真实科研场景中“不会做判断”的短板。

OpenAI 于 2026 年 6 月 30 日正式发布 GeneBench-Pro,这是一个专为评估 AI 在计算生物学中处理模糊性、做出高阶判断能力而设计的研究级基准测试,旨在解决现有 AI 在真实科研场景中“不会做判断”的短板。

OpenAI 在 2026 年 6 月底发布了 Genebench-Pro 基准测试的案例研究,详细展示了该基准如何以真实生物实验数据检验 AI 在复杂基因分析任务上的推理能力。这不仅是模型性能测试,更是对 AI 在医疗、制药等领域落地可靠性的直接拷问。

IBM 研究院发布了 ScarfBench,一个专门评测 AI 代理在企业 Java 框架间迁移能力的新基准。测试表明,当前最先进的编码代理在保证迁移后应用行为正确方面成功率不足 10%,远低于传统代码修复基准的表现。

OpenAI 联合博通推出了首款定制 AI 推理芯片 Jalapeño,标志着大模型公司开始垂直整合算力。同期,高通向 PC 和汽车领域跨界,IBM 则聚焦未来十年的芯片微缩技术,算力竞争已从模型层扩展至硬件底层。

OpenAI 将于 7 月 15 日发布与 Work Louder 合作的首款硬件产品,一个面向 Codex 用户的实体快捷宏键盘。这款产品因偏离市场对“AI 原生终端”的期待而引发质疑,暴露出 AI 行业巨头在硬件探索上的方向分歧。

美团宣布成功训练出参数量达 1.6 万亿的 AI 模型 LongCat-2.0,整个训练过程完全依赖超过 5 万块国产 AI ASIC 芯片,没有使用任何 Nvidia 硬件。这一成果直接回应了自 2022 年开始的美国出口管制,证明中国在万亿参数级大模型训练上已具备“纯国产”算力替代方案。

Dharma AI 团队基于 2026 年一篇由 Goldfeder、Wyder、LeCun 和 Shwartz-Ziv 合著的研究论文指出,来自优化理论、进化生物学和市场竞争的多重证据都指向同一个结论:AI 系统在特定领域的突破性表现,来源于对目标的深度拟合,而非通用能力的扩张——专业化不是一种偏好,而是一…

独立开发者David在Hacker News上展示了他独自构建的“一站式AI操作系统”SUNWÆE,将多个大模型的智能路由、笔记、任务、文件、日历等功能整合在一个浏览器应用中,目标是彻底替代传统Google化的工作与生活管理方式。

Autoharness 是一个为 Claude Code 设计的开源插件,能从用户真实工作会话中自动学习、合并、更新和淘汰技能(skill),从而让模型在不依赖人工重编的情况下持续提升特定任务表现——在 CORE-Bench 测试中,将成绩从 42% 提升至 78%。

中昊芯英于2026年6月30日发布了新一代全自研TPU芯片“须臾®”及配套的智算平台“泰则®2.0”,在算力、存储和能效等关键指标上实现显著升级。此举意味着国产AI芯片在专用架构上取得新突破,有望为国内大模型训练和推理提供更自主可控的算力选择。