被放弃的最新人工智能模型在处理复杂的知识工作者任务方面表现得非常好,尤其是处理复杂的工作领域,如法律、专业服务、医疗保健等……

Box 公司 CEO Aaron Levie 在 X 上测试了 Grok 4.5 模型,该模型成功自动审查了一份存储在 Box 中的复杂商业贷款协议(Credit & Security Agreement)。这一事件表明,最新一代大语言模型在理解高复杂度、高专业化文本方面的能力正快速提升,尤其是在法律、医疗等…

Box 公司 CEO Aaron Levie 在 X 上测试了 Grok 4.5 模型,该模型成功自动审查了一份存储在 Box 中的复杂商业贷款协议(Credit & Security Agreement)。这一事件表明,最新一代大语言模型在理解高复杂度、高专业化文本方面的能力正快速提升,尤其是在法律、医疗等…

Replit CEO Amjad Masad 在 X 上发出提问,质疑行业仍在将 AI 自主代理生成代码与人类手写代码做对比,就像不会把编译器与手写汇编比较一样;同日,开发者 Mehul Mohan 透露仅将 Bun 运行时从 Zig 移植到 Rust 就已花费超过 16.5 万美元的 Fable 5 API…

OpenAI 内部一位工程师在 X(原 Twitter)上分享了一张照片,显示深夜办公室门口堆满了外卖订单,暗示团队正在高强度加班推进新项目。这条带幽默的推文引发了行业对 OpenAI 即将发布重要产品或更新的猜测。

在2026年7月举办的AtCoder世界巡回决赛中,OpenAI的AI系统以绝对优势击败所有人类选手,在算法赛道的五道难题中全部解出,最终得分8300分,是第二名人类选手的两倍多。这是AI首次在顶级编程竞赛中全面超越人类顶尖选手。

英国 NHS 正在测试一种基于 AI 的血液检测技术,旨在通过识别子宫内膜癌(子宫癌)的早期生物标志物,减少对患者进行侵入性检查(如活检或宫腔镜)的必要。这项技术若能验证成功,将显著降低诊断门槛和患者痛苦。

7月9日,蚂蚁灵波科技开源了全球首个基于MoE架构的具身智能视频基模LingBot-Video,该模型以30B总参数仅激活3B的推理效率,在机器人动作预测与物理规律建模的基准测试中超越NVIDIA Cosmos 3等主流模型,为机器人仿真数据生成与世界模型研究提供了新的开源基座。

NVIDIA 推出了一款名为 Nemotron-Labs-3-Puzzle-75B-A9B 的新型大语言模型,通过压缩混合专家(MoE)架构设计,在不显著影响用户体验响应速度的前提下,将服务器吞吐量提升了 2.03 倍,直接降低了推理部署的算力和成本门槛。

亚马逊正在秘密推进代号“Moonraker”的AI智能体项目,旨在让Alexa从单一命令响应升级为能理解并自动执行多步复杂任务链的数字助手。该项目已投入巨额算力成本,但内部对投入产出比存在分歧。

法国AI公司Mistral于2026年7月9日发布首个机器人导航模型Robostral Navigate(8B参数),仅凭一个普通RGB摄像头即可实现复杂环境下的自主导航,在基准测试中甚至超越了依赖深度传感器或多摄像头的最优方案,标志着机器人导航的硬件门槛被大幅拉低。

OpenAI 向业界颇具影响力的 AI 编程评测基准 SWE-Bench Pro 公开开火,指出其 731 道公开题目中约 30% 存在评测缺陷。这导致模型的通过率在 8 个月内从 23% 窜升至 80%,但进步速度“异常”,基准本身已无法反映真实能力。