一句话看懂:国内团队实在智能自研的桌面操作智能体“实在Agent”,在权威基准测试OSWorld上以90.2%的总成功率拿下双冠,首次突破90%门槛。这件事的关键信号不是模型又多了一个“跑分王”,而是行业竞争正从“拼参数”转向“拼工程化落地能力”。
事件核心:发生了什么
7月27日,OSWorld榜单更新,国内技术团队实在智能开发的“实在Agent”,以90.2%的总成功率和325.59分的成绩,拿下总榜和Agentic Framework分榜双料第一。OSWorld是全球公认的衡量智能体在真实操作系统(Ubuntu)中完成任务能力的基准,涵盖361项全场景任务,包括跨软件协同、系统底层操作、图像处理等。此前行业最高纪录是2026年5月由其他模型创下的83.6%。实在Agent成为首个突破90%成功率的桌面操作智能体,将全球同类技术能力推至新高度。
为什么重要
OSWorld测试的是智能体在真实操作系统环境中的表现,而非轻量级的网页模拟。这意味着它考核的核心是环境感知、长链路规划、多软件协同和系统底层操作能力。此前行业共识是,大模型底座能力正在同质化,真正拉开差距的是Harness工程体系。Stanford、清华等研究显示,相同模型底座下,优质工程架构优化可带来6-10个百分点的性能提升,复杂场景下甚至达到17个百分点。实在Agent的领先,本质上是依托八年自动化工程积累,构建了一套“API优先、无API则GUI操作”的类人执行逻辑,而非单纯依赖模型基础能力提升。这标志着AI智能体竞争已从“参数竞赛”转向“工程落地竞赛”。
对用户/开发者/创作者的影响
对于开发者与企业采购者而言,实在Agent在跨应用场景(如浏览器下载、文档编辑、截图存档、邮件发送)和零容错场景(文件权限修改、进程管理)中的表现,意味着桌面自动化智能体从“实验室玩具”向“企业生产工具”迈出了实质性一步。目前公开信息显示,实在智能已规划工业级可靠性目标(99.99%),以及端云混合架构降低延迟与成本。对企业用户,需要关注其与现有自动化工具(如RPA)的替代或互补关系;对开发者,则需观察其实Agent的API开放程度与生态整合能力。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
- 工业级可靠性的实现路径:从90.2%到99.99%的跨越,是否依赖人机协同熔断机制、动态环境抗干扰能力和端云混合架构的同步迭代,以及这一路径能否被行业复现。
- 竞品跟进速度:GPT、Gemini、Claude等旗舰模型团队在OSWorld上的表现是否会快速追赶,以及它们各自的Harness工程优化策略是否会在公开论文或产品更新中披露。
- 产品落地与定价:实在智能的商业化阶段与定价策略尚未公开,是否面向中小企业开放,是否支持私有化部署,这些信息将直接影响其技术优势能否转化为市场份额。
来源:InfoQ CN


