Holo4:为通用型 computer-use Agent 提供动力

Hcompany 发布新一代 computer-use 智能体模型 Holo4,提供 27B 稠密版与 35B-A3B 混合专家版,统一支持图形界面、代码、MCP 与 API 多种操作方式,并开源了全部评测轨迹。

一句话看懂:Hcompany 发布新一代 computer-use 智能体模型 Holo4,提供 27B 稠密版与 35B-A3B 混合专家版,统一支持图形界面、代码、MCP 与 API 多种操作方式,并开源了全部评测轨迹。

事件核心:发生了什么

2026 年 9 月 28 日,Hcompany 在 Hugging Face 博客发布 Holo4 系列。该系列包含两个规格:27B 稠密模型和 35B-A3B 混合专家模型,均已在 H Models API 上线,并同步更新了 Holotron 3 的升级版 Holotron4 Nano。用户可通过 Hugging Face 获取 FP16、FP8、GGUF 等格式的权重。

官方强调,Holo4 不局限于单一交互接口。它可以在桌面、网页、Android、代码沙箱和企业 API 上运行,既能点击屏幕、输入文字,也能编写并执行代码,或调用 MCP 与 API 工具。模型通过监督学习和强化学习训练,任务环境部分来自其 Agentic Task Factory。

关键数据方面,在 OSWorld 2.0 桌面控制基准上,Holo4 27B 得分为 61.7%,35B-A3B 为 30.9%;作为参照,闭源模型 Opus 5.5 在同一基准上为 81.8%。Hcompany 同时开源了每个得分背后的完整操作轨迹,供开发者逐步复现。

为什么重要

当前多数智能体模型只针对一种接口训练:偏图形界面的模型离开屏幕就失效,偏工具调用的模型遇到没有 API 的旧软件就卡住。Holo4 的技术路线试图打破这种割裂,用同一个模型、同一套调用方式覆盖多种界面。这更接近真实企业流程——一项任务往往需要同时操作界面、跑代码、调接口。

另一个信号是成本与开放度。Holo4 以远小于闭源前沿模型的参数量,在部分基准上逼近头部水平,并把所有评测轨迹公开。对开源生态来说,可复现的轨迹比单纯的分数更有参考价值,也让企业评估模型时多了一层透明度。

对用户/开发者/创作者的影响

对开发者,Holo4 的价值在于“一套模型适配多平台”。如果团队此前需要为不同设备或软件分别选型,现在可以只调用一个模型,通过 H Models API 快速接入,减少工程切换成本。开源权重也让本地部署和私有化微调成为可能。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对企业采购方,OSWorld 2.0 与 AutomationBench 上的“成本—性能”对比值得细看。Hcompany 称 Holo4 在更低单任务成本下与前沿模型竞争,但目前公开信息显示,部分对比使用不同测试环境和榜单版本,采购前仍需用自身业务场景做验证。

对创作者和普通用户,这类 computer-use 智能体意味着更多软件操作可以被自动化,例如 3D 建模、设计软件操作、跨应用数据整理。不过这类能力目前更多面向专业工作流,离消费级开箱即用还有距离。

值得关注的后续

一是 Holo4 在 AutomationBench 私有测试集上的表现尚未公布,官方表示评估后会补充,这一结果将直接影响企业客户的判断。二是 35B-A3B 版本在 OSWorld 2.0 上明显低于 27B 稠密版,混合专家架构在长流程任务中的稳定性需要更多解释。三是开源轨迹和权重能否带动第三方复现与微调,决定它能否真正进入开发者生态。

来源:Hugging Face Blog

celebrityanime
celebrityanime
文章: 26021

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注