腾讯Hy3 编程评测出炉:参数只有对手五分之一,代码能力却与DeepSeek-V4-Pro打平

SuperCLUE 发布了面向编程场景的模型评测,腾讯 Hy3 以 295B 总参数量、仅 21B 激活参数,在代码能力上追平了参数量数倍于它的 DeepSeek-V4-Pro,且单题推理成本仅为 0.43 元。

腾讯Hy3 编程评测出炉:参数只有对手五分之一,代码能力却与DeepSeek-V4-Pro打平

一句话看懂:SuperCLUE 发布了面向编程场景的模型评测,腾讯 Hy3 以 295B 总参数量、仅 21B 激活参数,在代码能力上追平了参数量数倍于它的 DeepSeek-V4-Pro,且单题推理成本仅为 0.43 元。

事件核心:发生了什么

7 月 8 日,SuperCLUE 公布了针对腾讯 Hy3 语言模型的编程专项评测数据。Hy3 采用 MoE(混合专家)架构,总参数 295B,激活参数仅 21B,支持 256K 上下文长度,是混元系列中官方宣称的最强模型。评测设计贴近中国程序员真实的开发场景,每道编程任务需要数十轮对话,逐步完成代码分析、修改与验证。

在代码能力得分上,Hy3 高配版拿到 47.37 分,与 DeepSeek-V4-Pro 持平。多位竞品模型的参数量是 Hy3 的数倍,但未能拉开差距。成本方面,Hy3 完成一道编程题的平均费用仅为 0.43 元。运行速度上,每道题平均耗时不到 400 秒,完成整个任务平均对话轮次超过 40 轮,每道题约消耗 116 万 token。Hy3 目前已基于 Apache 2.0 协议完全开源。

为什么重要

这次评测提供的核心信号是:在大模型竞争进入应用落地的阶段,参数规模不再是衡量能力的唯一标尺。Hy3 用五分之一的激活参数达到与旗舰模型持平的效果,说明 MoE 架构和训练策略优化可以在大幅降低算力成本的同时保持竞争力。这对整个大模型行业的商业化路径有直接意义——企业不再必须追求千亿级模型,可以用更低的推理成本实现接近旗舰的代码生成能力。

同时,开源策略叠加极低的推理单价,可能在开发者群体和中小型技术公司中形成快速采纳的生态优势。如果后续持续优化,Hy3 在编程助手、CI/CD 代码审查等高频、预算敏感的场景中,具备替代闭源模型的可能性。

对用户/开发者/创作者的影响

对使用 AI 辅助编程的开发者个人而言,Hy3 的低成本意味着在个人开发者或小型团队中,可以长期、高频率使用而不会产生高额 API 费用。目前的 0.43 元/题成本,远低于多数同能力级别模型,适合用于日常代码生成、调试和代码审查。对于企业采购和技术选型团队,Hy3 的出现提供了“性能可接受、成本可控”的新选项,尤其是在需要大量推理任务的 DevOps 流程中,可以大幅降低运行成本。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对于 AI 应用开发者,Hy3 的开源降低了二开和私有化部署的门槛,尤其适合需要可控数据流和低延迟响应的企业场景。不过需要注意的是,目前评测集中在编程场景,其在通用对话、多模态等领域的表现尚未公开。

值得关注的后续

1. Hy3 在编程之外其他维度的能力摸底:目前评测仅覆盖编程场景,其在数学推理、长文本理解、多语言等任务上的表现有待更多公开数据验证。

2. 竞品模型的定价和策略调整:DeepSeek-V4-Pro 及其他同等能力的模型是否会跟进调整价格或推出轻量级开源版本,将影响开发者的取舍。

3. 开源生态的实际落地情况:Apache 2.0 协议下社区能基于 Hy3 开发出多少有价值的应用或微调模型,是检验其长期影响力的关键。

来源:AIbase

celebrityanime
celebrityanime
文章: 14628

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注