腾讯混元 Hy4 preview 开源:770B 参数、百万上下文,稳居开源第一梯队

腾讯今日开源混元 Hy4 preview 模型,770B 参数、49B 激活参数、1M 上下文窗口,在内部盲测中得分略高于 GLM-5.3 和 Kimi K3,暂列开源第一梯队,同时暴露了复杂任务长思考和不必要自校验等已知短板。

一句话看懂:腾讯今日开源混元 Hy4 preview 模型,770B 参数、49B 激活参数、1M 上下文窗口,在内部盲测中得分略高于 GLM-5.3 和 Kimi K3,暂列开源第一梯队,同时暴露了复杂任务长思考和不必要自校验等已知短板。

事件核心:发生了什么

腾讯今天正式发布并开源混元 Hy4 preview,模型总参数量 770B,激活参数 49B,上下文长度 1M。官方强调模型在规模、上下文和数据量三个维度同时扩容,采取了预训练与后训练并行推进的路线,称其智能水平较前代有显著提升。模型已同步上架 HuggingFace、GitHub、ModelScope 和 Gitcode,并集成至腾讯云 TokenHub 与 OpenRouter,用户可通过这些渠道直接调用或部署。

在能力验证上,腾讯组织了 163 名内部专家对 203 个工程任务进行盲测,Hy4 preview 综合得分 2.99(满分 4.00),略高于 GLM-5.3 的 2.92 与 Kimi K3 的 2.94。除通用任务外,官方还展示了面向软件工程、办公分析、游戏开发、分子动力学和凝聚态物理等垂直场景的进展,并提到 Hyra 在三维 Blaschke–Lebesgue 几何问题上将体积下限从 0.380799 推进到 0.41104,距 Meissner 四面体猜想的目标值约 2%。

官方同时承认,Hy4 preview 只是 Hy4 的早期迭代版本,预训练和后训练都还有改进空间,已知问题包括复杂任务长思维链和过度自我验证,后续会进行快速迭代。

为什么重要

这次开源的信号意义大于跑分本身。770B 参数规模配合 1M 上下文,使 Hy4 preview 在开源阵营中直接对标海外头部闭源模型的上下文能力,也意味着腾讯在开源路线上选择了重参数、高资源消耗的激进方案,而非单纯追求小参数高效率。这一选择直接拉高了开源模型在长文本处理和复杂推理场景的竞争门槛。

盲测得分虽然领先幅度不大,但考虑到它是在腾讯内部专家和内部任务上完成,对比外部榜单仍需谨慎解读。真正值得关注的是腾讯对开源生态的配合动作:同步 HuggingFace、GitHub、ModelScope、Gitcode,并接入 OpenRouter 和腾讯云 TokenHub,降低了开发者获取和接入的成本。这种全渠道分发策略,显示出腾讯希望在开源模型生态中占据入口位置,与闭源产品线形成互补。

对用户/开发者/创作者的影响

对开发者来说,Hy4 preview 的 1M 上下文窗口直接利好长文档解析、代码仓库级理解、大规模日志分析等场景,可以在一次推理中处理更完整的业务上下文,减少拆段和拼接的工程复杂度。模型已与 CodeBuddy、WorkBuddy 深度集成,腾讯系开发者工具链上的使用者可以优先体验。普通用户则可通过元宝和 ima 等产品直接试用,但需注意官方已提示当前版本存在长思维链和过度自验证问题,意味着响应速度可能比预期慢,生成结果也可能出现不必要的反复确认。

对于企业采购或技术选型团队,目前公开信息显示该模型的开源协议和商业化授权条款尚未详细披露,在正式商用前应关注后续的许可证条款和腾讯云上的定价策略。创作者若使用该模型做内容生成,需要留意长上下文的实际推理成本和延迟,尤其是在高并发生产环境中的表现。

值得关注的后续

第一,Hy4 正式版何时发布,以及 preview 阶段暴露的过度自验证和长思维问题能否在下个迭代中收敛,这直接决定模型在真实生产环境中的可用性。第二,腾讯云 TokenHub 和 OpenRouter 上的调用价格与限流策略尚未公布,价格定在什么档位,将直接影响中小开发者的采用意愿。第三,GLM、Kimi 等竞品的开源模型是否会跟进同等级别的上下文长度和参数规模——如果跟进,开源大模型的基础设施和算力成本竞赛将进一步加剧;如果不跟进,Hy4 preview 就可能在未来一段时间内占据长上下文开源模型的头部位置。

来源:AIbase

celebrityanime
celebrityanime
文章: 21255

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注