一句话看懂:字节跳动正讨论训练参数超过5万亿的大模型,规模超过阿里Qwen 3.8-Max和月之暗面K3,同时张一鸣在内部明确禁止蒸馏开源模型,要求团队接受短期损失、坚持长期自研。
事件核心:发生了什么
据AIbase报道,字节跳动内部正在讨论训练一个参数规模超过5万亿的大模型,该数字超过阿里Qwen 3.8-Max(2.4万亿参数)和月之暗面K3(2.8万亿参数)。若成型,它将成为目前已知中国参数规模最大的大模型。不过计划仍处于早期阶段,存在最终不发布的可能性。
该项目由字节跳动Seed基础模型负责人向亮主导,负责大语言模型预训练数据的沈珂联合负责,Seed团队正在围绕该项目重新划分职责和调配资源。接近Seed团队的人士给出的理由很直接:与其在现有参数规模上继续追赶同行,不如把参数体量拉到同行的数倍,直接建立代差优势。
这背后有字节高层的一系列明确表态。创始人张一鸣在最近一次内部会议上罕见发声,称“做模型要坚持长期主义和延迟满足,而不是用别人的输出追逐短期排名”,并明确要求字节愿意牺牲部分短期收益换取长期目标。据报道,字节内部目前严格禁止蒸馏开源模型,甚至通过API检测手段加强限制,张一鸣认为蒸馏会干扰真正的长期技术突破。
2026年8月6日的字节全员会上,CEO梁汝波重申了这一逻辑,强调大模型业务将继续聚焦自研和基本功,接受短期挫折、坚持长期优化。他特别澄清:“昨日外部报道说我们因外部压力坚持自研,这纯属猜测。真实原因是希望团队有延迟满足感,打好技术地基,这对长期实现AGI至关重要。”
为什么重要
这不是一个单纯的技术参数新闻,而是一次完整的战略表态。字节跳动选择了一条与国内主流路径不同的路线:不做快速追赶者,不依赖蒸馏开源模型来维持短期榜单成绩,而是试图用超大参数规模加长期自研建立一个独立的技术方向。
参数规模直接关联训练成本与推理成本,5万亿参数模型的算力投入将远超行业平均水平。这个决策的意义在于:字节愿意用短期财务消耗换取潜在的技术代差,而不是继续参与“用开源模型微调出高分”的竞争循环。它同时向市场传递了信号——字节不打算跟在其他厂商的技术路线后面跑,而是想画一条自己的增长曲线。
如果按原计划落地,中国大模型的参数规模上限将被显著抬高,阿里、月之暗面等竞争对手的应对方式,以及整个行业对“大参数是否等于强能力”的讨论,都会随之改变。
对用户/开发者/创作者的影响
对普通用户而言,短期内不会直接感受到变化。相反,由于字节坚持不蒸馏开源模型,其产品(如豆包等)的某些功能迭代节奏可能暂时慢于依赖开源模型的竞品,用户需要接受这种“短期体验波动”。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对开发者和API调用方来说,字节的模型策略会直接影响接入成本和能力边界。如果5万亿参数模型最终通过火山引擎等平台开放API,其推理成本如何定价、是否提供轻量级蒸馏版本供开发者调用,是两个关键观察点。在此之前,依赖字节模型API的开发者应关注其现有模型的稳定性和迭代承诺。
对创作者而言,字节系产品的AI能力(包括图像生成、视频生成等内容工具)会受底层模型策略影响。更强调自研和长期积累的路线,未来可能带来更具差异化的生成效果,但短期不会有立竿见影的功能突破。
值得关注的后续
第一,这个超过5万亿参数的模型是否会真正启动训练并对外发布。目前公开信息显示计划仍在早期,存在变数。
第二,字节“严禁蒸馏”是否会被其他大厂跟进。如果多家头部公司都转向自研,行业对开源模型的态度和评测体系可能发生连锁调整。
第三,算力与商业化问题。5万亿参数模型的训练和推理成本极高,字节目前的算力储备能否支撑、最终如何通过产品回收投入,是衡量这个战略是否可持续的重要指标。
来源:AIbase


