一句话看懂:历时一年多,美国初创公司 Reflection 发布首个开源编码大模型 Beam,总参数 501B、激活 23B,主打编码、Agent 与科研任务,权重采用 Apache 2.0 协议,计划本月放出。这是美国开源阵营少见的一次重量级补位,但公开对比显示它仍未追上中国头部开源模型。
事件核心:发生了什么
Reflection 发布的 Beam 是一个纯文本 MoE 模型,总参数 5010 亿、激活 230 亿,训练数据为 23.8 万亿 token,部分来自对数亿份 PDF 的 OCR 处理管道。官方称其预训练与强化学习各耗时约四周,使用约 10500 块 GB300,强化学习阶段在 1M 任务上完成超过 1 亿次 rollout。Reflection 自报 SWE-bench Verified 得分 80.9,推理效率约为 GLM 5.2 的 3 至 4 倍。团队同期承诺发布技术报告与开源集成。独立评测机构 Artificial Analysis 已提前拿到模型,认为它可能成为同智能水平下 token 效率最高的开源模型之一。不过观察者普遍把 Beam 定位在 GLM-5.2 附近,部分基准仍低于 DeepSeek V4 Flash。
为什么重要
Beam 的关键词是“美国从零训练的开源权重”。当前开源编码模型的第一梯队多来自中国团队,Reflection 此举让美国开源生态多了一个可验证的选项,也让它从长期 stealth 状态正式进入“新实验室”行列。更值得注意的是算力账本:据 Axios 报道,Reflection 每月为 Colossus 算力支付 1.5 亿美元,并签下 10 亿美元的 Nebius 协议。这种烧钱强度说明,愿意在本土做从零训练的开源玩家仍然存在,但门槛极高。技术层面,有分析认为 Beam 是一次“等 FLOPs 复刻 DeepSeek V3”的尝试,架构上采用 3:1 交错的全局与滑动窗口注意力,预训练 BF16 MFU 估计仅约 12%。
对用户/开发者/创作者的影响
对开发者而言,Beam 的价值目前更多在“多一个可自托管的编码与 Agent 底模”,尤其适合对 token 成本和推理效率敏感的批量任务。Apache 2.0 权重一旦如期开放,企业可以在私有环境部署,不必依赖闭源 API。但要注意:SWE-bench 成绩为官方自报,独立复现尚未铺开;若你的工作流依赖最强编码能力,现阶段仍应把 GLM、Kimi、Qwen、DeepSeek 等开源模型纳入对比。对创作者和普通用户,Beam 短期内不会直接改变日常工具,但它可能压低编码类 Agent 产品的推理成本。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是权重是否按承诺在本月放出,以及技术报告能否解释训练细节和评测口径;二是 Artificial Analysis 等第三方评测的完整结果,尤其是长上下文和 Agent 任务表现;三是美国其他实验室是否跟进发布开源模型,以及 Reflection 的巨额算力投入能否换来可持续的商业模式。


