蚂蚁百灵发布 Ling-3.1-flash,面向真实世界长任务升级

蚂蚁百灵发布 Ling-3.1-flash,约 560B 总参数、每 Token 激活约 25B,上下文上限 1M,主打办公、医疗、软件研发等真实长流程任务;它将开放两周免费体验,免费期服务长度 256K,转付费后计划开放 1M 并同步开源。

一句话看懂:蚂蚁百灵发布 Ling-3.1-flash,约 560B 总参数、每 Token 激活约 25B,上下文上限 1M,主打办公、医疗、软件研发等真实长流程任务;它将开放两周免费体验,免费期服务长度 256K,转付费后计划开放 1M 并同步开源。

事件核心:发生了什么

蚂蚁百灵推出新一代模型 Ling-3.1-flash,延续上一代 Ling-3.0-flash 的混合线性架构,并提高线性 Attention 层占比。结构上采用 7 层 KDA 配 1 层 Gated MLA,每 8 层保留 1 层全局 Attention;参数侧设置 512 个路由专家,每个 Token 选择 8 个路由专家并调用 1 个共享专家。

官方在办公、医疗、软件工程和终端操作等方向做了评测。其中披露的案例包括:约 17 小时从零实现 Lua 原生编译器,独立测试通过 178/182 项;约 10 小时完成 Pyright 性能优化,达 1.432 倍加速;约 20 小时完成 C 图像库的 Rust 重实现,达 8.015 倍加速。此外,模型还在 OceanBase 开源版本解析器组件中发现一个可造成栈缓冲区溢出的高危内存漏洞,并完成根因定位、PoC 构造与补丁生成。

为什么重要

这批信息的关键词是“长任务”而非“长上下文”。1M 窗口只是前提,真正被检验的是模型能否在数小时执行中保持目标、任务状态和历史决策一致,并调用工具形成可检查的成果。目前公开信息显示,Ling-3.1-flash 在部分基准上接近或落后于 Claude Fable 5:Lua 编译器通过率 97.8% 对 99.0%,Pyright 加速 1.432 倍对 1.502 倍;但在 C 图像库 Rust 重实现上 8.015 倍明显高于 GLM-5.3-Flash 的 1.396 倍,仍低于 Claude Fable 5 的 27.310 倍。这说明国产模型正在把竞争焦点从“对话能力”转向“交付能力”,但在极限优化类任务上仍有差距。

对用户/开发者/创作者的影响

对开发者,模型已进入蚂蚁内部桌面协同 Agent 客户端“小虎”,能理解目标、规划步骤、调用工具并整合成果;结合 Terminal-Bench 4.0、FrontierSWE 等评测,它更适合代码库问答、调试、终端操作等场景。对普通用户和企业,办公场景强调从一句模糊需求推进到研究报告、Excel、PPT 等可交付物;医疗场景则基于阿福、好大夫等反馈用 RLVR 做对齐,把零散症状整理成就诊清单和风险说明。创作者可关注 SVG 与 Web 3D:官方称其按开放权重、近 30 天新增模型筛选后,在 Design Arena 的 Mobile App 和 SVG 类别分列开放权重模型第二和第四,并能生成可独立运行的 Three.js 单文件演示。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是两周免费体验后的正式规格与价格,尤其是 1M 上下文是否按期开放、开源许可以及推理成本;二是长任务中的思维链和交互轮数增加带来的响应时间与 Token 消耗,官方已明确把智效比列为后续优化方向;三是医疗评测结果不等同于临床安全认证,相关应用仍需专业审核,其合规边界值得持续观察。

来源:公众号:蚂蚁百灵(Ling)

celebrityanime
celebrityanime
文章: 26497

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注