一句话看懂:蚂蚁集团将在 2026 年 QCon 上海站分享新一代大模型训练数据处理系统 Altum,试图用系统化工程手段解决训练数据环节的 GPU 效能、任务稳定性和交付时效难题。
事件核心:发生了什么
QCon 全球软件开发大会·2026 上海站已启动,定于 10 月 22 日至 24 日举办,主题聚焦「Harness AI 时代的工程实践」,覆盖 AI Native 架构、Agent Runtime、AI Infra、Data Systems 等 20 个专题论坛,将有 100 多位一线专家参与分享。
其中,蚂蚁集团新一代大模型训练数据处理系统 Altum 技术负责人王鑫确认出席「AI Infra:算力效率决定规模化落地」专题,发表《Altum:蚂蚁集团新一代大模型训练数据处理系统设计与实践》。王鑫是 Apache 软件基金会成员,担任多个 Apache 顶级项目 PMC Member、Committer 及孵化器项目 Mentor,此前曾就职阿里巴巴并参与大数据领域早期创业。目前公开信息显示,他当前重点关注 AI Data Infra 建设。
根据演讲提纲,Altum 的方案横跨算力、引擎、平台、数据多个层次:在性能上做异构算力融合调度、基于数据湖存储 Paimon 的端到端升级、全局去重与增量计算等算子优化;在稳定性上引入样本级重试、端到端可观测与 SLA 保障、熔断保护与智能运维诊断;在研发效率上提供场景化 Pipeline 和逐条数据多轮 Agent 处理能力。落地场景包括蚂蚁内部「阿福」「百灵」等业务。
为什么重要
大模型能力的竞争早已不只在模型结构或训练算法,训练数据管线的效率直接决定模型迭代速度。当数据规模持续上升、迭代周期不断压缩,数据侧的 GPU 利用率、任务稳定性、交付时长往往成为瓶颈。Altum 提出的「高失败率、低吞吐、高交付时长」三角困局,是许多做预训练和后训练的团队共同面对的工程问题。
更值得注意的是,蚂蚁选择把异构算力调度、数据湖存储优化和 Agentic 数据处理放在同一套体系里讲,而不是单点工具。这反映了 AI Infra 正在从「买卡跑训练」走向全链路资源编排——模型决定 AI 能做什么,系统决定 AI 能否真正创造价值。
对用户/开发者/创作者的影响
对开发者而言,Altum 涉及的样本级重试、端到端可观测、熔断保护等机制,是构建自有训练数据管线时的可参考思路,尤其适合面临「全量重跑烧 GPU」问题的团队。对数据工程方向的从业者,基于 Paimon 的数据湖端到端优化、异构算力统一抽象,可能会影响后续技术选型。需要注意的是,王鑫也坦承统一抽象会牺牲各引擎的独有优化,做不到「零损失抽象」;样本级重试的熔断阈值同样存在「误杀抖动」与「无效烧卡」之间的平衡难题。这些取舍对实际落地更有参考价值。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
第一,Altum 是否会在 QCon 分享中披露可量化的性能指标,例如 GPU 利用率提升幅度、样本级重试带来的成本下降比例。第二,该系统目前主要服务于蚂蚁内部业务,是否有开源或对外产品化的计划。第三,Agentic 数据处理支持逐条数据多轮 Agent 处理,这条路线能否在更多训练场景中被验证和复用。
来源:InfoQ CN


