模型越来越强之后,Infra 将被 AI 接管?

模型架构(MoE、全模态)的快速膨胀,正在倒逼 AI 基础设施(Infra)从“可用”走向“高效可规模化”,而国产算力的普及使异构管理成为必答题。多位一线专家认为,未来 Infra 工程师的角色可能从“手写代码”转向“定义 SLA,让模型自己完成任务”。

一句话看懂:模型架构(MoE、全模态)的快速膨胀,正在倒逼 AI 基础设施(Infra)从“可用”走向“高效可规模化”,而国产算力的普及使异构管理成为必答题。多位一线专家认为,未来 Infra 工程师的角色可能从“手写代码”转向“定义 SLA,让模型自己完成任务”。

事件核心:发生了什么

在近日 InfoQ《极客有约》栏目中,华为 AI 开源生态总监黄之鹏、Inferact vLLM committer 莫梓峰及第四范式系统研发专家杨守仁,围绕 AI 基础设施的下一阶段演进进行了讨论。核心观点包括:

  • 模型架构变得极其复杂。从 dense MoE 到带 index 的 DeepSeek V4,再到支持视频、音频、图片、机械臂 action 输出的全模态模型(如 Cosmos V),单一推理框架(如 vLLM)需要付出数月的人力重写 kernel。
  • 国产算力(昇腾、寒武纪、昆仑芯等)的异构管理成为主要挑战,某国产 GPU 在特定 shape 下存在 tensor 输出错误,只能通过 CPU offload 绕开。
  • 多模态推理面临“解耦难”问题。以千问 Omni 适配为例,AR 部分与其他组件(codec wave、diffusion)必须解耦才能异步执行,但 P2P 通信依然存在 20% 的性能 gap。
  • 开源社区被 Agent 刷 PR 问题困扰,部分维护者通过“邮箱验证是否为真人”来区分和处理 PR。
  • K8s 的 DRA 机制刚刚进入 GA,表达能力有限,无法满足灵活的共享/独占调度需求,CRD 方案在一些场景下依然更有优势。

为什么重要

模型越强,推理的复杂度与成本就越高,这直接决定了 AI 应用能否大规模落地。目前,开源社区和云厂商面临的核心矛盾是:硬件演进速度跟不上模型架构的膨胀速度。尤其是多模态模型从“单输入单输出”变成“多输入多输出”(AR + DiT + codec),传统的流水线式推理架构已经不够用。国产算力的加入虽然降低了供应链风险,却显著增加了调试和无缝调度的工作量。如果 Infra 层无法高效屏蔽这些差异,模型能力的兑现速度会严重受阻。

对用户/开发者/创作者的影响

  • AI 应用开发者:当你发现多模态模型(如千问 Omni、Cosmos V)在 API 上运行时,推理延迟可能比预期长 20% 甚至更多,原因不在模型本身,而在底层通信和调度的开销。未来在选择模型时,需要额外注意其架构是否“对推理友好”。
  • 企业技术采购者:国产 GPU 与 NVIDIA 卡之间的“一致性”依然是最大痛点。如果业务涉及多模态推理或 MoE 大模型,不建议仅依赖单一国产卡,异构混合调度方案(如基于 HAMi 或 DRA)将是必要的。做混合部署时需预留 CPU offload 空间来应对未知行为。
  • 开源贡献者与社区:社区正在经历 AI Agent 刷 PR 的治理困难。如果你提交 PR,最好通过个人邮箱(而非纯自动化账号)发布,并加上真人验证提示,否则可能因“机器人嫌疑”被直接 close。

值得关注的后续

  • vLLM 社区能否在 VLM Omni 框架基础上统一全模态模型的推理 schema,降低适配新模型的时间?
  • K8s 的 DRA 机制在进入 GA 后,能否在 2025 年内弥补“灵活调度”与“设备独家挂载”之间的空白?
  • 基于华为昇腾的国产算力集群,能否在商用场景中实现对 NVIDIA 的“无感替换”,尤其在多模态推理场景下验证一致性与性能?
GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

来源:InfoQ CN

celebrityanime
celebrityanime
文章: 15732

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注