Prime Intellect 发布推理平台 Prime Inference,已上线 GLM-5.3 端点

Prime Intellect 推出推理平台 Prime Inference,提供无服务器端点和预留算力,首个公开部署的 GLM-5.3 端点已于 9 月 22 日上线 OpenRouter,主打低延迟、高可用和面向生产环境的 SLA。

一句话看懂:Prime Intellect 推出推理平台 Prime Inference,提供无服务器端点和预留算力,首个公开部署的 GLM-5.3 端点已于 9 月 22 日上线 OpenRouter,主打低延迟、高可用和面向生产环境的 SLA。

事件核心:发生了什么

Prime Intellect 原本以强化学习训练基础设施为主,提供 prime-rl、verifiers、沙箱等工具。这次发布的 Prime Inference 补齐了”训练—上线—回收生产数据”的闭环:模型训练完可以直接对外提供推理服务,产生的真实调用记录又能回流到训练环节。

据官方信息,该平台在公开发布前已内部运行近一年,每天处理近一万亿 token,用于大规模 RL rollout、合成数据生成和长时间运行的编程智能体,并从今年 1 月起承接客户生产部署。首个公开模型是 GLM-5.3,9 月 22 日上线 OpenRouter,官方称其工具调用错误率接近零、上线以来保持 100% 可用性。

为什么重要

开源模型的能力正在逼近闭源,但”能跑分”和”能稳定服务生产流量”是两回事。Prime Inference 的卖点不在跑分速度,而在持续性能、质量和可靠性——预填充与解码分离、KV 缓存感知路由、跨数据中心自动故障转移、断路器与租约式准入控制,都是为长会话智能体场景设计的。

技术栈上,它组合了 NVIDIA Dynamo、vLLM、Mooncake 和 FlashInfer,硬件当前基于 NVIDIA Blackwell,官方表示 Vera Rubin 即将支持。这意味着开源模型推理正在形成一套相对独立的工程标准,而不是简单套用闭源 API 的运维方式。

对用户/开发者/创作者的影响

对开发者来说,接口兼容 OpenAI SDK,把 base URL 指向 api.pinference.ai 即可接入现有工具链,迁移成本较低。平台同时提供无服务器端点和预留容量两种模式,适合需求波动和持续负载两类场景,团队级用量追踪和统一计费也便于控制推理开销。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对使用智能体产品的团队,预填充/解码分离带来的收益更明显:官方测试中 p90 首包间隔降低近 40%,长提示词会话的交互体验会更稳定。对内容创作者,这类端点本身不直接产出内容,但会成为图像生成、写作助手等上层应用的底层推理选项之一。

值得关注的后续

一是 GLM-5.3 端点在 OpenRouter 上的速度排名和稳定性能否长期维持,官方数据目前来自自测;二是预留容量的定价和配额策略尚未公开,这直接影响中小团队是否采用;三是 Vera Rubin 支持的时间表,以及是否有更多开源模型(尤其是 Prime 自研模型)上线该平台。

来源:Prime Intellect(网页)

celebrityanime
celebrityanime
文章: 26980

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注