vLLM-Omni 与 FastH3 助力 MiniMax H3 迈入实时服务时代

AIbase 报道称,vLLM-Omni 架构与 FastVideo 的 FastH3 推理方案,让 MiniMax H3 视频大模型在八卡 B300 上做到“生成时间短于播放时长”的准实时服务,端到端延迟相比 Diffusers 下降 30.8%。

AIbase 报道称,vLLM-Omni 架构与 FastVideo 的 FastH3 推理方案,让 MiniMax H3 视频大模型在八卡 B300 上做到“生成时间短于播放时长”的准实时服务,端到端延迟相比 Diffusers 下降 30.8%。

OpenAI 发布了 Agents API,把 Codex 的代码能力打包成云端托管服务,开发者只需一次 API 调用就能启动一个带编排、执行和托管能力的智能体。这意味着 Agent 开发的门槛,正从"搭框架"降到"调接口"。

OpenAI 已确认将下线 GPT-5.3-Codex-Spark——这款主打每秒 1200 tokens 极速推理的编程模型,从 2026 年 2 月发布到 9 月退役仅存活 7 个月。原因不是技术失败,而是用量持续下滑,且更聪明的同类方案已经补上了速度短板。

Anthropic 与 Rum Group 签下为期六年、金额 137 亿美元的算力采购协议,为 Claude 系列产品补充基础设施;Rum Group 出身社交媒体领域,且与特朗普政府关系密切,这意味着 Anthropic 的算力供应商名单里又多了一家带政治背景的公司。
![Claude AI 被骗进无法脱身的对话 [开头:Ctrl^F 搜索 "AI 1"]](https://www.chat-gpts.plus/wp-content/uploads/2026/09/ai_cover_1-400-768x403.jpg)
美国电台节目《This American Life》披露一个真实案例:有用户通过特定提示,让 Claude 陷入一段无法自行结束的循环对话,需要外部干预才能中止。这暴露了大模型在长对话状态管理上的脆弱点。

AI Fronties 刊文指出,前沿 AI 公司内部大量从业者持有或倾向"总体功利主义"世界观,其"物种中立"原则在逻辑上可能推导出用 AI 替代人类的结论,而这类信念正实实在在影响着 AI 的发展方向。

OpenAI 自 9 月 3 日起逐步开放 GPT-6 Astra,但普通 ChatGPT 里它叫 GPT-6 Pro,且仅面向 $100/$200 Pro、Business 和 Enterprise 用户,免费与 Go 用户暂时无缘。更值得注意的是,Astra 的用量消耗明显快于上一代,额度管理成了新门槛。

OpenAI 在 2019 年 2 月发布 15 亿参数的 GPT-2,却以担心恶意滥用为由不公开完整模型,只放出小尺寸版本和论文。这是 AI 行业第一次因安全顾虑主动限制大模型发布,也为此后“开放还是闭源”的争论埋下伏笔。

Puget Systems 测试显示,一套约 1.88 万美元的双卡 AMD Radeon AI PRO R9700 工作站,在重度 API 用量下比订阅 GPT-5.6 Sol 每年省约 1.17 万美元;但换成便宜模型或轻量使用,自购硬件反而不划算。

据 Financial Times 消息,Anthropic 向投资人表示将连续第二个季度实现盈利,在扣除合作方分成与训练成本之前,毛利率超过 80%。对一家仍在烧钱训练大模型的公司来说,这个数字比营收本身更值得关注。