OpenAI 详解 GPT-Live 架构如何实现了连续的有状态语音交互

OpenAI 首次公开了 GPT-Live(语音实时交互服务)的工程架构细节,核心做法是把“语音必须畅通”的实时媒体管道与工具调用等异步逻辑彻底分离,并采用有状态、可迁移的专用推理实例来保证对话连续。这套设计思路直接关系到未来实时语音 API 的稳定性与成本。

OpenAI 首次公开了 GPT-Live(语音实时交互服务)的工程架构细节,核心做法是把“语音必须畅通”的实时媒体管道与工具调用等异步逻辑彻底分离,并采用有状态、可迁移的专用推理实例来保证对话连续。这套设计思路直接关系到未来实时语音 API 的稳定性与成本。

法国 AI 公司 Mistral AI 官宣完成 30 亿欧元 D 轮融资,是欧洲科技公司史上最大规模的一轮股权融资。这标志着欧洲在 OpenAI、Google 等美国巨头主导的大模型竞赛中,正式拿到了同量级的“弹药”。

微信官方团队宣布将自研多模态向量模型 WeMM-Embedding 全面开源,发布 2B、4B、9B 三个参数版本。该模型已在微信生态内实现日调用量超 10 亿次,并在国际评测榜单 MMEB-v2 上位列同类方案第一,意味着国产多模态检索模型在商业化落地与开放生态上同时迈出关键一步。

微信视觉团队于 9 月 4 日开源通用多模态嵌入模型 WeMM-Embedding,该模型已在微信朋友圈搜索、视频号推荐等场景中大规模落地,日调用量达 10 亿次。

字节跳动创始人张一鸣正亲自督导一个全新的 AI 模型项目,目标直指“实时生成虚拟世界”。该项目若落地,将把 AI 能力从生成一张图、一段视频推进到实时交互的 3D 虚拟空间,对内容创作和游戏行业可能产生直接冲击。

小鹏机器人正式启用全球首条高阶人形机器人自动化生产线,核心制程自动化率超过80%,并已完成首台全自动装配机器人下线。这意味着人形机器人正从实验室的手工拼装阶段,向汽车级标准化量产阶段迈进。

宇树科技基于世界模型 UnifoLM-X2-1.0,实现了全球首次由世界模型实时驱动的人形机器人全自主格斗,这意味着机器人不再依赖预设动作,而是能在高动态对抗中自行决策和行动。

可灵AI(Kling AI)宣布将首次亮相2026年多伦多国际电影节(TIFF)市场,并举办行业论坛与交流活动,试图将AI视频生成更正式地推入电影级制作流程。

OpenAI 首席科学家 Jakub Pachocki 公开警告,AI 模型可能很快具备无需人工干预的自我改进能力,并呼吁各家实验室在建立通用安全阈值之前,将“自愿放缓开发”变成常态。

OpenAI 旗下 ChatGPT Work 新增个人写作风格识别能力,可通过接入 Gmail、Slack 等日常工具学习用户的用词习惯与表达特征,并自动应用在后续内容生成中。这意味着 AI 助手从“通用工具”向“理解个人语感”的助手方向又迈近一步。