OpenAI 发布新的语音模型,实现更自然的实时对话

OpenAI 于 7 月 8 日推出两款全新语音模型 GPT-Live-1 和 GPT-Live-1 mini,采用全双工架构(可同时听说),支持更自然的实时对话与打断,并默认替换 ChatGPT 中的高级语音模式,旨在提升对话的自然度与智能性。

OpenAI 于 7 月 8 日推出两款全新语音模型 GPT-Live-1 和 GPT-Live-1 mini,采用全双工架构(可同时听说),支持更自然的实时对话与打断,并默认替换 ChatGPT 中的高级语音模式,旨在提升对话的自然度与智能性。

OpenAI 发布新语音模型 GPT-Live-1,让 ChatGPT 在对话中更少打断用户,能同时听和说,并支持实时翻译。这是语音交互从“轮流发言”到“类人对话”的实质性升级。

Meta 为 AI 眼镜推出摄像头安全功能,在 LED 指示灯被遮挡时自动禁用拍摄,试图缓解隐私担忧。但同一家公司同时在推进用公开 Instagram 照片训练 AI、探索持续录音和面部识别等功能,其整体 AI 战略要求用户交出更多数据,与安全举措形成深刻矛盾。

Mistral 于 2026 年 7 月 8 日发布了其首个机器人导航 AI 模型 Robostral Navigate,该模型仅需一个 RGB 摄像头就能让轮式、足式或飞行机器人在复杂环境中自主导航,在 R2R-CE 基准测试中以 79.4% 的成功率超越了此前所有单摄像头方案和部分多传感器方案。

OpenRouter 宣布其平台上的 Grok 模型端点将自动升级至即将发布的 Grok 4.5,开发者无需修改代码即可无缝切换最新版本。这一举措降低了 AI 模型迭代的接入成本,也折射出 API 聚合平台在模型竞争中的角色变化。

AI 工程师 Jason Liu 分享了一种将 ChatGPT Voice 当作写作助手的实用工作流——通过 20 分钟的语音口述完成文章初稿,而模型仅以简短回应维持对话感,不打断思路。这一模式展现出语音交互在内容创作场景中的真实价值,不再只是炫酷演示。

OpenAI 于 2026 年 7 月 8 日推出 GPT-Live,这是一款基于全双工架构的语音模型,能够同时听和说,实现更自然的人机对话。该模型已集成至 ChatGPT Voice,并面向全球用户推出 GPT-Live-1 和 GPT-Live-1 mini 两个版本。

GitHub Mobile 现在支持通过 Copilot 云代理直接在移动端修复拉取请求(PR)的合并冲突。开发者可以在手机上启动 Copilot,无需切换设备即可解决 PR 阻塞问题,这进一步将 AI 代码辅助能力延伸到移动工作流中。

OpenAI 学院联合沃尔顿家庭基金会,将于 2026 年暑期在美国多个城市举办面向 K-12 教育工作者的 AI 技能训练营,为超过 1600 名教师和管理员提供实操培训。此举旨在将 AI 从“概念讨论”推向日常教学应用,背后是教师使用 AI 后平均每周节省近 6 小时的调研数据。

npm v12 正式发布,默认关闭了依赖安装时的自动脚本执行、Git 和远程 URL 依赖解析,同时开始逐步废弃能绕过 2FA 的细粒度访问令牌(GAT),从账户操作到发布环节全面收紧安全策略。