NVIDIA 发布 NemotronLabs VoiceChat 11B:开源全双工语音模型,支持约 450 毫秒轮换与实时工具调用

NVIDIA 发布开源语音交互模型 NemotronLabs VoiceChat 11B,实现约 450 毫秒的对话切换延迟,并支持实时工具调用,把“能听会说”的语音助手带到了可商用落地的临界点。

NVIDIA 发布开源语音交互模型 NemotronLabs VoiceChat 11B,实现约 450 毫秒的对话切换延迟,并支持实时工具调用,把“能听会说”的语音助手带到了可商用落地的临界点。

苹果在最新版Mac用户手册中确认,国内版Apple Intelligence将接入阿里千问大模型,符合条件的国行Mac升级后即可解锁完整AI能力。这是苹果首次在国内市场明确引入第三方国产大模型,意味着Siri的智能化短板有望被补齐。

腾讯WorkBuddy App更新后支持手机端查看和发起AI任务,任务状态与产出内容可在多设备间实时同步。这意味着AI Agent正在从单一设备上的问答工具,向可跨端调度的智能体演进。

OpenAI 被曝将在 8 月推出参数规模达 10 万亿的 GPT-6(内部代号 Astra),年底前还可能发布更大规模的预训练模型 Doug,这将是 GPT-4o 发布两年多后首次真正更换底层引擎。

微信正在灰度上线朋友圈“AI帮写”功能,用户发布图文动态时,AI助手“小微”可识别图片内容并自动生成文案。这是AI能力首次直接嵌入微信最高频的UGC创作入口,意味着AI应用竞争正在从独立对话产品转向场景级整合。

OpenChamber 是一款开源的“代理式”开发环境,让 AI Agent 可以跨桌面、浏览器、手机持续工作,从 GitHub issue 到合并 PR,全程不需要开发者反复切换工具。它代表了 AI 编程工具从“对话助手”向“自主执行工作流”演进的又一形态。

千问开放平台正式上线,把租房、寄快递、查理财等十余个领域的服务搬进对话界面,用户可以直接通过聊天完成事务办理。这件事值得关注的地方在于,它不再只是让大模型“回答问题”,而是开始把大模型变成实际办事入口。

xAI 于 8 月 10 日发布 Imagine Image 2.0,为 Grok 的 Web 端和移动应用带来可控性更强的图像生成能力,支持 5 张参考图融合、智能扩图和局部精准编辑。API 尚未开放,但产品形态已经明显从“聊天生图”转向“可进入创作流程的图像工具”。

OpenAI 被曝正在推进代号 Doug 的全新预训练项目,这可能是其迄今规模最大的基座模型训练计划,预计最晚 11 月落地。若消息属实,意味着 OpenAI 在 GPT-4o 之后,首次尝试对基座模型本身做出代际级升级,而不再只依赖后训练和推理阶段补能力。

OpenAI 收购了 AI 演示文稿初创公司 NextSlide,团队将并入 ChatGPT 开发。这是 OpenAI 从文本问答向办公创作场景延伸的一个明确信号,AI 辅助做幻灯片可能很快成为 ChatGPT 的常规能力。