谁在何时说话一目了然:用 NVIDIA Nemotron 3 Diarization 构建实时多说话人 AI

NVIDIA 在 Hugging Face 发布开源权重模型 Nemotron 3 Diarization,用 1 亿参数把“谁在何时说话”做成可实时流式处理的说话人分离能力,并以 14.72% 的 DER 登上 VoiceArena 排行榜第一。

NVIDIA 在 Hugging Face 发布开源权重模型 Nemotron 3 Diarization,用 1 亿参数把“谁在何时说话”做成可实时流式处理的说话人分离能力,并以 14.72% 的 DER 登上 VoiceArena 排行榜第一。

Google DeepMind 于 2026 年 9 月 23 日发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,把语音生成从固定预设变成可用自然语言“导演”的创作过程。

OpenAI Academy 上线两年,累计举办 250 多场活动、触达超 400 万人;9 月 23 日官方宣布启动“社区培训师计划”,把 AI 培训能力下放到学校、职业培训机构和小企业网络等本地伙伴手中。

同一天里,Anthropic 的 Opus 5.5 宣布降价,OpenAI 又发布了 GPT-6 Sol 和 GPT-6 Luna,两款新模型的 token 价格下调 50%。Aaron Levie 认为,单位任务成本的下降速度在技术史上没有先例,而这会直接打开更多 AI 智能体(agent)的应用场景。

开发者 Thariq 在 X 上表示,工作流(workflows)已经成为他使用 Claude 的主要方式,而具备「Fable 级别智能」的模型能在成本上支撑这种用法,值得关注的是这指向了模型能力与调用成本之间的一次重新平衡。

Y Combinator 总裁 Garry Tan 在 X 上提出,应当教会更多人写好 prompt、最大化使用 AI,并借此培养主动解决问题的意愿。这一表态把当前 AI 讨论的焦点从"模型能力"拉回到"人的使用能力"上。

Peter Steinberger 在升级 macOS 27 后发现 ChatGPT 偶发崩溃,顺着崩溃线索排查,最终在底层网络库 libuv 中定位到一个约 14 年前的 macOS 文件事件路径内存泄漏问题,并提交了修复 PR。这类问题看似与 AI 无关,却直接决定了 AI 桌面应用的稳定性。
![We ran fresh Next.js evals. The tally: ① Opus 5.5 [𝟿𝟽%] ② GPT 6 Sol [𝟿𝟽%] ③ Fable 5.1 [𝟿𝟽%] ④ Grok 4.7 [𝟿𝟺%] Notably, Grok is 2x-7x cheaper https://t.co/BAUg14981G](https://www.chat-gpts.plus/wp-content/uploads/2026/09/ai_cover_1-756-768x403.jpg)
Vercel CEO Guillermo Rauch 公布了新一轮 Next.js 代码评测结果,四款前沿模型中有三款同时达到 97% 成功率,而 Grok 4.7 以 94% 紧随其后,但调用成本低 2 到 7 倍。这组数据把“顶级能力是否必须付顶级价格”这个老问题重新摆上了桌面。

Claude Code 作者 Boris Cherny 用 Opus 5.5 配合 Lean 形式化验证 Claude Agent SDK,几段简短提示词就换来 16 个修复 bug 与竞态条件的 PR,他还常把 Lean 与 TLA+ 组合使用。这提供了一个新信号:形式化验证正从学术工具变成日常找 bug…

知名创业孵化器 Y Combinator 总裁 Garry Tan 在 X 上表示,使用 Capy(@capydotai)提交 PR 的速度远快于单独使用 Codex 或 Claude Code。这条推文引发了开发者对“AI 写代码之后,谁来审代码”的讨论。