使用ChatGPT Voice的前后对比

OpenAI推出的ChatGPT Voice功能,正在改变用户与AI的交互方式——从打字提问到语音对话,许多人发现自己的坐姿和体态都因此发生了显著变化。这不仅仅是体验升级,更可能推动语音成为AI应用的主流入口。

OpenAI推出的ChatGPT Voice功能,正在改变用户与AI的交互方式——从打字提问到语音对话,许多人发现自己的坐姿和体态都因此发生了显著变化。这不仅仅是体验升级,更可能推动语音成为AI应用的主流入口。

OpenAI 产品负责人 Peter Yang 在 X 上透露,未来 ChatGPT 将支持同时运行多个语音线程,用户可以像组织一个团队会议一样,让多个 AI 角色相互对话并与用户交流。这一功能暗示了 ChatGPT 可能从单线对话向多智能体协作场景演进。

Replit 创始人 Amjad Masad 表示,他开发的国际象棋自动研究 Agent 通过自主实验,在“现代 LLM 微调”领域取得了类似博士级别的研究成果。这一举动展示了大模型在自我驱动、复杂推理与实验设计上的能力边界,而非单纯生成代码或文本。

一位科技创作者在X平台上发起了一项关于是否应将ChatGPT Work更名为“ChatGPT Vibe”的公开讨论,引发了超过21.5万次浏览量、近1800条回复和数千次互动。这个看似轻松的提议实际上反映了用户对AI工具命名与产品定位之间关系的深层关注。

Black Forest Labs 于 2026 年 7 月 23 日以 Early Access 形式推出 FLUX 3 多模态基础模型,首次将图像、视频和音频统一到一个训练框架中,支持单次生成最长 20 秒的带原生音频视频,并已在视频生成人工评测中超过 Grok Imagine Video 等竞品。

德国 AI 初创公司黑森林实验室(Black Forest Labs)发布了 Flux3,这是首个原生支持音频生成的多模态基础模型,能以一次推理方式输出最长 20 秒的音画同步内容,在评测中胜过了多家头部竞品。这意味着多模态模型首次将“听”和“看”完整融合到一个统一底座中。

2026年菲尔兹奖得主、数学家雅各布·齐默尔曼在获奖后宣布将加盟OpenAI,专注于AI安全研究。这位解决了数论核心猜想的顶尖学者跨界转向,释放出AI安全领域对基础数学人才的吸引力已达到顶级的信号。

腾讯于7月23日宣布,将其多模态模型部门与大语言模型部门合并,组建新的基础模型部,由腾讯首席AI科学家姚顺雨统一管理。此举旨在打破图像理解和语言生成两条技术路线的研发壁垒,集中资源冲击全模态大模型的上限。

2026年7月23日,新晋菲尔兹奖得主、IMO满分得主Jacob Tsimerman在获奖后公开宣布将研究重心转向AI安全,并已加入OpenAI。这一举动表明,顶尖数学人才正在向AI安全领域加速流动,OpenAI正在借顶级数学家的推理能力强化其安全对齐研究。

快手正式推出“AI互动内容”创作功能,面向首批创作者开放招募,标志着短视频平台的竞争从时长争夺转向交互体验。此举旨在通过AI驱动的互动内容(如角色对话、分支剧情、轻应用)延长用户停留时间,并为平台推荐算法提供更丰富的行为数据。