黑森林实验室FLUX3 多模态模型登场:单次生成 20 秒音视频,胜率碾压Grok与Seedance

黑森林实验室(Black Forest Labs)推出了全新的多模态基础模型FLUX3,该模型采用统一架构,可一次性生成最长20秒的视频及原生同步音频,并在人工评测中取得了显著优于Grok Imagine Video和Seedance的胜率,标志着视频生成领域从纯视觉向“音画同步”多模态输出的重要跃迁。

黑森林实验室(Black Forest Labs)推出了全新的多模态基础模型FLUX3,该模型采用统一架构,可一次性生成最长20秒的视频及原生同步音频,并在人工评测中取得了显著优于Grok Imagine Video和Seedance的胜率,标志着视频生成领域从纯视觉向“音画同步”多模态输出的重要跃迁。

2026年7月24日,红果短剧发布《关于规范AI剧集角色创作的公告》,明确要求AI生成的角色必须具有高辨识度,禁止跨剧复用相似角色面容,同时划定三条版权红线。这是短剧平台首次针对AI生成内容的同质化与侵权问题出台专项治理规则,意味着AI短剧行业正从野蛮增长转向精细化运营。

英美两家AI安全机构联合发布评测,显示月之暗面Kimi K3在漏洞利用和网络攻击模拟两项测试中,得分仅为美国前沿模型的40%左右,但依然领先国内同行智谱GLM-5.2。评测结果与近期“用Anthropic Fable模型输出蒸馏训练K3”的指控形成交叉印证,引发对开源模型安全能力真实水平的讨论。

Vercel 的 AI Gateway 新增实时语音转录功能,能将音频流直接转录为文本流,标志着 Vercel 的 AI 基础设施在实时语音交互领域迈出关键一步。

Claude 语音模式已升级,现在支持接入更强大的模型(如 Opus 和 Sonnet),并能在对话中调用用户已连接的第三方工具(如邮箱和日历),同时新增对西班牙语、法语、印地语、日语等多语言支持,即日起在公开测试版中向所有用户开放。

Anthropic 旗下 Claude 的语音模式于 2026 年 7 月 23 日更新,正式使用 Claude Opus 和 Sonnet 等更强的模型进行对话,同时支持在对话过程中调用用户已连接的邮件、日历等工具。该功能已作为公开测试版在移动端、桌面端和网页端上线。

Anthropic 已将 Claude 的语音模式升级至更强大的模型(包括 Opus 和 Sonnet),并在所有套餐中新增西班牙语、法语、印地语和日语支持。该功能已进入公开测试阶段,用户可在移动端、桌面端和网页端使用。

OpenAI 于 2026 年 7 月 23 日将 ChatGPT Voice 功能带入桌面端,用户现在可以语音控制计算机、指挥多个 AI 代理在 ChatGPT Work 或 Codex 中并行工作,底层由 GPT-Live 模型驱动,支持实时对话与任务协调。

Madhu Guru 在 X(原 Twitter)上发表的简洁对比,引发了对 AI 模型能力边界(jagged frontier)与团队人才管理之间类比的热议。其核心观点是:优秀的构建者知道如何探测和利用 AI 模型在特定任务上的不均衡表现,而优秀的领导者同样需要理解其团队成员在不同场景下的能力起伏。

Box 的 CEO Aaron Levie 在 X 上发帖认为,AI 最有效的用法是作为已有专业领域的“力量倍增器”,只有专家才能驾驭 AI 产出高质量成果,而缺乏判断力和兴趣的“第三类人”只能制造大量低效的“垃圾内容”。这一观点与剑桥学者 Henry Shevlin 的“内化知识是 AI 时代的创造性原材料…