支持耳语与情绪控制!Fish Audio 周年重磅发布 S2.1Pro 实时对话语音模型

Fish Audio 在周年庆发布了生产级实时对话语音模型 S2.1Pro,首帧延迟低至 90 毫秒,支持通过文字指令控制耳语、紧张笑声等情绪,并可用 10–30 秒音频完成高质量语音克隆。这标志着语音 AI 正从“读稿式”TTS 转向真正可商用的实时交互对话。

Fish Audio 在周年庆发布了生产级实时对话语音模型 S2.1Pro,首帧延迟低至 90 毫秒,支持通过文字指令控制耳语、紧张笑声等情绪,并可用 10–30 秒音频完成高质量语音克隆。这标志着语音 AI 正从“读稿式”TTS 转向真正可商用的实时交互对话。

OpenAI内部数据显示,ChatGPT周活跃用户数正逼近10亿,但这一里程碑比预期晚了七个月才接近达成。增长放缓背后,Google Gemini、GPT-5口碑问题以及Anthropic Claude正三路分流其用户注意力——聊天机器人市场从“一超”转向“多强”竞争。

OpenAI 悄悄更新了 ChatGPT 的规则,不再允许用户让模型完整模仿在世作家的独特文笔,仅可参考主题、叙事逻辑等抽象元素;已故作家则不受限制。这一调整旨在主动规避版权纠纷,是 AI 创作领域合规操作的一次重要试探。

来自OpenAI、Anthropic、谷歌、Meta等公司的1134名AI员工联名致信美国政府,要求建立国际合作机制来有意识地放缓AI开发速度。OpenAI CEO奥特曼一改此前反对态度,罕见公开支持这一倡议,表明行业内部对“AI自我进化失控”的担忧已从边缘走向主流。

英伟达黄仁勋开通 X 后首推公开信支持开放权重 AI 模型,却遭 Anthropic 员工嘲讽要求先开源 CUDA、Windows;吴恩达加入争论,划清“企业有权闭源”和“无权阻止他人开源”的边界,揭示开源与闭源之争正从技术讨论滑向商业和政策博弈。

模型聚合平台 OpenRouter 在近日发布了名为 langchain-openrouter 的专用 Python 集成包,让 LangChain 开发者能以一行代码切换、调用其平台上的 400 多个模型,并自动获得多提供商负载均衡与故障切换能力。这意味着开发者不再需要手动拼接第三方基座地址(base_ur…

来自 OpenAI、Anthropic、谷歌和 Meta 等头部 AI 公司的 1100 多名员工联合签署公开信,呼吁美国政府主导国际合作,开发能够“把控”AI 发展速度的治理工具。OpenAI CEO 奥尔特曼在接受播客采访时也明确表态支持这一方向,这与他在 2023 年反对类似“放缓 AI”倡议的立场形成…

开源项目 Deltafin 用混合计算方案,让一台 64GB M1 Max 工作站本地运行 2.8 万亿参数的 Kimi K3 MoE 大模型,推理速度仅为 0.0687 token/s(约 14.6 秒生成一个 token)。虽然速度极慢,但它证明了“模型远超硬件”的本地推理路径可行。

马斯克公开宣布Grok 4.6将于2026年8月7日正式发布,随后几周内将推出参数规模达2.1万亿的Grok 4.7。这是xAI首次以如此密集的节奏公布下一代模型路线图,表明其正在加快追赶对手的速度。

马斯克的SpaceXAI在7月29日宣布为AI助手Grok上线“Build”模式,用户只需输入自然语言提示,就能直接生成带独立域名的完整在线应用,目前仅向月费300美元(约2034元人民币)的SuperGrok Heavy顶级订阅用户开放。这一功能将Grok从对话型AI推向“一句话生成应用”的创作平台,直接挑…