Google的新AI转录功能会删掉你的“嗯”和“啊

Google 在 Gemini 3.5 Pro 迟迟未发布的情况下,先推出了三款 Gemini Audio 新模型,其中全新的 3.5 Transcribe 可以在语音转写时自动删除“嗯”“啊”等语气词,并支持超过 85 种语言。这标志着语音交互从“听清”向“理解并整理”迈了一步。

Google 在 Gemini 3.5 Pro 迟迟未发布的情况下,先推出了三款 Gemini Audio 新模型,其中全新的 3.5 Transcribe 可以在语音转写时自动删除“嗯”“啊”等语气词,并支持超过 85 种语言。这标志着语音交互从“听清”向“理解并整理”迈了一步。

阿里 Qwen 团队发布 Qwen3.8-Flash-Next,用仅 60 亿激活参数的多模态 MoE 架构对标千亿级模型,训练成本只有前代的约九分之一,并将于近期以极低价格开放 API,进一步压缩大模型商业化的价格空间。

Anthropic 官方发布《The AI-Native SDLC Playbook》,提出当 AI 编码工具让“写代码”不再是瓶颈时,传统软件开发生命周期的规划、审查和部署环节已成为新的效率卡点,并给出了内部基于 Claude 的重构方案。

安全研究员 David Buchanan 公开证明,Android 平台上的 C2PA 相机签名机制可被 root 权限攻击伪造,即使用户完全依赖“硬件安全”也无法修复。这项认证技术被 Meta、Google 等公司视为对抗 AI 深度伪造的核心手段,其信任模型在现实设备面前已经失效。

一个由以色列政府资助并设立的假冒美国智库,在9天内发布了超过56万字的AI优化内容,试图让ChatGPT等大模型在被问及巴以问题时自动引用其亲以色列论述。这暴露了针对大模型知识来源的系统性操纵手段已经出现。

中国 AI 公司 Moonshot AI 正与微软、亚马逊和 Google 洽谈,计划将其大模型 Kimi K3 托管在 Azure、AWS 和 Google Cloud 上并参与收入分成。如果达成,这将是第一家中国 AI 公司通过美国主流云平台分发模型,商业意义远超技术合作本身。

第三方监测数据显示,ChatGPT 回复中引用 Reddit 的占比在 2026 年 8 月中旬骤降 86%,但深入分析发现 ChatGPT 仍在后台频繁抓取 Reddit 内容,只是不再在最终答案中频繁展示引用来源。对于依赖 Reddit 做 AI 可见度营销的品牌,这既是一次警示,也未必是坏消息。

AI Agent 行业竞争焦点正在从“能做多少事”转向“知道何时该停下”。The Next Web 援引 Decodo 的实测指出,多数 Agent 已能完成支付等复杂操作,但只有 Amazon 和 OpenAI 的三款产品同时具备“先确认再花钱”的暂停机制,谨慎正成为新的核心卖点。

由谷歌前安全工程师创立的 AI 数据分析平台 QueryStory 正式亮相,试图把大模型回答与企业内部数据库连接起来,用“证据链”式的叙事方式解决 AI 在严肃商业场景里“不敢信”的问题。

比尔·盖茨在近 5900 字的长文中警告,AI 对就业的冲击将从白领岗位蔓延至蓝领体力工作,并建议通过“人类保留岗位”和征收 AI 税来缓解社会动荡。这是目前科技巨头创始人对 AI 失业问题最系统的政策表态之一。