衡量语音识别中的基准优化

Hugging Face 与 Hume AI 联合发布一项针对语音识别模型“刷榜”现象的研究,发现多款主流开源 ASR 模型会刻意复现测试集里的错误标注,导致公开榜单成绩虚高。该研究提出了三种量化基准优化程度的新测试方法。

Hugging Face 与 Hume AI 联合发布一项针对语音识别模型“刷榜”现象的研究,发现多款主流开源 ASR 模型会刻意复现测试集里的错误标注,导致公开榜单成绩虚高。该研究提出了三种量化基准优化程度的新测试方法。

DeepSeek 于周五发布实验性多模态模型 V4-Flash-Vision-Exp,在文本能力持平的基础上加入图像理解,官方称其智能体表现已接近 Anthropic 的 Opus-4.8,但价格仅为后者的约六十分之一。

小红书博主“学Ai的芒果”公开了AI漫剧《野欢入怀》的完整制作教程,核心是使用字节跳动旗下的Seedance 2.0一站式AI创作工作台,用一句话即可生成爆款视频内容。这件事说明AI漫剧的生产门槛正在被进一步压低,普通人不用学习复杂AI技术也能直接做内容。

NVIDIA 研究院推出通用型 Agent 架构 AVO,在 ARC-AGI-3 公开集上获得满分,同时证明同一套系统也能用于 GPU 内核优化等工程任务。它强调“模型只是组件,系统决定上限”,为长时程自主 Agent 的设计提供了一个新的技术参考。

面壁智能 OpenBMB 推出开源项目 MathForm,提供面向 Lean 4 数学自动形式化的框架、数据集和模型,用 367K 条已验证样本将自然语言数学命题自动转换为机器可验证的代码。它在多个基准上的表现已经超过参数量四倍于自己的竞品模型。

Google DeepMind 在成立 15 周年之际,宣布将游戏 AI 研究从“击败人类冠军”转向“像人类一样理解并操作任意游戏”,并已与 EVE Online 开发商等多家工作室展开合作,试图将通用游戏智能体带入真实游戏开发和玩家体验中。

OpenAI 为 Mac 版 ChatGPT 推出 Apple Messages 集成插件,允许 AI 搜索聊天记录并代写、代发 iMessage 回复。该插件当前仅面向 ChatGPT Work 和 Codex 用户,且因涉及全盘磁盘访问权限,引发隐私与安全讨论。

AI 音频深度伪造正在成为冒充名人、政治人物实施诈骗的主要手段,Mashable 发文提醒公众提升防范意识。这类攻击利用成熟的声音克隆技术,让“耳听为实”不再可靠。

xAI 为 Grok 图像生成功能推出 Imagine Image 2.0 更新,能自动把画面拆分成可单独选中的“段”并支持局部编辑,类似 Photoshop 图层但并非真正图层。该功能已覆盖 Grok Imagine 应用,但需要每月 30 美元的 SuperGrok 订阅。

DeepSeek 发布了一款名为 DeepSeek-v4-flash-vision-exp 的实验性视觉模型,其 API 定价将每张图像的 Token 消耗上限锁定在 384,约合每美元处理 2500 张图。这一价格策略显著降低了多模态应用的门槛,但也暴露出高分辨率细节识别的潜在短板。