阿里刚刚放出了下一代实时同声传译模型:Qwen3.8-LiveTranslate,字均延迟从2.8秒压到2.3秒,支持60种语言 如果延迟稳定压到2.3秒这个水平,并且在多说话人、长音频场景下DER可控,那会议、展会、跨境电商谈判等大量这种“够用就行”的场景可能会率先被AI接管 它这版做了架构重造,把同传重构为了音频—文本交织的单流形式,已听音频和已出译文都可缓存复用,从效果看整体翻译的忠实度、流畅度还可以 另外增加了三个新能力,实时…

阿里发布下一代实时同声传译模型 Qwen3.8-LiveTranslate,把字均延迟从 2.8 秒压到 2.3 秒,覆盖 60 种语言,并新增实时说话人分离、双语同屏、长上下文消歧三项能力。这意味着 AI 同传正在从“能翻”向“可用”推进。

一句话看懂:阿里发布下一代实时同声传译模型 Qwen3.8-LiveTranslate,把字均延迟从 2.8 秒压到 2.3 秒,覆盖 60 种语言,并新增实时说话人分离、双语同屏、长上下文消歧三项能力。这意味着 AI 同传正在从“能翻”向“可用”推进。

事件核心:发生了什么

阿里 Qwen 团队推出 Qwen3.8-LiveTranslate,定位是下一代实时同声传译模型。相比上一代,最直观的指标是字均延迟(LAAL)从 2.8 秒降到 2.3 秒,支持 60 种语言。架构上,它把同传任务重构成“音频—文本交织”的单流形式,已听音频和已生成译文都能被缓存复用,官方称在忠实度、流畅度和简洁度上都有提升。

功能层面新增三点:一是实时说话人分离,多人轮流发言时能识别每句话的归属,并保留对应发言人的音色;二是原文译文同帧同出、双语同屏对照;三是长上下文消歧,用于处理跨句指代和语义漂移。

为什么重要

同传一直是大模型落地里“看起来简单、做起来难”的场景,延迟、准确率和多说话人切换缺一不可。2.3 秒接近人类同传译员的自然停顿区间,如果这个水平能稳定保持,且在多说话人、长音频下 DER(说话人分离错误率)可控,会议、展会、跨境电商谈判这类“够用就行”的场景会率先被 AI 接管。架构改成单流交织后,推理链路更短,对算力和服务成本的压缩也有想象空间,这对阿里云把同传做成可规模化售卖的 API 或 SaaS 是加分项。目前公开信息显示,竞品在多语言同传上尚未给出同等量级的延迟数据,若属实,Qwen 在这一细分方向上有先发优势。

对用户/开发者/创作者的影响

开发者最直接的机会是调用同传能力做垂直应用,比如跨境会议工具、多语种直播字幕、客服实时翻译插件,说话人分离和同屏对照能显著降低二次开发成本。企业采购方可以重新评估自建同传团队与订阅 AI 服务的性价比,尤其是跨国谈判、培训、远程协作等高频场景。内容创作者则可用它做多语种视频字幕和直播分发,双语同屏直接解决了观众对“漏翻、翻歪”的不信任问题。需要注意,音色保留涉及声纹与隐私合规,出海产品要单独评估。价格和 API 开放细则目前尚未明确。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 2.3 秒延迟是否为端到端平均值,在真实网络和长音频下会不会退化;二是多说话人场景的 DER 有没有公开基准和第三方复现;三是是否以 API 或开源形式开放、定价如何,以及腾讯、字节、OpenAI 等是否跟进同类同传模型。

来源:@aigclink

celebrityanime
celebrityanime
文章: 24473

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注