一句话看懂:阿里千问发布 Qwen3.8-LiveTranslate 同声传译大模型,用统一的 Interleave 架构把字均延迟从 2.8 秒压到 2.3 秒,并新增说话人分离、原文译文同屏、长上下文消歧三项能力,让实时传译更接近可用状态。
事件核心:发生了什么
根据 AIbase 报道,阿里千问于 2026 年 9 月 20 日推出 Qwen3.8-LiveTranslate 实时语音翻译模型。它在原有支持 60 种语言的基础上做了三处关键改动:一是实现实时说话人分离,把每句话对应到正确的人,语音复刻更稳定,减少说话人混淆或串音;二是原文与译文同屏显示,听者可以边听边看;三是增强长上下文消歧,借助前文理解当前内容,改善人名、术语这类最容易出错的翻译。
技术底座是 Hybrid MoE 的 Thinker–Talker 双模块设计。Thinker 把视频、音频、原文和译文组织成一条因果序列,按时间顺序完成端到端理解与翻译;Talker 再拿译文和原音频合成语音,并保留原说话人的音色。核心指标字均延迟(LAAL)从 2.8 秒降到 2.3 秒。
为什么重要
同传是个对延迟极其敏感的赛道,0.5 秒的差距直接决定听感是否自然。此前不少实时翻译产品在准确率、流畅度与简洁度之间难以兼顾,Interleave 架构的价值在于把流式理解、文本输出和语音生成接进同一条管线,而不是拼装多个独立模块。目前公开信息显示,这一路线若能稳定落地,会抬高大模型在会议、直播、跨境协作等场景的实用门槛,也会让同传从“能翻”走向“敢用”。对千问生态来说,这是在通用大模型之外,往实时多模态交互延伸的一步。
对用户/开发者/创作者的影响
对普通用户,原文译文同屏加音色保留,意味着跨国会议和外语直播的跟随成本明显降低,2.3 秒延迟已接近可接受的听感区间。对开发者,值得关注的是它是否会以 API 形式开放,以及是否支持接入实时音视频管线,这决定了它能否被集成进会议软件、客服系统和出海工具。对内容创作者,说话人分离和音色复刻打开了多语言配音、实时字幕的新玩法,但涉及声音克隆,合规与授权问题需要提前考虑。企业采购侧则要看并发、语种覆盖与部署方式。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是产品落地形态:是否开放 API、定价与调用限制如何。二是竞品是否跟进类似 Interleave 与说话人分离的组合。三是长上下文消歧和音色复刻在真实嘈杂场景下的稳定性,以及声音克隆相关的合规约束会不会影响上线节奏。
来源:AIbase


