网界
网络资讯 网界财经 科技人物 数据洞察 行业动态 智能出行 智能手机 数码极客 商业资讯

千问发布 Qwen3.8-LiveTranslate 同声传译大模型:原文译文同屏出,字均延迟压到 2.3 秒

2026-09-20来源:CHINAZ编辑:瑞雪

阿里千问今天推出了同声传译大模型 Qwen3.8-LiveTranslate。它用一套 Interleave 架构把实时同传从头重构了一遍,准确度、流畅度和简洁度一起往上抬,字均延迟(LAAL)从2.8秒降到2.3秒——对同传这种"慢一秒就跟不上讲话人"的场景来说,这0.5秒的压缩直接决定了听感是否自然。

在已经支持60种语言的基础上,新模型又补了三块让同传真正能落地的拼图。第一是实时说话人分离,每句话归到对应的人头上,音色复刻也更稳,不会再出现甲乙不分、声音串味;第二是原文译文同帧同出,双语同屏显示,听的人能边听边对;第三是长上下文消歧,模型会联系前文来读懂当下,人名、术语这类最容易翻错的地方精准度明显提升。

底子上是基于 Hybrid MoE 的 Thinker–Talker 双模块设计,靠 Interleave 把流式理解、文本输出和语音生成串成一条线。Thinker 把视频、音频、原文和译文编排进同一条因果序列,按时序交替排列、端到端产出,让"听懂"和"译出"在同一个序列里完成;Talker 再拿着译文和源音频,把译文合成为保留原说话人音色的语音——也就是说,翻译出来的声音还是那个讲话人的声音。

在覆盖14个语向的多说话人长音频评测集 Omnilingua-MSpeaker 上,它在翻译忠实度、流畅度、简洁度以及说话人分离错误率(DER)四个维度上,全都压过了当前行业主流的实时同传系统;公开 FLEURS 测试集上跑的70个语言方向里,它在翻译质量、字均延迟、语音识别准确率和语音合成质量四项上同样领先上一代和主流系统。目前尝鲜体验入口和模型 API 都已开放,同传这个长期被专业译员把守的高门槛场景,正被大模型一步步推成人人可用的基础设施。