千问推Qwen3.8-LiveTranslate:同传延迟压到2.3秒,还能保留原音色

0 阅读

同传延迟再压缩:2.3秒是什么概念?

如果你参加过国际会议,大概率经历过这样的场景:讲者说完一句话,等两三秒后耳机里才传来翻译。这中间的等待就是“端到端延迟”——从声音输入到译文语音输出的总耗时。过去几年,主流系统普遍在3秒左右徘徊,而千问最新发布的Qwen3.8-LiveTranslate把这一数字压到了2.3秒。

别小看这0.5秒的差距。在快节奏对话中,超过2.5秒的延迟会让听者明显感到“断层”,影响理解流畅度。2.3秒已经接近人类同传译员的反应速度(通常为2–2.5秒),意味着机器翻译开始真正具备“实时对话”的能力。

这次提速的关键在于架构重构。上一代模型采用分阶段处理:先语音识别成文本,再翻译,最后合成语音。三个环节串行执行,每一步都累积延迟。Qwen3.8-LiveTranslate则用了一种叫“音频-文本交织”(Interleave)的新结构,把声音信号和文本token混合编排成一条因果序列,让模型在听到部分语音的同时就开始预测后续翻译内容,实现理解、翻译、合成三步并行。

不只是快:三大实用功能解决真实痛点

速度之外,这次升级更值得关注的是三个贴近实际场景的能力。

首先是实时说话人分离。多人讨论时,系统能自动区分不同发言者,并确保每句译文准确对应到原说话人。这意味着会议记录可以直接按人归类,不用后期手动整理。更特别的是,译文语音会模仿原说话人的音色特征——男声不会变成女声,低沉嗓音也不会突然变尖。虽然不是100%复刻,但音高、语速、语气等关键维度已足够让人一听就知道“这是张总在说话”。

其次是原文与译文同帧输出。屏幕上同时显示源语言和目标语言,且严格对齐时间轴。这对需要核对专业术语或法律条文的用户尤其有用。比如医生听一场医学讲座,既想快速理解内容,又担心机器误译关键剂量单位,双语对照就能兼顾效率与准确性。

最后是长上下文消歧。传统同传模型只看当前句子,遇到“它”“该方案”“前述条款”这类指代就容易翻错。Qwen3.8-LiveTranslate会跨轮次关联历史对话,结合上下文判断指代对象。测试显示,在包含大量专业名词和复杂指代的商务谈判录音中,其术语一致性错误率比竞品低约18%。

QQ20260920-092718.jpg

架构揭秘:Thinker 和 Talker 如何分工协作

支撑这些能力的是一套名为 Hybrid MoE 的 Thinker–Talker 双模块设计。

Thinker 模块专注“理解+翻译”。它接收交织后的音频-文本序列,输出高质量译文文本。这里用了稀疏激活的混合专家(MoE)机制,在保证精度的同时控制计算开销。值得注意的是,Thinker 并不直接生成完整句子,而是以流式方式逐词输出,为低延迟打基础。

Talker 模块负责“语音合成”。它的输入包括两部分:一是 Thinker 输出的译文文本,二是从原始语音中提取的说话人嵌入(speaker embedding)。通过条件生成技术,Talker 能在保持译文准确的前提下,让合成语音带上原说话人的声学特征。团队透露,音色保留效果在中文、英语、日语等主流语言上表现最好,小语种因数据有限仍有提升空间。

两个模块并非完全独立。在训练阶段,它们通过共享部分底层表示进行联合优化;推理时则通过缓存机制减少重复计算。这种设计平衡了性能与资源消耗——实测显示,在同等硬件下,Qwen3.8-LiveTranslate 的吞吐量比上一代提升约35%。

QQ20260920-092354.jpg

实测表现:在Omnilingua-MSpeaker上全面领先

为了验证效果,团队构建了一个名为 Omnilingua-MSpeaker 的评测集。它包含14个语向(如中英、英日、法西等)、覆盖60种语言,所有样本均为真实会议录音,含多人交替发言、背景噪音、口音变异等复杂因素。

评估指标除了传统的 BLEU、TER 等翻译质量分数,还新增了四项实用维度:

  • 说话人分离错误率(SSER):衡量系统是否正确分配每句话的归属
  • 音色相似度(VCS):通过听众盲测评分判断合成语音与原声的接近程度
  • 双语对齐精度:检查原文与译文在时间轴上的同步误差
  • 跨轮指代准确率:测试模型能否正确解析跨句指代

结果显示,Qwen3.8-LiveTranslate 在全部14个语向上均优于现有主流系统(包括某国际大厂的实时翻译API和开源项目Whisper-Multilingual)。尤其在 SSER 和 VCS 两项上优势明显——前者平均低12%,后者听众评分高出0.8分(5分制)。

不过也有局限。在极低信噪比(如嘈杂展会现场)或超长单句(>25秒无停顿)场景下,延迟仍会短暂飙升至3秒以上。团队承认这是当前流式架构的固有瓶颈,下一步计划引入自适应缓冲策略来缓解。

已上线60语种,下一步瞄准长期记忆

目前,Qwen3.8-LiveTranslate 已通过千问AI平台开放API,支持60种语言互译,包括中文、英语、西班牙语、阿拉伯语、俄语、葡萄牙语、法语、德语、日语、韩语等主流语种,以及泰语、越南语、印尼语、土耳其语等区域语言。

开发者调用时可指定是否启用音色保留、是否开启双语输出等选项。基础版免费额度足够小型会议使用,企业级客户可申请定制化部署,支持私有化模型和专属说话人音色库。

至于未来方向,团队明确提到三点:一是继续压缩端到端延迟,目标是稳定进入2秒以内;二是探索“跨会话长期记忆”,让模型记住用户过往会议中的术语偏好(比如你总把“blockchain”译作“区块链”而非“区块链接”);三是扩展更多低资源语种,特别是非洲和南太平洋地区的语言。

这些进展或许不会立刻改变普通人的日常,但对于跨国企业、国际组织、远程医疗和在线教育等领域,一个更自然、更少“机器感”的同传工具,正在让跨语言沟通真正变得无缝。