AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Aug 5, 2026 · MSRT

Breaking the Curse ofMultilinguality inMany-to-Many Speech-to-Text Translation via a Resource-AwareMixture of Speech Encoders

What Happened

MSRT 框架提出资源感知的混合语音编码器(MoSE),用显式语言路由器将每条话语分配给合适的专家编码器:冻结专家保留高资源语言能力,可训练专家适配中低资源语言。引入五阶段课程学习,每语言仅需 10 小时配对 S2TT 数据即可有效对齐。在 45 种语言上系统评估全部 45×44 个翻译方向,4B 参数模型取得领先结果。

EVENT STORY

Development

  1. First ReportBreaking the Curse ofMultilinguality inMany-to-Many Speech-to-Text Translation via a Resource-AwareMixture of Speech EncodersarXiv cs.CL
  2. Current Assessment多语言语音翻译长期受限于低资源语言性能,MSRT 以 10 小时配对数据实现有效对齐,可能降低多语言 S2TT 系统的数据收集成本,推动更多语言对进入实用范围。4B 参数规模在可部署范围内,资源感知架构或成为多语言语音模型设计的新方向。Agent Pulse · analysis
What Changed

多模态大语言模型在语音到文本翻译(S2TT)上取得显著成功,但多语言语音输入时,单一共享语音编码器面临多语言诅咒:不同资源水平的语言竞争有限表示容量,导致高资源语言性能强而低资源语言大幅退化。为改善多语言一致性,MSRT 框架采用资源感知的混合语音编码器(MoSE),通过显式语言路由器将每条话语分配给合适的专家编码器。冻结专家保留高资源语言能力,可训练专家适配中低资源语言。五阶段课程学习大幅降低数据依赖,每语言仅需 10 小时配对数据即可有效对齐。在 45 种语言上系统评估全部 45×44 个翻译方向,4B 参数模型取得领先结果。

How the Capability Boundary Shifted

MoSE 通过显式语言路由器实现专家分配,将高资源语言能力冻结保留,同时让可训练专家专注中低资源语言,缓解容量竞争。五阶段课程学习将每语言配对数据需求降至 10 小时,显著降低数据门槛。4B 参数模型在 45 种语言的全方向评估中表现领先,表明资源感知的专家混合策略能有效提升多语言一致性。

Why It Matters

多语言语音翻译长期受限于低资源语言性能,MSRT 以 10 小时配对数据实现有效对齐,可能降低多语言 S2TT 系统的数据收集成本,推动更多语言对进入实用范围。4B 参数规模在可部署范围内,资源感知架构或成为多语言语音模型设计的新方向。

Who It Affects

对多语言语音翻译产品,MSRT 可能降低新增语言对的适配成本,缩短上线周期。4B 参数规模适合边缘或私有化部署,为面向多语言用户的企业级翻译服务提供更经济的方案。

What to Watch Next

后续可验证信号包括:MSRT 是否在更多语言对或真实场景数据上复现效果;课程学习策略是否被其他多语言任务采用;MoSE 架构是否扩展到语音识别或语音生成等相邻任务。