Writing-System-Level Tokenizer Adaptation for Byte-Level BPE
arXiv 论文 2608.00582v1 提出 BPE-guided insertion 方法,用于在保持模型词汇表大小不变的前提下,将语言特定 tokenizer 的 token 适配到目标 byte-level BPE tokenizer。在 Nemotron 和 GPT-OSS 的乌克兰语适配中,token 数量分别减少 33.5% 和 36.6%,英语和四语言欧洲聚合的改动保持在 0.05% 以内,并保留了 78.5%/77.3% 的原始性能。
发展脉络
- 首次出现Writing-System-Level Tokenizer Adaptation for Byte-Level BPEarXiv cs.CL
- 当前判断该研究针对多语言模型在资源不足语言上的效率问题,提出了一种保持词汇表大小的适配方法。这有助于降低推理成本,同时减少对英语性能的影响。对于需要支持多语言但不想增加模型参数的团队,该方法提供了一种实用的解决方案。Agent Pulse · 分析
预训练的 byte-level BPE tokenizer 对资源不足的语言分词效率低下。直接替换 tokenizer 会改变几乎所有 token ID 的含义,而扩展词汇表会增大模型的嵌入和输出矩阵。该论文研究事后适配,保持模型词汇表大小固定,并将保留现有 token 到 ID 的映射作为构建时的兼容性属性。直接转移语言特定 tokenizer 的 token 不能保证通过目标 BPE 合并图的可派生性:插入的条目可能与目标的贪心合并排名冲突。作者将此失败形式化为合并排序问题,并引入 BPE-guided insertion,通过目标可达的分解来构建每个转移的 token。其流程使用脚本感知的行选择来限制附带碎片化,重建目标脚本的字节级先决条件,并应用引导插入来维护合并图的可达性。在 Nemotron 和 GPT-OSS 的乌克兰语适配中,token 数量分别减少 33.5% 和 36.6%,英语和四语言欧洲聚合的改动保持在 0.05% 以内,并保留了 78.5%/77.3% 的原始性能。
该方法的核心是合并排序问题:直接插入语言特定 token 可能违反目标 BPE 的贪心合并顺序,导致不可达。BPE-guided insertion 通过目标可达的分解构建 token,确保插入的 token 可以通过目标合并图派生。脚本感知的行选择减少了附带碎片化,重建目标脚本的字节级先决条件进一步提高了适配质量。这为 tokenizer 适配提供了一种无需扩展词汇表的方法,保持了模型架构不变。
该研究针对多语言模型在资源不足语言上的效率问题,提出了一种保持词汇表大小的适配方法。这有助于降低推理成本,同时减少对英语性能的影响。对于需要支持多语言但不想增加模型参数的团队,该方法提供了一种实用的解决方案。
对于提供多语言 AI 服务的公司,该方法可以在不增加模型参数的情况下提升低资源语言的分词效率,降低推理成本,同时保持英语性能。这有助于扩大市场覆盖,提升用户体验,并可能降低基础设施开销。
未来可能看到该方法被应用于更多语言和模型,验证其泛化性。也可能出现结合词汇表扩展与保持映射的混合方法。可验证的信号包括:该方法在其他语言(如阿拉伯语、印地语)上的 token 减少比例,以及在实际部署中的推理速度提升。