AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年7月31日 · DeepSeek

Tokenizer-Agnostic Engram Module

发生了什么

DeepSeek 的 Engram 条件记忆模块依赖 token 级 N-gram 哈希进行嵌入查找,与分词器紧密耦合。研究者提出用通用多项式哈希替代 XOR 哈希,并采用跨 N 的联合嵌入空间,使字节等价的 token 序列哈希等价,实现 tokenizer-agnostic,且性能与原始方法相当。

EVENT STORY

发展脉络

  1. 首次出现Tokenizer-Agnostic Engram ModulearXiv cs.CL
  2. 当前判断该研究可能推动记忆模块的跨模型复用,减少因分词器差异导致的重复训练。若被广泛采用,可能影响多语言模型和跨平台部署的效率。但当前仅为研究阶段,实际应用需更多验证。Agent Pulse · 分析
改变了什么

DeepSeek 的 Engram 模块是一种条件记忆模块,用于在大语言模型中权衡存储与推理。然而,该模块依赖 token 级 N-gram 哈希进行嵌入查找,导致与分词器紧密耦合:使用不同分词器的模型需要从头训练自己的 Engram 嵌入。为提升 Engram 嵌入的可复用性,研究者提出改变哈希例程,使不同分词器的 Engram 模型兼容。他们不再建模不相交的 N-gram 空间,而是将 N-gram 视为从所有可能的字节序列中采样潜在有用字节序列的方法,并用通用多项式哈希替代 XOR 哈希,同时采用跨 N 的联合嵌入空间。实验表明,这种简单替换产生了可比的性能,并实现了 tokenizer-agnostic:字节等价的 token 序列哈希等价。

能力边界怎么变了

该工作通过将 N-gram 视为字节序列采样方法,并用多项式哈希替代 XOR 哈希,实现了跨分词器的嵌入兼容性。这避免了为每个分词器重新训练嵌入,可能降低多分词器场景下的训练成本。但需注意,性能可比性仅在特定设置下验证,且哈希碰撞风险需进一步评估。下一步可验证在更大模型和更多分词器上的泛化性。

为什么重要

该研究可能推动记忆模块的跨模型复用,减少因分词器差异导致的重复训练。若被广泛采用,可能影响多语言模型和跨平台部署的效率。但当前仅为研究阶段,实际应用需更多验证。

对谁有影响

对于使用不同分词器的模型提供商,该技术可降低记忆模块的训练成本,加速模型迭代。但当前为研究阶段,商业价值需待产品化验证。

接下来观察

未来可观察该技术是否被 DeepSeek 或其他机构集成到实际模型中,以及是否出现基于字节级 N-gram 的标准化记忆模块。若性能在更大规模上保持,可能成为记忆模块设计的默认选择。