Structured Memory for Edge Language Models: Persistent Context and Corpus Retrieval via O(1) SSM State Injection
PRECOG 是一种针对状态空间模型(SSM)的检索机制,通过预编码文档语料为 SSM 隐藏状态,在查询时直接注入最佳匹配状态,将预填充成本从 O(L_context) 降至 O(1)。SMC 是分层持久记忆,支持认知域聚类、保真度-存储调节和 O(1) 会话初始化。系统在 TENNs-LLM(1.2B 参数 gated-SSM 语言模型,192 KB 隐藏状态)上演示。
发展脉络
- 首次出现Structured Memory for Edge Language Models: Persistent Context and Corpus Retrieval via O(1) SSM State InjectionarXiv cs.LG
- 当前判断该工作可能推动边缘 AI 设备上的持久上下文和检索增强生成,降低内存和计算需求。若验证有效,可能影响 RAG 系统的设计,使边缘设备能处理更大语料库。验证信号:后续研究是否在更多模型上复现,以及是否有商业产品采用该机制。Agent Pulse · 分析
论文提出 PRECOG 和 SMC 两种机制,利用 SSM 固定大小、位置无关的循环隐藏状态作为输入内容的完整摘要。PRECOG 离线预编码文档语料为隐藏状态,查询时直接注入最佳匹配状态,避免上下文重新摄入,将预填充成本从 O(L_context) 降至 O(1)。SMC 构建分层持久记忆,通过认知域聚类、保真度-存储调节和 O(1) 会话初始化,将短期情景状态整合为长期语义记忆,并在查询时与检索的语料状态融合。系统在 TENNs-LLM(1.2B 参数 gated-SSM 语言模型,192 KB 隐藏状态)上演示。
PRECOG 利用 SSM 的固定大小隐藏状态作为文档的完整摘要,实现 O(1) 预填充,消除了 RAG 中与上下文长度相关的成本。SMC 提供分层记忆和 O(1) 会话初始化,可能改变边缘设备的上下文管理方式。验证信号:TENNs-LLM 在长上下文任务上的基准测试结果,以及与其他 SSM 或 Transformer 的对比。
该工作可能推动边缘 AI 设备上的持久上下文和检索增强生成,降低内存和计算需求。若验证有效,可能影响 RAG 系统的设计,使边缘设备能处理更大语料库。验证信号:后续研究是否在更多模型上复现,以及是否有商业产品采用该机制。
对于边缘 AI 设备制造商和 RAG 服务提供商,该技术可能降低推理成本和内存占用,提升响应速度。验证信号:是否有公司采用该技术并报告性能提升。
未来可能看到 PRECOG 和 SMC 在边缘设备上的实际部署,以及与其他 SSM 模型的集成。验证信号:TENNs-LLM 的公开基准测试结果,以及是否有后续工作扩展该方法。