TELLER: Non-intrusive Cross-Layer Root-Cause Analysis for LLM Inference
TELLER 是一个非侵入式的 LLM 推理根因分析框架,通过收集 NVTX/CUPTI 追踪和服务日志,在不修改模型二进制的情况下重建请求级调用链树,并将日志行与执行步骤对齐。它引入依赖感知的因果上下文切片和 Trace Pair Encoding (TPE) 分词器,将切片压缩为包含父节点、深度和持续时间的结构标记序列,并结合数值候选定位与多模态根因模型来预测异常步骤和定位可疑点。
发展脉络
- 首次出现TELLER: Non-intrusive Cross-Layer Root-Cause Analysis for LLM InferencearXiv cs.CL
- 当前判断LLM 推理作为服务的运维需求正在催生专门的根因分析工具,TELLER 的出现表明可观测性领域正从通用 APM 转向针对 LLM 推理的专用解决方案,这可能会影响推理平台和云服务商的运维工具链。Agent Pulse · 分析
TELLER 是一个针对 LLM 推理服务的非侵入式跨层根因分析框架。随着 LLM 推理从离线工作负载演变为持续运行的软件服务,根因分析变得困难,因为单个请求跨越推理引擎、Python/C++ 后端、主机 CUDA API、GPU 内核和分布式通信。现有分析器提供原始时间线,而基于日志的诊断往往缺乏跨层执行语义和请求级结构。TELLER 通过收集 NVTX/CUPTI 追踪和服务日志,在不修改模型二进制的情况下,重建每个请求的调用链树,并将日志行与相应的执行步骤对齐。它引入了依赖感知的因果上下文切片,保留父子结构、时间顺序和通信关系,以及 Trace Pair Encoding (TPE) 分词器,将切片压缩为紧凑的结构标记序列。TELLER 结合数值候选定位和多模态根因模型,共同预测异常步骤并定位可疑点。
TELLER 的核心创新在于将追踪和日志统一为请求级因果上下文,并通过 TPE 分词器将结构信息编码为紧凑序列,使多模态模型能够联合处理数值和结构特征。这暗示了 LLM 推理可观测性正从原始时间线转向语义级根因分析,未来可能成为推理系统的标准组件。
LLM 推理作为服务的运维需求正在催生专门的根因分析工具,TELLER 的出现表明可观测性领域正从通用 APM 转向针对 LLM 推理的专用解决方案,这可能会影响推理平台和云服务商的运维工具链。
对于提供 LLM 推理服务的公司,TELLER 可降低故障排查时间,提升服务稳定性,从而减少运维成本并提高客户满意度,可能成为推理平台的关键差异化功能。
后续可关注 TELLER 是否开源、在真实生产环境中的效果评估,以及是否被主流推理框架(如 vLLM、TensorRT-LLM)集成,以验证其实际价值。