SparseDitto: Customizing GPU Kernels for Different Sparsity Patterns with LLM-Based Agentic System
SparseDitto 是一个基于 LLM 的系统,为每个矩阵、算子和目标 GPU 构建 GPU 内核,支持 SpMV、SpMM 和 SpGEMM。它使用轻量级加性模型根据输入矩阵的结构特征对既定策略进行排序,并由架构感知规划器提出候选设计,编码和验证代理通过目标 GPU 上的测量进行实现和优化。在三个稀疏算子和多种矩阵上,SparseDitto 实现了 2.68 倍的几何平均加速。
Development
- First ReportSparseDitto: Customizing GPU Kernels for Different Sparsity Patterns with LLM-Based Agentic SystemarXiv cs.LG
- Current AssessmentSparseDitto 的出现表明,LLM 智能体系统正在从自然语言处理领域扩展到系统软件和硬件优化领域。这种自动化内核生成方法可能降低对专家手工调优的依赖,加速科学计算和机器学习中稀疏矩阵运算的性能优化。对于 GPU 厂商和编译器开发者而言,这预示着未来可能出现更智能的编译器和运行时系统,能够根据具体硬件和负载自动生成高效代码。Agent Pulse · analysis
SparseDitto 是一个基于 LLM 的智能体系统,用于为不同的稀疏模式定制 GPU 内核。它针对 SpMV、SpMM 和 SpGEMM 三种稀疏算子,通过轻量级加性模型对既定策略进行排序,架构感知规划器提出候选设计,编码和验证代理在目标 GPU 上实现并优化。实验表明,SparseDitto 在多种矩阵上实现了 2.68 倍的几何平均加速,优于现有方法。
SparseDitto 展示了 LLM 智能体系统在自动生成和优化 GPU 内核方面的潜力。其核心在于将稀疏模式的结构特征与执行策略的匹配问题转化为可学习的排序问题,并通过架构感知规划器生成候选设计,再由编码和验证代理进行迭代优化。这种基于测量的反馈循环使得系统能够适应不同的 GPU 架构和稀疏模式,可能为高性能计算中的内核自动调优提供新范式。
SparseDitto 的出现表明,LLM 智能体系统正在从自然语言处理领域扩展到系统软件和硬件优化领域。这种自动化内核生成方法可能降低对专家手工调优的依赖,加速科学计算和机器学习中稀疏矩阵运算的性能优化。对于 GPU 厂商和编译器开发者而言,这预示着未来可能出现更智能的编译器和运行时系统,能够根据具体硬件和负载自动生成高效代码。
SparseDitto 对于依赖稀疏矩阵运算的行业(如科学计算、图分析、机器学习)具有潜在价值,因为它可以显著提升性能(几何平均加速 2.68 倍),同时减少人工调优成本。对于 GPU 厂商和云服务提供商,这可以成为差异化优势,提供更高效的稀疏计算库。对于企业用户,采用此类技术可以降低计算成本和时间。
未来,SparseDitto 可能扩展到更多稀疏算子(如 SpTRSV)和更广泛的硬件平台(如 TPU、FPGA)。其方法也可能与自动调优工具(如 TVM)结合,形成更通用的内核生成框架。此外,随着 LLM 能力的提升,智能体系统可能处理更复杂的优化目标,如能耗和内存占用。