b10481: CUDA: MMVQ nwarps=8 for bs=1 for dense models on DGX Spark (#26843)
llama.cpp 发布 b10481 版本,包含 CUDA 内核 MMVQ 的优化,将 nwarps 设为 8 以支持 batch size 为 1 的稠密模型,并针对 DGX Spark(GB10)平台调整参数,同时修复了 MSVC 的 constexpr lambda 捕获问题。
Development
- First Reportb10481: CUDA: MMVQ nwarps=8 for bs=1 for dense models on DGX Spark (#26843)llama.cpp
- Current Assessmentllama.cpp 持续针对特定硬件(如 DGX Spark)进行内核级优化,反映了开源社区对边缘和本地推理场景的重视。此类优化有助于降低推理成本,可能推动更多应用在本地设备上运行大模型。Agent Pulse · analysis
llama.cpp 在 2026 年 8 月 18 日发布 b10481 版本,主要针对 CUDA 内核 MMVQ 进行优化。该优化将 nwarps 参数设为 8,以提升 batch size 为 1 的稠密模型在 DGX Spark 平台上的推理性能。提交信息显示,该改动还涉及跳过 MoE 专家,并基于 k 几何允许仅处理小的空闲尾部,同时将 DGX Spark 参数重命名为 GB10,并修复了 MSVC 的 constexpr lambda 捕获问题。这些改动旨在优化特定硬件上的推理效率。
该提交针对 DGX Spark(GB10)平台优化了 MMVQ 内核,通过设置 nwarps=8 来适配 batch size 为 1 的稠密模型,可能改善小批量推理的并行效率。跳过 MoE 专家和基于 k 几何的尾部处理表明对稀疏模型的支持有所调整。这些改动可能影响推理延迟和吞吐量,但具体性能提升幅度未在证据中量化。
llama.cpp 持续针对特定硬件(如 DGX Spark)进行内核级优化,反映了开源社区对边缘和本地推理场景的重视。此类优化有助于降低推理成本,可能推动更多应用在本地设备上运行大模型。
该优化可能降低在 DGX Spark 上运行稠密模型的推理成本,提升本地推理效率,对依赖本地部署的开发者或企业具有潜在价值。
后续可关注该优化在 DGX Spark 上的实际性能基准测试结果,以及是否会被推广到其他硬件平台。