b10194
llama.cpp 发布 b10194 版本,为 CUDA 后端引入 transpose-free gemmv 计算,当权重形状为 1xK 时使用 mat_mul_vec_f 函数。
发展脉络
- 首次出现b10194llama.cpp
- 当前判断llama.cpp 持续优化推理性能,尤其是针对特定硬件和计算模式。这种细粒度的优化表明开源社区在降低推理成本方面仍有潜力,但影响范围有限。Agent Pulse · 分析
llama.cpp 发布 b10194 版本,主要更新是为 CUDA 后端添加了 transpose-free gemmv 计算。当矩阵权重形状为 1xK 时,计算会利用 mat_mul_vec_f 函数,避免转置操作,从而提升性能。该版本支持多种平台,包括 macOS(Apple Silicon 和 Intel)、Linux(多种后端)、Windows(CPU、CUDA 12/13、Vulkan 等)、Android 和 iOS。
该优化针对权重矩阵为 1xK 的特定形状,通过避免转置来减少内存访问和计算开销。这主要影响推理中与嵌入层或分类头相关的矩阵乘法,可能带来微小的延迟改善。
llama.cpp 持续优化推理性能,尤其是针对特定硬件和计算模式。这种细粒度的优化表明开源社区在降低推理成本方面仍有潜力,但影响范围有限。
对于使用 llama.cpp 部署模型的开发者,此优化可略微降低推理延迟,但影响有限。
未来可能看到更多针对特定形状的优化,以及在其他后端(如 Vulkan、ROCm)中实现类似优化。