KTransformers v0.7.0
KTransformers v0.7.0 发布,扩展了 MoE 模型的微调和部署能力。主要改进包括:LoRA 微调全面支持 AVX512 x86 CPU(无需 AMX),自动选择 CPU 实现;支持 VLM 微调,包括 Qwen VLM MoE 架构;支持 DeepSeek-V3.1 的原生 FP8 LoRA 微调,直接从检查点加载块级 E4M3 路由专家权重和缩放因子。
Development
- First ReportKTransformers v0.7.0KTransformers
- Industry Responsev0.1.0llama.cpp
- Industry Responsev0.1.1llama.cpp
- Industry Responsev0.1.2llama.cpp
- Industry Responsev0.5.4LMCache
- Current AssessmentKTransformers 作为开源项目,其更新反映了 MoE 模型微调工具链的成熟,可能推动更多中小团队在低成本硬件上微调大型 MoE 模型。Agent Pulse · analysis
KTransformers v0.7.0 发布,扩展了 MoE 模型的微调和部署能力。主要改进包括:LoRA 微调全面支持 AVX512 x86 CPU(无需 AMX),自动选择 CPU 实现;支持 VLM 微调,包括 Qwen VLM MoE 架构;支持 DeepSeek-V3.1 的原生 FP8 LoRA 微调,直接从检查点加载块级 E4M3 路由专家权重和缩放因子。
KTransformers v0.7.0 通过支持 AVX512 和原生 FP8 LoRA,降低了 MoE 模型微调的硬件门槛,并避免了 FP8 权重的物化开销。这暗示了在异构 CPU-GPU 环境下,MoE 微调可以更高效地利用 CPU 资源。
KTransformers 作为开源项目,其更新反映了 MoE 模型微调工具链的成熟,可能推动更多中小团队在低成本硬件上微调大型 MoE 模型。
对于依赖 MoE 模型的企业,KTransformers v0.7.0 可能降低微调成本,加速模型定制化部署。
后续可关注 KTransformers 对更多 VLM 架构的支持,以及 FP8 微调在更多模型上的应用。