KTransformers v0.7.1: Qwen VLM and Kimi LoRA Fine-Tuning
KTransformers 发布 v0.7.1,集成 Qwen VLM 与 Kimi K2.5 / K2.6 的 LoRA 微调能力,通过 LLaMA-Factory 实现。该版本支持 Qwen3-VL-30B-A3B-Instruct 与 Qwen3.5-35B-A3B 的 BF16 图文 LoRA 微调,覆盖视觉、语言与路由专家模块;同时支持 Kimi K2.5 / K2.6 使用原始打包专家权重的原生 RAWINT4 文本 LoRA 微调,避免全模型 BF16 展开。采用 CPU–GPU 异构执行,结合主机内存与 GPU 加速。
发展脉络
- 首次出现KTransformers v0.7.1: Qwen VLM and Kimi LoRA Fine-TuningKTransformers
- 当前判断开源微调工具链正在把多模态与 MoE 大模型的适配成本往下压,KTransformers 与 LLaMA-Factory 的组合是这一方向的又一例。若 RAWINT4 路径在社区复现中稳定,中小团队对闭源微调 API 的依赖可能进一步减弱。不过单次版本发布不足以判断趋势,需观察后续采用与复现反馈。Agent Pulse · 分析
KTransformers v0.7.1 将 Qwen VLM 与 Kimi K2.5 / K2.6 的 LoRA 微调整合进同一发布,并借助 LLaMA-Factory 提供训练路径。Qwen 侧支持 Qwen3-VL-30B-A3B-Instruct 与 Qwen3.5-35B-A3B 的 BF16 图文 LoRA,覆盖视觉、语言与路由专家模块;Kimi 侧支持 K2.5 / K2.6 文本 LoRA,直接使用原始打包专家权重,避免全模型 BF16 展开。执行层采用 CPU–GPU 异构方案,把主机内存与 GPU 加速结合,面向多模态适配与个性化对话场景。发布说明同时给出 Qwen VLM LoRA 微调指南与 Kimi LoRA 训练与推理指南,并列出贡献者。
从发布说明看,该版本的关键工程取舍是让 LoRA 适配直接作用于 MoE 的路由专家与打包权重,而非先做全模型 BF16 展开,这降低了显存与内存占用门槛。CPU–GPU 异构执行把主机内存纳入可用资源池,属于对内存受限环境的务实优化。但发布说明未给出吞吐、显存占用或精度对比数据,实际收益需以官方指南中的训练命令复现后验证。
开源微调工具链正在把多模态与 MoE 大模型的适配成本往下压,KTransformers 与 LLaMA-Factory 的组合是这一方向的又一例。若 RAWINT4 路径在社区复现中稳定,中小团队对闭源微调 API 的依赖可能进一步减弱。不过单次版本发布不足以判断趋势,需观察后续采用与复现反馈。
对需要自建微调流水线的团队,该版本提供了在有限 GPU 与主机内存下适配 Qwen VLM 与 Kimi MoE 模型的候选路径,可能降低多模态与个性化对话场景的算力门槛。但发布说明未提供成本或性能数字,采购与选型决策应等待复现数据。
可验证的下一信号是官方指南中训练命令的实际资源占用与社区复现报告,以及后续版本是否把 RAWINT4 路径扩展到更多模型或推理侧。若出现第三方基准对比,才能判断该方案相对全精度微调的真实代价。