XTuner Release V0.1.18
XTuner 发布 v0.1.18 版本,包含多项修复和功能:支持 mixtral varlen attention、支持 qwen sp 和 varlen attention、修复 default_collate_fn 中的 attention mask,并接受 pytorch==2.2 以解决 triton 2.2 中的 bug。
Development
- First ReportXTuner Release V0.1.18XTuner Releases
- Current AssessmentXTuner 作为开源训练工具,持续跟进模型架构演进(如 Mixtral、Qwen),反映了开源生态对高效训练框架的需求,也体现了社区协作在解决实际问题中的作用。Agent Pulse · analysis
XTuner 发布 v0.1.18 版本,主要更新包括:支持 Mixtral 和 Qwen 的变长注意力(varlen attention),修复默认 collate 函数中的注意力掩码问题,并接受 PyTorch 2.2 以规避 Triton 2.2 的 bug。这些改进增强了 XTuner 对混合专家模型和长序列训练的支持,提升了训练效率和稳定性。
变长注意力支持意味着 XTuner 可以更高效地处理不同长度的序列,减少 padding 带来的计算浪费,对长上下文训练尤为重要。接受 PyTorch 2.2 表明项目在积极适配新版本依赖,以解决底层库的兼容性问题。
XTuner 作为开源训练工具,持续跟进模型架构演进(如 Mixtral、Qwen),反映了开源生态对高效训练框架的需求,也体现了社区协作在解决实际问题中的作用。
对于使用 XTuner 的团队,该版本提升了训练效率和稳定性,降低了长序列训练的成本,有助于加速模型迭代。
未来 XTuner 可能继续扩展对更多模型架构和训练特性的支持,如长上下文、稀疏注意力等,以保持竞争力。