XTuner Release V0.1.21
XTuner v0.1.21 发布,新增 DPO、ORPO 和 Reward Model 支持,修复了 dispatch 和 HFCheckpointHook 在 deepseekv2 和 mixtral 训练中的问题,并支持 sp size 不被 attn head num 整除的场景。
Development
- First ReportXTuner Release V0.1.21XTuner Releases
- Current AssessmentXTuner 作为开源微调工具,持续跟进对齐技术,可能降低社区进行偏好优化的门槛。修复 MoE 模型训练问题,有助于提升对混合专家模型的支持,可能吸引更多用户。Agent Pulse · analysis
XTuner 发布 v0.1.21,主要新增 DPO、ORPO 和 Reward Model 训练支持,并修复了多个 bug,包括 dispatch 问题、HFCheckpointHook 在 deepseekv2 和 mixtral 训练中的问题,以及支持 sp size 不被 attn head num 整除的场景。
该版本新增 DPO、ORPO 和 Reward Model 支持,表明 XTuner 正在扩展对齐训练能力。修复 deepseekv2 和 mixtral 的 checkpoint 问题,可能涉及 MoE 模型的参数保存逻辑。支持 sp size 不被 attn head num 整除,可能改进了序列并行下的注意力计算。
XTuner 作为开源微调工具,持续跟进对齐技术,可能降低社区进行偏好优化的门槛。修复 MoE 模型训练问题,有助于提升对混合专家模型的支持,可能吸引更多用户。
XTuner 的更新可能提升 InternLM 生态的吸引力,促进开源社区采用,间接推动相关商业服务。
后续可关注 XTuner 是否支持更多对齐算法,以及是否优化 MoE 训练性能。