LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes
LLaDA-Image 是一个统一框架,将从头训练的 6B Diffusion Transformer (DiT) 与基于 LLaDA2.0-Mini 扩散语言模型骨干的冻结视觉语言理解模块配对。生成流程包含 220M 样本,其中 98 个为真实图像。在 DiT 中使用无参数 RMSNorm 和 Muon 优化器。蒸馏出 LLaDA-Image-Turbo,支持 2-4 步快速推理。在 Qwen-Image-Bench 上,LLaDA-Image 在英文和中文轨道分别取得 53.53 和 53.38 的分数,创下开源模型新纪录。作者发布了模型权重、训练代码和详细配方。
Development
- First ReportLLaDA-Image: Building Strong Image Generators with Fully Open Training RecipesHugging Face Daily Papers
- Industry ResponseLLaDA-Image: Building Strong Image Generators with Fully Open Training RecipesarXiv cs.AI
- Current AssessmentLLaDA-Image 在 Qwen-Image-Bench 上取得开源模型最佳成绩,表明开源图像生成模型在追赶闭源模型。完全开放的训练配方可能降低复现门槛,加速社区创新。下一步可观察:其他开源项目是否会采用类似训练策略,以及该模型在商业应用中的采用情况。Agent Pulse · analysis
LLaDA-Image 是一个统一框架,将从头训练的 6B Diffusion Transformer (DiT) 与基于 LLaDA2.0-Mini 扩散语言模型骨干的冻结视觉语言理解模块配对。生成流程包含 220M 样本,其中 98 个为真实图像。在 DiT 中使用无参数 RMSNorm 和 Muon 优化器。蒸馏出 LLaDA-Image-Turbo,支持 2-4 步快速推理。在 Qwen-Image-Bench 上,LLaDA-Image 在英文和中文轨道分别取得 53.53 和 53.38 的分数,创下开源模型新纪录。作者发布了模型权重、训练代码和详细配方。
LLaDA-Image 采用图像优先预训练和中期训练,而非依赖大量配对图像-文本数据,这暗示了视觉生成先验的重要性。使用无参数 RMSNorm 和 Muon 优化器可能提升训练效率。蒸馏出 Turbo 版本支持 2-4 步采样,表明推理加速是重点。下一步可验证:模型权重和训练代码发布后,社区能否复现基准分数,以及 Turbo 版本在更少步数下的质量保持情况。
LLaDA-Image 在 Qwen-Image-Bench 上取得开源模型最佳成绩,表明开源图像生成模型在追赶闭源模型。完全开放的训练配方可能降低复现门槛,加速社区创新。下一步可观察:其他开源项目是否会采用类似训练策略,以及该模型在商业应用中的采用情况。
LLaDA-Image 作为开源模型,可能降低图像生成技术的使用成本,使中小团队能够基于其权重构建应用。完全开放的训练配方可能吸引企业定制化训练,但需注意其 6B 参数规模对推理资源的要求。
LLaDA-Image 的开放配方可能推动图像生成领域的可复现研究。蒸馏出的 Turbo 版本可能使实时应用成为可能。下一步可关注:模型权重发布后的社区微调、下游应用开发,以及后续版本是否扩展至视频生成。