STARFlow2: Bridging Language Models and Normalizing Flows for Unified Multimodal Generation
Apple 研究团队发布 STARFlow2,一种统一多模态生成模型,将自回归归一化流与语言模型结合,用于交错文本-图像序列的生成。
发展脉络
- 首次出现STARFlow2: Bridging Language Models and Normalizing Flows for Unified Multimodal GenerationApple Machine Learning Research
- 当前判断Apple 在统一多模态生成领域的布局表明,大型科技公司正从单一模态模型转向多模态统一模型。STARFlow2 可能推动多模态模型在视觉保真度和结构对称性上的改进,影响后续研究方向和产品应用。Agent Pulse · 分析
Apple 机器学习研究团队于 2026 年 8 月 25 日发布 STARFlow2,旨在解决统一多模态模型的结构性碎片化问题。现有方法要么通过离散 tokenization 牺牲视觉保真度,要么结合因果文本生成与迭代扩散去噪导致结构不对称,要么在将视觉-语言模型适配为生成模型时降低预训练理解能力。STARFlow2 观察到自回归归一化流本质上是自回归 Transformer,与 LLM 共享因果掩码、KV-cache 机制和从左到右的结构,因此将其作为统一框架的基础。
STARFlow2 的核心洞察是自回归归一化流与自回归 Transformer 在结构上等价,这为统一多模态生成提供了新思路。它可能利用归一化流的连续特性避免离散 tokenization 的视觉信息损失,同时保持自回归生成的因果结构。下一步可验证的信号包括:是否在图像生成质量上超越离散 token 方法,以及是否能在保持理解能力的同时实现生成。
Apple 在统一多模态生成领域的布局表明,大型科技公司正从单一模态模型转向多模态统一模型。STARFlow2 可能推动多模态模型在视觉保真度和结构对称性上的改进,影响后续研究方向和产品应用。
STARFlow2 若成功,可提升 Apple 在 AI 生成内容方面的能力,应用于图像编辑、创意工具等场景,增强其生态竞争力。
STARFlow2 可能为多模态生成提供新的技术路径,未来可关注其开源情况、在 Apple 产品中的应用,以及是否引发更多关于归一化流与自回归模型结合的研究。