Qwen-CUA: Native Computer Use for (almost) Everything
Qwen 团队发布 Qwen-CUA,一个原生计算机使用智能体,基于 397B-A17B 的 Qwen 混合专家模型。它仅通过截图观察,并通过键盘和鼠标事件操作,不使用 DOM 树、可访问性元数据或任务特定 API。其脚手架维护最多 20 个活动截图,并将较旧的视觉历史折叠成固定大小的块。训练使用近 100,000 个 vCPU 和数万个并发环境的云部署,构建约 40,000 个可验证任务,并收集个性化长时程工作流。在八个基准测试中,Qwen-CUA 优于 Qwen3.7,并与领先的专有模型保持竞争力。
Development
- First ReportQwen-CUA: Native Computer Use for (almost) EverythingarXiv cs.CL
- Current AssessmentQwen-CUA 的发布表明,开源模型在计算机使用智能体领域正与专有模型竞争。其纯视觉方法可能降低对 DOM 和 API 的依赖,推动更通用的智能体应用。大规模云部署和可验证任务构建可能成为智能体训练的基础设施趋势。Agent Pulse · analysis
Qwen 团队发布了 Qwen-CUA,一个原生计算机使用智能体,基于 397B-A17B 的 Qwen 混合专家模型。它仅通过截图观察,并通过键盘和鼠标事件操作,不使用 DOM 树、可访问性元数据或任务特定 API。其脚手架维护最多 20 个活动截图,并将较旧的视觉历史折叠成固定大小的块,以保留近期证据并保持可重用的提示前缀。训练使用近 100,000 个 vCPU 和数万个并发环境的云部署,构建约 40,000 个可验证任务,并收集个性化长时程工作流。优化使用可验证奖励和轨迹切片,迭代训练刷新监督数据并重新校准强化学习任务。在八个基准测试中,Qwen-CUA 优于 Qwen3.7,并与领先的专有模型保持竞争力。
Qwen-CUA 的架构选择表明,纯视觉的计算机使用智能体可以通过混合专家模型和高效的视觉历史管理实现竞争力。其脚手架将视觉历史折叠成固定大小的块,可能是一种平衡上下文长度和保留关键信息的方法。训练策略结合大规模云部署和可验证奖励,可能成为长时程智能体训练的新范式。
Qwen-CUA 的发布表明,开源模型在计算机使用智能体领域正与专有模型竞争。其纯视觉方法可能降低对 DOM 和 API 的依赖,推动更通用的智能体应用。大规模云部署和可验证任务构建可能成为智能体训练的基础设施趋势。
Qwen-CUA 可能降低企业自动化中依赖特定 API 或 DOM 的集成成本,使智能体更易部署到现有软件。其纯视觉方法可能适用于更广泛的软件环境,提升自动化覆盖范围。对于开发者,可能提供新的智能体开发范式。
后续可关注 Qwen-CUA 在更多基准测试上的表现,以及其开源情况。若开源,可能推动社区开发更多基于纯视觉的智能体应用。同时,其训练方法可能被其他团队采用,加速智能体能力的提升。