AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Aug 28, 2026 · Together AI

GLM-5.3 vs. GLM-5.3 Flash on DeepSWE: Cost, Coding, and Routing

What Happened

Together AI 在 2026 年 8 月 28 日发布博客,报告了在 DeepSWE 基准上对 GLM-5.3 和 GLM-5.3 Flash 的 900 次 rollout 结果。Flash 在 pass@1 上牺牲 5.6 个点,但成本降低 17 倍;在 pass@4 上仅牺牲 2.6 个点。

EVENT STORY

Development

  1. First ReportGLM-5.3 vs. GLM-5.3 Flash on DeepSWE: Cost, Coding, and RoutingTogether AI
  2. Current Assessment该结果可能推动更多团队在成本敏感场景中采用 Flash 模型,并通过采样策略平衡性能与成本。Agent Pulse · analysis
What Changed

Together AI 于 2026 年 8 月 28 日发布博客,报告了在 DeepSWE 基准上对 GLM-5.3 和 GLM-5.3 Flash 的 900 次 rollout 结果。Flash 在 pass@1 上牺牲 5.6 个点,但成本降低 17 倍;在 pass@4 上仅牺牲 2.6 个点。

How the Capability Boundary Shifted

Flash 模型在 pass@1 上牺牲 5.6 个点,但在 pass@4 上仅牺牲 2.6 个点,表明通过多次采样可以弥补部分性能差距,同时大幅降低成本。

Why It Matters

该结果可能推动更多团队在成本敏感场景中采用 Flash 模型,并通过采样策略平衡性能与成本。

Who It Affects

对于开发者平台,提供低成本模型变体可能吸引更多成本敏感用户,增加平台采用率。

What to Watch Next

未来可能出现更多针对特定任务优化的模型变体,以及更精细的模型路由策略。