AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年8月28日 · Together AI

GLM-5.3 vs. GLM-5.3 Flash on DeepSWE: Cost, Coding, and Routing

发生了什么

Together AI 在 2026 年 8 月 28 日发布博客,报告了在 DeepSWE 基准上对 GLM-5.3 和 GLM-5.3 Flash 的 900 次 rollout 结果。Flash 在 pass@1 上牺牲 5.6 个点,但成本降低 17 倍;在 pass@4 上仅牺牲 2.6 个点。

EVENT STORY

发展脉络

  1. 首次出现GLM-5.3 vs. GLM-5.3 Flash on DeepSWE: Cost, Coding, and RoutingTogether AI
  2. 当前判断该结果可能推动更多团队在成本敏感场景中采用 Flash 模型,并通过采样策略平衡性能与成本。Agent Pulse · 分析
改变了什么

Together AI 于 2026 年 8 月 28 日发布博客,报告了在 DeepSWE 基准上对 GLM-5.3 和 GLM-5.3 Flash 的 900 次 rollout 结果。Flash 在 pass@1 上牺牲 5.6 个点,但成本降低 17 倍;在 pass@4 上仅牺牲 2.6 个点。

能力边界怎么变了

Flash 模型在 pass@1 上牺牲 5.6 个点,但在 pass@4 上仅牺牲 2.6 个点,表明通过多次采样可以弥补部分性能差距,同时大幅降低成本。

为什么重要

该结果可能推动更多团队在成本敏感场景中采用 Flash 模型,并通过采样策略平衡性能与成本。

对谁有影响

对于开发者平台,提供低成本模型变体可能吸引更多成本敏感用户,增加平台采用率。

接下来观察

未来可能出现更多针对特定任务优化的模型变体,以及更精细的模型路由策略。