AGENT PULSESJCPal Special EditionAI Industry Evidence & Trends
Jul 25, 2026 · SGLang

v0.5.16

What Happened

SGLang v0.5.16 发布,包含 DSpark 置信度驱动的投机解码算法,在 DeepSeek-V4-Pro 上达到 383.7 tok/s(B300 TP8)。新增 Inkling 模型支持,975B 参数多模态 MoE,1M 上下文,Blackwell 上输入 71.7k tok/s,解码 171.0 tok/s。默认启用 UnifiedRadixTree。

EVENT STORY

Development

  1. First Reportv0.1.8Xiaomi MiMo
  2. Industry Responsev0.5.16SGLang
  3. Industry ResponseRuff v0.16.0Simon Willison
  4. Current AssessmentSGLang 作为开源推理框架,持续集成前沿模型和优化技术,反映了推理引擎竞争加剧,聚焦于吞吐和成本优化。Inkling 的多模态和长上下文支持,以及 DSpark 的算法创新,可能推动行业对推理效率的重新评估。Agent Pulse · analysis
What Changed

SGLang 发布 v0.5.16,引入 DSpark 投机解码算法,基于置信度动态调整验证窗口,在 DeepSeek-V4-Pro 上实现 383.7 tok/s 的吞吐。新增对 Inkling 模型的支持,该模型为 975B 参数多模态 MoE,支持 1M 上下文,混合注意力机制,在 Blackwell 硬件上达到高吞吐。同时默认启用 UnifiedRadixTree 缓存,提升缓存效率。

How the Capability Boundary Shifted

DSpark 算法通过半自回归块草稿和置信度驱动的验证窗口,突破了固定草稿长度的限制,可能提升投机解码的接受率。Inkling 的混合注意力(滑动窗口、全注意力和 Mamba2)和 NVFP4 MoE 展示了长上下文和高吞吐的架构趋势。UnifiedRadixTree 默认化表明缓存管理正成为推理优化的关键。

Why It Matters

SGLang 作为开源推理框架,持续集成前沿模型和优化技术,反映了推理引擎竞争加剧,聚焦于吞吐和成本优化。Inkling 的多模态和长上下文支持,以及 DSpark 的算法创新,可能推动行业对推理效率的重新评估。

Who It Affects

对于部署大模型的团队,DSpark 和 Inkling 支持可能降低推理成本,提升吞吐,从而改善单位任务成本。SGLang 的持续更新增强了其作为推理基础设施的吸引力,可能影响技术选型。

What to Watch Next

后续可关注 DSpark 在更多模型上的表现,以及 UnifiedRadixTree 对缓存命中率的实际影响。Inkling 的开放权重和推理支持可能促进多模态应用的开发。