2026年8月26日 · KTransformers
v0.7.0.post1: feat(GLM): add native GLM-5.3-flash support (#2173)
KTransformers 发布 v0.7.0.post1,新增对 GLM-5.3-flash 的原生支持,并包含 SwiGLU 限制、FP8 专家层感知批量传输等特性。
EVENT STORY
发展脉络
- 首次出现v0.7.0.post1: feat(GLM): add native GLM-5.3-flash support (#2173)KTransformers
- 当前判断KTransformers 作为开源推理框架,快速跟进 GLM-5.3-flash 支持,反映开源生态对国产模型的适配加速,可能推动 GLM 系列在开发者中的采用。Agent Pulse · 分析
KTransformers 在 v0.7.0.post1 版本中新增了对 GLM-5.3-flash 模型的原生支持,同时引入了 SwiGLU 限制用于块 FP8 专家,以及 FP8 层感知批量传输功能,支持 TP1/2/4/8 的层感知传输。该版本还更新了相关文档并简化了发布公告。
该版本聚焦于 FP8 推理优化,通过层感知批量传输和 SwiGLU 限制提升块 FP8 专家的性能,可能降低显存占用并提高吞吐。
KTransformers 作为开源推理框架,快速跟进 GLM-5.3-flash 支持,反映开源生态对国产模型的适配加速,可能推动 GLM 系列在开发者中的采用。
对于使用 GLM 模型的开发者,该版本提供了更高效的推理路径,可能降低部署成本,提升应用响应速度。
后续可关注 GLM-5.3-flash 在推理性能上的基准测试结果,以及 KTransformers 对其他新模型的支持节奏。