v0.26.1rc0
vLLM 发布 v0.26.1rc0 版本,修复了 ROCm 上的 test_ocp_mx_wikitext_correctness 参考值问题。
Development
- First Reportv0.26.0vLLM
- Industry Responsev0.26.1rc0vLLM
- Current AssessmentvLLM 作为开源推理引擎,其快速迭代(v0.26.0 到 v0.26.1rc0 仅隔一天)反映了 AI 推理框架领域对稳定性和性能的持续追求。对 AMD ROCm 的修复表明开源生态正在积极拓展硬件兼容性,以降低对 NVIDIA 的依赖。Agent Pulse · analysis
vLLM 于 2026 年 7 月 27 日发布 v0.26.1rc0 版本,主要修复了 ROCm 平台上的 test_ocp_mx_wikitext_correctness 参考值问题。此前发布的 v0.26.0 版本包含 411 次提交,来自 212 位贡献者,新增 Inkling 模型家族支持、DeepSeek-V4 性能优化、fp32 lm_head 等功能。
v0.26.1rc0 是一个补丁版本,专注于修复 ROCm 上的测试正确性问题,表明 vLLM 在持续完善对 AMD GPU 的支持。v0.26.0 中引入的 Inkling 模型家族支持包括基础建模、CUDA 图、注意力机制、推测解码、LoRA 和量化,体现了对新型模型架构的全面适配。
vLLM 作为开源推理引擎,其快速迭代(v0.26.0 到 v0.26.1rc0 仅隔一天)反映了 AI 推理框架领域对稳定性和性能的持续追求。对 AMD ROCm 的修复表明开源生态正在积极拓展硬件兼容性,以降低对 NVIDIA 的依赖。
vLLM 的持续更新降低了企业部署大模型推理的成本和门槛,特别是对 AMD 硬件的支持可能为寻求替代 NVIDIA 方案的企业提供更多选择。
可关注 vLLM 后续版本是否进一步优化 Inkling 模型性能,以及是否扩展对其他硬件平台(如 Intel、Apple Silicon)的支持。