Ray-2.58.0
Ray 2.58.0 发布,Ray Serve 完成 KV cache 和 token 感知的路由,tokenization 在 LLMRouter ingress 副本内进行,tokens 带外传输避免引擎重新 tokenize,KV 生命周期事件广播到所有 ingress 副本。Ray Core 支持将任务事件从 GCS 热路径卸载到 dashboard head。Ray Data 增加 Databricks DeltaLake 集成和新的 shuffle v2 后端。
Development
- First ReportRay-2.58.0Ray Releases
- Current AssessmentRay 作为分布式计算框架,其 LLM 推理优化表明开源生态正聚焦于推理效率。KV cache 感知路由可能成为 LLM 服务标配,影响推理基础设施设计。Agent Pulse · analysis
Ray 2.58.0 发布,重点包括 Ray Serve 的 KV cache 和 token 感知路由,Ray Core 的任务事件卸载,以及 Ray Data 的 Databricks 集成和 shuffle v2。这些改进旨在提升 LLM 推理效率、降低 GCS 负载并优化数据处理性能。
KV cache 和 token 感知路由通过将 tokenization 移到 ingress 副本,避免引擎重复 tokenize,并通过带外传输 tokens 减少延迟。KV 生命周期事件广播确保所有副本缓存一致。任务事件卸载到独立 head 减少 GCS 压力。这些设计可能成为 LLM 推理服务的参考模式。
Ray 作为分布式计算框架,其 LLM 推理优化表明开源生态正聚焦于推理效率。KV cache 感知路由可能成为 LLM 服务标配,影响推理基础设施设计。
Ray 的优化可降低 LLM 推理成本,提升响应速度,对使用 Ray 的企业有直接价值。开源特性可能吸引更多用户,增强 Ray 生态。
后续可观察 Ray 是否将 KV cache 感知路由推广到更多后端,以及任务事件卸载对大规模集群稳定性的影响。