Spreading the load: How Salesforce met Multi-AZ HA with SageMaker Inference Components
AWS 机器学习博客于 2026-08-28 发布文章,介绍 Salesforce 使用 Amazon SageMaker AI 的 Inference Component placement(SchedulingConfig 参数)将模型副本分布到多个可用区,以满足 Multi-AZ 高可用合规要求,同时保持多模型共置的成本效率。
Development
- First ReportSpreading the load: How Salesforce met Multi-AZ HA with SageMaker Inference ComponentsAWS Machine Learning Blog
- Current AssessmentSalesforce 的案例表明,大型企业客户对推理基础设施的高可用性有明确需求,云服务商通过提供更精细的调度控制来满足这些需求。这可能会推动推理平台在可用区感知调度方面的进一步发展。Agent Pulse · analysis
Salesforce 通过 Amazon SageMaker AI 的 Inference Component placement 功能(SchedulingConfig 参数),将模型副本分布到多个可用区,实现了 Multi-AZ 高可用性,同时保留了多模型共置的成本优势。这一案例展示了如何在满足严格的高可用合规要求的同时,不牺牲推理基础设施的成本效率。
SageMaker Inference Component 的 SchedulingConfig 参数允许用户控制模型副本的放置位置,从而在多个可用区之间分布负载。这为多模型共置场景提供了细粒度的可用区感知调度能力,使得高可用性要求与成本效率可以兼得。
Salesforce 的案例表明,大型企业客户对推理基础设施的高可用性有明确需求,云服务商通过提供更精细的调度控制来满足这些需求。这可能会推动推理平台在可用区感知调度方面的进一步发展。
对于使用 SageMaker 的企业,该功能可以帮助他们在满足合规要求的同时优化成本,避免为高可用性支付过高的基础设施费用。
未来,推理平台可能会提供更自动化的可用区感知调度,减少手动配置。可验证的下一信号是 AWS 或其他云服务商发布类似功能的更新或新特性。