Why self-hosted inference is essential: Building a reliable, sovereign inference layer
Red Hat 的一篇博客文章指出,许多团队在构建 agent 时默认使用第三方托管 API(如 OpenAI、Anthropic、Google),因为自托管开源权重模型在 agentic 工作负载中不够可靠。文章主张构建可靠、自主的推理层,并强调自托管推理的重要性。
发展脉络
- 首次出现Why self-hosted inference is essential: Building a reliable, sovereign inference layerRed Hat AI
- 当前判断Red Hat 作为企业级开源解决方案提供商,强调自托管推理的重要性,反映了企业对数据主权和可靠性的需求。这可能导致更多企业考虑混合云或本地部署推理基础设施,而非完全依赖第三方 API。同时,这也可能推动开源模型和推理工具链的改进,以满足企业级可靠性要求。Agent Pulse · 分析
Red Hat 发表博客文章,讨论自托管推理在 agent 工作负载中的必要性。文章指出,尽管团队在开发中可能使用 LangChain 或 CrewAI 等框架,但推理通常运行在第三方托管 API 上,因为开源权重模型在自托管环境中不够可靠。作者认为,为了确保 agent 能够可靠地调用工具,需要构建一个可靠、自主的推理层。文章强调,身份、治理和工具访问都无济于事,如果模型无法可靠地执行推理。
文章暗示,开源权重模型在自托管环境中的可靠性不足,是阻碍其被广泛采用的关键技术瓶颈。这可能涉及推理延迟、稳定性、并发处理或工具调用准确性等问题。对于工程师而言,需要关注如何优化自托管推理的可靠性,例如通过模型量化、推理加速或更稳健的调度策略。
Red Hat 作为企业级开源解决方案提供商,强调自托管推理的重要性,反映了企业对数据主权和可靠性的需求。这可能导致更多企业考虑混合云或本地部署推理基础设施,而非完全依赖第三方 API。同时,这也可能推动开源模型和推理工具链的改进,以满足企业级可靠性要求。
对于企业而言,自托管推理可以降低长期成本、确保数据主权并满足合规要求。Red Hat 通过强调这一需求,可能旨在推广其 OpenShift AI 等产品,为企业提供可扩展、可靠的推理基础设施。这有助于企业在保持控制权的同时,利用 AI 能力。
未来,随着开源模型和推理技术的进步,自托管推理的可靠性可能提升,从而减少对第三方 API 的依赖。企业可能会采用混合策略,根据工作负载的敏感性和可靠性要求,在自托管和托管 API 之间动态选择。可验证的信号包括:开源模型在 agentic 基准上的性能提升,以及企业级推理平台(如 Red Hat 的解决方案)的采用率增长。