From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix
企业因数据驻留限制需自托管LLM,但持续采用新模型导致GPU池碎片化。一项研究将200多个内部应用的流量整合到单一模型,通过生产错误分析沿指令遵循、函数调用和内部任务分布三个轴关闭质量差距。训练每个轴的独立GRPO专家,并通过两阶段SLERP合并。非推理模式下,该模型在内部Arena上以69.6对65.8超越约7倍参数量的基线,指令遵循0.85对0.83,函数调用0.79对0.77。
发展脉络
- 首次出现From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request MixHugging Face Daily Papers
- 行业反馈From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request MixarXiv cs.CL
- 当前判断企业自托管LLM面临GPU资源碎片化问题,整合流量到单一模型可降低运维成本。该方法强调生产流量分析在模型优化中的价值,可能推动更多企业采用类似策略。Agent Pulse · 分析
数据驻留限制迫使企业自托管LLM,但持续采用新模型而不淘汰旧模型导致服务集群扩大,碎片化有限的GPU池。该研究将200多个内部应用的流量整合到单一模型,通过生产错误分析沿三个轴关闭质量差距:指令遵循、函数调用和内部任务分布。质量通过分层到生产流量的离线基准跟踪,由确定性验证器或校准的LLM评判。为避免跨域奖励干扰,他们为每个轴训练独立的GRPO专家,并通过两阶段SLERP合并。每个专家的奖励暴露不同的失败模式:语义崩溃、过度调用和冗长黑客,需要特定领域修复。非推理模式下,该配方在内部Arena上以69.6对65.8超越约7倍参数量的基线,指令遵循0.85对0.83,函数调用0.79对0.77,同时提升通用对话基准。
该方法通过生产错误分析识别质量差距,并针对每个轴训练独立GRPO专家,避免联合优化带来的跨域奖励干扰。两阶段SLERP合并专家权重,每个专家暴露特定失败模式(语义崩溃、过度调用、冗长黑客),需针对性修复。非推理模式下,较小模型在内部基准上超越约7倍参数量的基线,表明针对生产流量分布的训练可显著提升特定任务性能。
企业自托管LLM面临GPU资源碎片化问题,整合流量到单一模型可降低运维成本。该方法强调生产流量分析在模型优化中的价值,可能推动更多企业采用类似策略。
企业可减少GPU资源消耗,降低自托管成本,同时保持或提升模型质量。对提供自托管LLM解决方案的厂商,该方法可能成为产品差异化点。
后续可验证信号:该方法是否被其他企业采用,以及是否出现针对生产流量优化的商业工具或服务。