AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年8月2日 · SCHEDBench

SCHEDBench: A Benchmark for Evaluating LLM Constraint Faithfulness in Natural-Language Combinatorial Scheduling

发生了什么

论文提出 SCHEDBench,一个用于评估 LLM 在自然语言组合调度中约束忠实度的基准。它基于规范调度实例和求解器验证的可行性与最优性,包含 1,132 个实例,覆盖作业车间调度、单/多模式资源受限项目调度、护士排班和课程时间表问题。实例通过模板、主题实体、词汇句法改写和约束级表面形式变化生成,参考解经过可行性和最优性验证。对 13 个前沿和开源 LLM 的评估显示,模型对语义等价的调度问题表述并不可靠地不变,表面形式变化降低了可行性并导致硬约束违反的偏移。

EVENT STORY

发展脉络

  1. 首次出现SCHEDBench: A Benchmark for Evaluating LLM Constraint Faithfulness in Natural-Language Combinatorial SchedulingarXiv cs.CL
  2. 当前判断该基准为评估 LLM 在真实世界调度场景中的可靠性提供了标准化工具,可能影响企业采用 LLM 进行排程、资源分配等决策的信任度。Agent Pulse · 分析
改变了什么

SCHEDBench 是一个新的自然语言基准,用于评估 LLM 在组合调度问题上的约束忠实度,即模型在不同表面形式下是否保持相同的约束可行行为。基准基于规范调度实例和求解器派生的可行性与最优性,包含 1,132 个实例,涵盖作业车间调度、单/多模式资源受限项目调度、护士排班和课程时间表问题,难度各异。实例通过领域特定模板、主题实体、词汇句法模板改写和约束级表面形式变化生成,参考解经过可行性和最优性验证。对 13 个前沿和开源 LLM 的评估显示,模型对语义等价的调度问题表述并不可靠地不变,表面形式变化降低了可行性并导致硬约束违反的偏移。

能力边界怎么变了

该基准揭示了 LLM 在自然语言调度任务中的表面形式不变性缺陷,表明模型对语义等价的表述可能产生不同的约束满足行为。这提示当前 LLM 在理解自然语言约束时可能依赖表面线索而非深层语义,导致在调度等约束密集型任务中可靠性不足。

为什么重要

该基准为评估 LLM 在真实世界调度场景中的可靠性提供了标准化工具,可能影响企业采用 LLM 进行排程、资源分配等决策的信任度。

对谁有影响

对于依赖 LLM 进行调度和资源优化的企业,该基准提供了评估模型可靠性的方法,有助于选择更稳健的模型或开发针对性改进。

接下来观察

未来可能看到更多针对约束忠实度的基准和训练方法,以提升 LLM 在调度等结构化任务中的鲁棒性。