LM-GRASP: Instance-Specific Language Models for Combinatorial Construction via Online Imitation Learning
LM-GRASP 提出将 GRASP 的随机构造阶段重构为在线模仿学习任务,每个问题实例从头训练。局部搜索作为专家,解码器 Transformer 作为构造策略,通过行为克隆在精英轨迹动态档案上在线训练,无需外部数据或离线预训练。
Development
- First ReportLM-GRASP: Instance-Specific Language Models for Combinatorial Construction via Online Imitation LearningarXiv cs.LG
- Current Assessment该研究可能推动组合优化领域从离线预训练范式转向实例级在线适应,降低对大规模数据集和预训练算力的依赖。若该方法在标准基准上表现优异,可能吸引优化软件供应商和云服务商关注,将其集成到求解器中。可验证信号:后续论文的引用和复现情况,以及是否有商业产品采用类似思路。Agent Pulse · analysis
LM-GRASP 是一种混合元启发式框架,将组合优化中的 GRASP 随机构造阶段转化为在线模仿学习问题。与依赖固定问题类别离线数据集训练的神经构造器不同,LM-GRASP 在每个实例上从头训练策略,局部搜索作为专家 oracle,解码器 Transformer 作为构造策略。通过迭代的 learn-infer-improve 循环,在动态精英轨迹档案上进行行为克隆,无需外部数据或离线预训练。该方法完全数据驱动,无需问题特定的特征工程,仅通过目标评估与领域交互。
LM-GRASP 的核心创新在于将在线模仿学习与元启发式搜索结合,使构造策略从搜索过程中发现的高质量解中涌现。这避免了传统神经构造器的高预训练成本和分布外泛化问题。可验证的下一信号:在更多问题类别(如车辆路径、调度)上的基准测试结果,以及与其他在线学习方法(如在线强化学习)的对比。
该研究可能推动组合优化领域从离线预训练范式转向实例级在线适应,降低对大规模数据集和预训练算力的依赖。若该方法在标准基准上表现优异,可能吸引优化软件供应商和云服务商关注,将其集成到求解器中。可验证信号:后续论文的引用和复现情况,以及是否有商业产品采用类似思路。
对于依赖组合优化的行业(如物流、制造、金融),LM-GRASP 可能降低定制求解器的开发成本,因为无需为每个问题类别收集大规模训练数据。其在线适应能力可能使求解器在环境变化时无需重新训练。可验证信号:是否有企业尝试将该方法应用于实际业务问题,并报告成本或效率改进。
未来可能看到 LM-GRASP 扩展到更复杂的组合优化问题,并与其他元启发式(如模拟退火、遗传算法)结合。在线学习机制可能使模型在动态环境中持续适应。可验证信号:作者后续工作或相关论文中是否报告了在更大规模实例上的性能提升。