Benchmarking and Reasoning Distillation of Large Language Models for Feedback Controller Design in Complex Dynamical Systems
CoDyControlBench 基准包含 132 个系统配置,覆盖五个评估维度:自由度、系统类型、耦合水平、阻尼机制和控制器类型。六个 LLM 在三次独立运行中评估,包括三个商业模型(GPT、Gemini、Claude)和三个开源模型(GLM、DeepSeek、Qwen)。GPT 设计成功率最高(94.8%),Qwen 最低(50.0%)。自由度和控制器类型导致模型间成功率差异最大,范围分别为 36.3% 和 17.6%。
Development
- First ReportBenchmarking and Reasoning Distillation of Large Language Models for Feedback Controller Design in Complex Dynamical SystemsarXiv cs.RO
- Current Assessment该基准填补了 LLM 在控制设计领域评估的空白,为工业界选择模型提供了参考。商业模型(如 GPT)在复杂控制任务中表现更优,但开源模型(如 GLM、DeepSeek、Qwen)的差距可能通过推理蒸馏缩小。这暗示在自动化控制领域,模型选择需权衡性能与部署成本。Agent Pulse · analysis
该论文介绍了 CoDyControlBench,一个用于评估 LLM 在复杂动态系统反馈控制器设计能力的基准。现有基准主要关注线性单自由度系统和大型 API 托管模型,忽略了复杂任务和边缘部署可行性。CoDyControlBench 包含 132 个系统配置,覆盖五个维度。评估了六个 LLM,包括商业和开源模型。结果显示 GPT 成功率最高(94.8%),Qwen 最低(50.0%)。自由度和控制器类型是影响成功率的主要因素。该基准为 LLM 在控制设计领域的应用提供了系统评估,并揭示了开源模型的差距。
该基准的维度设计(自由度、耦合水平、阻尼机制等)为评估 LLM 在控制设计中的能力提供了细粒度视角。GPT 的高成功率表明商业模型在复杂推理任务上仍具优势,而开源模型(如 Qwen)的较低成功率可能源于推理能力或领域知识不足。自由度和控制器类型对成功率影响最大,提示这些维度是模型能力的关键瓶颈。未来可探索推理蒸馏或领域微调来提升开源模型性能。
该基准填补了 LLM 在控制设计领域评估的空白,为工业界选择模型提供了参考。商业模型(如 GPT)在复杂控制任务中表现更优,但开源模型(如 GLM、DeepSeek、Qwen)的差距可能通过推理蒸馏缩小。这暗示在自动化控制领域,模型选择需权衡性能与部署成本。
对于控制系统的设计自动化,该基准可帮助工程师选择合适模型,减少试错成本。商业模型的高成功率可能推动其在工业软件中的集成,而开源模型的改进可能降低边缘部署成本。
后续可关注推理蒸馏方法在开源模型上的应用,以提升其控制设计成功率。同时,基准的扩展(如更多系统类型或实际硬件测试)可能成为趋势。