Training-Free versus Training-Based Intent Classification in LLMs: Accuracy, Robustness, and Failure Modes
arXiv 论文 2608.02415v1 系统比较了 LLM 意图分类的训练无关与训练方法,发现两者在简单基准上饱和,训练方法在困难任务上更优,训练无关方法对混合意图和对抗提示更鲁棒。
发展脉络
- 首次出现Training-Free versus Training-Based Intent Classification in LLMs: Accuracy, Robustness, and Failure ModesarXiv cs.CL
- 当前判断意图分类是模型路由的关键,训练无关方法可降低部署成本,无需标注数据,适合快速适配新任务;训练方法在精度要求高的场景仍有价值。混合意图和对抗鲁棒性对实际系统重要,训练无关方法可能更适合安全敏感场景。Agent Pulse · 分析
该研究系统比较了 LLM 意图分类的训练无关与训练方法。训练无关方法基于内部表示的统计,训练方法包括 MLP 分类器和线性探针。实验发现:在简单基准(数学 vs 编码 vs 自然语言)上,两类方法均饱和;在困难任务(如 Java vs Python)上,训练方法有优势;训练无关方法对混合意图和对抗提示更鲁棒。
训练无关方法基于内部表示统计,可能利用 LLM 隐式编码的语义特征,而训练方法通过监督信号学习判别边界。在困难任务上,训练方法能捕捉更细粒度差异,但可能过拟合;训练无关方法对分布外提示更鲁棒,可能因为其不依赖特定训练分布。
意图分类是模型路由的关键,训练无关方法可降低部署成本,无需标注数据,适合快速适配新任务;训练方法在精度要求高的场景仍有价值。混合意图和对抗鲁棒性对实际系统重要,训练无关方法可能更适合安全敏感场景。
对模型路由和推理优化有直接价值:训练无关方法可减少标注和训练成本,加速部署;训练方法在精度敏感场景提供更高准确率。企业可根据任务难度和鲁棒性需求选择方法,优化成本与性能。
未来可探索结合两者优势的混合方法,或利用 LLM 内部表示设计更鲁棒的分类器。可验证信号:后续研究是否在更大基准上验证鲁棒性,或训练无关方法在真实路由系统中的表现。