When Specifications Conflict: A Symmetry-Based Framework for Measuring LLM Preferences
arXiv 论文 2607.28384v1 提出一个基于对称性的框架,用于测量 LLM 在冲突规格下的偏好。该框架在包含 550 个冲突实例、覆盖 11 个函数族的可执行数学基准上进行了评估,比较了四种表示类型:纯自然语言、形式语言、自然化形式语言和输入-输出示例。结果显示系统性偏好模式,偏好顺序为:形式语言 ≈ 自然化形式语言 > 纯自然语言 > 输入-输出示例。
Development
- First ReportWhen Specifications Conflict: A Symmetry-Based Framework for Measuring LLM PreferencesarXiv cs.AI
- Current Assessment该研究为评估 LLM 在冲突规格下的行为提供了方法,可能影响模型对齐和可靠性评估。偏好顺序提示形式化表示在冲突解决中更受信任,这可能指导提示工程或模型训练。未来可验证信号:该框架是否被用于其他基准或实际应用中的冲突解决。Agent Pulse · analysis
该论文提出一个受控实验框架,用于研究 LLM 在冲突规格下的偏好。通过构造显式冲突的规格,直接观察模型在竞争规格间的选择。对称性设计减少混淆因素,允许跨表示类型系统比较偏好。在包含 550 个冲突实例、覆盖 11 个函数族的可执行数学基准上,比较了四种表示类型:纯自然语言、形式语言、自然化形式语言和输入-输出示例。结果显示系统性偏好模式而非随机行为,偏好顺序为:形式语言 ≈ 自然化形式语言 > 纯自然语言 > 输入-输出示例。示例效应进一步影响偏好。该框架为分析模型如何解决冲突规格提供了可控且可归因的方法。
该框架通过对称性设计减少混淆因素,使偏好测量更可控。偏好顺序表明模型更倾向于形式化表示,这可能反映训练数据中形式语言的分布或模型对结构化信息的处理优势。示例效应表明输入-输出示例可能引入偏差。未来可验证信号:在不同模型规模或训练数据下,偏好顺序是否保持稳定。
该研究为评估 LLM 在冲突规格下的行为提供了方法,可能影响模型对齐和可靠性评估。偏好顺序提示形式化表示在冲突解决中更受信任,这可能指导提示工程或模型训练。未来可验证信号:该框架是否被用于其他基准或实际应用中的冲突解决。
对于依赖 LLM 处理多源信息的应用,如文档摘要或决策支持,该框架可帮助识别模型偏好,从而设计更可靠的系统。偏好顺序提示形式化表示可能提高一致性,但需权衡可读性。未来可验证信号:该框架是否被企业用于模型选择或提示优化。
该框架可能扩展至更复杂的冲突场景,如多文档矛盾或指令冲突。未来可验证信号:是否出现基于该框架的标准化评测基准,或模型在冲突解决上的改进。