Quantization Effects on Biomedical LLM Reliability
arXiv 论文 2608.03854v1 对三种 Mistral-7B 变体(Base、BioMistral、Instruct)在 PubMed RCT 句子分类(n=2000)上,在 FP16、INT8、INT4 精度下使用四种提示模板进行受控评估。主要发现:概率提取协议主导表观校准。从求和改为均值 token 对数似然评分会反转模型间的校准排名:BioMistral 的平均期望校准误差从 0.097 增至 0.289,而 Instruct 从 0.237 降至 0.096;专门模型的准确率变化小于 1 个百分点,基础模型变化 4-6 个百分点。提示模板选择产生 7-24 个百分点的准确率差异。
Development
- First ReportQuantization Effects on Biomedical LLM ReliabilityarXiv cs.LG
- Current Assessment该研究强调在医疗等高风险领域,LLM 分类器的可靠性受实现细节(提示模板、评分规则)影响显著,可能超过模型选择。这提示行业在评估和部署 LLM 分类器时,需将实现选择作为关键变量,否则校准和准确率结论可能不可复现。Agent Pulse · analysis
arXiv 论文 2608.03854v1 报告了对三种 Mistral-7B 变体(Base、BioMistral、Instruct)在 PubMed RCT 句子分类任务(n=2000)上的受控评估,覆盖 FP16、INT8、INT4 精度和四种答案文本提示模板。核心发现是概率提取协议(求和 vs 均值 token 对数似然)主导表观校准:切换评分规则使 BioMistral 的平均期望校准误差从 0.097 升至 0.289,而 Instruct 从 0.237 降至 0.096,同时准确率变化对专门模型小于 1 个百分点,对基础模型为 4-6 个百分点。提示模板选择造成 7-24 个百分点的准确率差异,与模型级效应相当或更大。在一个模板上 BioMistral 优于 Instruct,尽管总体均值仅 favor Instruct 1.3 个百分点。
该研究将提示模板、verbalizer 和评分规则视为实验变量,而非固定实现细节。概率提取协议(求和 vs 均值 token 对数似然)对校准的影响超过模型选择,可反转模型校准排名。提示模板造成的准确率差异(7-24 个百分点)与模型级差异相当或更大。这提示在部署分类器时,实现选择(模板、评分规则)可能比模型架构或量化精度更影响可靠性。
该研究强调在医疗等高风险领域,LLM 分类器的可靠性受实现细节(提示模板、评分规则)影响显著,可能超过模型选择。这提示行业在评估和部署 LLM 分类器时,需将实现选择作为关键变量,否则校准和准确率结论可能不可复现。
对使用 LLM 分类器的团队,该研究提示:校准和准确率结论可能因提示模板和评分规则而反转,影响模型选型和部署决策。忽略这些实现细节可能导致错误的高估或低估模型可靠性,进而影响医疗等领域的合规与安全。
后续可验证信号:其他研究是否在更多任务和模型上复现评分规则对校准的排名反转效应;是否有标准化评估协议出现,将提示模板和评分规则纳入默认报告;量化精度(INT4/INT8)与评分规则交互作用是否在更大模型上表现一致。