From Sports to Safety: Benchmarking Proactive Risk Inference in MLLMs
SPRINT(Sports Proactive Risk INference Testbed)是一个包含 2,888 个真实世界体育视频(2,440 个事故、448 个安全对照)的基准,覆盖 14 种运动和 3 种环境设置。事故视频包含早期危险线索、事故时间和分层原因的细粒度标注;安全视频经人工验证无事故,用于诊断提示引发的误报。评估最先进的 MLLM 显示,最佳模型在信号危险方面超过 95%,但在识别原因方面低于 50%。显式危险查询会引发严重误报。
Development
- First ReportFrom Sports to Safety: Benchmarking Proactive Risk Inference in MLLMsarXiv cs.CL
- Current AssessmentSPRINT 基准为安全关键型 AI 应用(如自动驾驶和跌倒检测)提供了评估工具。当前 MLLM 在危险信号检测上表现良好,但因果理解不足,这限制了其在需要解释和决策的安全场景中的可靠性。误报问题进一步表明,模型在实际部署中可能产生不必要的警报,影响用户体验和信任。这推动行业关注模型的可解释性和鲁棒性,以及更精细的评估基准。Agent Pulse · analysis
SPRINT 基准测试评估多模态大语言模型(MLLM)在真实世界体育视频中主动推断物理危险的能力。现有 MLLM 评估侧重于有害内容或一般风险,忽略了主动物理危险预测。体育提供了合适的测试平台,因为事故原因涵盖多种伤害维度,事故前的时空线索依赖于与自动驾驶和跌倒检测等更广泛安全领域共享的推理能力。基准包含 2,888 个视频,其中事故视频有细粒度标注。评估结果显示,模型在危险信号敏感性与原因理解之间存在显著差距:最佳模型信号危险超过 95%,但识别原因低于 50%。诊断实验表明,显式危险查询即使在无危险视频上也会引发严重误报。
SPRINT 基准揭示了 MLLM 在主动风险推断中的关键短板:危险信号检测与因果理解之间存在显著能力差距。最佳模型在信号危险方面超过 95%,但在识别原因方面低于 50%,表明模型可能依赖表面线索而非深层因果推理。显式危险查询引发严重误报,说明提示设计对模型行为有显著影响。这提示未来需要改进模型对时空因果关系的推理能力,并开发更鲁棒的提示策略以减少误报。
SPRINT 基准为安全关键型 AI 应用(如自动驾驶和跌倒检测)提供了评估工具。当前 MLLM 在危险信号检测上表现良好,但因果理解不足,这限制了其在需要解释和决策的安全场景中的可靠性。误报问题进一步表明,模型在实际部署中可能产生不必要的警报,影响用户体验和信任。这推动行业关注模型的可解释性和鲁棒性,以及更精细的评估基准。
SPRINT 基准为安全关键型 AI 产品(如自动驾驶、跌倒检测)提供了评估和验证工具,帮助企业量化模型的风险推断能力。识别因果理解短板和误报问题,可指导产品改进,减少安全风险并提升用户信任。该基准也可能成为行业标准,影响安全 AI 的采购和部署决策。
未来可预期更多针对主动风险推断的基准和模型改进,特别是在因果推理和误报控制方面。SPRINT 可能成为安全评估的标准工具,推动 MLLM 在安全关键领域的应用。模型需要从信号检测转向因果理解,并发展更稳健的提示策略。跨领域(如自动驾驶)的迁移能力也将成为研究重点。