WorldCup Arena: Prospective, Leakage-Free Evaluation of Frontier LLMs on a Live Tournament
2026年FIFA世界杯期间,六款前沿LLM(均具备扩展思维和原生服务端网络搜索)在39天内,于每场比赛开球前被要求填写七市场预测卡,覆盖全部104场比赛、12个小组冠军及赛前冠军池,共产生4,494个评分预测。由于提问时答案尚不存在,评测在构造上无泄漏。结果显示,六款系统在比赛结果预测上平均准确率为63.9%,与押注博彩公司热门持平;系统间相互一致频率远高于正确频率,多数投票无增益;对平局和进球数预测不足,比分预测集中于单一典型结果;准确率随比赛悬殊程度变化。
发展脉络
- 首次出现WorldCup Arena: Prospective, Leakage-Free Evaluation of Frontier LLMs on a Live TournamentarXiv cs.CL
- 当前判断该评测展示了LLM在真实世界预测任务中的实际表现,与博彩市场基准持平,表明当前模型在概率预测上尚未超越市场聚合智慧。系统间高一致性可能反映训练数据或方法的同质化,引发对模型多样性不足的担忧。评测方法本身具有推广价值,可应用于其他前瞻性预测场景,为行业提供更可靠的模型评估标准。Agent Pulse · 分析
arXiv论文报告了一项前瞻性、无泄漏的LLM评测:在2026年世界杯期间,六款前沿LLM在每场比赛前被要求预测七市场结果,共4,494个评分预测。评测设计确保无数据泄漏,因为提问时答案不存在。结果显示,系统平均预测准确率63.9%,与押注博彩热门持平;系统间一致性高但正确率低,多数投票无增益;对平局和进球数预测不足,比分预测集中。准确率与比赛悬殊程度相关。
评测设计的关键在于前瞻性:在事件发生前提问,从构造上消除记忆泄漏,而非事后过滤。这为LLM预测能力评估提供了更可靠的方法。系统间高一致性但低正确率表明,它们可能共享相似的推理偏差或训练数据模式,多数投票无法提升性能。对平局和进球数的低估,以及比分预测的集中性,揭示了模型在概率分布校准上的系统性缺陷,可能源于训练目标或推理策略。
该评测展示了LLM在真实世界预测任务中的实际表现,与博彩市场基准持平,表明当前模型在概率预测上尚未超越市场聚合智慧。系统间高一致性可能反映训练数据或方法的同质化,引发对模型多样性不足的担忧。评测方法本身具有推广价值,可应用于其他前瞻性预测场景,为行业提供更可靠的模型评估标准。
对于依赖LLM进行预测或决策的企业,该评测提供了实际性能基准,表明当前模型在预测任务上接近市场水平但未超越。模型对平局和进球数的低估可能影响体育博彩或相关预测产品的准确性。评测方法可被评测平台或企业采用,作为模型选型的参考,降低因记忆泄漏导致的性能高估风险。
未来可期待更多前瞻性评测应用于不同领域,如经济、政治或体育事件,以验证模型泛化能力。模型在概率校准上的缺陷可能促使研究者改进训练目标或推理策略,提升对不确定性的建模。系统间一致性高的问题可能推动开发更多样化的模型或集成方法。