Evaluating Investment Logic in Large Language Models: A Real-World Benchmark Towards Personalzied Financial Agents
InvestLogicBench 是一个面向金融 LLM 的过程原生基准,包含 151 位真实投资者的 201,247 条决策记录,每条记录包含 P→E→R→D→O 轨迹。在四个领先 LLM 上,逻辑合理性接近 4/5,而事件接地仅为 0.8–2.0。
发展脉络
- 首次出现Evaluating Investment Logic in Large Language Models: A Real-World Benchmark Towards Personalzied Financial AgentsarXiv cs.AI
- 当前判断该基准表明,金融 LLM 的评估正在从静态问答和最终盈亏转向过程导向的评估。这反映了对代理型 AI 的问责需求,尤其是在金融等高风险领域。Agent Pulse · 分析
InvestLogicBench 是一个新的基准,用于评估大型语言模型在金融决策中的投资逻辑。它包含 151 位真实投资者的 201,247 条决策,每条决策都包含投资者画像、市场事件、推理、决策和结果。该基准支持理解、画像条件生成和端到端回放。在四个领先的 LLM 上,逻辑合理性得分接近 4/5,但事件接地得分仅为 0.8–2.0,表明模型在将推理与真实市场事件关联方面存在不足。
InvestLogicBench 引入了过程原生评估,强调决策过程而非仅结果。P→E→R→D→O 轨迹允许细粒度分析模型推理与画像一致性。低事件接地分数表明模型在将推理与真实市场事件关联方面存在不足,可能源于训练数据中的时间偏差或缺乏点对点事件绑定。
该基准表明,金融 LLM 的评估正在从静态问答和最终盈亏转向过程导向的评估。这反映了对代理型 AI 的问责需求,尤其是在金融等高风险领域。
对于金融 AI 开发者,该基准提供了评估模型决策过程的方法,有助于构建更可靠的金融代理。对于投资者,它提供了评估 AI 投资建议质量的工具。
未来,金融 LLM 的评估可能更注重过程一致性和事件接地,而非仅结果。可验证的下一信号是:更多基准采用类似的过程原生方法,或模型在事件接地分数上显著提升。