What Could the Agent See at 19:05? Generating Temporal Enterprise Scenarios from Real Research and Replaying Them to Evaluate Agents
arXiv 论文 2608.01042v1 提出一种系统,从真实研究生成人物驱动的、随时间演化的企业世界,并在任意时刻重放以评估可插拔的 Agent。系统使用 schema 推断的时间描述,通过确定性与 LLM 结合重建每条记录的历史状态,并将所有重建预计算为紧凑的差异缓存。
Development
- First ReportWhat Could the Agent See at 19:05? Generating Temporal Enterprise Scenarios from Real Research and Replaying Them to Evaluate AgentsarXiv cs.AI
- Current Assessment该研究可能推动企业 Agent 评估从静态快照转向时间动态场景,影响 Agent 开发、测试和部署的实践。未来可能出现更多关注时间一致性和状态历史的评估工具。Agent Pulse · analysis
该论文指出,企业 AI Agent 跨多个应用运行,数据持续变化,答案的正确性取决于提问时刻的数据和可见性。离线评估通常基于单一静态快照,只能评估最终状态,无法覆盖中间时刻。为每个时刻重建快照成本过高,且单一快照会泄露未来状态。该系统通过生成真实、人物驱动、时间演化的企业世界,并在任意时刻重放来评估 Agent,解决了这两个问题。
论文提出一种基于 schema 推断的时间描述方法,结合确定性和 LLM 重建记录的历史状态。由于可查询时刻有限,所有重建被预计算为紧凑的差异缓存,使评估在任意时刻可行。这暗示了一种新的评估范式,可能对 Agent 的时间敏感性和状态管理提出新要求。
该研究可能推动企业 Agent 评估从静态快照转向时间动态场景,影响 Agent 开发、测试和部署的实践。未来可能出现更多关注时间一致性和状态历史的评估工具。
对于企业 Agent 供应商,该方法可能降低评估成本,提高 Agent 在动态环境中的可靠性,从而增强产品竞争力。
后续可关注该方法的开源实现、在真实企业场景中的基准测试,以及是否被主流评估框架采纳。