New in Arize AX: first-class sessions, Agent-as-a-Judge, and vision evals
Arize AI 发布 Arize AX 更新,时间范围为 2026 年 8 月 6 日至 9 月 18 日。更新内容包括:Sessions 成为 Arize AX 中的一等工作单元,可对整个对话进行标注、排队送审,并让 Alyx 对其过滤;此外还有 Agent-as-a-Judge(应用于每个 plan)、vision judges、更快的 datasets。
Development
- First ReportNew in Arize AX: first-class sessions, Agent-as-a-Judge, and vision evalsArize AI Blog
- Current Assessment评测与可观测性厂商正把竞争焦点从「记录调用」转向「评审工作流」:会话级标注、排队送审、按会话过滤,都是把人工 QA 流程产品化。若这一方向成立,评测平台的差异化将更多来自评审协作与 judge 覆盖度,而非单纯的埋点接入。可验证下一信号:竞品是否在同期发布会话级评审或 plan 级 judge 功能。Agent Pulse · analysis
Arize AI 博客发布 Arize AX 九月更新,覆盖 2026 年 8 月 6 日至 9 月 18 日期间上线的功能。核心变化是 Sessions 成为 Arize AX 中的一等工作单元:用户可以对整段对话进行标注、将其排队等待评审,并让 Alyx 按会话进行过滤。同一批更新还包含 Agent-as-Judge(原文写作 Agent-as-a-Judge)作用于每个 plan、面向视觉的 judges,以及更快的 datasets。这些能力均围绕 LLM/Agent 应用的观测、评测与人工评审流程展开。
把 session 提升为一等对象,意味着评测与标注的粒度从单条 trace 上移到整段对话,这对多轮 Agent 的上下文一致性与状态追踪更友好;Agent-as-a-Judge 覆盖每个 plan,说明评测点前移到规划阶段而非仅看最终输出。可验证下一信号:官方文档是否给出 session 级评测 API 与 plan 级 judge 的输入输出 schema。
评测与可观测性厂商正把竞争焦点从「记录调用」转向「评审工作流」:会话级标注、排队送审、按会话过滤,都是把人工 QA 流程产品化。若这一方向成立,评测平台的差异化将更多来自评审协作与 judge 覆盖度,而非单纯的埋点接入。可验证下一信号:竞品是否在同期发布会话级评审或 plan 级 judge 功能。
对使用 Agent 的团队,会话级标注与送审可减少人工评审的拼接成本,plan 级 judge 有助于在早期发现规划错误而非事后返工;更快的 datasets 缩短评测迭代周期。可验证下一信号:官方是否公布 session 评审的吞吐或延迟指标,以及是否提供按会话计费的定价项。
若 session 与 plan 级 judge 成为默认评测单元,Agent 应用的发布门槛会从「单步正确」转向「整段任务可审计」。可验证下一信号:Arize 后续版本是否把 vision judges 与 session 评审合并为统一的多模态评审队列。