v2.51.0 (2026-09-25)
Pydantic AI 发布 v2.51.0(2026-09-25)。变更包括:新增 OpenAI GPT-Live 支持(OpenAILiveModel);在实时会话上暴露 context_window_used,取自 GPT-Live 上报比例或响应用量;对 Gemini 3.1 Flash Live 与 3.8 Live 在连接时拒绝 google_affective_dialog,并按 Gemini Live 关闭码抛出 RealtimeError;对 OpenAI、Azure OpenAI、xAI 上强制工具调用的 realtime tool_choice 抛出 UserError;修复包括降低 capability hooks 中 RunContext 复制开销、缓存 agent graph 而非每次 Agent.run() 重建、单子节点时不再创建 task group、CompletedStreamedResponse 重放中缓冲文本增量、在 Gemini Live 打字回合中重发近期图像。
发展脉络
- 首次出现v2.51.0 (2026-09-25)Pydantic AI
- 当前判断该版本同时适配 OpenAI、Azure OpenAI、xAI 与 Gemini Live,并统一了工具调用与关闭码的错误语义,反映多供应商实时语音/多模态接入正成为 Agent 框架的标配能力,供应商差异被下沉到框架兼容层。可验证下一信号:其他 Agent 框架是否跟进暴露实时上下文用量与统一关闭码错误。Agent Pulse · 分析
Pydantic AI 发布 v2.51.0,主要围绕实时(realtime)多模态会话做兼容性与性能修补。功能侧新增 OpenAI GPT-Live 支持(OpenAILiveModel),并在实时会话上暴露 context_window_used,来源为 GPT-Live 上报比例或响应用量。兼容性侧,对 Gemini 3.1 Flash Live 与 3.8 Live 在连接时拒绝 google_affective_dialog,并按 Gemini Live 关闭码抛出 RealtimeError;对 OpenAI、Azure OpenAI、xAI 上强制工具调用的 realtime tool_choice 抛出 UserError。修复侧包括降低 capability hooks 中 RunContext 复制开销、缓存 agent graph 而非每次 Agent.run() 重建、单子节点时不再创建 task group、CompletedStreamedResponse 重放中缓冲文本增量,以及在 Gemini Live 打字回合中重发近期图像。
从变更看,实时会话的上下文用量开始被显式暴露(context_window_used),且 agent graph 被缓存、单子节点不再开 task group,说明框架在向长连接、低开销方向收敛。可验证下一信号:后续版本是否把 context_window_used 扩展到非实时模型,以及 agent graph 缓存是否带来可测量的 Agent.run() 延迟下降。
该版本同时适配 OpenAI、Azure OpenAI、xAI 与 Gemini Live,并统一了工具调用与关闭码的错误语义,反映多供应商实时语音/多模态接入正成为 Agent 框架的标配能力,供应商差异被下沉到框架兼容层。可验证下一信号:其他 Agent 框架是否跟进暴露实时上下文用量与统一关闭码错误。
对使用 Pydantic AI 构建实时语音/多模态 Agent 的团队,本次升级降低了升级到 GPT-Live 与 Gemini Live 的适配成本,并让上下文用量可观测,便于做成本与容量规划。可验证下一信号:团队能否基于 context_window_used 建立实时会话的成本告警,以及缓存 agent graph 后单次 Agent.run() 的延迟变化。
若实时会话的上下文用量与错误语义被标准化,Agent 框架的竞争点可能从「支持哪些模型」转向「长连接下的成本与稳定性控制」。可验证下一信号:是否出现跨框架的实时会话用量/错误码约定,或 Pydantic AI 在后续版本中给出实时会话的成本控制接口。