@ai-sdk/typesafe-ai@3.0.0
Vercel AI SDK 发布 @ai-sdk/typesafe-ai@3.0.0,新增 TypeSafe provider 用于 experimental_evaluate,支持在单次请求中处理原生 Choice、Score、Boolean 问题,并支持结构化 JSON rubric、概率分布、置信度元数据与工作流序列化。该版本同时更新了 @ai-sdk/provider-utils@5.0.42 与 @ai-sdk/provider@4.0.16 等依赖。
发展脉络
- 首次出现@ai-sdk/typesafe-ai@3.0.0Vercel AI SDK
- 行业反馈@ai-sdk/xai@5.0.2Vercel AI SDK
- 行业反馈@ai-sdk/typesafe-ai@3.0.2Vercel AI SDK
- 行业反馈@ai-sdk/typesafe-ai@3.0.3Vercel AI SDK
- 行业反馈@ai-sdk/xai@5.0.3Vercel AI SDK
- 当前判断评测能力被下沉到 SDK provider 层,而非独立评测平台,反映 AI 应用工具链正把「模型输出质量判定」纳入标准调用路径。若被主流框架跟进,评测可能从项目自建脚本变为框架内置原语,影响评测类工具的定位。可验证下一信号:其他主流 SDK 或框架是否推出同类结构化评测接口。Agent Pulse · 分析
Vercel AI SDK 的 @ai-sdk/typesafe-ai 从 2.x 升至 3.0.0,属于 major 变更。发布说明显示,本次新增 TypeSafe provider 以支撑 experimental_evaluate:可在一次请求中提交原生 Choice、Score、Boolean 三类问题,返回结构化 JSON rubric、概率分布与置信度元数据,并支持工作流序列化。补丁部分为依赖更新,涉及 @ai-sdk/provider-utils@5.0.42、@ai-sdk/provider@4.0.16 等。证据未披露评测精度、延迟或成本数据。
把评测问题类型(Choice/Score/Boolean)与 rubric、概率分布、置信度统一进单次请求,意味着评测结果从自由文本转向可解析结构,便于下游做阈值判断与重试。工作流序列化暗示评测步骤可被持久化与重放。可验证下一信号:官方文档或示例中是否出现该 provider 的 schema 定义与序列化格式说明。
评测能力被下沉到 SDK provider 层,而非独立评测平台,反映 AI 应用工具链正把「模型输出质量判定」纳入标准调用路径。若被主流框架跟进,评测可能从项目自建脚本变为框架内置原语,影响评测类工具的定位。可验证下一信号:其他主流 SDK 或框架是否推出同类结构化评测接口。
对使用 Vercel AI SDK 的团队,结构化评测可减少自建打分脚本与解析逻辑,降低评测链路维护成本,并让置信度元数据直接参与发布门禁。但证据未给出准确率或成本收益,采购与选型决策仍需自行基准测试。可验证下一信号:官方是否发布评测准确率或与人工标注的一致性对比。
短期看,该能力仍标注 experimental,接口与字段可能变动,不宜在生产评测流水线中作为唯一依赖。中期若序列化与置信度元数据稳定,评测结果有望进入 CI 与回归测试环节。可验证下一信号:该 provider 是否在后续版本去掉 experimental 前缀。