CallScreenBench: Benchmarking On-Device Models as Phone Secretaries
CallScreenBench 是一个评测手机端侧模型作为电话秘书(phone secretary)的基准,于 2026 年 8 月 2 日发布在 arXiv 上。该基准从五个质量维度打分,每个维度与对应的反指标并列展示,不合并为单一数字。评测覆盖 6 个端侧模型(0.6-4B 参数,4-bit 量化),发现质量随能力提升,但分流(triage)表现不随能力提升,看似提升是测量假象。论文还报告了无工具代理的防护(guardedness)概况,并用脚本化退化代理提供缺失的基线。
Development
- First ReportCallScreenBench: Benchmarking On-Device Models as Phone SecretariesarXiv cs.AI
- Current Assessment端侧模型作为电话秘书的可行性正在被系统评测,这标志着 on-device 代理从演示走向可验证。评测强调机主认可而非任务成功,反映代理设计需考虑用户信任。无工具代理的防护概况提示,端侧代理在安全设计上可能采用不同策略。Agent Pulse · analysis
CallScreenBench 是一个新基准,用于评测能在手机上运行的端侧语言模型作为电话秘书的表现。与大多数评测代理的基准不同,电话秘书没有明确任务或合作用户:来电者持有目标,可能是对手,代理必须从开场白判断意图,没有 oracle 辅助。关键不是任务成功,而是机主是否认可代理处理电话的方式。基准从五个质量维度评分,每个维度与计费它的反指标并列,不合并为单一数字。论文还报告了无工具代理(不持凭证、不调用工具)的防护概况。在 6 个端侧模型(0.6-4B 参数,4-bit 量化)上,质量随能力提升,但分流表现不随能力提升,看似提升是测量假象。脚本化退化代理提供缺失的基线,修正后模型对的分流表现差异减少。
该基准的设计强调测量假象:分流表现看似随能力提升,但修正基线后消失,说明评测方法需谨慎。五个维度与反指标并列,避免单一分数掩盖维度间权衡。无工具代理的防护概况表明,不持凭证的代理在防护上可能有不同表现。端侧模型(0.6-4B,4-bit)在质量上随能力提升,但分流不提升,暗示分流可能依赖不同能力或评测噪声。
端侧模型作为电话秘书的可行性正在被系统评测,这标志着 on-device 代理从演示走向可验证。评测强调机主认可而非任务成功,反映代理设计需考虑用户信任。无工具代理的防护概况提示,端侧代理在安全设计上可能采用不同策略。
对端侧模型厂商,该基准提供可验证的评测维度,可能影响模型优化方向。对手机厂商,电话秘书功能可能成为差异化卖点,但需确保机主认可。对安全团队,防护概况提供评估代理风险的方法。
后续可关注 CallScreenBench 的评测结果是否被模型厂商用于优化端侧模型,以及是否有更多模型加入评测。防护概况的扩展可能成为端侧代理安全评测的标准。