AGENT PULSESJCPal Special EditionAI 行业证据与趋势
2026年7月30日 · llama.cpp

b10199

发生了什么

llama.cpp 发布 b10199 版本,支持输入嵌入生成下一个 token,支持采样 token 的嵌入,修复 server_batch 函数,更新网站、macOS、iOS、Linux、Android、Windows 等多平台构建,并更新 UI。

EVENT STORY

发展脉络

  1. 首次出现b10199llama.cpp
  2. 当前判断llama.cpp 持续优化本地推理体验,新增嵌入支持使其更适用于 RAG 和嵌入缓存场景,降低对云 API 的依赖。多平台构建覆盖广泛,包括移动端和边缘设备,推动 AI 推理的本地化和去中心化。Agent Pulse · 分析
改变了什么

llama.cpp 发布 b10199 版本,新增 server 端支持输入嵌入生成下一个 token(#26313),支持采样 token 的嵌入,修复 server_batch 函数。同时更新了网站、macOS(Apple Silicon 含 KleidiAI 启用/禁用、Intel)、iOS、Linux(Ubuntu x64/arm64/s390x 含 Vulkan、ROCm 7.2、OpenVINO、SYCL FP32/FP16)、Android(arm64)、Windows(x64/arm64 含 OpenCL Adreno、CUDA 12/13、Vulkan、OpenVINO、SYCL、HIP)、openEuler(x86/aarch64 含 310p、910b ACL Graph)等平台构建,并更新 UI。

能力边界怎么变了

该版本通过支持输入嵌入生成下一个 token,使 llama.cpp 能够接受预计算的嵌入向量作为输入,可能用于检索增强生成或嵌入缓存场景。同时支持采样 token 的嵌入,允许在生成过程中获取每个采样 token 的嵌入表示,为后续分析或下游任务提供中间表示。修复 server_batch 函数表明对批处理推理的稳定性改进。

为什么重要

llama.cpp 持续优化本地推理体验,新增嵌入支持使其更适用于 RAG 和嵌入缓存场景,降低对云 API 的依赖。多平台构建覆盖广泛,包括移动端和边缘设备,推动 AI 推理的本地化和去中心化。

对谁有影响

对于依赖本地推理的开发者,嵌入支持可降低 RAG 系统的延迟和成本;多平台覆盖扩大了 llama.cpp 在边缘设备上的应用场景,可能吸引更多企业采用本地推理方案。

接下来观察

后续可关注 llama.cpp 是否进一步支持嵌入的批量处理、与向量数据库的集成,以及是否开放嵌入 API 供外部调用。