b10254
llama.cpp 发布 b10254 版本,为 DeepSeek V4 Flash 0731 添加新模板,并更新 DeepSeek V4 模板以对齐官方编码器。默认对 DeepSeek V4 历史启用 drop_thinking,除非请求 preserve_reasoning 或存在工具。模板中加入结构化输出响应格式指令,并将 schema 传入模板渲染。新增 Flash 0731 模板以映射更新的 high 和 max 推理努力。测试覆盖推理努力、drop_thinking、结构化输出提示、保留推理、连续对话和空工具参数。
发展脉络
- 首次出现b10254llama.cpp
- 当前判断llama.cpp 作为广泛使用的推理引擎,其模板更新通常反映模型生态的演进方向。DeepSeek V4 系列对推理控制和结构化输出的强调,可能预示着推理模型在应用中将更注重可控性和输出格式,这对依赖结构化输出的 Agent 工作流有直接影响。Agent Pulse · 分析
llama.cpp 在 b10254 版本中为 DeepSeek V4 系列模型更新了聊天模板,重点支持 DeepSeek V4 Flash 0731。更新包括对齐官方编码器、默认丢弃历史思考内容(除非明确要求保留或存在工具)、添加结构化输出指令并传递 schema,以及为 Flash 0731 新增单独的模板以映射 high 和 max 推理努力。这些改动旨在提升模板与官方模型的兼容性,并增强对推理控制和结构化输出的支持。
该更新表明 llama.cpp 正在紧跟 DeepSeek V4 的模板变化,特别是对推理内容(thinking)的处理策略:默认丢弃历史思考,仅在需要保留或使用工具时保留。这反映了推理模型在推理时可能产生大量中间 token,而默认丢弃可降低上下文占用。同时,结构化输出通过模板指令和 schema 传递实现,可能利用模型的原生 JSON 模式能力。
llama.cpp 作为广泛使用的推理引擎,其模板更新通常反映模型生态的演进方向。DeepSeek V4 系列对推理控制和结构化输出的强调,可能预示着推理模型在应用中将更注重可控性和输出格式,这对依赖结构化输出的 Agent 工作流有直接影响。
对于使用 llama.cpp 部署 DeepSeek V4 的团队,此更新可降低推理时的上下文占用(默认丢弃思考),并简化结构化输出的实现,从而可能降低推理成本并提升输出可靠性。
后续可关注 llama.cpp 是否支持 DeepSeek V4 的更多推理参数,以及官方编码器是否有进一步更新。同时,其他推理引擎(如 vLLM)是否会跟进类似模板调整,以及 DeepSeek V4 在推理成本上的表现。