更新于 2026/07/13 01:28
llama.cpp 修复 per-request 推理预算参数被静默忽略的 bug
llama.cpp b9982 版本修复了两个影响 OpenAI 兼容 API 的 bug:per-request 的 reasoning_budget_tokens 和 reasoning_budget_message 参数因代码执行顺序问题被静默忽略,导致调用方无法按请求控制推理预算(如关闭思考过程)。
根因是 oaicompat_chat_params_parse 函数先写入服务端默认值,后续的通用 body 拷贝循环发现 key 已存在便跳过,调用方传入的值被丢弃。修复方案是在通用拷贝之前先从请求体中读取这两个字段,使采样层能收到调用方意图的值。
该修复对使用 Qwen3 等具备思考能力的模型的推理服务尤为重要,调用方现在可以精确控制每次请求的推理预算,例如将 budget 设为 0 来完全抑制思考过程,实现更灵活的推理成本管理。
速读
llama.cpp 修复 per-request 推理预算参数被静默覆盖的 bug
相关源 (1)
- llama.cpp Releases · 2026/7/13 01:28:35https://github.com/ggml-org/llama.cpp/releases/tag/b9982