← 返回信息流
更新于 2026/07/13 01:28

llama.cpp 修复 per-request 推理预算参数被静默忽略的 bug

llama.cpp b9982 版本修复了两个影响 OpenAI 兼容 API 的 bug:per-request 的 reasoning_budget_tokens 和 reasoning_budget_message 参数因代码执行顺序问题被静默忽略,导致调用方无法按请求控制推理预算(如关闭思考过程)。

根因是 oaicompat_chat_params_parse 函数先写入服务端默认值,后续的通用 body 拷贝循环发现 key 已存在便跳过,调用方传入的值被丢弃。修复方案是在通用拷贝之前先从请求体中读取这两个字段,使采样层能收到调用方意图的值。

该修复对使用 Qwen3 等具备思考能力的模型的推理服务尤为重要,调用方现在可以精确控制每次请求的推理预算,例如将 budget 设为 0 来完全抑制思考过程,实现更灵活的推理成本管理。

速读

llama.cpp 修复 per-request 推理预算参数被静默覆盖的 bug

相关源 (1)