← 返回信息流
更新于 2026/07/28 18:53

llama.cpp 修复 Adreno 多流批次 KQ/KQV 图像内核越界读取

llama.cpp 发布 b10171,修复 Adreno GPU 上 KQ/KQV image1d 内核忽略 dim 3 的缺陷。统一 KV cache 下多序列批次以 4D 张量呈现,内核只覆盖首个流的 K/V,导致后续流读到垃圾数据,困惑度从 1817 骤降至 15.6。

修复将 ne03/ne13>1 路由到通用路径并处理 view_offs,单流结果不变,test-backend-ops 输出与修复前一致。该问题在未启用 flash attention 的 Adreno 740/840 上默认触发,属硬件适配层的正确性修复,无破坏性变更。

速读

llama.cpp 修复 Adreno 多流批次 KQ/KQV 内核越界,困惑度从 1817 降至 15.6

相关源 (1)