← 返回信息流
更新于 2026/07/13 08:32

llama.cpp b9985 发布,SYCL 后端新增融合 Top-K MoE

llama.cpp 发布 b9985 版本,核心变化是为 SYCL 后端新增 fused top-k MoE 算子,通过算子融合减少 kernel launch 开销,提升 MoE 层在 Intel GPU 上的推理效率。该融合通过环境变量 GGML_SYCL_ENABLE_FUSION 控制,启动时打印启用状态。

代码由 Claude Fable 5 辅助生成,属于社区协作成果。此次更新主要面向 Intel GPU(SYCL)用户,MoE 模型推理场景可获得明显加速,不影响其他后端。

无破坏性变更。

速读

llama.cpp b9985 为 SYCL 后端加入融合 Top-K MoE 算子

相关源 (1)