更新于 2026/07/13 08:32
llama.cpp b9985 发布,SYCL 后端新增融合 Top-K MoE
llama.cpp 发布 b9985 版本,核心变化是为 SYCL 后端新增 fused top-k MoE 算子,通过算子融合减少 kernel launch 开销,提升 MoE 层在 Intel GPU 上的推理效率。该融合通过环境变量 GGML_SYCL_ENABLE_FUSION 控制,启动时打印启用状态。
代码由 Claude Fable 5 辅助生成,属于社区协作成果。此次更新主要面向 Intel GPU(SYCL)用户,MoE 模型推理场景可获得明显加速,不影响其他后端。
无破坏性变更。
速读
llama.cpp b9985 为 SYCL 后端加入融合 Top-K MoE 算子
相关源 (1)
- llama.cpp Releases · 2026/7/13 08:32:45https://github.com/ggml-org/llama.cpp/releases/tag/b9985