更新于 2026/07/13 23:09
llama.cpp 发布 b9993,新增腾讯混元 Hy3 模型与 MTP 投机解码支持
llama.cpp 发布 b9993 版本,核心变更为新增 Tencent Hunyuan 3(Hy3/hy_v3)架构支持,并集成了 MTP(Multi-Token Prediction)投机解码能力。
Hy3 采用 MoE 解码器架构,包含 per-head Q/K RMSNorm、sigmoid 路由器加专家选择偏置、始终激活的无门控共享专家,以及前若干层密集块(first_k_dense_replace)。实现基于社区 fork 移植,适配了当前主线的 build_qkv、build_moe_ffn 等 API。
该版本使 llama.cpp 用户可直接在本地运行腾讯混元 3 系列模型,并利用 MTP 投机解码提升推理吞吐,进一步扩展了 llama.cpp 对国产大模型的硬件适配覆盖。
速读
llama.cpp b9993 新增腾讯 Hy3 架构与 MTP 投机解码
相关源 (1)
- llama.cpp Releases · 2026/7/13 23:09:16https://github.com/ggml-org/llama.cpp/releases/tag/b9993