Вышла новая версия llama.cpp с индексом b10174
Вышла версия llama.cpp b10174 с поддержкой спекулятивного декодирования NextN/MTP для моделей GLM-5.2. Включает обновление конвертера и новые сборки.
Вышла новая версия llama.cpp с индексом b10174. Главное изменение — добавлена поддержка спекулятивного декодирования NextN/MTP для моделей GLM_DSA (GLM-5.2). Это позволяет использовать эти модели в качестве драфт-модели для ускорения генерации текста.
Поддержка GLM-5.2 и MTP
Реализация включает загрузку тензоров nextn через «зонд присутствия» в стиле Qwen35MoE/Step35. Построен новый граф graph_mtp, состоящий из элементов enorm/hnorm/eh_proj, плотного слоя MLA, сигмоидно-активированного MoE с общим экспертом и общей головой с fallbacks, а также тензоров _s для NVFP4. В основной граф добавлено извлечение t_h_nextn.
Для MTP-контекста используется отдельный KV-кэш: драфт-голова работает с плотным MLA, поэтому MTP-контекст получает обычный attention KV-кэш, хранящий только слои nextn (аналогично гибридному MTP-контексту Qwen3.5). Основной контекст при этом использует DSA-кэш, отфильтрованный для trunk-слоёв.
Обновление конвертера
В конвертер моделей добавлены флаги --mtp и --no-mtp для модели GlmMoeDsaForCausalLM (GLM-5.2). При использовании --no-mtp удаляется блок NextN (blk.78) и его слой nextn_predict_layers KV. Флаг --mtp оставляет только NextN-блок, shared embeddings, norm и lm_head. Поведение по умолчанию (без флагов) не меняет выходной файл. В описании коммитов указано, что изменения подготовлены при участии Claude Fable 5 (языковая модель Anthropic).
Доступные сборки
В релизе представлены готовые бинарные сборки для macOS (Apple Silicon, Intel, iOS XCFramework), Linux (Ubuntu x64/arm64/s390x с бэкендами CPU, Vulkan, ROCm 7.2, OpenVINO, SYCL FP16/FP32), Windows (x64/arm64 CPU, CUDA 12.4/13.3, Vulkan, OpenVINO, SYCL, HIP, OpenCL Adreno), Android (arm64 CPU) и openEuler (x86/aarch64). Некоторые варианты (macOS с KleidiAI, openEuler) помечены как отключённые. Также доступна сборка UI (веб-интерфейс) и архив с исходным кодом. Для каждой сборки приведена контрольная сумма SHA256.
Теперь пользователи llama.cpp, работающие с моделями семейства GLM-5.2, могут использовать спекулятивное декодирование для повышения скорости вывода.
Источник: https://github.com/ggml-org/llama.cpp/releases/tag/b10174