← Все новости
29.07.2026

Вышла новая версия llama.cpp с индексом b10174

Вышла версия llama.cpp b10174 с поддержкой спекулятивного декодирования NextN/MTP для моделей GLM-5.2. Включает обновление конвертера и новые сборки.

Вышла новая версия llama.cpp с индексом b10174

Вышла новая версия llama.cpp с индексом b10174. Главное изменение — добавлена поддержка спекулятивного декодирования NextN/MTP для моделей GLM_DSA (GLM-5.2). Это позволяет использовать эти модели в качестве драфт-модели для ускорения генерации текста.

Поддержка GLM-5.2 и MTP

Реализация включает загрузку тензоров nextn через «зонд присутствия» в стиле Qwen35MoE/Step35. Построен новый граф graph_mtp, состоящий из элементов enorm/hnorm/eh_proj, плотного слоя MLA, сигмоидно-активированного MoE с общим экспертом и общей головой с fallbacks, а также тензоров _s для NVFP4. В основной граф добавлено извлечение t_h_nextn.

Для MTP-контекста используется отдельный KV-кэш: драфт-голова работает с плотным MLA, поэтому MTP-контекст получает обычный attention KV-кэш, хранящий только слои nextn (аналогично гибридному MTP-контексту Qwen3.5). Основной контекст при этом использует DSA-кэш, отфильтрованный для trunk-слоёв.

Обновление конвертера

В конвертер моделей добавлены флаги --mtp и --no-mtp для модели GlmMoeDsaForCausalLM (GLM-5.2). При использовании --no-mtp удаляется блок NextN (blk.78) и его слой nextn_predict_layers KV. Флаг --mtp оставляет только NextN-блок, shared embeddings, norm и lm_head. Поведение по умолчанию (без флагов) не меняет выходной файл. В описании коммитов указано, что изменения подготовлены при участии Claude Fable 5 (языковая модель Anthropic).

Доступные сборки

В релизе представлены готовые бинарные сборки для macOS (Apple Silicon, Intel, iOS XCFramework), Linux (Ubuntu x64/arm64/s390x с бэкендами CPU, Vulkan, ROCm 7.2, OpenVINO, SYCL FP16/FP32), Windows (x64/arm64 CPU, CUDA 12.4/13.3, Vulkan, OpenVINO, SYCL, HIP, OpenCL Adreno), Android (arm64 CPU) и openEuler (x86/aarch64). Некоторые варианты (macOS с KleidiAI, openEuler) помечены как отключённые. Также доступна сборка UI (веб-интерфейс) и архив с исходным кодом. Для каждой сборки приведена контрольная сумма SHA256.

Теперь пользователи llama.cpp, работающие с моделями семейства GLM-5.2, могут использовать спекулятивное декодирование для повышения скорости вывода.

Источник: https://github.com/ggml-org/llama.cpp/releases/tag/b10174

Первоисточник: NewsKit