← Все новости
27.07.2026

Вышла новая версия llama.cpp b10142 с поддержкой MiniMax-M3 Vision

Вышла новая версия llama.cpp b10142 с экспериментальной поддержкой MiniMax-M3 Vision. Оптимизации повысили скорость декодирования и снизили потребление памяти, также исправлены конвертации.

Вышла новая версия llama.cpp b10142 с поддержкой MiniMax-M3 Vision

Вышла новая версия llama.cpp b10142, главная особенность которой — экспериментальная поддержка языковой модели MiniMax-M3 с функциями зрения (Vision). Релиз также включает масштабные оптимизации, которые повысили скорость декодирования и снизили потребление памяти, а также исправления, связанные с кэшированием и конвертацией.

Архитектура MiniMax-M3: сочетание подходов MiniMax-M2 и DeepSeek-V3

Новая модель объединяет механизм группового внимания (GQA) с per-head QK-нормой и частичным ротари, как у MiniMax-M2, и архитектуру плотных слоёв с маршрутизированными и разделяемыми экспертами (routed/shared experts) от DeepSeek-V3. Активация — SwiGLU с адаптивной нормой. Для обработки изображений используется проекция mmproj и граф CLIP, что добавляет возможность работы с визуальными данными. Из-за экспериментального статуса sparse-внимание пока не реализовано (применяется dense fallback), а компоненты Vision Tower и MTP-головы отключены. Все ранее созданные GGUF-файлы MiniMax-M3 необходимо перегенерировать.

Оптимизация производительности: рост скорости декодирования и уменьшение буферов

Разработчики полностью переписали файл minimax-m3.cpp, что привело к значительному приросту производительности. Скорость декодирования выросла с 6,2–7,15 до 7,7–7,8 токенов в секунду при контекстах от 5k до 60k+. Prefill стал быстрее примерно на 10%, а размер вычислительного буфера сократился на 20% (с 6,8 до 4,2 GiB при ub2048/62k). Добавлена поддержка multi-stream (ключ kv_unified) и возможность запуска с несколькими потоками (-np N), что улучшает многопользовательскую работу. Тип кэша по умолчанию изменён на F32, исправлена проблема с двойным выделением памяти под индексеры, реализована поддержка prompt caching и устранены баги обрезания хвостов очереди.

Изменения конвертации и совместимость

Для поддержки MiniMax-M3 обновлены скрипты конвертации: добавлены параметры indexer (block_size, local_blocks), изменён порядок тензоров Q/K, отменено предварительное вычисление sin/cos, унифицированы типы FFN (LLM_FFN_SWIGLU_OAI_MOE). Разработчикам, собирающим llama.cpp из исходников, необходимо учесть изменения в заголовочных файлах, отвечающих за кэш KV. Все ранее сконвертированные GGUF-файлы модели требуют повторной генерации.

Доступные платформы и сборки

Релиз включает готовые бинарные сборки для macOS (включая Apple Silicon, Intel и iOS), Linux (x64, arm64, s390x, с поддержкой Vulkan, ROCm 7.2, OpenVINO, SYCL), Windows (CPU, arm64, CUDA up, Vulkan, OpenVINO, SYCL, HIP), Android (arm64 CPU) и openEuler. Некоторые сборки, например с KleidiAI на macOS, временно отключены.

Источник: https://github.com/ggml-org/llama.cpp/releases/tag/b10142

Первоисточник: NewsKit