Вышла новая версия llama.cpp b10094
В llama.cpp b10094 добавлено автоматическое определение типа спекулятивной модели из репозиториев Hugging Face. Обновлены сборки для всех платформ.
Вышла новая версия llama.cpp b10094, популярного инструмента для локального запуска больших языковых моделей. Основное изменение упрощает использование спекулятивного декодирования с репозиториями Hugging Face.
Раньше при указании draft-репозитория через флаг -hfd без явного задания типа спекулятивной модели (--spec-type) загружалась полная модель, а не предназначенный для этой цели облегчённый черновик из сайдкаров (mtp, dflash, eagle3). Пользователю приходилось вручную указывать --spec-type, чтобы получить корректное поведение.
Автоматическое определение типа спекулятивной модели
Начиная с этой версии, если типы спекулятивных моделей оставлены по умолчанию, llama.cpp автоматически проверяет содержимое -hfd репозитория. Сначала он ищет файлы с приоритетом mtp → dflash → eagle3 и, обнаружив первый доступный сайдкар, устанавливает соответствующий тип спекулятивной модели. Таким образом, команда вида:
```
llama-server -hf repo:Q3_K_M -hfd repo:Q8_0
```
теперь работает без дополнительных флагов — draft-модель подбирается автоматически.
Явное указание --spec-type по-прежнему отключает эту инференцию, а репозиторий без сайдкаров продолжает загружать полную модель, как и раньше.
Доступные сборки
С релизом опубликованы обновлённые бинарники для всех поддерживаемых платформ: macOS (Apple Silicon и Intel), Linux (x86, ARM, s390x, а также сборки с Vulkan, ROCm 7.2, OpenVINO, SYCL FP32/FP16), Windows (CPU, ARM, CUDA 12/13, Vulkan, OpenVINO, SYCL, HIP), Android (ARM64 CPU) и openEuler (x86 и ARM с разными бэкендами). Также доступны UI-сборки.
Разработчики отмечают, что исправление не затрагивает остальные возможности библиотеки — все остальные функции работают как прежде.
Источник: https://github.com/ggml-org/llama.cpp/releases/tag/b10094