Выпуск №41 Дайджест недели
← В ленту Новость · 24 августа · 4 мин
Новости

llama.cpp ускорила GLM-4.5-Air до 1,3 раза через MTP

С 74,55 до 88,73 токена в секунду на четырёх RTX 3090 — без телеметрии и облака, только флаги запуска.

Если вы запускаете тяжелые открытые модели локально, скорость генерации токенов обычно резко падает, как только вы отказываетесь от облачной инфраструктуры. Пулл-реквест разработчика jacekpoplawski в репозитории ggml-org/llama.cpp (PR #26534) меняет эту ситуацию для GLM-4.5-Air. Благодаря интеграции поддержки multi-token prediction (MTP) обновление ощутимо снижает задержки на локальных рабочих станциях без отправки телеметрии на сторонние серверы.

По данным бенчмарков jacekpoplawski, реализация адаптирует архитектуру MTP из GLM-4.7-Flash и обеспечивает стабильный прирост производительности в 1,17–1,20 раза на протестированных файн-тюнах с Hugging Face при использовании одного драфт-токена. На рабочей станции с четырьмя видеокартами RTX 3090 при полной выгрузке в GPU базовая скорость выросла с 74,55 до средних 88,73 токена в секунду. На структурированных задачах разница оказалась еще заметнее: пошаговые математические вычисления достигли 96,54 токена в секунду с двумя драфт-токенами, а задачи перевода показали 92,03 токена в секунду.

Ограничения по железу и тесты памяти

Аппаратные ограничения по-прежнему определяют реальный выигрыш. При тестировании несжатых версий Q8 для целевой и драфт-моделей, которые выходят за пределы доступной видеопамяти, сброс 13 слоев MoE в оперативную память сохранил положительное ускорение при MTP 1. Переход на массивную полную сборку GLM-4.5 с 30 слоями MoE на CPU дал лишь скромный прирост в 1,07 раза — пропускная способность памяти остается главным узким местом. При этом загрузчик нативно обрабатывает объединенные, раздельные и чисто MTP-макеты формата GGUF, не нарушая работу пайплайнов Solar Open или GLM-4.6V.

«Пропускная способность памяти остается главным узким местом при выгрузке слоев MoE на процессор»

Итог

Для энтузиастов и разработчиков, использующих локальный инференс, этот PR дает чистый прирост скорости исключительно за счет флагов запуска. Если в вашей рабочей станции достаточно VRAM, чтобы удерживать активные параметры GLM-4.5-Air исключительно на GPU, один драфт-токен MTP станет идеальным выбором. Попытка генерировать больше двух драфт-токенов быстро упирается в закон убывающей отдачи при творческих задачах и код-ревью с длинным контекстом, но в установленных рамках технология превращает тяжелые китайские MoE-архитектуры в по-настоящему практичные инструменты на каждый день.

Источник ggml-org/llama.cpp, PR #26534 © 2026 «Гад же ты». Полное или частичное копирование — со ссылкой на эту страницу.