1 материал · всё по этой теме, от свежего к старому.
В llama.cpp добавили механизм multi-token prediction для модели GLM-4.5-Air, что позволило поднять скорость генерации до 96 токенов в секунду на сборках из четырех RTX 3090. Для разработчиков на собственном железе это дает бесплатный прирост производительности без обращения к платным облачным API.