Выпуск №41 Дайджест недели
← В ленту Обзор · 23 августа · 7 мин
Обзоры

Локальный ИИ на смартфонах: тест моделей 2B без облака

Команда RWB собрала компактную модель класса 2B с нуля: гибридное внимание, 11 трлн токенов и честные ограничения.

Гонка триллионов параметров окончательно уперлась в потолок целесообразности: кормить облачные дата-центры ради банального автодополнения текста на смартфоне — сомнительное удовольствие. Команда обучения и инференса RWB протестировала сборку компактной языковой модели класса 2B с нуля, сделав ставку на гибридные методы внимания, которые способны вытащить локальный ИИ без постоянного подключения к серверу.

Гибридная архитектура и оптимизация памяти

В основе эксперимента лежит гибридная архитектура Qwen3.5-2B, опубликованная в феврале 2026 года. В стандартных трансформерах классический механизм квадратичного внимания SDPA пожирает оперативную память и вычислительные ресурсы NPU пропорционально росту контекста. В протестированной конфигурации тяжелый квадратичный расчет дополнен рекуррентным блоком GatedDeltaNet с линейной сложностью по длине входящей последовательности.

В Qwen3.5-2B квадратичное внимание объединено с рекуррентным механизмом GatedDeltaNet, что дает линейную сложность обработки по длине входящей последовательности.

Как следует из отчета RWB, инженеры провели два последовательных этапа обучения: сначала компактный прогон на 1 трлн токенов в две фазы, а затем полномасштабный запуск на 11 трлн токенов с трехфазным доменным расписанием. Дополнительно исследователи проверили архитектурную модификацию XSA (Exclusive Self-Attention) на модели Qwen3-1.7B-Base со стандартным SDPA. Этот модифицированный слой внимания дал снижение валидационной ошибки на 0,009 и прибавил 1,6 процентного пункта к точности на бенчмарке MMLU, хотя и потребовал компромисса — потери от 5% до 10% скорости пропускной способности (throughput).

Поведение бенчмарков и ограничения

В ходе тестирования инженеры зафиксировали неравномерное поведение метрик. Бенчмарк MMLU долгое время держался около уровня случайного угадывания и показал выраженный рост только на второй фазе. Формат подачи вопросов в виде прямого продолжения фразы быстрее упирался в плато, тогда как выбор из готовых вариантов разгонялся медленнее, но сохранял положительную динамику до конца фазы спада скорости обучения.

Финальный прогон на 11 трлн токенов выдал результаты на тестах здравого смысла, сопоставимые с внутренними замерами оригинальной Qwen3.5-2B-Base. При этом от иллюзий стоит избавиться: слабым местом компактных сетей остается решение сложных математических и логических задач. На наш взгляд, для умного дома с нулевой задержкой, жесткой приватностью данных и голосовых ассистентов прямо на чипе смартфона без подписок и API таких моделей уже более чем достаточно, но доверять им аналитику и расчеты без доработки специализированных датасетов пока рано.

Источник Источник не указан © 2026 «Гад же ты». Полное или частичное копирование — со ссылкой на эту страницу.