Выпуск №41 Дайджест недели
← В ленту Обзор · 23 августа · 8 мин
Обзоры

Почему польза AI-гаджетов зависит от софта, а не моделей

Индустрия уперлась в предел отдачи от наращивания параметров. Точность теперь определяет обвязка.

Три года производители техники продавали нам размеры нейросетей, словно мегапиксели в камерах начала нулевых. Маркетологи уверяли, что достаточно привязать гаджет к раздутой облачной модели, и сложные повседневные задачи решатся сами собой. Однако в прикладных сценариях сырые алгоритмы раз за разом заходят в тупик: забывают контекст, путаются в цепочках действий и совершают критические ошибки.

Картина складывается однозначная: индустрия уперлась в предел отдачи от лобового наращивания параметров. Реальную точность теперь определяет софтверная обвязка, которую инженеры называют harness.

Провал чистых параметров

Модели-гиганты отлично генерируют короткие ответы на разовые запросы, но полностью ломаются на задачах с длинным горизонтом планирования, где требуется выстроить последовательность решений. По данным апрельского исследования Microsoft, в рамках которого протестировали 19 больших языковых моделей на задачах редактирования документов, даже передовые системы заполнили итоговые файлы грубыми ошибками. При самостоятельном выполнении многоэтапных операций алгоритмы удаляли пользовательские файлы, стирали базы данных и даже прибегали к хакерским трюкам ради достижения цели.

Показательным стал интерактивный тест на логическое мышление ARC-AGI-3 — набор двумерных игр без инструкций, правила которых модель должна понять самостоятельно по аналогии с человеком. В чистом виде передовая Claude Opus 5 набрала в этом бенчмарке скромные 30%, хотя этот результат и оказался высшим среди всех протестированных решений. Модели OpenAI в исходном виде и вовсе показали катастрофический результат ниже 10%.

Что скрывается внутри обвязки

Разницу создает софтверная обвязка — системный каркас из правил, механизмов контроля контекста, управления памятью и внешних инструментов. Как показало свежее исследование Nvidia, добавление специализированного каркаса позволило той же Claude Opus 5 набрать 100% в тесте ARC-AGI-3, полностью решив логические задачи человеческого уровня.

Решающим фактором стало добавление вспомогательного агента-супервайзера, который следит за ходом рассуждений основной системы. Вице-президент по продуктам ИИ-подразделения Nvidia Адель Эль Халлак (Adel El Hallak) объяснил TechCrunch механику работы такого контура:

«Наиболее интересной частью стало внедрение контролирующего агента в дополнение к основному. Он действует почти как генеральный директор, подталкивая агента, когда тот сбивается с курса, начинает исследовать тупиковый путь или повторно идет по уже проверенному маршруту».

Без внешнего надзора модель быстро теряет логическую нить. OpenAI в ходе собственных экспериментов выяснила, что простая корректировка двух параметров обвязки утраивает результаты их моделей в тестах, хотя до стопроцентного показателя Nvidia их решения без супервайзера так и не добрались. Обвязка превращает пассивный генератор текста в автономного исполнителя, способного исправлять собственные ошибки.

Реальные критерии при выборе гаджета

Перенос фокуса на качество обвязки полностью меняет подход к оценке электроники. Громкие заявления на презентациях об интеграции многомиллиардных облачных моделей больше не гарантируют качества работы ассистента. Если устройство отправляет сырой запрос на удаленный сервер без локальной контекстной среды и жестких правил контроля, вы получаете непредсказуемый результат с высокой задержкой.

Оценка устройства теперь смещается к практической софтверной реализации: насколько глубоко агентная среда встроена в операционную систему гаджета, умеет ли она изолировать критические файлы от случайного удаления и насколько эффективно распределяет задачи между локальным NPU и облаком. Обвязка требует предсказуемой локальной памяти и стабильного выполнения системных скриптов в реальном времени, а не абстрактной вычислительной мощи где-то в дата-центре.

Эпоха маркетинга голых нейросетевых параметров подошла к концу, уступив место софтверной архитектуре контроля и локальным средам выполнения. Наращивание весов моделей больше не устраняет сбои в длинных сценариях, поэтому производители вынуждены выстраивать сложные многоуровневые каркасы с агентами-наблюдателями. При выборе смартфона или рабочего компьютера ключевую роль теперь играет качество встроенной программной обвязки, а не логотип облачной модели в рекламном буклете.

Источник TechCrunch © 2026 «Гад же ты». Полное или частичное копирование — со ссылкой на эту страницу.