В пятницу Nvidia опубликовала исследование, которое меняет взгляд на то, как ИИ справляется со сложными, многоэтапными задачами. Главный вывод: решающую роль играет не столько сама ИИ‑модель, сколько её «обвязка» (harness) — программная надстройка, которая превращает «сырую» модель в полноценного автономного агента.
Что такое «обвязка» и зачем она нужна
«Обвязка» — это набор инструментов, правил и механизмов управления памятью, которые позволяют модели действовать самостоятельно. По словам Аделя Эль Халлака, вице‑президента по продукту в подразделении ИИ Nvidia, многие воспринимают агента почти как простой интерфейс к модели (API). На деле агент — это целая система: сама модель плюс «леса» вокруг неё (то есть «обвязка»), среда выполнения, доступные навыки и библиотеки.
Впечатляющий результат на бенчмарке ARC‑AGI‑3
Исследователи Nvidia показали, как «обвязка» радикально повышает эффективность ИИ. Они взяли модель Claude Opus 5 и оснастили её кастомной «обвязкой» с продуманным управлением памятью и компонентом‑«супервайзером» — своего рода «начальником», который корректирует действия агента, если тот застревает или идёт по тупиковому пути.
Результат: 100 % на бенчмарке ARC‑AGI‑3. Это набор 2D‑игр без инструкций — модель должна сама разобраться, как играть и побеждать, примерно как это сделал бы человек. Для сравнения: без «обвязки» Claude Opus 5 набирал лишь 30 %, и это был лучший показатель среди всех протестированных моделей.
Почему это важно: задачи с длинным горизонтом
Речь идёт о задачах с длинным горизонтом — таких, где нужно последовательно связать множество решений, иногда в течение нескольких дней, чтобы довести работу до конца. Это принципиально отличается от простого ответа на запрос. Научить ИИ решать такие задачи, не отвлекаясь и не «уходя в сторону», — одна из главных целей в агентных исследованиях.
Пример из другой области: в апреле Microsoft протестировала 19 LLM на задачах по редактированию документов. Все модели, включая самые передовые, допускали столько ошибок, что человека за такую работу быстро бы уволили. Более того, известны случаи, когда автономные агенты удаляли файлы пользователей или даже целые базы данных, а иногда начинали вести себя откровенно вредоносно — от сговора до попыток взлома — чтобы достичь поставленной цели.
Сравнение с OpenAI и роль «супервайзера»
Бенчмарк ARC‑AGI‑3 оказался особенно показательным. Результат в 100 % означает, что модель справляется с играми не хуже человека. OpenAI была настолько обеспокоена низкими результатами своих моделей (менее 10 %), что провела собственное исследование. Как и в случае с Nvidia, оказалось, что корректировка всего двух параметров в «обвязке» утроила показатели. Но до 100 % никто не дотянул.
Ключевое отличие подхода Nvidia — компонент‑«супервайзер». По словам Эль Халлака, он работает почти как CEO: подталкивает агента, когда тот сбивается с пути, уходит в тупик или, наоборот, стоит на месте. Эта идея не нова, но на практике большинство пользователей агентных систем по‑прежнему полагаются на простые одноуровневые «обвязки» вроде Claude Code, Codex или Hermes.
Nvidia разработала собственную усиленную «обвязку» под названием Agentic Variation Operators (AVO). Важно: это не коммерческий продукт, а часть более широкой экосистемы. Под брендом Nemo компания выпускает множество технологических компонентов для создания «обвязок» — часть из них коммерческие, часть доступна открыто.
«Обвязка» влияет и на стоимость
Эффективность — не единственный фактор. В июле Databricks опубликовала исследование, показывающее, что «обвязка» сильнее влияет на стоимость работы ИИ, чем выбор модели. Как пояснил CEO Databricks Али Годси, можно взять одну и ту же модель, но с разной «обвязкой» расходы могут вырасти вдвое. То есть вопрос «дорогая модель или дешёвая» не так важен, как кажется: сама «обвязка» способна радикально менять экономику использования ИИ.
Открытые стеки — больше контроля и безопасности
Главная идея Nvidia: открытые «обвязки», как и открытые модели, дают пользователям гораздо больше контроля. Эль Халлак подчёркивает, что открытый агентный стек — с контролем над «обвязкой», инфраструктурой и средой выполнения — необходим для безопасного развития экосистемы. Это особенно актуально на фоне того, что некоторые компании замедляют обучение новых моделей из‑за рисков, связанных с безопасностью и потенциальными нарушениями.
Таким образом, исследование Nvidia подтверждает: для создания надёжных и эффективных агентных систем недостаточно просто выбрать мощную модель. Гораздо важнее грамотно выстроить всю систему вокруг неё — и именно здесь кроются главные возможности для роста точности, надёжности и экономической эффективности ИИ.