Обучение ИИ‑моделей с помощью других ИИ‑моделей набирает популярность в неолабораториях. Исследователь из программы стипендиатов Anthropic поделился предварительными результатами такого подхода.
Anthropic выпустила статью «Автоматизированные исследователи могут надёжно предотвращать сбои в согласованности». В ней показано, как ИИ‑системы повышают эффективность модели в тестах на согласованность. Автоматизированные системы прошли 10 тестов на выявление несоответствий в поведении — и улучшили результаты по каждому, сохранив общую эффективность.
Систему разработал научный сотрудник Anthropic Чэнь Юэ‑Хань. Её логика близка к традиционному исследовательскому процессу: система изучает доступную литературу, предлагает метод, затем 30 минут обучает модель с его применением. Сложность тестов постепенно растёт в ходе нескольких итераций. Эффективные методы сохраняются, неэффективные — отбрасываются. Такой подход позволяет масштабировать работу и действовать быстро.
Авторы считают результаты первым подтверждением того, что автоматизированное пост‑обучение для обеспечения согласованности может стать практическим решением уже в ближайшем будущем. Работа — шаг к рекурсивному самосовершенствованию ИИ, которое многие называют следующим важным этапом развития технологий. Если модели смогут улучшать собственные методы обучения, вероятно, они оптимизируют и общие подходы к обучению. В перспективе это может снизить потребность в исследователях ИИ.
В статье прямо сравнивают автоматизированного исследователя в области обучения (Automated Alignment Researcher, AAR) с человеком. По данным авторов, лучший метод AAR превосходит предложения опытных специалистов — в среднем за шесть часов. При этом направления исследований от людей не дают роста эффективности.
Есть и сравнение затрат: работа AAR стоит около 4 долларов в час (по тарифам API), тогда как час работы человеческого исследователя обходится в 150 долларов.