Новая модель Astra от OpenAI: в чём опасность техники «непрозрачной рекурренции»
OpenAI разрабатывает новую модель Astra — она использует особую технику рассуждения, которую называют «рекуррентная глубина» или «непрозрачная рекурренция». В отличие от привычных моделей, Astra не придерживается строго последовательного хода рассуждений. По данным издания The Information (сообщение от вторника), именно это вызывает серьёзные опасения у экспертов по безопасности ИИ: из‑за новой техники становится сложнее отслеживать, как модель приходит к выводам.
Что говорят эксперты
Хотя применение техники в Astra пока ограничено, специалисты встревожены самим фактом её использования.
Бак Шлегерис, генеральный директор Redwood, прямо заявил, что крайне обеспокоен новостью:
«Я не знаю, насколько Astra менее поддаётся мониторингу цепочки рассуждений (CoT) по сравнению с предыдущими моделями. Но если OpenAI будет активнее развивать эту технику, у компании появится возможность значительно усилить рекурренцию — и полностью лишить цепочку рассуждений наблюдаемости».
Цви Мовшовиц, давний сторонник безопасности ИИ, считает, что ситуация может потребовать вмешательства на законодательном уровне — чтобы не допустить «гонки на понижение» среди лабораторий:
«Эта техника — игра с огнём: она ставит под угрозу принцип, который OpenAI и Anthropic старались закрепить: мы усердно работаем над тем, чтобы как можно дольше сохранять достоверность и наблюдаемость цепочки рассуждений. Более активное использование таких техник, скорее всего, ухудшит наблюдаемость».
Как работает «непрозрачная рекурренция»
Обычно цепочка рассуждений модели — это последовательность шагов, которые она делает для решения задачи. Даже если такая запись не идеальна, она помогает выявлять ошибки или нежелательное поведение. Например, именно по логам цепочки рассуждений разбирали недавние инциденты с «неконтролируемыми» агентами OpenAI.
«Непрозрачная рекурренция» меняет подход: модель обрабатывает один и тот же запрос несколько раз в цикле, действуя менее линейно. В результате остаётся меньше понятных следов — а значит, привычный способ контроля перестаёт работать.
Позиция OpenAI
В компании подчёркивают, что пока не планируют отказываться от прозрачного контроля. По словам Якуба Пахоцки, главного научного сотрудника OpenAI:
«OpenAI стремилась сохранять и использовать мониторинг цепочки рассуждений с самых первых наших рассуждающих моделей. Это ключевая цель нашей текущей исследовательской программы».
Кроме того, OpenAI уже анонсировала масштабные системы мониторинга цепочки рассуждений — они станут частью будущих мер безопасности. Компания также опровергла предположения о переходе к «нейрозе» (neuralese).
Риски масштабирования
Даже если сейчас техника применяется ограниченно, главная тревога экспертов связана с её возможным масштабированием. Райан Гринблатт, главный научный сотрудник Redwood Research, сформулировал самый серьёзный риск:
«Больше всего меня беспокоит, что естественным развитием ситуации может стать масштабирование непрозрачных рассуждений до такой степени, что модель будет рассуждать полностью или почти полностью в латентном пространстве. Надеюсь, ещё не слишком поздно избежать наиболее тревожных архитектур и что OpenAI остановится на этом».
При этом исследователи признают: все ИИ‑модели в той или иной степени используют непрозрачные рассуждения, а логи цепочки не стоит считать прямым отражением мыслительного процесса. Тем не менее рост популярности «непрозрачной рекурренции» может заметно усложнить контроль за поведением ИИ.
По данным The Information (отчёт в среду утром), технику уже обсуждают в Anthropic и Google DeepMind — это показывает, что вопрос выходит за пределы одной компании и становится отраслевой темой.