Новый подход к автоматизации исследований в области выравнивания ИИ
Исследователь в программе стипендиатов компании Anthropic представил ранний пример того, как системы искусственного интеллекта могут автоматически улучшать процессы выравнивания моделей. В опубликованной работе с заголовком «Automated Researchers Can Reliably Mitigate Alignment Failures» описан прототип, который демонстрирует заметные результаты на ряде бенчмарков.
Система, получившая название Automated Alignment Researcher (AAR), была протестирована на десяти бенчмарках, направленных на обнаружение конкретных несоответствий в поведении моделей. По данным авторов, автоматизированный подход позволил улучшить производительность по каждому из этих бенчмарков без ухудшения общей функциональности модели.
Как работает автоматизированный исследователь
Модель воспроизводит многие этапы традиционного исследовательского процесса: поиск релевантной литературы, выдвижение гипотез и последующая тренировка модели с предложенным методом. Каждый метод тренируется в течение примерно 30 минут и оценивается по метрикам бенчмарков.
Эффективные подходы сохраняются и используются далее, а неэффективные отвергаются. Такой итеративный цикл позволяет системе действовать быстро и масштабируемо, что и приводит к накоплению полезных улучшений за относительно короткое время.
Сравнение с человеческими исследователями и экономический аспект
Авторы работы прямо сравнивают производительность AAR с человеческой командой исследователей. По их утверждению, «The best AAR method beats what experienced humans propose, on average within six hours. Human guided research directions do not lead to stronger performance.»
В документе также приведено сравнение затрат: «An AAR costs roughly $4 per hour in API inference against the $150 per hour we pay our human researchers.» Это подчёркивает возможную экономическую привлекательность автоматизации в исследовательских задачах.
При этом в тексте работы отмечены и ограничения предложенного подхода. Автоматизированная система эффективна лишь в той мере, в какой используемые бенчмарки действительно отражают цели выравнивания. Поддержка, расширение и корректность этих бенчмарков требуют отдельной работы.
- Работа AAR зависит от качества и объёма доступной литературы и данных.
- Необходимость постоянного поддержания и обновления бенчмарков остаётся нерешённой.
- Результаты показывают потенциал, но не снимают всей ответственности человека за формулирование целей выравнивания.
Авторы резюмируют, что полученные результаты дают «ранние свидетельства того, что автоматизированное пост-тренировочное выравнивание может стать практичным в ближайшем будущем», однако подчёркивают необходимость дальнейших исследований и аккуратной валидации бенчмарков.
Работа рассматривается как шаг к более широкой теме рекурсивного самоулучшения: если модели смогут улучшать процедуры собственного обучения и выравнивания, это может привести к значительным изменениям в роли и задачах человеческих исследователей в области ИИ.






