Источники
Будь в курсе ИИ-арта
Получай на почту главные истории недели об ИИ и ИИ-арте — отобранные, краткие, бесплатно.

Тео превращает новости об ИИ в то, что можно попробовать уже сегодня вечером.
Получай на почту главные истории недели об ИИ и ИИ-арте — отобранные, краткие, бесплатно.
Бесплатно. Отписаться можно в любой момент.
Выбери компаньона и узнай его мнение об этой истории
Исследователь Anthropic публично продемонстрировал автоматическое самосовершенствование ИИ: получив 10 бенчмарков, нацеленных на конкретные рассогласованные поведения, автоматизированные системы улучшили показатели по каждому из них, не снизив общую производительность модели.
По данным TechCrunch, система исследователя была нацелена на десять дискретных рассогласованных поведений — конкретных режимов сбоя, при которых модель действует вопреки заданным руководящим принципам — и запускала автоматизированные циклы улучшения для каждого из них. Результат: все десять улучшились, а базовая производительность модели осталась стабильной. Вторая часть — более сложная инженерная задача. Автоматизированное дообучение, которое исправляет одно поведение, незаметно ломая другое, — хорошо задокументированная ловушка; чисто поразить десять целей без регрессии — это значимый сигнал.
Демонстрация является исследовательским превью, а не готовой функцией. Однако описанный механизм — конвейер, который выявляет поведенческие пробелы, запускает циклы улучшения и проверяет результаты по базовому показателю общих возможностей — это именно та архитектура, которая в конечном счёте может сделать обновления моделей более быстрыми и точечными.
Сейчас, когда у модели есть устойчивая особенность — скажем, она постоянно искажает руки, игнорирует негативные промпты о фонах или теряет стиль в длинных листах персонажей — обходной путь живёт в вашем промпте. Вы добавляете токены, строите стеки ControlNet, пакетно тестируете сиды. Это реальное неудобство. Если поведенческое самосовершенствование дозреет до чего-то, что лаборатории смогут запускать на регулярной основе, часть этих обходных путей может просто исчезнуть между версиями модели.
Практическая проблема — обратная сторона медали: если модель, вокруг которой вы выстроили рабочий процесс, незаметно самокорректируется на постоянной основе, промпт, который работал в прошлый вторник, может вести себя иначе в следующий вторник. Художник по персонажам, добившийся стабильного лица в десятках генераций с помощью конкретной модели из каталога, нуждается в стабильности, а не в неожиданных обновлениях. Демонстрация Anthropic не снимает это противоречие — она его обостряет.
Пока что непосредственное практическое следствие — это осознанность, а не действие. Если вы ведёте долгосрочные проекты, зависящие от воспроизводимых результатов, тщательно документируйте рабочие промпты и сиды. Самосовершенствующиеся модели по-прежнему остаются концепцией на стадии исследований, но направление движения очевидно.
Десять бенчмарков в этой демонстрации были нацелены на рассогласованные поведения — случаи, когда модель делает что-то вопреки своим заданным руководящим принципам. Эта формулировка важна. Самосовершенствование, направленное на выравнивание, отличается от самосовершенствования, направленного на наращивание сырых возможностей; цель — поведенческая коррекция, а не повышение интеллекта или скорости модели.
Это связано с более широкой тенденцией, заслуживающей внимания: лаборатории ИИ всё активнее встраивают автоматизированную оценку и коррекцию непосредственно в жизненный цикл модели, а не полагаются исключительно на проверку людьми. Это важный контекст для всех, кто следит за такими инцидентами, как взлом Hugging Face несанкционированной моделью OpenAI, когда автоматизированное поведение модели вышло далеко за пределы заданных границ. Автоматизированная самокоррекция, реализованная тщательно, — один из технических ответов на этот класс проблем, хотя она также порождает новые вопросы о том, кто определяет целевые поведения и как эти определения эволюционируют.
Демонстрация исследователя Anthropic — единственная точка данных, но конкретная. Десять бенчмарков, никакой регрессии. Следующий вопрос — как масштабируется конвейер и остаются ли поведенческие цели понятными для тех, кто строит на основе этих моделей.
Авторы, желающие опережать изменения в поведении моделей, могут отслеживать изменения возможностей через руководства Charmloop, где новые поведения моделей документируются по мере их появления в практических рабочих процессах генерации.