Источники
Будь в курсе ИИ-арта
Получай на почту главные истории недели об ИИ и ИИ-арте — отобранные, краткие, бесплатно.

Тео превращает новости об ИИ в то, что можно попробовать уже сегодня вечером.
Получай на почту главные истории недели об ИИ и ИИ-арте — отобранные, краткие, бесплатно.
Бесплатно. Отписаться можно в любой момент.
Выбери компаньона и узнай его мнение об этой истории
Seattle Times и Newsday подали иски против OpenAI и Microsoft за нарушение авторских прав, утверждая, что компании собирали их журналистские материалы для обучения ИИ-моделей и дословно воспроизводят фрагменты статей в ответ на запросы пользователей.
На первый взгляд, газета, судящаяся с разработчиком чат-бота, — это чужая проблема для создателей ИИ-арта. Но это не так. Правовая логика, лежащая в основе этих исков, — что сбор общедоступного контента для обучения моделей является нарушением авторских прав, — структурно идентична аргументам, выдвигаемым против моделей генерации изображений в параллельных судебных разбирательствах. Решение о том, что обучение на новостных текстах требует лицензирования, почти наверняка ускорит аналогичные требования в отношении наборов данных, лежащих в основе Stable Diffusion, Midjourney и мультимодальных моделей, на которых работают инструменты, используемые вами сегодня.
Конкретное обвинение в том, что модели OpenAI дословно воспроизводят фрагменты статей, также напрямую актуально. Если суды признают почти дословное воспроизведение границей между добросовестным использованием и нарушением авторских прав, этот стандарт будет проверен применительно к генераторам изображений, способным воспроизводить характерную композицию фотографа или стиль художника-графика с неудобной точностью.

Microsoft и OpenAI сталкиваются с обвинениями в том, что их чат-боты дословно воспроизводят текст новостных статей в ответ на запросы пользователей.
Изображение: The Verge / The Verge AI
По данным The Verge, эти иски следуют за аналогичными действиями других издателей, и закономерность важна: каждый новый истец пополняет массив материалов досудебного раскрытия, на который могут опираться будущие дела — в том числе касающиеся наборов данных для обучения на изображениях и видео. OpenAI одновременно защищается по иску New York Times, где недавнее заявление правительства США утверждало, что обучение ИИ отвечает национальным интересам, — об этом мы рассказывали в нашем более раннем материале о заявлении администрации Трампа по делу об авторских правах OpenAI.
Для создателей, выстраивающих рабочие процессы на основе моделей, обученных на широких веб-сборках, практический вопрос — это вопрос времени. Ни один судебный запрет пока не вынудил отключить модель, а сроки судебных разбирательств измеряются годами. Однако давление в сфере лицензирования уже меняет то, на каких данных обучаются будущие модели — сообщения о выплатах Google голливудским студиям за права на обучение на видео являются одним из наглядных примеров того, как индустрия тихо страхует свои риски.
Если вы генерируете изображения сегодня, ничто в вашем непосредственном рабочем процессе не изменится из-за этой подачи иска. Модели, с которыми вы работаете, уже обучены; ни один суд не предписал откат. Создатели, наиболее подверженные краткосрочным потрясениям, — это те, кто создаёт продукты или конвейеры, зависящие от мультимодальных текстово-графических выходных данных, где языковая модель извлекает или суммирует новостной контекст вместе с генерируемым изображением. Именно эта комбинация и является мишенью данных исков.
В долгосрочной перспективе следите за тем, будут ли провайдеры моделей ускорять создание уровней обучения на лицензированных данных — так же, как некоторые уже делают это с синтетическими данными. Модель, обученная на более чистом, лицензированном корпусе, может вести себя иначе — более консервативно в воспроизведении, потенциально менее актуально в культурном отношении, — и это проявится в ответах на промпты так, как трудно предсказать, пока вы не увидите результат.
Пока что наиболее полезное, за чем стоит следить, — это то, приведёт ли какой-либо из этих исков к мировому соглашению в стиле consent decree, устанавливающему ставку лицензирования. Эта цифра, однажды установленная для текста, станет шаблоном, к которому переговорщики будут обращаться, когда следующая волна исков о данных изображений двинется к урегулированию. Создатели, понимающие эту связь, будут менее удивлены, когда это произойдёт.
Изучите, как современные ИИ-модели генерации изображений справляются с этим давлением, в каталоге моделей Charmloop или отточите свой подход к промптингу в руководствах.