Источники
Посмотри в деле
Полистай модели и стили, что стоят за такими историями — бесплатный аккаунт, галерея сразу.
Открыть каталог
Полистай модели и стили, что стоят за такими историями — бесплатный аккаунт, галерея сразу.
Открыть каталогВеб-скрапер одержал победу над Google и Reddit в судебном споре на основе DMCA: правовой эксперт назвал стратегию платформ «абсурдной» — и исход дела имеет реальные последствия для формирования датасетов для обучения ИИ и контроля над доступом к публичному вебу.
Закон об авторском праве в цифровую эпоху (DMCA) был разработан для борьбы с нарушениями авторских прав — несанкционированным копированием и распространением защищённых произведений. Использовать его для остановки скрапера, читающего общедоступные веб-страницы, — это натяжка, по мнению эксперта, процитированного Ars Technica. Положения DMCA об обходе технических средств защиты направлены против таких мер, как DRM, а не против файлов robots.txt или ограничений частоты запросов к API. Когда Google и Reddit попытались представить скрапинг как нарушение DMCA, они фактически утверждали, что их серверы представляют собой защищённый технологический замок — теория, к которой суды исторически относились скептически.
Основной аргумент скрапера прямолинеен: открытый веб не принадлежит ни одной отдельной платформе. Индексирование общедоступных страниц — это то, чем занимаются поисковые системы, академические исследователи и конвейеры обучения ИИ. Согласие суда с такой трактовкой не означает, что скрапинг не влечёт никаких последствий — договорное право и Закон о компьютерном мошенничестве и злоупотреблениях по-прежнему остаются действенными инструментами для платформ, — однако решение лишает их одного из наиболее агрессивных орудий в арсенале борьбы со скрапингом.
Для разработчиков ИИ-моделей решение является частичным зелёным светом. Большие языковые модели и системы генерации изображений — такие как Stable Diffusion и его производные — были созданы на основе датасетов, собранных из веба: Common Crawl, LAION и других. Юридические претензии к этому конвейеру исходили преимущественно от правообладателей — авторов, художников, фотографов, — утверждавших, что их конкретные произведения были использованы без согласия. Дело Google/Reddit было иным: речь шла о том, могут ли платформы использовать DMCA для контроля над доступом к самому вебу.
После того как этот путь оказался закрыт, основное поле битвы смещается к применению пользовательских соглашений и, что принципиально важно, к вопросам авторского права, которые суды так и не разрешили окончательно. Мировое соглашение Anthropic с авторами установило финансовый прецедент — около $3 000 за книгу, — однако не определило, является ли обучение на защищённых авторским правом текстах нарушением в принципе. Разработчики моделей генерации изображений сталкиваются с тем же неразрешённым вопросом применительно к визуальному контенту.
Для авторов, использующих инструменты генерации изображений на основе ИИ, это имеет менее очевидный, но реальный эффект: широта и актуальность обучающих данных определяют, что модели способны воспроизводить, насколько хорошо они справляются с нишевыми стилями и как быстро усваивают новые визуальные тренды. Правовая среда, сохраняющая открытый доступ к публичному вебу для скраперов, способствует формированию более богатых и актуальных обучающих наборов — что в конечном счёте сказывается на качестве моделей и диапазоне стилей. Авторы, исследующие возможности современных моделей, могут ознакомиться с каталогом Charmloop, чтобы увидеть, как разнообразие обучающих данных проявляется на практике в различных стилях генерации.
По данным Ars Technica, Google не намерена прекращать борьбу, несмотря на проигрыш в суде, — что примечательно, учитывая, что сама Google является одним из крупнейших веб-скраперов в мире. Собственный Googlebot компании непрерывно индексирует весь публичный веб. Критики указывают на противоречие: Google одновременно отстаивает своё право на скрапинг и пытается заблокировать его для других — особенно когда эти скраперы питают конкурентов в сфере ИИ.
Мотивация Reddit более очевидна: платформа заключила соглашение о лицензировании данных с Google и агрессивно защищает этот источник дохода, ограничивая сторонний доступ через API и скрапинг. Решение, ослабляющее её возможности применять эти ограничения через DMCA, является прямым коммерческим ударом.
Это дело не станет последним словом. Платформы адаптируют свои правовые стратегии, а Конгресс всё ещё может принять законодательство, предоставляющее веб-платформам более явный контроль над автоматизированным доступом. Но пока публичный веб остаётся — по крайней мере юридически — ближе к общественному достоянию, чем к огороженному саду.