Джерела
Подивись у дії
Переглянь моделі та стилі, що стоять за такими історіями — безкоштовний акаунт, галерея одразу.
Відкрити каталог
Переглянь моделі та стилі, що стоять за такими історіями — безкоштовний акаунт, галерея одразу.
Відкрити каталогВеб-скрейпер переміг Google і Reddit у судовому спорі на підставі DMCA: правовий експерт назвав стратегію платформ «дивною» — і результат справи має реальні наслідки для того, як формуються навчальні датасети ШІ та хто контролює доступ до публічного вебу.
Закон про авторське право в цифрову епоху (DMCA) був розроблений для боротьби з порушенням авторських прав — несанкціонованим копіюванням і розповсюдженням захищених творів. Використовувати його для зупинки скрейпера, який читає публічно доступні вебсторінки, — це натяжка, на думку експерта, на якого посилається Ars Technica. Положення DMCA про заборону обходу захисту спрямовані проти технічних засобів захисту на кшталт DRM, а не файлів robots.txt чи обмежень частоти запитів до API. Коли Google і Reddit намагалися кваліфікувати скрейпінг як порушення DMCA, вони фактично стверджували, що їхні сервери є захищеним технологічним замком — теорія, до якої суди традиційно ставляться скептично.
Основний аргумент скрейпера прямолінійний: відкритий веб не належить жодній окремій платформі. Індексування публічно доступних сторінок — це те, що роблять пошукові системи, академічні дослідники та конвеєри навчання ШІ. Те, що суд погодився з таким формулюванням, не означає, що скрейпінг є безнаслідковим — договірне право та Закон про комп'ютерне шахрайство і зловживання залишаються дієвими інструментами для платформ, — але це позбавляє їх однієї з найагресивніших зброй в арсеналі боротьби зі скрейпінгом.
Для розробників моделей ШІ рішення є частковим зеленим світлом. Великі мовні моделі та системи генерації зображень на кшталт Stable Diffusion та його нащадків були побудовані на датасетах, зібраних із вебу, — Common Crawl, LAION та інших. Правові виклики цьому конвеєру здебільшого надходили від власників авторських прав (авторів, художників, фотографів), які стверджували, що їхні конкретні твори були використані без згоди. Справа Google/Reddit була іншою: вона стосувалася того, чи можуть платформи використовувати DMCA для контролю доступу до самого вебу.
Після того як цей шлях звузився, більш імовірне поле битви зміщується до застосування умов використання та, що критично важливо, до питань авторського права, які суди ще не вирішили остаточно. Мирова угода Anthropic з авторами встановила фінансовий прецедент — приблизно 3 000 дол. за книгу, — але не визначила, чи є навчання на захищених текстах порушенням авторських прав взагалі. Розробники моделей генерації зображень стикаються з тим самим невирішеним питанням щодо візуального контенту.
Для авторів, які використовують інструменти ШІ для створення зображень, це має тихий, але реальний ефект: широта та актуальність навчальних даних визначають, що моделі можуть відтворювати, наскільки добре вони справляються з нішевими стилями та як швидко засвоюють нові візуальні тенденції. Правове середовище, яке зберігає публічний веб доступним для скрейперів, сприяє формуванню багатших і актуальніших навчальних наборів — що зрештою позначається на якості моделей і стилістичному різноманітті. Автори, які досліджують можливості сучасних моделей, можуть переглянути каталог Charmloop, щоб побачити, як різноманітність навчальних даних проявляється на практиці в різних стилях генерації.
За даними Ars Technica, Google не відмовляється від боротьби, незважаючи на програш у суді, — що примітно, зважаючи на те, що сама Google є одним із найбільших веб-скрейперів у світі. Власний Googlebot компанії безперервно індексує весь публічний веб. Критики вказують на суперечність у тому, що Google одночасно відстоює своє право на скрейпінг і намагається заблокувати інших від того самого — особливо коли ці скрейпери живлять конкурентів у сфері ШІ.
Мотивація Reddit зрозуміліша: платформа уклала угоду про ліцензування даних із Google і агресивно захищає це джерело доходу, обмежуючи доступ третіх сторін через API та скрейпінг. Рішення, яке послаблює її здатність застосовувати ці обмеження через DMCA, є прямим комерційним ударом.
Ця справа не стане останнім словом. Платформи адаптують свої правові стратегії, а Конгрес ще може ухвалити законодавство, яке надасть вебплатформам більш чіткий контроль над автоматизованим доступом. Але наразі публічний веб залишається — принаймні з правової точки зору — ближчим до спільного надбання, ніж до огородженого саду.