Источники
Будь в курсе ИИ-арта
Получай на почту главные истории недели об ИИ и ИИ-арте — отобранные, краткие, бесплатно.
Бесплатно. Отписаться можно в любой момент.
Обсуди это с
Выбери компаньона и узнай его мнение об этой истории

Майя прогоняет через бенчмарки каждый новый релиз — сначала цифры, и никакого хайпа.
Получай на почту главные истории недели об ИИ и ИИ-арте — отобранные, краткие, бесплатно.
Бесплатно. Отписаться можно в любой момент.
Выбери компаньона и узнай его мнение об этой истории
AirTag, спрятанный внутри редкой книги, отследил том до объекта Amazon, где он был уничтожен, — это вещественное доказательство того, что Amazon приобретает и измельчает редкие тексты для извлечения обучающих данных для своих моделей ИИ.
Находка с AirTag, о которой сообщила Ars Technica, превращает косвенные подозрения в задокументированный факт. Букинисты уже замечали тревожную закономерность — массовые закупки необычных или вышедших из печати изданий, после которых наступала тишина, — однако до сих пор не было прямых доказательств того, что происходило после продажи.

Amazon приобретает редкие физические книги и уничтожает их, чтобы извлечь текст для обучающих данных ИИ.
Изображение: TechCrunch / TechCrunch AI
Привлекательность физических редких текстов для обучения ИИ очевидна: эти модели уже поглотили большую часть того, что существует в открытом интернете. Книги, которые никогда не были оцифрованы, — малотиражные издания, региональные исторические труды, специализированные академические тома — представляют собой подлинно новый обучающий сигнал. По данным TechCrunch, именно этот дефицит делает их привлекательными для разработчиков ИИ, наперегонки стремящихся дифференцировать свои обучающие корпуса.
Ирония здесь очевидна. Amazon построил весь свой бизнес на продаже книг. Внутренняя команда по данным для ИИ, судя по всему, использует изображение тираннозавра, поедающего книгу, в качестве своего логотипа — деталь, которая говорит о том, что уничтожение носит не случайный, а намеренный и фирменный характер.
Устройство слежения сопроводило книгу от места продажи через логистическую сеть Amazon до объекта, где сигнал пропал способом, характерным для уничтожения. Методология проста, но эффективна: небольшой коммерчески доступный трекер формирует хронологический след местоположения, обрывающийся на объекте Amazon.
Масштаб по-прежнему не подтверждён. Amazon не раскрыл, сколько книг было приобретено таким образом, какие названия или категории являются целевыми и какая правовая база — если таковая вообще существует — по его мнению, регулирует авторско-правовой статус отсканированного контента. Уничтожение физического объекта не снимает вопросов о правах на цифровое воспроизведение текста в целях обучения, и независимого аудита программы не существует.
Эта история — конкретный факт в рамках более широкого сдвига: компании в сфере ИИ выходят за пределы интернета и обращаются к физическим архивам, библиотекам и рынкам вышедших из печати изданий в поисках обучающих материалов, которые конкуренты ещё не успели поглотить. Эта гонка имеет прямые последствия для всех, кто заботится о сохранении культурного наследия, — и для авторов, которые полагаются на инструменты ИИ, обученные на разнообразных высококачественных текстах.
Для создателей ИИ-арта вопрос об обучающих данных важен, поскольку богатство и специфичность понимания текста моделью определяют, насколько хорошо она интерпретирует сложные подсказки. Модель, обученная на подлинно редких исторических и литературных материалах, может иначе справляться с запросами на стилизацию под определённую эпоху, малоизвестными художественными отсылками или сложными нарративными промптами, чем модель, обученная исключительно на веб-текстах. Приводит ли подход Amazon к измеримому повышению качества его моделей — пока неизвестно.
Статья Charmloop о более ранних подозрениях букинистов освещала косвенные свидетельства, предшествовавшие этому подтверждению, — находка с AirTag замыкает этот круг. Более широкая дискуссия о происхождении данных также связана с продолжающимися вопросами о том, что компании в сфере ИИ делают с контентом, созданным на их платформах, — закономерность, прослеживающаяся в стриминге, социальных сетях и теперь в физических медиа.
Amazon публично не отреагировал ни на один из отчётов. До тех пор, пока этого не произойдёт, масштаб программы — и её правовой статус — остаётся открытым вопросом.