出典
このニュースについて話す相手
コンパニオンを選んで、この話題についての感想を聞いてみましょう

コンパニオンを選んで、この話題についての感想を聞いてみましょう
希少本業界全体で、不穏なパターンが報告されている。絶版本や入手困難な書籍の大量注文が相次ぎ、その後、書籍が破棄されたとみられる痕跡が残るというものだ。AI企業が学習データとしてスキャンするために物理的な書籍を意図的に入手しているのではないかという疑惑が広がっている。
Ars Technicaの報道によると、業者たちは、エージェントやダミーアカウントを通じて動く買い手が、ある共通点を持つ大量の特定タイトルを注文していると証言している。その共通点とは、どこにもデジタル化されていないという点だ。注文は、コレクターが通常示すような状態・来歴・転売価値への関心を一切示さずに行われる。書籍は届き、そして足跡が途絶える。転売市場にも図書館の収蔵リストにも該当タイトルが見当たらないことから、購入後に物理的な本が単純に消滅したと考えられるケースも報告されている。
もしこれが実際に起きていることであれば、その法的論理は明快だ。物理的な書籍を購入すれば、その物体の所有権が得られる。個人使用目的でスキャンすることは法的にグレーゾーンだが、その後に破棄すれば複製の証拠が消える。これは、複数のAI企業を高額訴訟に巻き込んでいるウェブ上の著作権テキストのスクレイピングよりも、はるかに法的に守りやすい立場だ。
標的となっているのは、Project Gutenbergやインターネットアーカイブ、その他の主要なデジタル化プロジェクトに収録されなかった書籍のようだ。ニッチな学術書、地域の歴史書、専門的な技術マニュアル、無名の小説など。これらはまさに、AI開発者が公式に補完したいと認めている既存の学習コーパスの空白部分だ。より広範でレアなテキスト分布で学習した大規模言語モデルや画像生成システムは、ロングテールのプロンプトや専門知識においてより優れたパフォーマンスを発揮する傾向がある。これは、AI画像生成ツールを使うクリエイターが求める、ニュアンスのある出力の種類だ。
AIアート制作者にとって、この影響はモデルのリリースや価格変更ほど直接的ではないが、確かに存在する。モデルの学習データの幅と具体性が、何をリアルに描写できるかを左右するからだ。希少なデザイン史、無名の神話、専門的な工芸文献で学習したモデルは、ニッチな美的プロンプトをより確実に処理できる。すでにオンラインに存在するものだけで学習したモデルとは異なる。
希少本業界は規模が小さく、人間関係で成り立っているため、情報の伝達が早い。業者たちは情報を共有し合っており、大量注文・状態への無関心・収集目的の不明確さというプロファイルに合致する注文に対して、スキャン禁止条項を売買契約に追加したり、単純に注文を断ったりするケースも出てきている。業界団体に警告を発している業者もいる。
難しいのは帰属の特定だ。購入者が身元を明かすことはほとんどなく、仲介業者の利用により特定のAI企業を名指しすることはほぼ不可能だ。大手AI開発企業がこの慣行を認めた例はない。疑惑はパターンに基づくものにとどまっている。独立した販売業者の間で十分に一貫しており、真剣に受け止めるべきだが、法的措置に必要な証拠の痕跡はない。
これは、AI企業が学習データをどのように収集しているかという、より広範な問いと並置される。その問いはすでに、ウェブスクレイピングをめぐる訴訟、著作権画像の使用をめぐる紛争、C2PAウォーターマーキングのような来歴メタデータ標準をめぐる継続的な議論を生み出している。物理的な書籍もまた、その争われた境界線の外側にはないことが明らかになりつつある。
この慣行が大規模に確認されれば、それは重大なエスカレーションを意味する。既存のデジタルコンテンツをコピーするだけでなく、物理的な文化的遺産を積極的に変換・消滅させることでそれを行うということだ。希少本コミュニティは規模が小さいため、資金力のあるAIラボによる控えめな収集活動でさえ、代替不可能なテキストの入手可能性に測定可能な損害を与えかねない。