

自分の作品がAIトレーニングデータセットに含まれていることを発見したアーティストや作家の数が増え続けており、主要なAI企業に対して訴訟を起こし、一部は勝訴し始めている。The Vergeによると。

ビジュアルアーティストや作家たちが、トレーニングデータセットにおける自分たちのクリエイティブ作品の無断使用をめぐり、AI企業に対して法的異議申し立てを組織している。
これらの訴訟の多くのきっかけとなったのは、The Atlanticが公開した検索可能なデータセットだ。誰でも自分の作品がAIトレーニングコーパスに含まれているかどうかを調べることができた。ノンフィクションベストセラー『The Feather Thief』および『The Fishermen and the Dragon』の著者であるカーク・ウォレス・ジョンソンは自分の名前を検索し、著書がリストに載っていることを発見。法廷に訴えを持ち込むクリエイターの輪に加わった。彼の経験は決して特異なものではなかった。
法的な全体像はまだ形成途中だが、その方向性は重要だ。一部の初期判決では、著作権侵害の申し立てが却下申し立ての段階を通過することが認められた——これは裁判所がこれらを根拠のない訴訟として扱っていないことを示す意味のある閾値だ。AI企業はフェアユースの抗弁に大きく依存しており、著作権で保護された素材を使ったトレーニングは変容的であると主張している。しかし裁判官たちは一様にそれを受け入れているわけではない。
AIアートクリエイターにとって、実際的な賭け金は高い。もし裁判所が最終的に、著作権で保護されたテキストや画像をトレーニング目的でスクレイピングすることが侵害に当たると判断すれば、今日の最も高性能な画像生成モデルや言語モデルを支えるデータセットは強制的な改訂やライセンス要件に直面する可能性がある。つまり、将来のモデルバージョンはより狭い範囲の、ライセンスされた、あるいは合成データで学習されることになり、スタイルの幅、プロンプトへの応答性、モデルが参照できる文化的知識の深さに実質的な影響が生じる。
これは仮定の未来の問題ではない。この訴訟はすでに、一部の開発者が新しいモデルのトレーニングにアプローチする方法に影響を与えている。たとえばAdobeは、Fireflyをライセンスされたコンテンツのみで学習させたと積極的にアピールしている——この位置づけが商業的に意味を持つのは、代替手段の法的リスクが今や可視化されているからに他ならない。ツールを選択するクリエイターは、クライアントや自身のリスク許容度にとって重要な場合、その違いを考慮すべきだ。
この検索可能なデータベースは、一種の大規模な証拠開示イベントとして機能した。それ以前、ほとんどのアーティストは疑念を持っていたが証拠がなかった。それ以降、彼らは名前、タイトル、タイムスタンプを手にした——著作権侵害の申し立てを推測の域から実行可能なものにするために必要な、まさに具体的な証拠だ。法律チームはこれらの発見をクラスアクションや個別訴訟にまとめ、Google、Meta、Anthropicなどを標的にしている。
これは、AIトレーニングデータをめぐる法的環境が複数の方向から締め付けられているという、より広いパターンと結びついている。Charmloopはこれに関連する動向をすでに取り上げた:ウェブスクレイパーがGoogleとRedditに対してDMCAケースで勝訴したという判決で、これはトレーニング目的でパブリックウェブ上の何が法的にアクセス可能かという前提を複雑にするものだった。スクレイピングの権利とトレーニングデータにおける著作権という二つの流れは、真に不確定な法的状況へと収束しつつある。
今日AIツールを使用しているクリエイターにとって、これはツールが明日から使えなくなることを意味しない。しかし、画像生成に頼っているモデルが、裁判所が積極的に再検討しているデータ体制の産物であることを意味する。どの企業が和解し、どの企業が争い、どの企業がライセンスデータセットへと方向転換するかを注視することで、次世代モデルがどこへ向かっているか——そして何が可能になるか——が見えてくるだろう。