- MIT CSAILの研究によると、生成AIモデルが非常に大規模なデータセットで学習されると、出力を個々の元の作品まで遡って特定することはほぼ不可能になる。
- 研究チームはこの現象を「帰属の減衰(attribution decay)」と呼んでいる。これは、データ規模が大きくなるにつれて、出力を特定の学習データに帰属させる能力が低下することを意味する。
- 実験では、学習データから1枚の画像、ある画家の全作品、あるいは特定の人物の全写真を取り除いても、出力結果はほとんど変わらないことが示された。
- 研究チームによれば、あるデータを除去しても結果が変わらないのであれば、そのデータは出力の原因とは見なせないという。
- 彼らは「ディフュージョン・アンサンブル」というアーキテクチャを開発し、モデルを小さな構成要素に分割することで、全体を再学習することなく個々のデータの影響を正確に排除できるようにした。
- 同じデータを用いて新しいシステムを24の従来の拡散モデルと比較したところ、生成される画像の品質は同等であった。
- 実験には、CIFAR-10、CelebA、MetFaces、ArtBenchなど、7つの公開データセットから16万枚以上の画像が使用された。
- 結果、個々のデータの影響力は、データ規模が増大するにつれて逆べき乗則に従って減少することがわかった。
- チームはさらに検証のために1,282の個別のモデルを学習させ、同様の結果を得た。
- デビッド・ギフォード教授は、この発見により、AIの出力が依然として二次的著作物であると言えるのか、あるいは著作権保護の対象となり得るのかという問いが再燃すると指摘している。
- また、この研究は、出力を特定の作品に帰属させないことを保証するモデルをAI企業が構築できる可能性も示唆している。
- 著者らは、この研究は現在のところ画像生成の拡散モデルにのみ適用されるものであり、大規模言語モデルについてはまだ確認されていないと注意を促している。
📌 MITの研究は、生成AIの著作権に対して新しい視点を提示しています。学習データが十分に大きい場合、個々の作品は生成される画像に対してほとんど大きな影響を与えず、「元の作者」を特定することは非常に困難になります。この発見は、AIの著作権訴訟、二次的著作物の評価方法、およびクリエイターへの補償規定に強い影響を与える可能性がありますが、現時点では大規模言語モデルへの適用は証明されていません。
