- 麻省理工学院计算机科学与人工智能实验室(MIT CSAIL)的研究显示,当生成式 AI 模型使用海量数据集训练时,几乎不可能将输出追溯到具体的原始作品。
- 研究小组将这一现象称为“归属衰减”(attribution decay),即随着数据规模的增加,将输出归因于特定训练数据的能力逐渐减弱。
- 实验表明,可以从训练数据中删除一张图片、一位艺术家的全部作品或一个人的所有照片,而输出结果几乎没有任何变化。
- 研究小组认为,如果删除某项数据而结果保持不变,那么该数据就不能被视为产生输出的原因。
- 他们开发了一种“扩散集成”(diffusion ensemble)架构,将模型分成多个小组件,以便在不重新训练整个模型的情况下精确消除单个数据的影响。
- 该团队在相同数据上将新系统与 24 个传统扩散模型进行了对比,生成的图像质量相当。
- 实验使用了来自 CIFAR-10、CelebA、MetFaces 和 ArtBench 等 7 个公共数据集的 16 万多张图像。
- 结果显示,随着数据规模的增加,单个数据点的影响力按照逆幂律下降。
- 该小组还训练了 1282 个独立模型进行验证,得到了类似的结果。
- David Gifford 教授认为,这一发现重新引发了关于 AI 输出是否仍属于派生作品或是否有资格获得版权保护的问题。
- 研究还建议,AI 公司可以构建确保输出无法追溯到特定作品的模型。
- 作者指出,该研究目前仅适用于生成图像的扩散模型,尚未在大语言模型上得到证实。
📌 麻省理工学院的研究为生成式 AI 的版权问题提供了新视角。当训练数据足够大时,单个作品对生成的图像几乎不再产生显著影响,这使得确定“源作者”变得非常困难。这一发现可能会对 AI 版权诉讼、派生作品的评估方式以及创作者的赔偿规定产生重大影响,但目前尚未证明其适用于大语言模型。

