- Исследование MIT CSAIL показывает, что когда модели генеративного ИИ обучаются на огромных наборах данных, отследить происхождение результата до конкретной оригинальной работы становится практически невозможно.
- Исследовательская группа назвала это явление «распадом атрибуции» (attribution decay): способность соотнести результат с конкретными данными обучения снижается по мере роста объема данных.
- Эксперименты показывают, что из обучающих данных можно удалить одно изображение, все работы одного художника или все фотографии человека, при этом результат практически не изменится.
- По мнению исследователей, если при удалении данных результат остается прежним, то эти данные нельзя считать причиной создания этого результата.
- Они разработали архитектуру «diffusion ensemble», разделяющую модель на множество мелких компонентов, чтобы точно устранять влияние отдельных данных без переобучения всей модели.
- Группа сравнила новую систему с 24 традиционными диффузионными моделями на тех же данных; качество создаваемых изображений оказалось эквивалентным.
- В ходе тестирования использовалось более 160 000 изображений из 7 публичных наборов данных, таких как CIFAR-10, CelebA, MetFaces и ArtBench.
- Результаты показали, что влияние каждой единицы данных снижается по закону обратной степени при увеличении масштаба данных.
- Группа также обучила 1282 отдельные модели для проверки и получила аналогичные результаты.
- Профессор Дэвид Гиффорд считает, что это открытие ставит под вопрос, является ли результат работы ИИ производным произведением и подлежит ли он защите авторским правом.
- Исследование также предполагает, что ИИ-компании могут создавать модели, гарантирующие невозможность соотнесения результата с конкретными произведениями.
- Авторы отмечают, что исследование пока применимо только к диффузионным моделям генерации изображений и не подтверждено для больших языковых моделей.
📌 Работа MIT предлагает новый взгляд на авторское право в сфере генеративного ИИ. Когда объем обучающих данных достаточно велик, отдельные произведения почти не оказывают значительного влияния на создаваемое изображение, что делает определение «исходного автора» крайне сложным. Это открытие может сильно повлиять на судебные иски по авторским правам на ИИ, методы оценки производных работ и правила компенсации авторам, хотя его применимость к большим языковым моделям еще не доказана.
