• MIT CSAIL의 연구에 따르면 생성형 AI 모델이 매우 방대한 데이터셋으로 학습될 경우, 결과물의 출처를 개별 원저작물로 추적하는 것이 거의 불가능해진다.
  • 연구팀은 이 현상을 ‘속성 쇠퇴(attribution decay)’라고 명명했는데, 데이터 규모가 커질수록 출력물을 특정 학습 데이터로 귀속시킬 수 있는 능력이 감소하는 것을 의미한다.
  • 실험 결과, 학습 데이터에서 이미지 한 장, 특정 화가의 전체 작품, 또는 한 인물의 모든 사진을 삭제하더라도 결과물은 거의 변하지 않는 것으로 나타났다.
  • 연구팀에 따르면, 특정 데이터를 제거해도 결과가 같다면 해당 데이터는 결과물 생성의 직접적인 원인으로 간주될 수 없다.
  • 연구진은 ‘확산 앙상블(diffusion ensemble)’ 아키텍처를 개발하여, 전체 모델을 다시 학습시키지 않고도 개별 데이터의 영향을 정밀하게 제거할 수 있도록 모델을 작은 구성 요소로 나누었다.
  • 동일한 데이터로 새로운 시스템을 24개의 기존 확산 모델과 비교한 결과, 생성된 이미지의 품질은 대등한 수준이었다.
  • 실험에는 CIFAR-10, CelebA, MetFaces, ArtBench 등 7개의 공개 데이터셋에서 추출한 16만 개 이상의 이미지가 사용되었다.
  • 결과적으로 개별 데이터의 영향력은 데이터 규모가 커짐에 따라 역거듭제곱 법칙에 따라 감소하는 것으로 나타났다.
  • 연구팀은 검증을 위해 1,282개의 개별 모델을 추가로 학습시켰으며, 역시 동일한 결과를 얻었다.
  • 데이비드 기포드 교수는 이 발견이 AI 출력물을 여전히 파생 저작물로 볼 수 있는지, 혹은 저작권 보호 자격이 있는지에 대한 의문을 다시 제기한다고 언급했다.
  • 연구는 또한 AI 기업들이 결과물을 특정 작품으로 귀속시킬 수 없도록 보장하는 모델을 구축할 수 있음을 시사한다.
  • 저자들은 이번 연구가 현재 이미지 생성 확산 모델에만 적용되며, 거대 언어 모델(LLM)에서는 아직 확인되지 않았다고 덧붙였다.

📌 MIT의 이번 연구는 생성형 AI 저작권에 대한 새로운 관점을 제시합니다. 학습 데이터가 충분히 클 경우, 개별 작품은 생성된 이미지에 거의 유의미한 영향을 미치지 않게 되어 ‘원저작자’를 판별하기가 매우 어려워집니다. 이러한 발견은 AI 저작권 소송, 2차 저작물 평가 방식 및 창작자 보상 규정에 강력한 영향을 미칠 수 있으나, 현재 거대 언어 모델에 대해서는 증명된 바가 없습니다.

Share.
VIET NAM CONSULTING AND MEASUREMENT JOINT STOCK COMPANY
연락처

이메일: info@vietmetric.vn
주소: 베트남 하노이시 옌호아 동 쩐주이흥 거리 91번 골목 34번

© 2026 Vietmetric
Exit mobile version