이 기사는 첨단 AI 칩 부족 문제에 이어 중국이 차세대 AI 모델을 학습시킬 고품질 중국어 데이터 부족이라는 또 다른 심각한 도전에 직면해 있다고 주장한다.

미국 연구기관 에폭 AI(Epoch AI)에 따르면, 전 세계적으로 공개된 고품질의 인간 생성 텍스트는 향후 6년 안에 완전히 고갈될 수 있다.

OpenAI의 공동 창립자 안드레이 카르파시(Andrej Karpathy) 역시 추가적이고 신뢰할 수 있는 데이터가 없으면 AI 모델의 성능이 정체될 수 있다며 이번 십 년 말까지 ‘데이터 장벽’이 올 것이라고 경고했다.

미국 AI 기업들은 오프라인 데이터 수집을 가속화해 왔다. 법원 기록에 따르면 앤트로픽(Anthropic)은 수천만 달러를 들여 수백만 권의 실물 책을 사고, 제본을 뜯어 전체 내용을 스캔 및 디지털화한 뒤 인쇄본을 폐기하여 윤리 및 저작권 논란을 불러일으켰다.

중국에게 이 문제는 더욱 심각하다. 중국어는 전 세계 인터넷 콘텐츠의 약 1.3%만을 차지하여 영어(약 50%), 스페인어(6%), 독일어(5.9%), 일본어(5%)보다 훨씬 낮기 때문이다.

6월, 중국 국가데이터국은 고품질 AI 학습 데이터의 공급, 유통, 상용화를 대폭 늘리는 계획을 발표했다.

2028년까지 중국은 제조업, 에너지, 의료, 금융, 농업, 체화형 AI(embodied AI), 자율주행, 저고도 항공 등의 분야를 위한 검증된 데이터 생태계를 구축하는 것을 목표로 하고 있다.

중국 전문가들은 역사 기록, 지방지, 고대 필사본, 과학 문서, 사전, 시청각 콘텐츠, 심지어 방언까지 디지털화하여 대규모 중국어 데이터 저장소를 구축할 것을 촉구하고 있다.

베이징은 또한 인간이 생성한 데이터를 보완하기 위해 기업들이 합성 데이터(synthetic data)를 개발하도록 장려하고 있다. 그러나 문서 디지털화는 출판사들의 반발에 부딪히고 있다. 일부 새로 인쇄된 책에는 AI 학습에 콘텐츠를 사용하는 것을 금지하는 조항이 명시되어 있으며 위반 시 법적 조치를 취하겠다고 경고하고 있다.

📌 AI 경쟁이 칩과 모델에서 데이터로 이동하고 있다. 고품질 공개 데이터 소스가 점차 고갈됨에 따라, 인터넷상의 중국어 콘텐츠 양이 전 세계의 약 1.3%에 불과한 중국은 더 큰 도전에 직면해 있다. AI 발전 속도를 유지하기 위해 중국은 오프라인 지식 저장소의 디지털화, 국가 데이터 생태계 구축, 합성 데이터 개발을 가속화하고 있다. 그러나 저작권과 데이터 소유권 문제는 AI 경쟁의 다음 단계에서 큰 걸림돌이 될 수 있다.

Share.
VIET NAM CONSULTING AND MEASUREMENT JOINT STOCK COMPANY
연락처

이메일: info@vietmetric.vn
주소: 베트남 하노이시 옌호아 동 쩐주이흥 거리 91번 골목 34번

© 2026 Vietmetric
Exit mobile version