- 중국은 모델 및 컴퓨팅 능력과 더불어 데이터를 AI 경쟁의 결정적 요소로 간주한다.
- 2023년 베이징 공대 연구진은 ChatGPT가 중국 문화에 관한 많은 질문에 오답을 내놓고 편향된 관점을 보여준다고 평가했다.
- 베이징은 주로 영어 데이터로 학습된 AI 모델이 서구적 가치와 관점을 반영할 것을 우려한다.
- 정부는 국가데이터국 계획에 따라 2028년까지 중국을 데이터 강국으로 만드는 것을 목표로 한다.
- 이 계획은 과학, 제조, 자율주행차 등 20개 이상의 전략 분야를 위한 고품질 데이터셋 구축을 제안한다.
- 중국은 개발도상국들이 자체 AI 시스템을 구축할 수 있도록 데이터를 공유하겠다고 약속했다.
- 국가 실험실과 관영 매체는 GitHub와 Hugging Face에 많은 무료 데이터셋을 공개했다.
- 목표는 글로벌 개발자들을 유인하고 고품질 학습 데이터 분야에서 미국과의 격차를 줄이는 것이다.
- 전문가는 국내 데이터가 기관과 기업 사이에 분산되어 있어 중국이 여전히 어려움을 겪고 있다고 분석한다.
- 계획은 ‘데이터 고립’을 타파하고, 저렴한 노동력 대신 전문가 데이터 라벨링 인력을 양성할 것을 요구한다.
- 대학들은 AI 데이터 라벨링 교육 과정 개설을 권장받고 있다.
- 서구 분석가들은 중국 데이터가 국가 홍보의 영향력을 확대할 수 있다고 경고한다.
- Nature지에 실린 연구에 따르면 ChatGPT와 Claude는 영어보다 중국어를 사용할 때 중국에 대해 더 긍정적으로 답변하는 것으로 나타났다.
- 상하이 AI 실험실이 개발한 ‘완쥐안(WanJuan)’ 데이터셋은 ‘중국 주류 가치’에 부합하는 것으로 소개되었으며 아랍어, 러시아어, 태국어, 베트남어를 포함한 다국어를 지원한다.
- 관측통들은 저가형 AI 모델과 오픈 데이터셋의 결합이 중국이 개발도상국에서 기술적 영향력을 확대하는 데 도움이 될 것이라고 본다.
📌 중국과 미국 간의 AI 경쟁이 칩, 모델, 컴퓨팅 능력을 넘어 학습 데이터로 확장되고 있다. 베이징은 글로벌 데이터 공급원이 되는 동시에 독자적인 표준과 AI 생태계를 구축하고자 한다. 그러나 이러한 전략은 특히 이 데이터가 여러 국가의 AI 시스템 학습이나 미세 조정에 사용될 경우, 글로벌 AI 모델이 중국의 공식 입장을 반영하는 콘텐츠를 더 많이 흡수할 위험에 대한 논란을 불러일으키고 있다.

