- La Chine considère les données comme un facteur décisif dans la course à l’IA, aux côtés des modèles et de la puissance de calcul.
- En 2023, des chercheurs de l’Institut de technologie de Pékin ont estimé que ChatGPT répondait de manière erronée à de nombreuses questions sur la culture chinoise et affichait des points de vue jugés biaisés.
- Pékin craint que les modèles d’IA formés principalement avec des données en anglais ne reflètent les valeurs et les perspectives occidentales.
- Le gouvernement souhaite transformer la Chine en une puissance des données d’ici 2028, selon le plan de l’Administration nationale des données.
- Le plan propose de construire des ensembles de données de haute qualité pour plus de 20 secteurs stratégiques tels que la science, l’industrie et les véhicules autonomes.
- La Chine s’engage à partager ses données avec les pays en développement pour les aider à construire leurs propres systèmes d’IA.
- Les laboratoires d’État et les médias ont publié de nombreux jeux de données gratuits sur GitHub et Hugging Face.
- L’objectif est d’attirer les développeurs mondiaux et de réduire l’écart avec les États-Unis en matière de données d’entraînement de haute qualité.
- Les experts notent que la Chine rencontre encore des difficultés car les données internes sont fragmentées entre les administrations et les entreprises.
- Le plan appelle à briser les « îlots de données » et à développer une force d’étiquetage de données experte pour remplacer la main-d’œuvre bon marché.
- Les universités sont encouragées à ouvrir des programmes de formation sur l’étiquetage des données d’IA.
- Les analystes occidentaux préviennent que les données chinoises pourraient étendre l’influence de la propagande d’État.
- Une étude dans Nature a montré que ChatGPT et Claude répondent de manière plus positive sur la Chine lorsqu’ils utilisent le chinois par rapport à l’anglais.
- Le jeu de données WanJuan, développé par le laboratoire d’IA de Shanghai, est présenté comme conforme aux « valeurs dominantes chinoises » et prend en charge plusieurs langues dont l’arabe, le russe, le thaï et le vietnamien.
- Les observateurs estiment que la combinaison de modèles d’IA à bas coût et de jeux de données ouverts aidera la Chine à étendre son influence technologique dans les pays en développement.
📌 La compétition en IA entre la Chine et les États-Unis s’étend des puces, des modèles et de la puissance de calcul aux données d’entraînement. Pékin souhaite devenir un fournisseur mondial de données, tout en construisant ses propres normes et son écosystème IA. Cependant, cette stratégie suscite également des débats sur le risque que les modèles d’IA mondiaux absorbent davantage de contenus reflétant les points de vue officiels de la Chine, en particulier lorsque ces données sont utilisées pour entraîner ou affiner des systèmes d’IA dans de nombreux pays.

