- 中国は、モデルや計算能力と並んで、データをAI競争における決定的な要因と見なしている。
- 2023年、北京理工大学の研究者らは、ChatGPTが中国文化に関する多くの質問に誤って回答し、偏った見解を示していると評価した。
- 北京は、主に英語データで訓練されたAIモデルが西洋の価値観や視点を反映することを懸念している。
- 政府は国家データ局の計画に基づき、2028年までに中国をデータ強国にすることを目指している。
- この計画は、科学、製造、自動運転車など20以上の戦略的分野で高品質なデータセットを構築することを提案している。
- 中国は、途上国が独自のAIシステムを構築できるようデータを共有することを約束している。
- 国立研究所や国営メディアは、GitHubやHugging Faceで多くの無料データセットを公開している。
- 目標は、世界の開発者を惹きつけ、高品質な学習データにおいて米国との差を縮めることである。
- 専門家は、国内データが官庁や企業間で分散しているため、中国は依然として困難に直面していると指摘している。
- 計画では「データの孤立」を打破し、安価な労働力に代わって専門家によるデータラベル付け部隊を育成することを求めている。
- 大学には、AIデータのラベル付けに関するトレーニングプログラムの開設が奨励されている。
- 西側の分析家は、中国のデータが国家宣伝の影響を拡大させる可能性があると警告している。
- Nature誌の研究によると、ChatGPTとClaudeは英語に比べて中国語を使用した場合、中国についてより肯定的に回答することが示された。
- 上海AI研究所が開発したデータセット「万巻(WanJuan)」は、「中国の主流の価値観」に合致するものとして紹介され、アラビア語、ロシア語、タイ語、ベトナム語を含む多言語をサポートしている。
- 観測筋は、低コストのAIモデルとオープンデータセットを組み合わせることで、中国が途上国で技術的影響力を拡大するのに役立つと考えている。
📌 中国と米国のAI競争は、チップ、モデル、計算能力から学習データへと拡大している。北京は世界のデータ供給源になることを目指すと同時に、独自の基準とAIエコシステムを構築しようとしている。しかし、この戦略は、特にこれらのデータが多くの国のAIシステムの学習や微調整に使用される場合、世界のAIモデルが中国の公式見解を反映した内容をより多く吸収するリスクについての議論も巻き起こしている。

