この記事は、先端AIチップの不足という課題に続き、中国は次世代AIモデルを訓練するための高品質な中国語データの不足という別の深刻な課題に直面していると主張している。
米国の研究機関エポックAI(Epoch AI)によると、世界中で公開されている高品質な人間が作成したテキストは、今後6年以内に完全に枯渇する可能性があるという。
OpenAIの共同創設者であるアンドレイ・カルパシー(Andrej Karpathy)氏も、追加の新しく信頼性の高いデータがなければAIモデルの能力が頭打ちになる可能性があるとして、今十年末に向けた「データの壁」について警告している。
米国のAI企業はオフラインデータの収集を加速させている。裁判所の記録によると、Anthropicは数千万ドルを費やして数百万冊の物理的な本を購入し、背表紙を切り落とし、全コンテンツのスキャンとデジタル化を行ってから印刷版を廃棄したため、倫理や著作権に関する多くの論争を引き起こした。
中国にとって、この問題はより深刻である。なぜなら、中国語はグローバルインターネット上のコンテンツの約1.3%しか占めておらず、英語(約50%)、スペイン語(6%)、ドイツ語(5.9%)、日本語(5%)よりもはるかに少ないからである。
6月、中国国家データ局は、高品質なAI訓練データの供給、流通、商用化を大幅に増やす計画を発表した。
2028年までに、中国は製造業、エネルギー、医療、金融、農業、具現化AI(embodied AI)、自動運転、低空飛行などの分野に向けた検証済みデータエコシステムを構築することを目指している。
中国の専門家は、歴史的アーカイブ、地方誌、古代の写本、科学文書、辞書、視聴覚コンテンツ、さらには方言をデジタル化することで、大規模な中国語データリポジトリを構築することを求めている。
北京政府はまた、人間が生成したデータを補うために合成データの開発を企業に奨励している。しかし、文書のデジタル化は出版社からの反発に直面している。新しく印刷された本の中には、AIの訓練にコンテンツを使用することを禁止する条項を明確に記載し、違反した場合には法的措置を取ると警告するものもある。
📌 AI競争はチップやモデルからデータへと移行している。高品質なパブリックデータソースがますます枯渇する中、インターネット上の中国語コンテンツの割合が世界全体の約1.3%にとどまる中国は、より大きな課題に直面している。AIの発展ペースを維持するため、同国はオフラインの知識リポジトリのデジタル化、国家データエコシステムの構築、合成データの開発を加速させている。しかし、著作権とデータ所有権の問題が、AI競争の次の段階において大きな障壁となる可能性がある。
