文章指出,继缺乏先进AI芯片的问题之后,中国正面临另一项严峻挑战,即缺乏用于训练新一代AI的高质量中文数据。
根据美国研究机构Epoch AI的数据,全球公开的高质量人类生成文本可能会在未来六年内彻底枯竭。
OpenAI联合创始人安德雷·卡帕西(Andrej Karpathy)也警告称,本十年末将出现“数据墙”,如果没有更多新且可靠的数据,AI模型的能力可能会陷入停滞。
美国AI公司一直在加速收集离线数据。根据法庭文件,Anthropic曾花费数千万美元购买数百万本实体书,拆除书脊,扫描并数字化全部内容,随后丢弃印刷本,引发了关于伦理和版权的大量争议。
对中国而言,这个问题更为严重,因为中文仅占全球互联网内容的约1.3%,远低于英语(近50%)、西班牙语(6%)、德语(5.9%)和日语(5%)。
6月,中国国家数据局公布了一项计划,旨在大幅增加高质量AI训练数据的供给、流通和商业化。
到2028年,中国计划为制造、能源、医疗、金融、农业、具身智能、自动驾驶和低空航空等领域构建经过验证的数据生态系统。
中国专家呼吁通过数字化历史档案、地方志、古籍手稿、科学文献、字典、视听内容甚至方言,来构建大规模的中文数据仓库。
北京还鼓励企业开发合成数据,以补充人类生成的数据。然而,文献数字化正面临来自出版商的反对。一些新印的书籍明确载有禁止将内容用于AI训练的条款,并警告将对违规行为采取法律行动。
📌 AI竞争正从芯片和模型转向数据。随着高质量公开数据源日益枯竭,由于互联网上的中文内容仅占全球的约1.3%左右,中国面临着更大的挑战。为了维持AI发展速度,中国正在加速数字化离线知识库、构建国家数据生态系统并开发合成数据。然而,版权和数据所有权问题可能成为AI竞赛下一阶段的主要障碍。
