- 中国认为数据是 AI 竞赛中的决定性因素,与模型和算力同等重要。
- 2023年,北京理工大学的研究人员评估认为 ChatGPT 在许多关于中国文化的问题上回答错误,并表现出被视为偏见的观点。
- 北京担心主要由英语数据训练的 AI 模型会反映西方价值观和观点。
- 根据国家数据局的计划,政府目标是在2028年前将中国建设成为数据强国。
- 该计划建议为科学、制造和自动驾驶等20多个战略领域构建高质量数据集。
- 中国承诺与发展中国家分享数据,以帮助其建立自己的 AI 系统。
- 国家实验室和官方媒体已在 GitHub 和 Hugging Face 上发布了许多免费数据集。
- 目标是吸引全球开发者,缩小与美国在高质量训练数据方面的差距。
- 专家认为,由于国内数据分散在机构和企业之间,中国仍面临困难。
- 计划要求打破“数据孤岛”,同时发展专家级数据标注力量以取代廉价劳动力。
- 鼓励大学开设 AI 数据标注培训课程。
- 西方分析人士警告称,中国数据可能会扩大国家宣传的影响力。
- 《自然》杂志上的一项研究显示,与英语相比,ChatGPT 和 Claude 在使用中文时对中国的评价更为积极。
- 由上海 AI 实验室开发的“万卷”(WanJuan)数据集被介绍为符合“中国主流价值观”,支持阿拉伯语、俄语、泰语和越南语等多种语言。
- 观察家认为,将低成本 AI 模型与开放数据集相结合,将有助于中国在发展中国家扩大技术影响力。
📌 中美之间的 AI 竞争正从芯片、模型和算力扩展到训练数据。北京希望成为全球数据供应源,同时建立自己的标准和 AI 生态系统。然而,这一战略也引发了关于全球 AI 模型更多吸收反映中国官方观点的内容的讨论,特别是当这些数据被用于许多国家的 AI 系统训练或微调时。
