- Trung Quốc coi dữ liệu là yếu tố quyết định trong cuộc đua AI, bên cạnh mô hình và năng lực tính toán.
- Năm 2023, các nhà nghiên cứu tại Viện Công nghệ Bắc Kinh đánh giá ChatGPT trả lời sai nhiều câu hỏi về văn hóa Trung Quốc và thể hiện quan điểm bị cho là thiên lệch.
- Bắc Kinh lo ngại các mô hình AI chủ yếu được huấn luyện bằng dữ liệu tiếng Anh sẽ phản ánh giá trị và quan điểm phương Tây.
- Chính quyền muốn biến Trung Quốc thành cường quốc dữ liệu trước năm 2028 theo kế hoạch của Cục Quản lý Dữ liệu Quốc gia.
- Kế hoạch đề xuất xây dựng bộ dữ liệu chất lượng cao cho hơn 20 lĩnh vực chiến lược như khoa học, sản xuất và xe tự lái.
- Trung Quốc cam kết chia sẻ dữ liệu với các nước đang phát triển để xây dựng hệ thống AI riêng.
- Các phòng thí nghiệm và truyền thông nhà nước đã phát hành nhiều bộ dữ liệu miễn phí trên GitHub và Hugging Face.
- Mục tiêu là thu hút nhà phát triển toàn cầu và thu hẹp khoảng cách với Mỹ về dữ liệu huấn luyện chất lượng cao.
- Chuyên gia nhận định Trung Quốc vẫn gặp khó vì dữ liệu trong nước bị phân tán giữa cơ quan và doanh nghiệp.
- Kế hoạch yêu cầu phá bỏ các “ốc đảo dữ liệu”, đồng thời phát triển lực lượng gán nhãn dữ liệu chuyên gia thay cho lao động giá rẻ.
- Đại học được khuyến khích mở chương trình đào tạo về gán nhãn dữ liệu AI.
- Các nhà phân tích phương Tây cảnh báo dữ liệu Trung Quốc có thể mở rộng ảnh hưởng của tuyên truyền nhà nước.
- Một nghiên cứu trên Nature cho thấy ChatGPT và Claude trả lời tích cực hơn về Trung Quốc khi sử dụng tiếng Trung so với tiếng Anh.
- Bộ dữ liệu WanJuan do Phòng thí nghiệm AI Thượng Hải phát triển được giới thiệu là phù hợp với “giá trị chủ đạo Trung Quốc”, hỗ trợ nhiều ngôn ngữ gồm tiếng Ả Rập, Nga, Thái và Việt Nam.
- Giới quan sát cho rằng kết hợp mô hình AI giá rẻ với bộ dữ liệu mở sẽ giúp Trung Quốc mở rộng ảnh hưởng công nghệ tại các nước đang phát triển.
📌 Cạnh tranh AI giữa Trung Quốc và Mỹ đang mở rộng từ chip, mô hình và năng lực tính toán sang dữ liệu huấn luyện. Bắc Kinh muốn trở thành nguồn cung dữ liệu toàn cầu, đồng thời xây dựng tiêu chuẩn và hệ sinh thái AI riêng. Tuy nhiên, chiến lược này cũng làm dấy lên tranh luận về nguy cơ các mô hình AI toàn cầu hấp thụ nhiều hơn những nội dung phản ánh quan điểm chính thức của Trung Quốc, đặc biệt khi dữ liệu này được sử dụng để huấn luyện hoặc tinh chỉnh các hệ thống AI ở nhiều quốc gia.
Tổng hợp.
