• Bài viết cho rằng sau bài toán thiếu chip AI tiên tiến, Trung Quốc đang đối mặt một thách thức nghiêm trọng khác là thiếu dữ liệu tiếng Trung chất lượng cao để huấn luyện các mô hình AI thế hệ mới.
  • Theo viện nghiên cứu Epoch AI của Mỹ, nguồn văn bản do con người tạo ra có chất lượng cao và công khai trên toàn cầu có thể cạn kiệt hoàn toàn trong khoảng 6 năm tới.
  • Đồng sáng lập OpenAI Andrej Karpathy cũng cảnh báo về “bức tường dữ liệu” vào cuối thập niên này, khi khả năng của các mô hình AI có thể chững lại nếu không có thêm dữ liệu mới và đáng tin cậy.
  • Các công ty AI Mỹ đã tăng tốc thu thập dữ liệu ngoại tuyến. Theo hồ sơ tòa án, Anthropic từng chi hàng chục triệu USD để mua hàng triệu cuốn sách giấy, cắt gáy, quét số hóa toàn bộ nội dung rồi loại bỏ bản in, gây nhiều tranh cãi về đạo đức và bản quyền.
  • Đối với Trung Quốc, vấn đề nghiêm trọng hơn vì tiếng Trung chỉ chiếm khoảng 1,3% nội dung trên Internet toàn cầu, thấp hơn nhiều so với tiếng Anh (gần 50%), tiếng Tây Ban Nha (6%), tiếng Đức (5,9%) và tiếng Nhật (5%).
  • Tháng 6, Cục Quản lý Dữ liệu Quốc gia Trung Quốc công bố kế hoạch tăng mạnh nguồn cung, lưu thông và thương mại hóa dữ liệu huấn luyện AI chất lượng cao.
  • Đến năm 2028, Trung Quốc đặt mục tiêu xây dựng hệ sinh thái dữ liệu được kiểm chứng cho các lĩnh vực như sản xuất, năng lượng, y tế, tài chính, nông nghiệp, AI hiện thân (embodied AI), xe tự hành và hàng không tầm thấp.
  • Các chuyên gia Trung Quốc kêu gọi xây dựng kho dữ liệu tiếng Trung quy mô lớn bằng cách số hóa kho lưu trữ lịch sử, địa chí, bản thảo cổ, tài liệu khoa học, từ điển, nội dung nghe nhìn và cả các phương ngữ.
  • Bắc Kinh cũng khuyến khích doanh nghiệp phát triển dữ liệu tổng hợp (synthetic data) để bổ sung cho dữ liệu do con người tạo ra. Tuy nhiên, việc số hóa tài liệu đang gặp phản ứng từ các nhà xuất bản. Một số sách mới đã in rõ điều khoản cấm sử dụng nội dung để huấn luyện AI và cảnh báo sẽ xử lý pháp lý đối với các trường hợp vi phạm.

📌 Cạnh tranh AI đang chuyển từ chip và mô hình sang dữ liệu. Khi nguồn dữ liệu công khai chất lượng cao ngày càng cạn kiệt, Trung Quốc phải đối mặt thách thức lớn hơn do lượng nội dung tiếng Trung trên Internet chỉ chiếm khoảng 1,3% toàn cầu. Để duy trì tốc độ phát triển AI, nước này đang đẩy mạnh số hóa kho tri thức ngoại tuyến, xây dựng hệ sinh thái dữ liệu quốc gia và phát triển dữ liệu tổng hợp. Tuy nhiên, bài toán bản quyền và quyền sở hữu dữ liệu có thể trở thành rào cản lớn trong giai đoạn tiếp theo của cuộc đua AI.

Tổng hợp

Share.
CÔNG TY CỔ PHẦN TƯ VẤN VÀ ĐO LƯỜNG VIỆT NAM
Liên hệ:

Địa chỉ: Số 34 Ngõ 91 Đường Trần Duy Hưng, Phường Yên Hòa, Thành phố Hà Nội, Việt Nam

© 2026 Vietmetric
Exit mobile version