В статье утверждается, что вслед за проблемой нехватки передовых чипов для ИИ Китай столкнулся с еще одной серьезной проблемой — нехваткой высококачественных данных на китайском языке для обучения моделей ИИ нового поколения.

По данным американского исследовательского института Epoch AI, высококачественный публичный текст, созданный человеком, в глобальном масштабе может полностью исчерпаться в течение следующих шести лет.

Сооснователь OpenAI Андрей Карпаты также предупредил о «наступлении стены данных» к концу этого десятилетия, поскольку возможности моделей ИИ могут зайти в тупик без дополнительных новых и надежных данных.

Американские ИИ-компании ускорили сбор офлайн-данных. Согласно судебным документам, компания Anthropic потратила десятки миллионов долларов на покупку миллионов бумажных книг, срезание переплетов, сканирование и оцифровку всего содержимого с последующей утилизацией печатных копий, что вызвало широкие споры об этике и авторском праве.

Для Китая эта проблема стоит острее, поскольку на китайский язык приходится всего около 1,3% контента в мировом Интернете, что значительно меньше, чем на английском (почти 50%), испанском (6%), немецком (5,9%) и японском (5%).

В июне Национальное бюро данных Китая обнародовало план по значительному увеличению поставок, циркуляции и коммерциализации высококачественных данных для обучения ИИ.

К 2028 году Китай ставит перед собой цель создать проверенную экосистему данных для таких секторов, как производство, энергетика, здравоохранение, финансы, сельское хозяйство, воплощенный ИИ (embodied AI), автономный транспорт и маловысотная авиация.

Китайские эксперты призывают к созданию крупномасштабных хранилищ китайских данных путем оцифровки исторических архивов, местных хроник, древних рукописей, научных документов, словарей, аудиовизуального контента и даже диалектов.

Пекин также поощряет предприятия разрабатывать синтетические данные в качестве дополнения к данным, созданным человеком. Однако оцифровка документов сталкивается с противодействием со стороны издателей. В некоторые недавно напечатанные книги четко внесены пункты, запрещающие использовать контент для обучения ИИ, с предупреждением о судебном преследовании в случае нарушений.

📌 Конкуренция в сфере ИИ смещается от чипов и моделей к данным. По мере того как источники высококачественных общедоступных данных истощаются, Китай сталкивается с более серьезной проблемой, поскольку объем контента на китайском языке в Интернете составляет лишь около 1,3% от общемирового. Чтобы поддерживать темпы развития ИИ, страна ускоряет оцифровку офлайн-хранилищ знаний, создает национальную экосистему данных и развивает синтетические данные. Однако вопросы авторского права и владения данными могут стать серьезным препятствием на следующем этапе гонки ИИ.

Share.
VIET NAM CONSULTING AND MEASUREMENT JOINT STOCK COMPANY
KONTAKT

Электронная почта: info@vietmetric.vn
Адрес: Дом 34, переулок 91, улица Чан Зуй Хынг, район Йен Хоа, город Ханой

© 2026 Vietmetric
Exit mobile version