В статье утверждается, что вслед за проблемой нехватки передовых чипов для ИИ Китай столкнулся с еще одной серьезной проблемой — нехваткой высококачественных данных на китайском языке для обучения моделей ИИ нового поколения.
По данным американского исследовательского института Epoch AI, высококачественный публичный текст, созданный человеком, в глобальном масштабе может полностью исчерпаться в течение следующих шести лет.
Сооснователь OpenAI Андрей Карпаты также предупредил о «наступлении стены данных» к концу этого десятилетия, поскольку возможности моделей ИИ могут зайти в тупик без дополнительных новых и надежных данных.
Американские ИИ-компании ускорили сбор офлайн-данных. Согласно судебным документам, компания Anthropic потратила десятки миллионов долларов на покупку миллионов бумажных книг, срезание переплетов, сканирование и оцифровку всего содержимого с последующей утилизацией печатных копий, что вызвало широкие споры об этике и авторском праве.
Для Китая эта проблема стоит острее, поскольку на китайский язык приходится всего около 1,3% контента в мировом Интернете, что значительно меньше, чем на английском (почти 50%), испанском (6%), немецком (5,9%) и японском (5%).
В июне Национальное бюро данных Китая обнародовало план по значительному увеличению поставок, циркуляции и коммерциализации высококачественных данных для обучения ИИ.
К 2028 году Китай ставит перед собой цель создать проверенную экосистему данных для таких секторов, как производство, энергетика, здравоохранение, финансы, сельское хозяйство, воплощенный ИИ (embodied AI), автономный транспорт и маловысотная авиация.
Китайские эксперты призывают к созданию крупномасштабных хранилищ китайских данных путем оцифровки исторических архивов, местных хроник, древних рукописей, научных документов, словарей, аудиовизуального контента и даже диалектов.
Пекин также поощряет предприятия разрабатывать синтетические данные в качестве дополнения к данным, созданным человеком. Однако оцифровка документов сталкивается с противодействием со стороны издателей. В некоторые недавно напечатанные книги четко внесены пункты, запрещающие использовать контент для обучения ИИ, с предупреждением о судебном преследовании в случае нарушений.
📌 Конкуренция в сфере ИИ смещается от чипов и моделей к данным. По мере того как источники высококачественных общедоступных данных истощаются, Китай сталкивается с более серьезной проблемой, поскольку объем контента на китайском языке в Интернете составляет лишь около 1,3% от общемирового. Чтобы поддерживать темпы развития ИИ, страна ускоряет оцифровку офлайн-хранилищ знаний, создает национальную экосистему данных и развивает синтетические данные. Однако вопросы авторского права и владения данными могут стать серьезным препятствием на следующем этапе гонки ИИ.
