- Китай считает данные решающим фактором в гонке ИИ, наряду с моделями и вычислительными мощностями.
- В 2023 году исследователи из Пекинского технологического института пришли к выводу, что ChatGPT неправильно отвечает на многие вопросы о китайской культуре и демонстрирует предвзятость.
- Пекин опасается, что модели ИИ, обученные преимущественно на англоязычных данных, будут отражать западные ценности и взгляды.
- Правительство намерено превратить Китай в державу данных к 2028 году согласно плану Государственного управления данных.
- План предлагает создание высококачественных наборов данных для более чем 20 стратегических областей, таких как наука, производство и беспилотные автомобили.
- Китай обязуется делиться данными с развивающимися странами для создания их собственных систем ИИ.
- Государственные лаборатории и СМИ выпустили множество бесплатных наборов данных на GitHub и Hugging Face.
- Цель — привлечь мировых разработчиков и сократить отставание от США в области качественных данных для обучения.
- Эксперты отмечают, что Китай всё еще сталкивается с трудностями из-за разрозненности внутренних данных между ведомствами и предприятия.
- План требует разрушения «оазисов данных» и развития штата экспертов по разметке данных вместо дешевой рабочей силы.
- Университетам рекомендуется открывать программы обучения по разметке данных для ИИ.
- Западные аналитики предупреждают, что китайские данные могут усилить влияние государственной пропаганды.
- Исследование в Nature показало, что ChatGPT и Claude отвечают о Китае более позитивно на китайском языке, чем на английском.
- Набор данных WanJuan, разработанный Шанхайской лабораторией ИИ, представлен как соответствующий «основным китайским ценностям» и поддерживает несколько языков, включая арабский, русский, тайский и вьетнамский.
- Наблюдатели считают, что сочетание недорогих моделей ИИ с открытыми данными поможет Китаю расширить технологическое влияние в развивающихся странах.
📌 Конкуренция в области ИИ между Китаем и США расширяется с чипов, моделей и вычислительных мощностей на данные для обучения. Пекин хочет стать глобальным поставщиком данных, создавая при этом собственные стандарты и экосистему ИИ. Однако эта стратегия также вызывает дискуссии о риске того, что мировые модели ИИ будут впитывать больше контента, отражающего официальную точку зрения Китая, особенно когда эти данные используются для обучения или настройки систем ИИ во многих странах.
