- China betrachtet Daten neben Modellen und Rechenleistung als entscheidenden Faktor im KI-Wettlauf.
- Im Jahr 2023 bewerteten Forscher des Beijing Institute of Technology, dass ChatGPT viele Fragen zur chinesischen Kultur falsch beantwortete und voreingenommene Standpunkte vertrat.
- Peking befürchtet, dass KI-Modelle, die hauptsächlich mit englischsprachigen Daten trainiert wurden, westliche Werte und Perspektiven widerspiegeln.
- Die Regierung will China laut dem Plan der Nationalen Datenverwaltung bis 2028 zu einer Datenmacht machen.
- Der Plan sieht den Aufbau hochwertiger Datensätze für mehr als 20 strategische Bereiche wie Wissenschaft, Fertigung und autonomes Fahren vor.
- China verpflichtet sich, Daten mit Entwicklungsländern zu teilen, um deren eigene KI-Systeme aufzubauen.
- Staatliche Labore und Medien haben viele kostenlose Datensätze auf GitHub und Hugging Face veröffentlicht.
- Ziel ist es, globale Entwickler anzuziehen und die Lücke zu den USA bei hochwertigen Trainingsdaten zu schließen.
- Experten merken an, dass China immer noch Schwierigkeiten hat, da interne Daten zwischen Behörden und Unternehmen fragmentiert sind.
- Der Plan fordert das Aufbrechen von „Dateninseln“ und den Aufbau einer Truppe von Experten für Datenkennzeichnung anstelle von Billiglohnkräften.
- Universitäten werden ermutigt, Ausbildungsprogramme für KI-Datenkennzeichnung anzubieten.
- Westliche Analysten warnen, dass chinesische Daten den Einfluss staatlicher Propaganda ausweiten könnten.
- Eine Studie in Nature zeigte, dass ChatGPT und Claude positiver über China antworten, wenn sie Chinesisch statt Englisch verwenden.
- Der vom Shanghai AI Laboratory entwickelte WanJuan-Datensatz wird als im Einklang mit den „chinesischen Hauptwerten“ stehend präsentiert und unterstützt mehrere Sprachen, darunter Arabisch, Russisch, Thailändisch und Vietnamesisch.
- Beobachter glauben, dass die Kombination aus kostengünstigen KI-Modellen und offenen Datensätzen China helfen wird, seinen technologischen Einfluss in Entwicklungsländern auszuweiten.
📌 Der KI-Wettbewerbs zwischen China und den USA weitet sich von Chips, Modellen und Rechenleistung auf Trainingsdaten aus. Peking will ein globaler Datenlieferant werden und gleichzeitig eigene Standards und ein eigenes KI-Ökosystem aufbauen. Diese Strategie löst jedoch auch Debatten über das Risiko aus, dass globale KI-Modelle verstärkt Inhalte absorbieren, die Chinas offizielle Sichtweise widerspiegeln, insbesondere wenn diese Daten zum Trainieren oder Verfeinern von KI-Systemen in vielen Ländern verwendet werden.

