• Fortune stellte fest, dass OpenAI die Bewertungskennzahlen von GPT-6 Astra nach der Veröffentlichung des Vorstellungsartikels am 3. September mehrfach geändert hat.
  • Der Veröffentlichungsprozess war fehlerhaft; Links funktionierten fast zwei Stunden lang nicht, bevor sie normal angezeigt wurden.
  • OpenAI gab an, dass der Artikel zunächst veröffentlicht und dann aus Gründen, die nichts mit den Benchmarks zu tun hatten, zurückgezogen wurde, um später mit geänderten Kennzahlen erneut gepostet zu werden.
  • Die interne Halluzinationsrate von GPT-6 Astra lag zunächst bei 4,2 %, sank dann auf 2,0 % und wurde später wieder auf 4,2 % korrigiert.
  • Der Halluzinationsindex von GPT-5.6 Sol änderte sich ebenfalls von 12,2 % auf 9,4 %, bevor er auf das ursprüngliche Niveau zurückkehrte.
  • Der ARC-AGI-3-Wert von Astra in den Presseunterlagen lag bei 98,6 %, wurde aber in der öffentlichen Version auf 99,9 % angehoben.
  • Der Terminal-Bench 4.0-Wert von Astra stieg nach der Aktualisierung des Artikels leicht von 57,7 % auf 57,9 %.
  • Auch einige Werte der Anthropic-Modelle änderten sich, wie z. B. FrontierMath von Claude Fable 5.1, das zeitweise von 87,8 % auf 78,0 % sank und später angepasst wurde.
  • OpenAI erklärte, dass Benchmarking-Ergebnisse von vielen Faktoren wie Checkpoints, Harnesses, Inferenzstufen und Bewertungskonfigurationen abhängen, weshalb Anpassungen vor oder nach der Veröffentlichung normal seien.
  • Das Unternehmen gab an, dass das Ziel darin bestehe, die beste Leistungsschätzung widerzuspiegeln, damit Nutzer die Modelle genauer vergleichen können.
  • Forscher der Stanford University sind der Ansicht, dass das Phänomen des „Benchmaxxing“ – das mehrfache Ausführen von Benchmarks, um das höchste Ergebnis zu erzielen – in der KI-Branche Realität ist, und fordern mehr Transparenz bei den Bewertungsmethoden.
  • Einige Experten schlugen vor, dass KI-Unternehmen bei der Aktualisierung von Benchmarks alle Änderungen der Testbedingungen klar offenlegen müssen, damit die Forschungsgemeinschaft und Kunden die genaue Bedeutung der Zahlen verstehen.

📌 KI-Benchmarks werden zunehmend zu einem wichtigen Wettbewerbsfaktor, lösen aber auch viele Debatten über die Transparenz aus. Dass OpenAI die Kennzahlen von GPT-6 Astra nach der Ankündigung kontinuierlich anpasst, wirft Fragen zur Messung und Darstellung der Modellleistung auf. Während das Unternehmen behauptet, dies sei ein normaler technischer Aktualisierungsprozess, argumentieren viele Experten, dass die KI-Branche öffentlichere Standards für Testbedingungen und Gründe für Benchmark-Änderungen benötigt, damit Nutzer, Forscher und Investoren die Ergebnisse fairer bewerten können.

Share.
VIET NAM CONSULTING AND MEASUREMENT JOINT STOCK COMPANY
KONTAKT

E-mail: info@vietmetric.vn
Adresse: Nr. 34, Gasse 91, Tran-Duy-Hung-Straße, Bezirk Yen Hoa, Stadt Hanoi

© 2026 Vietmetric
Exit mobile version