• Fortune a découvert qu’OpenAI a modifié à plusieurs reprises les indicateurs d’évaluation de GPT-6 Astra après la publication de l’article de présentation le 3 septembre.
  • Le processus de publication a connu des dysfonctionnements, les liens étant inactifs pendant près de deux heures avant de s’afficher normalement.
  • OpenAI a déclaré que l’article avait été initialement publié puis retiré pour des raisons non liées aux benchmarks, avant d’être republié avec certains indicateurs modifiés.
  • Le taux d’hallucination interne de GPT-6 Astra était initialement de 4,2 %, puis est tombé à 2,0 %, avant d’être réajusté à 4,2 %.
  • L’indice d’hallucination de GPT-5.6 Sol a également varié de 12,2 % à 9,4 % avant de revenir à son niveau initial.
  • Le score ARC-AGI-3 d’Astra dans les documents de presse était de 98,6 %, mais a été porté à 99,9 % dans la version publique.
  • Le score Terminal-Bench 4.0 d’Astra a légèrement augmenté, passant de 57,7 % à 57,9 % après la mise à jour de l’article.
  • Certains scores des modèles d’Anthropic ont également changé, comme le FrontierMath de Claude Fable 5.1 qui est passé de 87,8 % à 78,0 % avant d’être réajusté.
  • OpenAI a expliqué que les résultats des benchmarks dépendent de nombreux facteurs tels que les checkpoints, le harness, les niveaux d’inférence et les configurations d’évaluation, rendant les ajustements normaux avant ou après la sortie.
  • L’entreprise a affirmé que l’objectif était de refléter la meilleure estimation des performances pour permettre aux utilisateurs de comparer les modèles plus précisément.
  • Des chercheurs de l’Université de Stanford estiment que le phénomène de « benchmaxxing », consistant à relancer les tests plusieurs fois pour obtenir le résultat le plus élevé, est une réalité dans l’industrie de l’IA et appellent à plus de transparence sur les méthodes d’évaluation.
  • Certains experts suggèrent que les entreprises d’IA devraient publier clairement tout changement dans les conditions de test lors de la mise à jour des benchmarks pour que la communauté de recherche et les clients comprennent l’exactitude de ces chiffres.

📌 Les benchmarks d’IA deviennent un facteur de compétition crucial mais suscitent également de nombreux débats sur la transparence. L’ajustement continu des indicateurs de GPT-6 Astra par OpenAI après l’annonce soulève des questions sur la manière dont les performances des modèles sont mesurées et présentées. Bien que l’entreprise affirme qu’il s’agit d’un processus de mise à jour technique normal, de nombreux experts estiment que l’industrie de l’IA a besoin de normes plus publiques sur les conditions de test et les raisons des modifications de benchmarks afin que les utilisateurs, les chercheurs et les investisseurs puissent évaluer les modèles de manière plus équitable.

Share.
VIET NAM CONSULTING AND MEASUREMENT JOINT STOCK COMPANY
Contact

E-mail: info@vietmetric.vn
Adresse : N° 34, Allée 91, Rue Tran Duy Hung, Quartier Yen Hoa, Ville de Hanoï

© 2026 Vietmetric
Exit mobile version