• Fortune ha scoperto che OpenAI ha cambiato più volte i parametri di valutazione di GPT-6 Astra dopo la pubblicazione dell’articolo di presentazione il 3 settembre.
  • Il processo di rilascio ha subito dei rallentamenti con link non funzionanti per quasi due ore prima di essere visualizzati normalmente.
  • OpenAI ha dichiarato che l’articolo originale era stato pubblicato e poi ritirato per motivi non correlati ai benchmark, per poi essere ripubblicato con alcuni parametri modificati.
  • Il tasso di allucinazione interno di GPT-6 Astra era inizialmente del 4,2%, poi è sceso al 2,0%, ed è stato successivamente riportato al 4,2%.
  • Anche l’indice di allucinazione di GPT-5.6 Sol è passato dal 12,2% al 9,4% prima di tornare al livello originale.
  • Il punteggio ARC-AGI-3 di Astra nei documenti per la stampa era del 98,6%, ma è stato elevato al 99,9% nella versione pubblica.
  • Il punteggio Terminal-Bench 4.0 di Astra è aumentato leggermente dal 57,7% al 57,9% dopo l’aggiornamento dell’articolo.
  • Sono cambiati anche alcuni punteggi dei modelli Anthropic, come il FrontierMath di Claude Fable 5.1 che era sceso dall’87,8% al 78,0% per poi essere nuovamente corretto.
  • OpenAI ha spiegato che i risultati dei benchmark dipendono da molti fattori come checkpoint, harness, livelli di inferenza e configurazioni di valutazione, rendendo normali gli aggiustamenti prima o dopo il rilascio.
  • L’azienda ha affermato che l’obiettivo è riflettere la migliore stima delle prestazioni affinché gli utenti possano confrontare i modelli in modo più accurato.
  • I ricercatori dell’Università di Stanford ritengono che il fenomeno del “benchmaxxing”, ovvero ripetere i benchmark più volte per ottenere il risultato più alto, sia una realtà nel settore dell’IA e chiedono maggiore trasparenza sui metodi di valutazione.
  • Alcuni esperti suggeriscono che le aziende di IA debbano dichiarare chiaramente ogni cambiamento nelle condizioni di test quando aggiornano i benchmark, affinché la comunità di ricerca e i clienti comprendano l’esatto significato dei numeri.

📌 I benchmark dell’IA stanno diventando un fattore competitivo cruciale, ma causano anche molte polemiche sulla trasparenza. Il fatto che OpenAI modifichi continuamente i parametri di GPT-6 Astra dopo l’annuncio solleva dubbi su come le prestazioni dei modelli vengano misurate e presentate. Sebbene l’azienda sostenga che si tratti di un normale processo di aggiornamento tecnico, molti esperti ritengono che il settore dell’IA necessiti di standard più pubblici sulle condizioni di test e sui motivi dei cambiamenti dei benchmark, per consentire una valutazione più equa da parte di utenti, ricercatori e investitori.

Share.
VIET NAM CONSULTING AND MEASUREMENT JOINT STOCK COMPANY
CONTATTI

Email: info@vietmetric.vn
Indirizzo: Numero 34, Vicolo 91, Via Tran Duy Hung, Quartiere Yen Hoa, Città di Hanoi

© 2026 Vietmetric
Exit mobile version