- Fortune ha scoperto che OpenAI ha cambiato più volte i parametri di valutazione di GPT-6 Astra dopo la pubblicazione dell’articolo di presentazione il 3 settembre.
- Il processo di rilascio ha subito dei rallentamenti con link non funzionanti per quasi due ore prima di essere visualizzati normalmente.
- OpenAI ha dichiarato che l’articolo originale era stato pubblicato e poi ritirato per motivi non correlati ai benchmark, per poi essere ripubblicato con alcuni parametri modificati.
- Il tasso di allucinazione interno di GPT-6 Astra era inizialmente del 4,2%, poi è sceso al 2,0%, ed è stato successivamente riportato al 4,2%.
- Anche l’indice di allucinazione di GPT-5.6 Sol è passato dal 12,2% al 9,4% prima di tornare al livello originale.
- Il punteggio ARC-AGI-3 di Astra nei documenti per la stampa era del 98,6%, ma è stato elevato al 99,9% nella versione pubblica.
- Il punteggio Terminal-Bench 4.0 di Astra è aumentato leggermente dal 57,7% al 57,9% dopo l’aggiornamento dell’articolo.
- Sono cambiati anche alcuni punteggi dei modelli Anthropic, come il FrontierMath di Claude Fable 5.1 che era sceso dall’87,8% al 78,0% per poi essere nuovamente corretto.
- OpenAI ha spiegato che i risultati dei benchmark dipendono da molti fattori come checkpoint, harness, livelli di inferenza e configurazioni di valutazione, rendendo normali gli aggiustamenti prima o dopo il rilascio.
- L’azienda ha affermato che l’obiettivo è riflettere la migliore stima delle prestazioni affinché gli utenti possano confrontare i modelli in modo più accurato.
- I ricercatori dell’Università di Stanford ritengono che il fenomeno del “benchmaxxing”, ovvero ripetere i benchmark più volte per ottenere il risultato più alto, sia una realtà nel settore dell’IA e chiedono maggiore trasparenza sui metodi di valutazione.
- Alcuni esperti suggeriscono che le aziende di IA debbano dichiarare chiaramente ogni cambiamento nelle condizioni di test quando aggiornano i benchmark, affinché la comunità di ricerca e i clienti comprendano l’esatto significato dei numeri.
📌 I benchmark dell’IA stanno diventando un fattore competitivo cruciale, ma causano anche molte polemiche sulla trasparenza. Il fatto che OpenAI modifichi continuamente i parametri di GPT-6 Astra dopo l’annuncio solleva dubbi su come le prestazioni dei modelli vengano misurate e presentate. Sebbene l’azienda sostenga che si tratti di un normale processo di aggiornamento tecnico, molti esperti ritengono che il settore dell’IA necessiti di standard più pubblici sulle condizioni di test e sui motivi dei cambiamenti dei benchmark, per consentire una valutazione più equa da parte di utenti, ricercatori e investitori.
