- Издание Fortune обнаружило, что OpenAI несколько раз меняла оценочные показатели GPT-6 Astra после публикации презентации 3 сентября.
- Процесс выпуска сопровождался техническими сбоями: ссылки не работали почти два часа, прежде чем контент отобразился корректно.
- OpenAI заявила, что статья была сначала опубликована, а затем отозвана по причинам, не связанным с бенчмарками, после чего была опубликована снова с измененными цифрами.
- Внутренний показатель «галлюцинаций» GPT-6 Astra сначала составлял 4,2%, затем снизился до 2,0%, а позже был снова скорректирован до 4,2%.
- Показатель галлюцинаций GPT-5.6 Sol также изменился с 12,2% до 9,4%, прежде чем вернуться к исходному уровню.
- Балл ARC-AGI-3 для Astra в документах для прессы составлял 98,6%, но в публичной версии был поднят до 99,9%.
- Балл Terminal-Bench 4.0 для Astra незначительно вырос с 57,7% до 57,9% после обновления статьи.
- Изменились и некоторые показатели моделей Anthropic: например, FrontierMath для Claude Fable 5.1 сначала упал с 87,8% до 78,0%, а затем был скорректирован.
- OpenAI объяснила, что результаты бенчмарков зависят от многих факторов, таких как чекпоинты, инструменты тестирования, уровень логического вывода и конфигурация оценки, поэтому корректировка до или после релиза — это нормально.
- Компания заявила, что цель состоит в том, чтобы отразить наилучшую оценку производительности для более точного сравнения моделей пользователями.
- Исследователи из Стэнфордского университета отметили, что феномен «benchmaxxing» (многократный запуск тестов для достижения наилучшего результата) является реальностью в индустрии ИИ, и призвали к большей прозрачности методов оценки.
- Некоторые эксперты предложили компаниям четко раскрывать все изменения в условиях тестирования при обновлении бенчмарков, чтобы исследовательское сообщество и клиенты понимали точное значение цифр.
📌 Бенчмарки ИИ все чаще становятся важным фактором конкуренции, но также вызывают много споров о прозрачности. Постоянная корректировка показателей GPT-6 Astra компанией OpenAI после их публикации ставит вопросы о методах измерения и представления эффективности моделей. Хотя компания утверждает, что это обычный процесс технического обновления, многие эксперты полагают, что индустрии ИИ нужны более открытые стандарты условий тестирования и причин изменения бенчмарков, чтобы пользователи, исследователи и инвесторы могли проводить более честную оценку.

