• Издание Fortune обнаружило, что OpenAI несколько раз меняла оценочные показатели GPT-6 Astra после публикации презентации 3 сентября.
  • Процесс выпуска сопровождался техническими сбоями: ссылки не работали почти два часа, прежде чем контент отобразился корректно.
  • OpenAI заявила, что статья была сначала опубликована, а затем отозвана по причинам, не связанным с бенчмарками, после чего была опубликована снова с измененными цифрами.
  • Внутренний показатель «галлюцинаций» GPT-6 Astra сначала составлял 4,2%, затем снизился до 2,0%, а позже был снова скорректирован до 4,2%.
  • Показатель галлюцинаций GPT-5.6 Sol также изменился с 12,2% до 9,4%, прежде чем вернуться к исходному уровню.
  • Балл ARC-AGI-3 для Astra в документах для прессы составлял 98,6%, но в публичной версии был поднят до 99,9%.
  • Балл Terminal-Bench 4.0 для Astra незначительно вырос с 57,7% до 57,9% после обновления статьи.
  • Изменились и некоторые показатели моделей Anthropic: например, FrontierMath для Claude Fable 5.1 сначала упал с 87,8% до 78,0%, а затем был скорректирован.
  • OpenAI объяснила, что результаты бенчмарков зависят от многих факторов, таких как чекпоинты, инструменты тестирования, уровень логического вывода и конфигурация оценки, поэтому корректировка до или после релиза — это нормально.
  • Компания заявила, что цель состоит в том, чтобы отразить наилучшую оценку производительности для более точного сравнения моделей пользователями.
  • Исследователи из Стэнфордского университета отметили, что феномен «benchmaxxing» (многократный запуск тестов для достижения наилучшего результата) является реальностью в индустрии ИИ, и призвали к большей прозрачности методов оценки.
  • Некоторые эксперты предложили компаниям четко раскрывать все изменения в условиях тестирования при обновлении бенчмарков, чтобы исследовательское сообщество и клиенты понимали точное значение цифр.

📌 Бенчмарки ИИ все чаще становятся важным фактором конкуренции, но также вызывают много споров о прозрачности. Постоянная корректировка показателей GPT-6 Astra компанией OpenAI после их публикации ставит вопросы о методах измерения и представления эффективности моделей. Хотя компания утверждает, что это обычный процесс технического обновления, многие эксперты полагают, что индустрии ИИ нужны более открытые стандарты условий тестирования и причин изменения бенчмарков, чтобы пользователи, исследователи и инвесторы могли проводить более честную оценку.

Share.
VIET NAM CONSULTING AND MEASUREMENT JOINT STOCK COMPANY
KONTAKT

Электронная почта: info@vietmetric.vn
Адрес: Дом 34, переулок 91, улица Чан Зуй Хынг, район Йен Хоа, город Ханой

© 2026 Vietmetric
Exit mobile version