- 포춘(Fortune)은 OpenAI가 9월 3일 소개글을 게시한 이후 GPT-6 Astra의 평가 지표를 여러 차례 변경한 사실을 발견했다.
- 출시 과정에서 링크가 약 2시간 동안 작동하지 않다가 정상적으로 표시되는 등 차질을 빚었다.
- OpenAI는 초기 게시물이 벤치마크와 무관한 이유로 내려갔다가 일부 지표가 수정된 상태로 다시 게시되었다고 밝혔다.
- GPT-6 Astra의 내부 환각(hallucination) 비율은 처음에 4.2%였다가 2.0%로 낮아졌으며, 이후 다시 4.2%로 조정되었다.
- GPT-5.6 Sol의 환각 지표 역시 12.2%에서 9.4%로 변경되었다가 다시 원래 수준으로 돌아왔다.
- 언론 배포 자료에서 Astra의 ARC-AGI-3 점수는 98.6%였으나, 공개 버전에서는 99.9%로 상향 조정되었다.
- 기사 업데이트 후 Astra의 Terminal-Bench 4.0 점수는 57.7%에서 57.9%로 소폭 상승했다.
- 앤스로픽(Anthropic) 모델의 일부 점수도 변경되었는데, 클로드 페이블 5.1(Claude Fable 5.1)의 FrontierMath 점수는 87.8%에서 78.0%로 떨어졌다가 나중에 다시 조정되었다.
- OpenAI는 벤치마크 결과가 체크포인트, 하네스(harness), 추론 수준, 평가 구성 등 많은 요인에 따라 달라지므로 출시 전후의 조정은 정상적인 일이라고 설명했다.
- 회사는 사용자가 모델을 보다 정확하게 비교할 수 있도록 성능에 대한 최선의 추정치를 반영하는 것이 목표라고 밝혔다.
- 스탠퍼드 대학교 연구진은 최고 결과를 얻기 위해 벤치마크를 여러 번 반복하는 ‘벤치맥싱(benchmaxxing)’ 현상이 AI 업계의 현실이라고 지적하며 평가 방법의 투명성을 촉구했다.
- 일부 전문가들은 연구 커뮤니티와 고객이 수치의 의미를 정확히 이해할 수 있도록 벤치마크 업데이트 시 테스트 조건의 모든 변경 사항을 명확히 공개해야 한다고 제안했다.
📌 AI 벤치마크는 점차 중요한 경쟁 요소가 되고 있지만 투명성에 대한 논란도 끊이지 않고 있습니다. OpenAI가 공개 후 GPT-6 Astra의 지표를 지속적으로 조정한 것은 모델 성능 측정 및 제시 방식에 대한 의문을 자아냅니다. 회사 측은 정상적인 기술 업데이트 과정이라고 주장하지만, 많은 전문가는 사용자, 연구자, 투자자가 공정하게 평가할 수 있도록 테스트 조건과 벤치마크 변경 이유에 대한 더 공개적인 표준이 필요하다고 지적합니다.
