• Fortune 誌は、OpenAI が 9 月 3 日の紹介記事公開後、GPT-6 Astra の評価指標を何度も変更したことを発見した。
  • 公開プロセスに不具合があり、リンクが正常に表示されるまで約 2 時間機能しなかった。
  • OpenAI は、記事は当初投稿された後にベンチマークとは無関係な理由で取り下げられ、その後、一部の指標を変更して再投稿されたと述べた。
  • GPT-6 Astra の内部ハルシネーション(幻覚)率は当初 4.2% だったが、その後 2.0% に低下し、さらに再び 4.2% に調整された。
  • GPT-5.6 Sol のハルシネーション指標も、12.2% から 9.4% に変更された後、元のレベルに戻った。
  • 報道資料における Astra の ARC-AGI-3 スコアは 98.6% だったが、公開版では 99.9% に引き上げられた。
  • 記事の更新後、Astra の Terminal-Bench 4.0 スコアは 57.7% から 57.9% へとわずかに上昇した。
  • Anthropic モデルのスコアも一部変更されており、例えば Claude Fable 5.1 の FrontierMath は 87.8% から 78.0% に低下した後、再調整された。
  • OpenAI は、ベンチマーク結果はチェックポイント、ハーネス、推論レベル、評価構成など多くの要因に依存するため、公開前後の調整は通常のことだと説明した。
  • 同社は、ユーザーがモデルをより正確に比較できるように、性能の最善の推定値を反映することが目的であると述べた。
  • スタンフォード大学の研究者は、最高の結果を得るためにベンチマークを何度もやり直す「benchmaxxing」現象は AI 業界の現実であると指摘し、評価方法の透明性を高めるよう求めた。
  • 一部の専門家は、研究コミュニティや顧客が数字の意味を正確に理解できるように、ベンチマークを更新する際にテスト条件のすべての変更を明確に公表することを AI 企業に提案した。

📌 AI ベンチマークは重要な競争要素になりつつありますが、透明性を巡る論争も絶えません。OpenAI が公開後に GPT-6 Astra の指標を繰り返し調整したことは、モデル性能の測定および提示方法に疑問を投げかけています。同社は通常の技術アップデートであると主張していますが、多くの専門家は、ユーザー、研究者、投資家がより公平に評価できるよう、テスト条件やベンチマーク変更の理由に関するより公開された基準が AI 業界には必要だと考えています。

Share.
VIET NAM CONSULTING AND MEASUREMENT JOINT STOCK COMPANY
連絡先

メール:info@vietmetric.vn
住所:ベトナム ハノイ市 イエンホア坊 チャン・ズイ・フン通り 91番路地 34番

© 2026 Vietmetric
Exit mobile version