- Fortune phát hiện OpenAI đã nhiều lần thay đổi các chỉ số đánh giá của GPT-6 Astra sau khi bài giới thiệu được công bố ngày 3/9.
- Quá trình phát hành bài viết gặp trục trặc khi liên kết không hoạt động trong gần hai giờ trước khi được hiển thị bình thường.
- OpenAI cho biết bài viết ban đầu đã được đăng rồi rút xuống vì lý do không liên quan đến benchmark, sau đó đăng lại với một số chỉ số đã thay đổi.
- Tỷ lệ ảo giác nội bộ của GPT-6 Astra ban đầu là 4,2%, sau đó giảm xuống 2,0%, rồi tiếp tục được điều chỉnh trở lại 4,2%.
- Chỉ số ảo giác của GPT-5.6 Sol cũng thay đổi từ 12,2% xuống 9,4% trước khi quay lại mức ban đầu.
- Điểm ARC-AGI-3 của Astra trong tài liệu gửi báo chí là 98,6%, sau đó được nâng lên 99,9% trong phiên bản công khai.
- Điểm Terminal-Bench 4.0 của Astra tăng nhẹ từ 57,7% lên 57,9% sau khi bài viết được cập nhật.
- Một số điểm của các mô hình Anthropic cũng thay đổi, như FrontierMath của Claude Fable 5.1 từng giảm từ 87,8% xuống 78,0% rồi sau đó được điều chỉnh lại.
- OpenAI giải thích kết quả benchmark phụ thuộc vào nhiều yếu tố như checkpoint, harness, mức suy luận và cấu hình đánh giá nên việc điều chỉnh trước hoặc sau phát hành là bình thường.
- Công ty cho biết mục tiêu là phản ánh ước lượng tốt nhất về hiệu năng để người dùng có thể so sánh các mô hình chính xác hơn.
- Các nhà nghiên cứu tại Đại học Stanford cho rằng hiện tượng “benchmaxxing”, tức chạy lại benchmark nhiều lần để đạt kết quả cao nhất, là thực tế đã tồn tại trong ngành AI và kêu gọi minh bạch hơn về phương pháp đánh giá.
- Một số chuyên gia đề xuất các công ty AI cần công bố rõ mọi thay đổi trong điều kiện thử nghiệm khi cập nhật benchmark để cộng đồng nghiên cứu và khách hàng hiểu chính xác ý nghĩa của các con số.
📌 Benchmark AI ngày càng trở thành yếu tố cạnh tranh quan trọng nhưng cũng gây nhiều tranh cãi về tính minh bạch. Việc OpenAI liên tục điều chỉnh các chỉ số của GPT-6 Astra sau khi công bố làm dấy lên câu hỏi về cách đo lường và trình bày hiệu năng mô hình. Dù công ty khẳng định đây là quá trình cập nhật kỹ thuật bình thường, nhiều chuyên gia cho rằng ngành AI cần các tiêu chuẩn công khai hơn về điều kiện thử nghiệm và lý do thay đổi benchmark để người dùng, nhà nghiên cứu và nhà đầu tư có thể đánh giá công bằng hơn.
Tổng hợp.

