- OpenAI cho rằng doanh nghiệp không nên đánh giá AI dựa trên số người dùng hay chi phí token mà cần đo bằng lượng công việc hữu ích AI hoàn thành trên mỗi USD chi tiêu.
- Công ty đề xuất chỉ số “Useful Intelligence per Dollar”, gồm 4 tiêu chí: lượng công việc hoàn thành, chi phí cho mỗi nhiệm vụ thành công, độ tin cậy của kết quả và mức tăng giá trị khi quy mô sử dụng mở rộng.
- Theo OpenAI, điều quan trọng không phải giá token thấp mà là tổng chi phí để hoàn thành một nhiệm vụ đạt chất lượng, bao gồm thời gian nhân viên, số lần thử lại và công sức kiểm tra kết quả.
- Công ty minh họa bằng quy trình lập dự báo tài chính, trong đó AI có thể tự động thu thập dữ liệu, đối chiếu bảng tính và chuẩn bị báo cáo để nhân viên tập trung vào phân tích và ra quyết định.
- GPT-5.6 được chia thành 3 phiên bản gồm Sol, Terra và Luna nhằm cân bằng giữa hiệu năng, chi phí và tốc độ cho các nhu cầu khác nhau.
- Trên Artificial Analysis Coding Agent Index, GPT-5.6 Sol đạt 72,7%, vượt Claude Fable 5 với 69,9% trong khi chi phí API ước tính thấp hơn khoảng 36,2%.
- OpenAI cho biết GPT-5.6 Sol cũng sử dụng ít hơn khoảng 54% số token đầu ra so với một mô hình AI hàng đầu khác trong các tác vụ lập trình dài.
- Công ty khuyến nghị doanh nghiệp theo dõi 3 chỉ số vận hành gồm kết quả dùng được ngay, kết quả cần chỉnh sửa và trường hợp phải chuyển cho con người xử lý để đánh giá hiệu quả AI.
- OpenAI nhấn mạnh khả năng mở rộng AI phụ thuộc vào việc kết hợp mô hình tốt hơn, hạ tầng tính toán hiệu quả hơn, phần cứng chuyên dụng và cơ chế điều phối thông minh.
- Bài viết kết luận thành công của AI sẽ được đo bằng khả năng giúp con người hoàn thành nhiều công việc có giá trị hơn, ra quyết định tốt hơn và giảm chi phí theo thời gian thay vì chỉ giảm giá token.
📌 OpenAI đề xuất một cách đo lường mới cho kỷ nguyên AI, chuyển trọng tâm từ chi phí token sang giá trị kinh doanh tạo ra. Theo công ty, doanh nghiệp nên đánh giá AI dựa trên lượng công việc hoàn thành, chi phí cho mỗi kết quả đạt yêu cầu, độ tin cậy và hiệu quả khi mở rộng quy mô. Các số liệu như GPT-5.6 Sol đạt 72,7% trên Artificial Analysis Coding Agent Index, vượt Claude Fable 5 với chi phí API thấp hơn khoảng 36,2%, được đưa ra để minh họa rằng AI mạnh hơn có thể mang lại chi phí thực tế thấp hơn nếu hoàn thành công việc đúng ngay từ lần đầu.
Tổng hợp.
