Tin AI mới

OpenAI ra mắt GPT-6 Sol và Luna với giá API giảm một nửa

OpenAI ra mắt GPT-6 Sol và Luna với giá API giảm một nửa

TL;DR: OpenAI vừa ra mắt 2 mô hình, GPT-6 Sol và GPT-6 Luna, 2 model GPT-6 rẻ hơn với giá API giảm 50% so với các model GPT-5.6 tương ứng, nhắm đến tác vụ chuyên môn, lập trình và agent cần chạy ở quy mô lớn.

GPT-6 Sol và GPT-6 Luna là hai lựa chọn mới bên cạnh GPT-6 Astra, model cao cấp mà OpenAI vẫn mô tả là tốt nhất toàn diện trong dòng GPT-6. Theo công ty, Sol và Luna được huấn luyện bằng phương pháp tương tự Astra để mang các cải tiến về độ chính xác, lập trình, sử dụng máy tính và an toàn xuống các cấu hình nhanh, rẻ hơn.

Điểm thay đổi dễ thấy nhất là chi phí. OpenAI hạ giá API của GPT-6 Sol xuống 2 USD cho một triệu input token và 10 USD cho một triệu output token. GPT-6 Luna có giá lần lượt 0,10 USD và 0,50 USD. Token là đơn vị văn bản mà model xử lý; input token là dữ liệu gửi vào, còn output token là nội dung model tạo ra.

Sol và Luna được định vị cho các mức ngân sách khác nhau

OpenAI khuyến nghị dùng GPT-6 Astra khi cần chất lượng kết quả cao nhất và trải nghiệm không thỏa hiệp. Trong khi đó, GPT-6 Sol hướng đến các công việc phức tạp cần năng lực cao nhưng phải kiểm soát chi phí, còn GPT-6 Luna là lựa chọn nhẹ hơn cho nhu cầu triển khai số lượng lớn.

So với giá khuyến mãi trước đó của GPT-5.6, giá input và output của Sol đều giảm một nửa, từ 4 USD xuống 2 USD và từ 20 USD xuống 10 USD mỗi một triệu token. Với Luna, giá input giảm từ 0,20 USD xuống 0,10 USD, còn output giảm từ 1,20 USD xuống 0,50 USD.

Việc giảm giá có ý nghĩa lớn nhất với doanh nghiệp xây dựng trợ lý AI, tự động hóa các quy trình hoặc agent xử lý các phiên làm việc dài. Ở các trường hợp này, chi phí token và số lần model phải đọc lại ngữ cảnh có thể nhanh chóng trở thành khoản chi đáng kể.

Công ty công bố kết quả tốt hơn ở công việc, độ chính xác và lập trình

OpenAI cho biết GPT-6 Sol đạt 33,2% trên AutomationBench ở mức suy luận xhigh, với chi phí 0,27 USD mỗi tác vụ. Benchmark này kiểm tra agent thực hiện quy trình xuyên nhiều ứng dụng và 47 công cụ trong bán hàng, marketing, vận hành, hỗ trợ khách hàng, tài chính và nhân sự.

Theo bảng so sánh do OpenAI công bố, kết quả này cao hơn Claude Opus 5 ở mức effort tối đa, trong khi chi phí mỗi tác vụ chỉ bằng khoảng 9%. Trên Agents’ Last Exam, bài đánh giá các quy trình chuyên môn phức tạp, GPT-6 Sol ở mức effort tối đa đạt 56,4%; OpenAI nói mức chi phí thấp hơn 60% so với điểm cao nhất của Claude Opus 5 trong đánh giá này.

Về độ chính xác thực tế, OpenAI nói GPT-6 Sol mắc số lỗi khoảng bằng một nửa model tiền nhiệm trong bài đánh giá nội bộ dựa trên các cuộc trò chuyện đã được khử định danh, nơi người dùng từng gắn cờ lỗi dữ kiện. Công ty cũng nói GPT-6 Luna ở mức effort cao có thể đạt độ tin cậy tương đương GPT-5.6 Sol với chi phí khoảng bằng một phần trăm.

Các số liệu factuality này không đại diện cho mọi tình huống sử dụng: chúng tập trung vào các cuộc hội thoại vốn đã có điều kiện dễ phát sinh lỗi. OpenAI cũng lưu ý điểm benchmark được thực hiện trong môi trường nghiên cứu hoặc qua API, nên đầu ra có thể khác sản phẩm ChatGPT đang vận hành.

Nhắm đến coding agent và tác vụ điều khiển máy tính dài hơn

Với lập trình, OpenAI định vị Sol và Luna cho các tác vụ dài, phức tạp, nơi nhóm phát triển cần nhiều lượt thử nghiệm. Trên DeepSWE v1.1, benchmark đo năng lực xử lý công việc kỹ thuật phần mềm trong codebase thực, GPT-6 Sol ở mức effort tối đa đạt 68,8%. OpenAI cho biết con số này thấp hơn 1,1 điểm phần trăm so với kết quả cao nhất 69,9% của Claude Fable 5, nhưng chi phí mỗi tác vụ thấp hơn khoảng 80%.

GPT-6 Luna đạt 66,6% trong cùng bài đánh giá ở mức effort tối đa. Theo OpenAI, chi phí của Luna thấp hơn 93% so với Claude Opus 5 và 96% so với Claude Fable 5 trong các so sánh được nêu.

Ở mảng computer use, tức khả năng để AI agent thao tác trong giao diện máy tính, Astra vẫn là model đứng đầu theo mô tả của OpenAI. Nhưng trên OSWorld 2.0 offline, GPT-6 Sol ở mức xhigh đạt 60,5%, gần với 60,3% của Claude Opus 5 ở mức effort trung bình, với chi phí mỗi tác vụ thấp hơn khoảng 80% theo công ty.

Image credit: OpenAI

Cải thiện cache để giảm chi phí ngữ cảnh lặp lại

Cùng với giá token thấp hơn, OpenAI cập nhật prompt caching cho GPT-6. Cơ chế này lưu lại phần ngữ cảnh đã xử lý để ứng dụng không phải tính lại toàn bộ ở các lượt sau, đặc biệt hữu ích cho agent và cuộc hội thoại dài. OpenAI cho biết input token đọc từ cache được giảm giá 90%.

Nhà phát triển có thêm dashboard theo dõi lượng input được cache, công cụ chẩn đoán nguyên nhân bỏ lỡ cache và tùy chọn xác định rõ phần tiền tố prompt cần lưu. OpenAI cũng nói việc thay đổi mức reasoning effort hoặc bật, tắt công cụ giữa cuộc hội thoại giờ có thể giữ lại ngữ cảnh cũ để tái sử dụng cache.

Theo OpenAI, GitHub ghi nhận các cải tiến này đã giảm hơn 50% tỷ lệ prompt token cần xử lý mới trên hàng tỷ yêu cầu tới model của công ty trong vài tháng qua. Đây là tuyên bố từ OpenAI, không kèm dữ liệu độc lập trong thông báo.

Khả dụng trên ChatGPT Work, Codex và API

GPT-6 Sol và GPT-6 Luna hiện có trong ChatGPT Work và Codex cho người dùng Plus, Pro, Business, Enterprise và Edu. Người dùng gói Free và Go có thể dùng GPT-6 Luna trong ứng dụng máy tính. OpenAI cho biết hai model chưa có trong Chat.

Trên API, tên model là gpt-6-solgpt-6-luna. Việc triển khai trong ChatGPT được thực hiện dần để giữ ổn định dịch vụ, vì vậy một số người dùng có thể chưa thấy ngay các model mới.

Vì sao đáng chú ý?

Đợt ra mắt cho thấy cạnh tranh AI không chỉ xoay quanh model mạnh nhất, mà còn nằm ở chi phí vận hành khi đưa AI vào quy trình thường ngày. Với các đội ngũ dùng agent cho hỗ trợ khách hàng, phân tích, vận hành hoặc lập trình, giá API và hiệu quả cache có thể quyết định một thử nghiệm có thể mở rộng thành sản phẩm hay không.

Tuy vậy, phần lớn tuyên bố hiệu năng đến từ benchmark và phương pháp đánh giá do OpenAI công bố, trong khi kết quả thực tế còn phụ thuộc prompt, công cụ được cấp quyền, loại dữ liệu và quy trình kiểm tra của từng doanh nghiệp.