Mục lục
TL;DR: OpenAI giới thiệu GPT-6.1 Sol, phiên bản nâng cấp của GPT-6 Sol được công ty cho biết tiến gần năng lực GPT-6 Astra trong các tác vụ AI agent nhưng có chi phí token đầu vào và đầu ra tiêu chuẩn bằng khoảng một phần năm.
Mô hình mới nhắm đến các công việc cần AI tự thực hiện nhiều bước, như viết và sửa mã, đọc tài liệu phức tạp, vận hành quy trình nghiệp vụ hoặc tương tác với ứng dụng trên máy tính. Theo OpenAI, GPT-6.1 Sol cải thiện đáng kể so với GPT-6 Sol, đồng thời tạo ra một lựa chọn chi phí thấp hơn cho doanh nghiệp và nhà phát triển không cần dùng mẫu cao cấp nhất trong mọi tác vụ.
GPT-6.1 Sol hiện có trong ChatGPT Work và Codex cho người dùng Plus, Pro, Business, Enterprise và Edu. Nhà phát triển có thể gọi qua API với tên gpt-6.1-sol. Mô hình chưa có trong Chat.
Hướng tới AI agent chi phí thấp hơn
AI agent là hệ thống có thể lập kế hoạch và dùng công cụ để hoàn tất một chuỗi bước, thay vì chỉ trả lời một câu hỏi đơn lẻ. Đây là nhóm tác vụ thường tốn nhiều token, đặc biệt khi agent phải liên tục đọc lại ngữ cảnh, kiểm tra tài liệu và đối chiếu nguồn trong các yêu cầu kế tiếp.
OpenAI cho biết GPT-6.1 Sol gần đạt mức của GPT-6 Astra trong coding theo kiểu agent, computer use và công việc chuyên môn. Điểm nhấn của công bố là tỷ lệ hiệu năng trên chi phí: giá input và output tiêu chuẩn được đặt ở mức khoảng một phần năm Astra theo mô tả của công ty.
Với API, giá tiêu chuẩn là 2 USD cho một triệu input token, 10 USD cho một triệu output token và 0,10 USD cho một triệu cached input token. Cached input là phần ngữ cảnh đã được hệ thống lưu để tái sử dụng trong các yêu cầu sau, thay vì xử lý lại từ đầu. OpenAI nói mức cached input này thấp hơn 95% so với input tiêu chuẩn và thấp hơn 50% so với GPT-6 Sol.

Các kết quả benchmark OpenAI công bố
Trên DeepSWE v1.1, bài đánh giá các nhiệm vụ kỹ thuật phần mềm phức tạp trong codebase thực tế, OpenAI cho biết GPT-6.1 Sol đạt mức tương đương GPT-6 Astra với chi phí khoảng một phần năm. Điểm tốt nhất của Sol mới cũng cao hơn GPT-6 Sol 6,4 điểm phần trăm, ở mức suy luận và chi phí thấp hơn.
Ở GDP.pdf, benchmark kiểm tra khả năng trả lời câu hỏi chuyên môn từ PDF phức tạp có bảng, biểu đồ, sơ đồ và chi tiết nhỏ, GPT-6.1 Sol được công ty cho biết vượt Opus 5.5 with fallbacks với chi phí dưới một nửa mỗi tác vụ. Mô hình cũng tiến gần GPT-6 Astra với chi phí khoảng một phần năm.
Trên AutomationBench, nơi agent phải hoàn tất quy trình nghiệp vụ nhiều bước bằng 47 công cụ trong các lĩnh vực như bán hàng, marketing, vận hành, hỗ trợ, tài chính và nhân sự, GPT-6.1 Sol cao hơn Opus 5.5 2,2 điểm phần trăm ở mức suy luận trung bình. Theo OpenAI, chi phí ở cấu hình này bằng khoảng một phần ba, đồng thời điểm số cao hơn GPT-6 Sol 4,8 điểm phần trăm.
Cải thiện khi dùng máy tính và làm nghiên cứu
Với OSWorld 2.0 offline set, bài đánh giá các quy trình tương tác máy tính kéo dài, GPT-6.1 Sol cao hơn GPT-6 Sol 7 điểm phần trăm ở mức suy luận tối đa. OpenAI cho biết mô hình chỉ kém Astra 2,1 điểm phần trăm, trong khi chi phí mỗi tác vụ bằng khoảng một phần bảy.
Ở Terminal-Bench Science 0.1, bao gồm phân tích dữ liệu, mô phỏng và chứng minh định lý, GPT-6.1 Sol đạt hơn gấp đôi điểm của GPT-6 Sol ở mức suy luận tối đa. Chi phí trung bình được công bố là 5,47 USD mỗi tác vụ, so với 23,21 USD của Opus 5.5 và 23,80 USD của Astra. Tuy nhiên, OpenAI nói GPT-6 Astra vẫn có điểm cao nhất, 68,1%, và phù hợp hơn với những bài toán nghiên cứu khoa học khó nhất.
Các benchmark này là kết quả do OpenAI công bố, trong những điều kiện thử nghiệm cụ thể. Chúng hữu ích để so sánh xu hướng năng lực và chi phí, nhưng không đồng nghĩa hiệu quả thực tế sẽ giống nhau với mọi dữ liệu, công cụ hay quy trình triển khai.
Độ đúng sự thật, an toàn và tốc độ
OpenAI cũng báo cáo cải thiện về độ đúng sự thật. Ở mức suy luận thấp, tỷ lệ câu trả lời có ít nhất một lỗi thực tế giảm từ 11,4% trên GPT-6 Sol xuống 7,7% trên GPT-6.1 Sol. Công ty lưu ý bộ đánh giá này dùng các cuộc hội thoại đã được ẩn danh, nơi người dùng từng đánh dấu lỗi của mô hình trước đó, nên là nhóm prompt khó và không đại diện cho việc sử dụng thông thường.
Trong các đánh giá an toàn có chủ đích tạo tình huống khó, GPT-6.1 Sol có tỷ lệ thất bại thấp hơn GPT-6 Sol về việc minh bạch khi công cụ tìm kiếm bị lỗi, tuân thủ ràng buộc rõ ràng và tránh kết quả không được phép. Chẳng hạn, khi công cụ tìm kiếm hỏng, tỷ lệ không thông báo vấn đề là 2,1%, so với 4,9% ở GPT-6 Sol. OpenAI nói các đánh giá này không phản ánh tỷ lệ lỗi trong sử dụng thông thường.
Công ty cho biết sẽ phát hành GPT-6.1 Sol Ultrafast trong vài ngày tới trên Codex. Phiên bản này được mô tả có tốc độ sinh token nhanh hơn tới 8 lần so với bản tiêu chuẩn.
Vì sao đáng chú ý?
Cuộc cạnh tranh giữa các mô hình AI đang chuyển mạnh từ điểm benchmark đơn lẻ sang khả năng vận hành agent với chi phí chấp nhận được. Với các hệ thống phải xử lý ngữ cảnh dài và lặp lại nhiều bước, giá cached input thấp có thể ảnh hưởng đáng kể đến chi phí triển khai hơn là chỉ nhìn vào giá một lần gọi API.
Định vị của GPT-6.1 Sol cũng cho thấy OpenAI đang phân tầng rõ hơn giữa mô hình cao cấp dành cho bài toán khó nhất và mô hình cân bằng hơn cho khối lượng công việc hàng ngày. Với người dùng và doanh nghiệp, lựa chọn phù hợp sẽ vẫn phụ thuộc vào độ chính xác cần thiết, tốc độ, mức độ tự chủ của agent và chi phí thực tế của từng quy trình.
- Nguồn chính thức: Introducing GPT-6.1 Sol, OpenAI, 29/09/2026

