Ứng dụng AI

Claude Opus 5.5 vượt ChatGPT-6 trong 4 trên 5 bài test đời thường

Claude Opus 5.5 vượt ChatGPT-6 trong 4 trên 5 bài test đời thường

TL;DR: Trong bài thử nghiệm 5 prompt đời thường, Claude Opus 5.5 được đánh giá thắng ChatGPT-6 ở 4 tình huống nhờ đào sâu bối cảnh và chủ động phát hiện ràng buộc, còn ChatGPT-6 nổi bật ở việc tạo một hệ thống giảm tải quyết định cho phụ huynh bận rộn.

Một bài so sánh mới đặt hai mô hình flagship của OpenAI và Anthropic vào những yêu cầu gần với đời sống: tổ chức tiệc sinh nhật, viết lại thông báo, chọn nhà nghỉ, phân bổ ngân sách thành phố và sắp xếp cuộc sống gia đình. Cùng một prompt được gửi cho cả hai mô hình, sau đó câu trả lời được đánh giá theo mức độ thực dụng, khả năng suy luận và việc xử lý các điều kiện ẩn.

Kết quả không phải benchmark kỹ thuật, cũng không đủ để tuyên bố một mô hình vượt trội trong mọi trường hợp. Nhưng bài thử cho thấy một khác biệt đáng chú ý: Claude Opus 5.5 thường mở rộng vấn đề để tìm các rủi ro hoặc hệ quả chưa được hỏi trực tiếp; ChatGPT-6 thường trả lời ngắn gọn, đi thẳng vào cấu trúc hành động.

Hai mô hình được định vị khác nhau

ChatGPT-6 được OpenAI định vị cho suy luận, công việc chuyên môn, lập trình, duyệt web và thao tác trên máy tính. Phiên bản Sol được công ty mô tả là lựa chọn nhanh và chi phí thấp hơn cho công việc thường ngày.

Trong khi đó, Anthropic cho biết Claude Opus 5.5 hướng tới các tác vụ agentic, tức những quy trình mà AI cần thực hiện nhiều bước tương đối tự chủ, và công việc tri thức kéo dài. Mô hình có cơ chế adaptive thinking để điều chỉnh mức độ suy nghĩ theo yêu cầu, cửa sổ ngữ cảnh 1 triệu token, đầu ra tối đa 128.000 token. Anthropic cũng nói chi phí vận hành của Opus 5.5 thấp hơn 40% so với thế hệ Opus trước.

Claude thắng nhờ nhìn thấy các ràng buộc ngoài câu hỏi

Ở bài toán lập tiệc sinh nhật 150 USD cho 10 trẻ, gồm yêu cầu ăn chay, dị ứng đậu phộng, phương án khi mưa và giới hạn ba giờ, Claude được đánh giá cao hơn. Câu trả lời không chỉ lập ngân sách và hoạt động, mà còn chú ý nguy cơ nhiễm chéo thực phẩm từ bánh hoặc nguyên liệu đóng gói, đồng thời dùng túi vải và bút vẽ vừa làm hoạt động đầu buổi vừa thành quà mang về.

Trong yêu cầu viết lại thông báo về tính năng lịch dùng AI, Claude cũng thắng vì chuyển các tính năng như phát hiện xung đột lịch, gợi ý giờ họp và tóm tắt sau họp thành lợi ích gần với trải nghiệm làm việc. ChatGPT-6 giữ đủ dữ kiện và viết dễ quét, nhưng bị nhận xét là thiên về thay đổi câu chữ hơn là diễn giải lại giá trị cho người dùng.

Với tình huống gia đình chọn giữa nhà nghỉ gần biển giá cao và nhà nghỉ xa hơn nhưng phải trả phí đỗ xe, Claude được chấm nhỉnh hơn. Mô hình tính thêm chi phí đỗ xe trong bảy ngày, nhắc đến phí dọn dẹp, phí dịch vụ và thuế có thể khiến chênh lệch giá thay đổi. Nó còn đặt ra khả năng việc phải đưa ba trẻ lên xuống xe nhiều lần có thể khiến gia đình bỏ bớt một chuyến ra biển mỗi ngày.

Lợi thế của ChatGPT-6 nằm ở khung quyết định

ChatGPT-6 chỉ thắng bài cuối, khi người dùng có ba con, làm việc toàn thời gian, gánh trách nhiệm gia đình và chỉ có khoảng 30 phút mỗi tối để ổn định cuộc sống. Theo đánh giá, điểm mạnh của câu trả lời là một khung ra quyết định theo từng bước, giúp người dùng kiệt sức không phải tự nghĩ thêm về việc bắt đầu từ đâu.

Claude vẫn nhận ra đúng vấn đề “tải tinh thần”, tức gánh nặng phải liên tục ghi nhớ, lên kế hoạch và điều phối việc nhà. Mô hình cũng đề cập đến phân công công việc. Tuy nhiên, phần trả lời của ChatGPT-6 được xem là bảo vệ năng lực chú ý của người dùng tốt hơn, thay vì chủ yếu đưa ra một lịch tổ chức gia đình.

Khác biệt thể hiện cả ở các câu hỏi chính sách

Trong bài toán buộc thành phố chọn một trong ba phương án cho 10 triệu USD, gồm xây thư viện, phát tiền một lần cho hộ gia đình hoặc nâng cấp hạ tầng nước, cả hai mô hình đều chọn nâng cấp hạ tầng nước. ChatGPT-6 đưa ra lập luận rõ và dễ đọc, còn Claude được đánh giá sâu hơn vì xem đây là lựa chọn liên quan đến động cơ quản trị công: chính quyền phải đầu tư cho những rủi ro mà cử tri có thể không nhận thấy cho đến khi sự cố xảy ra.

Đây là kiểu khác biệt xuyên suốt bài thử. Claude có xu hướng tiếp tục khai thác những biến số thứ cấp, còn ChatGPT-6 ưu tiên câu trả lời trực diện và ít dài dòng hơn. Cách tiếp cận đầu tiên hữu ích khi người dùng cần kế hoạch đầy đủ hoặc đánh giá tình huống nhiều ràng buộc; cách thứ hai có lợi khi mục tiêu là nhanh chóng chuyển từ câu hỏi sang hành động.

Vì sao đáng chú ý?

Kết quả 4-1 phản ánh đánh giá của một người thử với năm tình huống cụ thể, không phải phép đo khách quan về toàn bộ năng lực của hai mô hình. Chất lượng đầu ra còn phụ thuộc prompt, phiên bản sản phẩm, công cụ được bật và tiêu chí của người dùng.

Dù vậy, bài thử gợi ý rằng khi chọn AI cho công việc hàng ngày, câu hỏi quan trọng không chỉ là mô hình nào “thông minh hơn”. Người dùng cần xác định mình muốn một trợ lý tự mở rộng bối cảnh và cảnh báo các điểm có thể bỏ sót, hay một công cụ gọn hơn để giảm ma sát và ra quyết định nhanh.

Skills Bridge tổng hợp