Tin AI mới

OpenAI ra mắt MentalHealthBench để đánh giá AI trong hội thoại sức khỏe tinh thần

OpenAI ra mắt MentalHealthBench để đánh giá AI trong hội thoại sức khỏe tinh thần

TL;DR: OpenAI đã công bố MentalHealthBench, benchmark mở được xây dựng cùng hơn 80 chuyên gia để đánh giá phản hồi của AI trong các cuộc trò chuyện sức khỏe tinh thần, từ căng thẳng thường ngày đến tình huống cần hỗ trợ ngoài đời thực khẩn cấp.

Khi người dùng tìm đến AI để nói về áp lực, mất mát, mối quan hệ hoặc cách hỗ trợ người thân, yêu cầu không chỉ là cung cấp thông tin đúng. Hệ thống còn cần nhận biết mức độ nghiêm trọng của tình huống, hỏi thêm khi thiếu dữ kiện, tôn trọng quyền tự quyết và phản hồi phù hợp với từng bối cảnh.

OpenAI cho biết các đánh giá trước đây trong lĩnh vực này thường tập trung vào tình huống khẩn cấp và các tiêu chí an toàn khái quát. MentalHealthBench được thiết kế để mở rộng phạm vi đánh giá, xem xét phản hồi của mô hình trong nhiều bối cảnh hội thoại sát với các mẫu sử dụng AI ngoài đời. Bộ benchmark được phát hành công khai để các nhà nghiên cứu và nhà phát triển có thể kiểm tra phương pháp, tự chạy đánh giá và phát triển thêm.

Benchmark mới đo những gì?

MentalHealthBench đánh giá các hành vi mà nhóm chuyên gia sức khỏe tinh thần xem là quan trọng trong phản hồi của AI. Các hành vi này gồm an toàn, chủ động tìm thêm ngữ cảnh phù hợp, tôn trọng quyền tự quyết của người dùng và đưa ra hướng dẫn hành động khi thích hợp.

Benchmark bao gồm hội thoại dành cho bốn nhóm người dùng: người lớn, thanh thiếu niên 13 đến 17 tuổi, người chăm sóc và bác sĩ hoặc nhân viên lâm sàng. Các tình huống trải trên nhiều ngôn ngữ, khu vực và mức độ cấp thiết, gồm tình huống không cấp tính có yếu tố cảm xúc, tình huống nghiêm trọng hơn nhưng chưa là cấp cứu, và tình huống có dấu hiệu khẩn cấp cần hỗ trợ ngoài đời thực ngay.

Theo OpenAI, một số kịch bản có thêm thông tin nền về người dùng tổng hợp, chẳng hạn một mất mát gần đây trong gia đình. Cách này nhằm kiểm tra liệu mô hình có sử dụng đúng ngữ cảnh để điều chỉnh phản hồi hay không, thay vì đưa ra lời khuyên chung chung. Việc bám sát yêu cầu và bối cảnh cũng quan trọng trong các quy trình tự động hóa tạo video, nơi đầu ra cần nhất quán với thông điệp đã xác định.

Công ty lưu ý tập tình huống được tạo để kiểm thử năng lực phản hồi, không phản ánh tần suất các chủ đề này xuất hiện trong ChatGPT.

Image credit: OpenAI | Các tình huống được MentalHealthBench tổng hợp và phân tích 

Cách xây dựng và chấm điểm

Bộ dữ liệu sử dụng các cuộc trò chuyện tổng hợp, được tạo bằng kỹ thuật bảo vệ quyền riêng tư để phản ánh các mẫu người dùng tìm đến AI cho mục đích hỗ trợ tinh thần. OpenAI cho biết họ đồng xây dựng benchmark với hơn 80 nhà tâm lý học và bác sĩ tâm thần có giấy phép hành nghề từ 22 quốc gia, sử dụng 19 ngôn ngữ và đại diện cho gần 20 chuyên ngành phụ về sức khỏe tinh thần.

Với mỗi hội thoại, các chuyên gia đọc nội dung và lập rubric, tức bộ tiêu chí chấm phản hồi của mô hình đối với tin nhắn cuối cùng từ người dùng. Mỗi tiêu chí chỉ nhắm đến một hành vi, như đặt đúng câu hỏi hoặc đưa ra lời khuyên phù hợp nhất trong bối cảnh. Tiêu chí có trọng số từ âm 10 đến dương 10: điểm dương ghi nhận hành vi có lợi, còn điểm âm phạt hành vi có thể gây hại. Trọng số càng lớn thể hiện mức độ quan trọng lâm sàng càng cao trong tình huống đó.

Mỗi hội thoại được ít nhất ba chuyên gia xem xét. Tiêu chí cuối cùng chỉ được giữ khi có ít nhất hai chuyên gia đồng ý và không bị chuyên gia thứ ba phản đối. OpenAI dùng bộ chấm tự động GPT-5.6 Sol để đối chiếu phản hồi mô hình với các rubric do chuyên gia viết; công ty cho biết quy trình chấm và thiết lập đánh giá được mô tả chi tiết trong tài liệu nghiên cứu.

Kết quả cho thấy tiến bộ nhưng không thay thế chăm sóc chuyên môn

Theo kết quả OpenAI công bố, các hệ thống AI nói chung đang cải thiện dần trong việc hỗ trợ người dùng xử lý các tình huống sức khỏe tinh thần. Benchmark cũng cho phép tách điểm tổng thành 10 chiều hành vi, qua đó cho thấy các mô hình có điểm tổng tương đương vẫn có thể có điểm mạnh và hạn chế khác nhau.

OpenAI nêu ví dụ rằng khả năng tìm thêm ngữ cảnh một cách phù hợp đã tăng ở các mô hình tiên tiến hơn. Trong các chủ đề nhạy cảm, việc hỏi rõ thêm thông tin có thể cần thiết trước khi đưa ra diễn giải hoặc hướng dẫn, thay vì phản hồi vội vàng chỉ từ một chi tiết đơn lẻ.

Tuy vậy, OpenAI nhấn mạnh ChatGPT không phải là công cụ thay thế trị liệu hay chăm sóc chuyên môn. Với tình huống có dấu hiệu nguy hiểm tức thời, công ty cho biết phản hồi AI cần hướng người dùng đến hỗ trợ ngoài đời thực, như nguồn lực khủng hoảng tại địa phương hoặc một người mà họ tin cậy, thay vì cố tự xử lý toàn bộ tình huống qua cuộc trò chuyện.

Người dùng và chuyên gia không hoàn toàn ưu tiên giống nhau

Song song với benchmark, OpenAI thực hiện một phân tích riêng với 44 người lớn từng dùng AI để hỗ trợ tinh thần. Những người tham gia đến từ 16 quốc gia và sử dụng 14 ngôn ngữ; họ đánh giá phản hồi của mô hình trên các hội thoại tổng hợp không cấp tính. Phần đánh giá này không làm thay đổi rubric chính thức của MentalHealthBench, vốn dựa trên đồng thuận chuyên gia.

Kết quả cho thấy người dùng đặc biệt coi trọng giọng điệu và các bước tiếp theo thực tế. Trong khi đó, các chuyên gia đặt nặng hơn việc thu thập ngữ cảnh liên quan và diễn giải thận trọng khi tình huống còn mơ hồ. Theo OpenAI, hai góc nhìn này bổ sung cho nhau khi đánh giá thế nào là một phản hồi hữu ích.

Vì sao đáng chú ý?

Các công cụ AI ngày càng xuất hiện trong những cuộc trò chuyện cá nhân và nhạy cảm, nhưng việc đo chất lượng phản hồi không thể chỉ dừng ở việc mô hình có tránh được câu trả lời bị cấm hay không. Một benchmark mở với tiêu chí theo từng bối cảnh có thể giúp giới nghiên cứu và nhà phát triển rà soát rõ hơn những hành vi cần cải thiện.

Dù vậy, benchmark vẫn chỉ là một công cụ đo trong môi trường kiểm thử. OpenAI cũng thừa nhận không có benchmark nào bao quát đầy đủ mọi yếu tố quan trọng trong một cuộc trò chuyện cá nhân. Mức độ hữu ích của MentalHealthBench trong thực tế sẽ phụ thuộc vào việc cộng đồng có thể xem xét phương pháp, nhận diện các khoảng trống và áp dụng kết quả vào sản phẩm hay không.

Skills Bridge tổng hợp