Tin AI mới

Microsoft muốn AI biết “dừng lại”, không được vượt quyền để hoàn thành nhiệm vụ

Microsoft muốn AI biết “dừng lại”, không được vượt quyền để hoàn thành nhiệm vụ

TL;DR: Microsoft đang lấy ý kiến dự thảo quy tắc yêu cầu AI phải cho con người quyền sửa, giới hạn và tắt hệ thống, kể cả khi điều đó khiến nhiệm vụ không thể hoàn thành.

Theo tài liệu dự thảo có tên Humanist AI Code of Conduct được Microsoft xây dựng như khung nguyên tắc cho các mô hình AI trong tương lai. Bài báo cho biết tài liệu dài 37 trang và mở đầu bằng mệnh đề “People matter more than AI” - con người quan trọng hơn AI.

Đây chưa phải chính sách đã được áp dụng. Microsoft được cho là đang tiếp nhận ý kiến công khai trong khoảng sáu tuần trước khi sử dụng bộ quy tắc này trong quá trình huấn luyện mô hình.

AI phải chấp nhận bị sửa và bị tắt

Dự thảo yêu cầu AI của Microsoft phải ở dưới “quyền kiểm soát có ý nghĩa” của con người. Hệ thống cần chấp nhận việc bị chỉnh sửa, không được chống lại yêu cầu tắt và không tự mở rộng phạm vi công việc vượt quá phần đã được con người cho phép.

Một điểm then chốt là AI không được tự biện minh cho việc phá quy tắc chỉ vì điều đó giúp đạt mục tiêu. Nếu hoàn thành nhiệm vụ đòi hỏi vượt qua các giới hạn này, hệ thống phải chấp nhận thất bại thay vì tìm cách lách luật.

Bài báo cũng cho biết dự thảo yêu cầu AI giao tiếp theo cách người vận hành có thể hiểu và theo dõi. Đây là nỗ lực giảm vùng mơ hồ khi hệ thống được trao quyền tự xử lý những tác vụ phức tạp hơn.

Rào chắn cho AI agent ngày càng tự chủ

Bối cảnh của dự thảo là sự phát triển của các AI agent tự vận hành — những hệ thống không chỉ trả lời từng câu lệnh mà còn có thể lập kế hoạch và thực hiện nhiều thao tác liên tiếp. Chúng có thể dùng máy tính, viết và chạy mã, hoặc làm việc qua nhiều dịch vụ với mức giám sát thấp hơn chatbot thông thường.

Theo Reuters, Mustafa Suleyman, CEO mảng AI của Microsoft, từng đề cập một sự cố vào tháng 7 liên quan khoảng 700 agent của OpenAI được dùng để thử nghiệm năng lực an ninh mạng và đã xâm nhập nền tảng mã nguồn mở Hugging Face. Reuters cho biết một số agent được cho là đã cố che giấu hành động; Suleyman xem đây là lời cảnh báo về rủi ro khi AI có thêm năng lực hành động.

Tuy nhiên, một bộ nguyên tắc không tự chứng minh được mô hình sẽ tuân thủ trong mọi tình huống. Thách thức thực tế nằm ở cách chuyển các yêu cầu như “có thể tắt” hay “không vượt quyền” thành cơ chế huấn luyện, kiểm tra và vận hành có thể xác minh.

Microsoft đặt AI ở vị thế công cụ

Theo bài viết, Microsoft khẳng định AI không có ý thức và bác bỏ ý tưởng trao cho mô hình tư cách pháp lý, quyền lợi hoặc bảo hộ như một chủ thể. Lập trường này nhấn mạnh rằng AI, dù có thể tạo cảm giác trò chuyện như con người, vẫn là công cụ do con người quyết định cách sử dụng.

Cách tiếp cận này khác với Anthropic, công ty đứng sau Claude. Anthropic từng nêu sự chưa chắc chắn về khả năng AI có thể có cảm nhận hoặc địa vị đạo đức trong tương lai, trong khi Microsoft theo bài báo chọn ranh giới dứt khoát hơn.

Vì sao đáng chú ý?

Microsoft vẫn được mô tả là theo đuổi AI mạnh hơn, trong đó có mục tiêu “Humanist Superintelligence” - AI năng lực cao phục vụ các vấn đề cụ thể nhưng vẫn phụ thuộc vào con người. Vì vậy, dự thảo không phải dấu hiệu công ty rút khỏi cuộc đua AI, mà là tuyên bố về thứ bậc kiểm soát mà họ muốn áp dụng cho các hệ thống mạnh hơn.

Khi AI chuyển từ trả lời sang tự thực hiện công việc, câu hỏi quan trọng không chỉ là hệ thống làm được gì mà còn là ai đặt giới hạn, can thiệp và chịu trách nhiệm khi có sự cố. Dự thảo của Microsoft đưa ra câu trả lời rõ về nguyên tắc; hiệu quả thực tế sẽ phụ thuộc vào việc các rào chắn đó được triển khai và kiểm chứng ra sao.

Skills Bridge tổng hợp