Mục lục
TL;DR: Anthropic cho biết đã chặn một số người dùng Claude sau khi phát hiện các dấu hiệu nghiên cứu sinh học nhạy cảm và nỗ lực che giấu hoạt động.
Vụ việc đặt trọng tâm vào cách con người có thể dùng AI để tăng tốc công việc rủi ro, thay vì kịch bản mô hình tự lập kế hoạch tạo vũ khí sinh học. Theo Anthropic, các tài khoản bị chặn có hành vi vượt hạn chế địa lý, che giấu mục đích sử dụng và đưa yêu cầu qua những hạ tầng khiến việc truy vết bối cảnh trở nên khó hơn.
Điểm khó nhất nằm ở tính “lưỡng dụng” của khoa học sự sống: cùng một loại nghiên cứu có thể hỗ trợ phát triển vaccine hoặc phục vụ mục đích gây hại. Vì vậy, một câu hỏi gửi đến AI có thể hợp pháp khi đứng riêng lẻ, nhưng trở nên đáng lo khi được đặt trong chuỗi hoạt động rộng hơn.
Những dấu hiệu khiến Anthropic can thiệp
Anthropic không nói các nhà nghiên cứu này đã hoặc chắc chắn sẽ phát triển tác nhân gây bệnh nguy hiểm. Tuy nhiên, công ty cho biết tập hợp tín hiệu mà họ quan sát được đủ để đóng các tài khoản liên quan.
Trong một trường hợp, một người dùng được cho là truy cập Claude từ khu vực không được hỗ trợ thông qua hạ tầng ảo đặt tại Mỹ, đồng thời sử dụng tài khoản được tạo tự động. Đây không phải hành vi “xâm nhập” vào Claude, nhưng là cách che khuất địa điểm truy cập và né các giới hạn dịch vụ theo khu vực.
Anthropic cũng phát hiện các yêu cầu tới Claude được chuyển qua một nền tảng phục vụ nhiều nhà nghiên cứu khoa học đời sống. Nhóm người dùng trên nền tảng này được cho là có cả các nhà virus học liên hệ với cơ quan dân sự và quân sự. Bản thân chi tiết đó không chứng minh mục đích xấu, nhưng trở nên đáng chú ý khi đi cùng các dấu hiệu che giấu khác.
Một đề xuất nghiên cứu có thể hợp pháp nhưng vẫn nhạy cảm
Một trường hợp khác được nêu liên quan đến việc dùng Claude để soạn hồ sơ xin tài trợ cho nghiên cứu sửa đổi virus chikungunya, nhằm tìm hiểu các đặc tính như khả năng lây truyền và né tránh miễn dịch. Đây là hướng nghiên cứu có thể mang mục tiêu khoa học hợp pháp.
Chính vì vậy, Anthropic nói rằng họ không thể kết luận ý định cuối cùng của người thực hiện là lành tính hay độc hại. Quyết định chặn không dựa trên một yêu cầu đơn lẻ, mà dựa vào sự kết hợp giữa nội dung nhạy cảm và hành vi được cho là nhằm che giấu công việc hoặc vượt rào bảo vệ.
AI làm thay đổi tốc độ và quy mô của rủi ro
Claude hay các mô hình ngôn ngữ không thể tự thực hiện thí nghiệm trong phòng lab. Nhưng với người đã có chuyên môn, AI có thể giúp phân tích tài liệu kỹ thuật, xử lý dữ liệu, hỗ trợ khắc phục vấn đề và lấp các khoảng trống kiến thức chuyên biệt. Ở các tác vụ thông thường, việc nêu rõ bối cảnh và ràng buộc giúp mô hình hiểu đúng phạm vi công việc; trong tình huống nhạy cảm, chính bối cảnh sử dụng rộng hơn lại là phần cần được đánh giá. Điều đó có thể khiến một dự án phức tạp diễn ra nhanh và dễ hơn.
Rủi ro vì thế không nhất thiết đến từ một prompt trực diện về vũ khí sinh học. Một người dùng có thể chia một dự án lớn thành nhiều yêu cầu nhỏ, mỗi yêu cầu đều có vẻ vô hại. Nếu chỉ xem xét từng cuộc hội thoại riêng biệt, hệ thống an toàn có thể không nhận ra mô hình hành vi tổng thể.
Thách thức của việc phát hiện mẫu hành vi
Theo logic của vụ việc này, các công ty AI cần theo dõi những tín hiệu trải dài qua nhiều tương tác: các lần cố vượt quy định, cách sử dụng tài khoản, nỗ lực che giấu bối cảnh và sự liên kết giữa các yêu cầu. Đây là cách tiếp cận khác với việc chỉ từ chối những câu hỏi rõ ràng vi phạm quy định.
Tuy vậy, biện pháp mạnh hơn cũng có nguy cơ chặn nhầm nghiên cứu hợp pháp. Với lĩnh vực sinh học, ranh giới giữa công việc có ích và công việc có thể bị lạm dụng đặc biệt khó xác định. Vụ Anthropic cho thấy bài toán an toàn AI đang chuyển dần từ kiểm duyệt từng prompt sang đánh giá khi nào một chuỗi hành vi tưởng như hợp lệ đã đủ đáng ngờ để nền tảng phải can thiệp.
Vì sao đáng chú ý?
Đối với doanh nghiệp xây dựng hoặc triển khai AI, đây là lời nhắc rằng kiểm soát truy cập và chính sách nội dung không thể tách rời khỏi việc hiểu ngữ cảnh sử dụng. Đối với giới nghiên cứu, thách thức là thiết kế cơ chế phát hiện rủi ro mà vẫn bảo vệ hoạt động khoa học chính đáng, thay vì mặc định mọi nghiên cứu nhạy cảm đều là nguy hiểm.
Skills Bridge tổng hợp
