Mục lục
TL;DR: OpenAI sẽ triển khai watermark vô hình cho văn bản do ChatGPT và Codex tạo ra tại Liên minh châu Âu trong vài tuần tới để đáp ứng yêu cầu minh bạch của EU AI Act, nhưng tính năng này chưa trở thành mặc định trên toàn cầu.
Theo OpenAI, watermark sẽ được áp dụng cho người dùng ChatGPT và Codex đủ điều kiện tại EU trên mọi gói dịch vụ. Việc triển khai diễn ra sau khi các quy tắc minh bạch của EU AI Act có hiệu lực từ ngày 2/8, yêu cầu nội dung tạo bởi AI phải được đánh dấu theo cách để hệ thống khác có thể nhận biết.
Đây không phải nhãn hiển thị trên màn hình hay ký hiệu gắn cuối văn bản. OpenAI nói dấu nhận diện được nhúng vào chính cách mô hình chọn từ, nhằm giúp công cụ phát hiện xác định liệu một đoạn nội dung có được hệ thống của công ty tạo ra hoặc xử lý hay không.
Watermark áp dụng ở EU, còn API là tùy chọn
Ở đợt ra mắt này, OpenAI chỉ tự triển khai watermark cho ChatGPT và Codex, tác nhân AI hỗ trợ lập trình, tại EU. Công ty cho biết không biến watermark văn bản thành thiết lập mặc định trên phạm vi toàn cầu.
Với các nhà phát triển dùng API của OpenAI, tính năng đã có thể được bật từ hôm nay cho một số mô hình, bất kể họ ở đâu trên thế giới. Tuy nhiên, watermark bị tắt mặc định, nghĩa là nhà phát triển cần chủ động kích hoạt nếu muốn văn bản đầu ra mang dấu nhận diện này.
Phạm vi triển khai khác nhau cho thấy OpenAI đang kết hợp nghĩa vụ tuân thủ theo khu vực với lựa chọn kỹ thuật dành cho khách hàng API. Fact sheet của công ty không nêu cụ thể những mô hình API nào hỗ trợ tính năng trong đợt đầu.
TextGrain tạo dấu nhận diện ngay trong lựa chọn từ
Phương pháp watermark của OpenAI có tên textGrain. Công ty đã công bố báo cáo kỹ thuật về phương pháp này cùng các nhà nghiên cứu từ Đại học Pennsylvania và Yale.
Về nguyên lý, mô hình AI thường dự đoán nhiều từ có thể đứng tiếp theo trong một câu. textGrain dùng một khóa bí mật để sắp xếp các dự đoán đó, rồi tác động rất nhỏ đến lựa chọn từ. Khi những điều chỉnh nhỏ này tích lũy qua nhiều từ, một bộ phát hiện có thể tìm ra mẫu đặc trưng bằng văn bản và khóa tương ứng.
Do dấu hiệu nằm trong bản thân câu chữ, nó vẫn đi theo nội dung khi người dùng sao chép và dán. OpenAI khẳng định watermark không dùng để nhận diện người dùng, đồng thời cho biết họ không quan sát thấy thay đổi đáng kể về hiệu năng mô hình khi bật tính năng.
Watermark không phải bằng chứng tuyệt đối về nguồn gốc
OpenAI thừa nhận dấu nhận diện có thể suy yếu khi văn bản bị chỉnh sửa. Trong một thử nghiệm của công ty, việc thay 10% số từ bằng từ đồng nghĩa làm tỷ lệ phát hiện giảm từ khoảng 92% xuống 66%.
Các đoạn văn ngắn, câu trả lời toán học và nội dung dịch cũng khó phát hiện hơn. Vì những giới hạn này, OpenAI cho biết quyền truy cập ban đầu vào bộ phát hiện sẽ chỉ dành cho các nhà nghiên cứu được phê duyệt và tổ chức chuyên môn, để đánh giá độ tin cậy cũng như cách sử dụng có trách nhiệm.
Công ty cũng lưu ý việc không phát hiện watermark không chứng minh văn bản do con người viết. Đoạn nội dung có thể quá ngắn, bị biên tập nhiều, hoặc được tạo bởi hệ thống AI của một nhà cung cấp khác. Theo OpenAI, watermark chỉ có thể cho thấy một hệ thống của họ đã tạo hoặc xử lý một phần văn bản, chứ không thể kết luận con người đã đóng góp bao nhiêu phán đoán, chỉnh sửa hay sáng tạo.
Vì sao đáng chú ý?
Watermark văn bản là một trong các cách các công ty AI cố gắng tăng khả năng truy vết nội dung tổng hợp, trong bối cảnh quy định về minh bạch đang được siết chặt. Nhưng số liệu thử nghiệm của OpenAI cũng cho thấy đây là công cụ hỗ trợ nhận diện, không phải phương án xác minh nguồn gốc tuyệt đối, đặc biệt khi nội dung đã qua biên tập hoặc chuyển ngữ.
Động thái này diễn ra sau khi Anthropic cho biết sẽ watermark văn bản từ Claude trên toàn cầu. Việc OpenAI bắt đầu tại EU thay vì mặc định toàn cầu phản ánh những khác biệt còn tồn tại giữa yêu cầu pháp lý theo khu vực, lựa chọn sản phẩm và mức độ chấp nhận của người dùng.
Skills Bridge tổng hợp

