AI cho doanh nghiệp

Anthropic công bố ba thước đo theo dõi tốc độ phát triển AI trong phòng thí nghiệm

Anthropic công bố ba thước đo theo dõi tốc độ phát triển AI trong phòng thí nghiệm

TL;DR: Anthropic công bố 3 thước đo về tự động hóa R&D, giám sát AI agent và phân bổ dữ liệu nhằm giúp công chúng theo dõi rõ hơn tốc độ phát triển AI bên trong các phòng thí nghiệm frontier.

Anthropic cho biết các hệ thống AI ngày càng được dùng để xây dựng thế hệ AI tiếp theo, trong khi phần lớn dữ liệu về quá trình này vẫn nằm bên trong các công ty phát triển mô hình. Bộ chỉ số mới là nỗ lực của hãng nhằm thu hẹp khoảng cách thông tin đó, đồng thời tạo cơ sở để bên thứ ba và chính phủ theo dõi tiến trình phát triển AI.

Ba phép đo gồm: AI đang đảm nhiệm bao nhiêu phần việc trong nghiên cứu và phát triển AI; các hành động của agent được theo dõi và can thiệp ra sao; và compute, tức năng lực tính toán dùng để huấn luyện, chạy và nghiên cứu AI, được phân bổ thế nào. Anthropic công bố một ảnh chụp dữ liệu nội bộ, song cũng nhấn mạnh đây là các phương pháp thử nghiệm cần được kiểm chứng độc lập.

AI đã tham gia sâu vào R&D nhưng chưa tự chủ hoàn toàn

Chỉ số đầu tiên, Anthropic R&D Automation Index, đo phần việc R&D AI tại Anthropic đang do Claude thực hiện. Công ty lập danh mục các loại công việc, đánh giá mức độ tự động hóa của từng loại rồi tổng hợp theo trọng số person-time, tức thời gian lao động con người dành cho các nhiệm vụ đó.

Thang đo Automation Level do Epoch AI phát triển có sáu cấp từ AL0 đến AL5. AL3 nghĩa là AI cộng tác chặt chẽ với con người và có thể thực hiện các phần việc lớn dưới sự chỉ đạo sát sao. AL4 là AI dẫn dắt phần lớn nhiệm vụ từ một prompt cấp cao, còn con người giám sát. AL5 là hoạt động hoàn toàn tự chủ, không có người trong vòng kiểm soát.

Theo Anthropic, tính đến tháng 8/2026, Claude chưa đạt trạng thái tự chủ hoàn toàn ở bất kỳ nhóm công việc R&D AI nào được đo. Claude ở mức “dẫn dắt” đối với 26% khối lượng R&D AI; tỷ lệ công việc ở mức từ “AI cộng tác” trở lên vượt 90%.

Để xây dựng chỉ số, Anthropic cho biết đã lấy mẫu nhân sự trong tháng 7/2026, dùng dữ liệu công việc nội bộ để tạo khoảng 15.000 nhiệm vụ R&D chi tiết và sắp xếp chúng thành cây 542 nút. Hãng thừa nhận cách đánh giá vẫn phụ thuộc vào mô hình AI làm giám khảo. Trong đối chiếu với nhân sự phụ trách các mảng công việc, mức khớp hoàn toàn giữa mô hình và con người là 59%, còn mức khớp trong phạm vi chênh lệch một cấp là 97%.

Measurements for understanding the pace of AI development inside frontier  labs \ Anthropic

Image credit: Anthropic

30.000 agent được theo dõi qua hai lớp giám sát

Phép đo thứ hai tập trung vào các AI agent, tức hệ thống có thể thực hiện chuỗi tác vụ tương đối độc lập và giao việc cho agent khác. Anthropic dùng ba chỉ số: coverage, tỷ lệ hành động được theo dõi; review latency, thời gian từ hành động đến lúc được kiểm tra; và escalation rate, tỷ lệ hành động bị chặn, chuyển hướng hoặc gắn cờ để xem xét thêm.

Trên nền tảng nội bộ được sử dụng nhiều nhất, Anthropic cho biết có khoảng 30.000 agent đang làm công việc nghiên cứu và kỹ thuật tại bất kỳ thời điểm nào trong tháng 8/2026. 100% hành động của các agent này đi qua monitor trực tuyến trước khi thực thi, và 100% được hệ thống giám sát ngoại tuyến tiếp nhận sau đó.

Monitor trực tuyến được thiết kế để ngăn các hành động có thể gây hại tức thời và khó đảo ngược, chẳng hạn sao chép trọng số mô hình ra khỏi hệ thống. Monitor ngoại tuyến đọc hoạt động sau khi xảy ra, phù hợp với các dấu hiệu rủi ro diễn tiến chậm hơn. Anthropic nói rằng trong tháng 8, hệ thống đã phân tích hơn 1 tỷ quyết định của agent nghiên cứu và kỹ thuật, chặn 0,002%, tương đương khoảng 1 trên 47.000 quyết định.

Ở lớp giám sát ngoại tuyến, hệ thống xử lý khoảng 100.000 transcript, tức bản ghi phiên hoạt động, mỗi tuần. Phần lớn các cờ cảnh báo được lọc tiếp bằng classifier, mô hình phân loại tự động; khoảng 50 cảnh báo ưu tiên cao mỗi tuần được chuyển cho con người xem xét. Các số liệu này chỉ áp dụng cho nền tảng nội bộ nói trên, không đại diện cho mọi hoạt động agent tại Anthropic.

Compute cho an toàn chiếm khoảng 6% trong một tuần được khảo sát

Với phép đo thứ ba, Anthropic xem xét toàn bộ compute trong tuần từ 13 đến 20/7 và phân loại các workload thành nghiên cứu an toàn hoặc R&D AI khác. Theo ước tính của công ty, khoảng 6% compute dành cho AI R&D được dùng cho công việc an toàn. Nếu chỉ xét phần R&D AI được AI hỗ trợ hoặc thực hiện, tỷ lệ này là khoảng 12%.

Anthropic gọi đây là các ước tính thận trọng: một token vừa hỗ trợ năng lực mô hình vừa phục vụ an toàn sẽ không được tính vào phần an toàn. Hãng cũng không đưa compute dành cho các classifier bảo vệ vào chỉ số này. Tuy vậy, compute không phản ánh đầy đủ mức đầu tư cho an toàn, bởi nhiều nghiên cứu an toàn cần thời gian của nhà nghiên cứu nhưng không tiêu tốn lượng tính toán lớn như các đợt huấn luyện mô hình frontier.

Về phương pháp, Anthropic lấy mẫu khoảng 14% trong gần 10.000 lượt chạy nghiên cứu của tuần khảo sát, ưu tiên các lượt dùng nhiều compute để kết quả phản ánh nơi tài nguyên thực sự được tiêu thụ. Công ty thừa nhận ranh giới giữa nghiên cứu an toàn và nghiên cứu nâng cao năng lực không luôn rõ ràng; nhãn workload nền tảng cũng có thể do quy tắc tự động hoặc người dùng gán và không phải lúc nào được xác minh.

Vì sao đáng chú ý?

Điểm quan trọng của công bố không chỉ là các con số hiện tại, mà là đề xuất biến chúng thành báo cáo định kỳ có phương pháp chung và có thể đối chiếu giữa các phòng thí nghiệm. Anthropic cho rằng nhà phát triển nên để bên thứ ba kiểm tra độc lập, đặc biệt khi chính mô hình của công ty đang được dùng để đánh giá hoạt động của công ty.

Nếu được các lab khác áp dụng, những chỉ số này có thể bổ sung cho các bài đánh giá năng lực mô hình vốn chủ yếu trả lời AI làm được gì. Chúng hướng sự chú ý sang quy trình tạo ra mô hình: mức AI đang tăng tốc chính quá trình R&D, mức giám sát có theo kịp quy mô agent hay không, và nguồn lực cho an toàn thay đổi thế nào theo thời gian. Tuy nhiên, Anthropic cũng lưu ý việc so sánh liên công ty còn cần định nghĩa chung, phương pháp công khai và cơ chế xác minh để tránh cách phân loại có lợi cho bên tự báo cáo.

Skills Bridge tổng hợp