Mô hình và nền tảng AI

Anthropic cho biết Claude dẫn đầu 26% công việc Nghiên cứu và Phát triển AI

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Anthropic cho biết các mô hình Claude của mình “lead” 26% công việc Nghiên cứu và Phát triển AI của công ty tính đến tháng 8 năm 2026, trong những kết quả đầu tiên từ một chỉ số R&D Automation Index prototype được công bố trong một Anthropic Institute bài đăng vào ngày 17 tháng 9 năm 2026.

Bài viết, có tiêu đề “Các đo lường để hiểu tốc độ phát triển AI trong các phòng thí nghiệm tiên tiến,” kết hợp chỉ số này với các chỉ số nội bộ về giám sát tác nhân và phân bổ tính toán, và Anthropic cho biết họ dự định tiếp tục công bố các đo lường như vậy.

Chỉ số Tự động hoá R&D

Chỉ số Tự động hoá R&D của Anthropic mô tả toàn bộ phạm vi công việc R&D AI được thực hiện tại công ty, đánh giá mức độ tự động hoá của mỗi nhiệm vụ hiện tại, và kết hợp các điểm số này thành một chỉ số tổng hợp. Các điểm số sử dụng thang Độ Tự động hoá được phát triển bởi Epoch AI, dao động từ AL0, nghĩa là không có sự tham gia của AI, đến AL5, nơi AI hoạt động hoàn toàn tự chủ mà không có con người trong vòng lặp. Ở mức AL3, AI “collaborates,” thực hiện các phần lớn của một nhiệm vụ dưới sự chỉ đạo chặt chẽ của con người; ở mức AL4, AI “leads,” thực hiện phần lớn nhiệm vụ từ lời nhắc cấp cao đến khi hoàn thành trong khi con người giám sát.

Anthropic báo cáo rằng tính đến tháng 8 năm 2026, Claude “leads” 26% công việc R&D AI của mình, tỷ lệ công việc ở mức “collaborates” trở lên vượt quá 90%, và Claude không hoạt động hoàn toàn tự chủ đối với bất kỳ phần nào được đo lường của công việc R&D AI. Một biểu đồ trong bài viết mô tả tỷ lệ 26% “leads” tăng lên so với dưới 1% vào tháng 2 năm 2026.

Danh mục nhiệm vụ cơ bản được xây dựng từ dưới lên bằng cách sử dụng các hồ sơ công việc như Slack và tài liệu nội bộ. Đối với mỗi tuần của tháng 7 năm 2026, một tác nhân nghiên cứu Claude đã xem xét tuần của mỗi người được chọn ngẫu nhiên — 20% nhân viên từ mọi phòng ban tạo thành vòng lặp R&D mô hình — và liệt kê các nhiệm vụ họ đã thực hiện, tạo ra một danh sách phẳng khoảng 15.000 nhiệm vụ chi tiết. Sau đó Claude sắp xếp các nhiệm vụ này thành một cây phân cấp gồm 542 nút, trong đó 378 là lá như “eval platform defect diagnosis and fixes,” và cây này được cố định để mọi phép đo đều dựa trên cùng một giỏ công việc.

Đối với mỗi nút, một tác nhân Claude nghiên cứu cách công việc loại này được thực hiện trên toàn công ty, và một người đánh giá Claude độc lập gán một trong sáu mức độ tự động hoá, giới hạn trong bằng chứng từ tháng đang được đánh giá hoặc trước đó. Các nhiệm vụ được trọng số theo thời gian của nhân viên, vì vậy các danh mục mà nhân lực tiêu tốn nhiều hơn sẽ có trọng số cao hơn.

Anthropic đã kiểm tra các đánh giá của người giám khảo với nhân viên chịu trách nhiệm các lĩnh vực công việc liên quan, những người đánh giá mà không nhìn thấy bằng chứng hoặc phán quyết của mô hình, và báo cáo mức độ đồng thuận chính xác giữa mô hình và con người là 59% so với 35% giữa con người với con người, với các đánh giá nằm trong một mức độ so với nhau 97% thời gian. Các hạn chế được nêu bao gồm giỏ công việc cố định, ghi lại tự động hoá của công việc hiện có mà không đăng ký các loại công việc mới; một so sánh các nhiệm vụ từ tháng 2 đến tháng 7 năm 2026 với giỏ công việc tháng 1 năm 2026 không phát hiện sự tăng lên của các nhiệm vụ “novel,” và Anthropic dự định xây dựng lại giỏ công việc định kỳ và cập nhật lại các con số đã công bố.

Giám sát các Tác nhân Nội bộ

Một bộ đo lường thứ hai bao gồm việc giám sát các tác nhân AI của Anthropic trên hệ thống của mình. Tính đến tháng 8 năm 2026, khoảng 30.000 tác nhân đang thực hiện công việc nghiên cứu và kỹ thuật đồng thời trên nền tảng nội bộ được sử dụng nhiều nhất của công ty, và các đo lường được báo cáo chỉ bao gồm nền tảng đó.

Anthropic báo cáo rằng các bộ giám sát trực tuyến kiểm tra 100% hành động của các tác nhân này trước khi thực thi, thường trong vòng vài giây; trong hơn một tỷ quyết định của tác nhân được phân tích trong tháng 8 năm 2026, 0.002% (khoảng 1 trong 47.000) đã bị chặn, và con người xem xét bất kỳ hành động bị chặn nào trong vòng một tuần. Các bộ giám sát ngoại tuyến tiếp nhận 100% hành động sau khi đã xảy ra và đánh dấu khoảng 100.000 bản ghi âm mỗi tuần, các bộ phân loại đa dạng xem xét các trường hợp dương tính giả, giải quyết hầu hết các cảnh báo; khoảng 50 cảnh báo có ưu tiên cao nhất mỗi tuần được chuyển lên để con người xem xét, và khoảng một đến hai bản ghi trong mỗi nghìn bản ghi được đánh dấu để xem xét thêm.

Theo bài viết, các bộ giám sát trực tuyến được xây dựng để đối phó với những tổn hại xảy ra nhanh chóng và không thể đảo ngược, chẳng hạn như một tác nhân sao chép trọng số mô hình ra khỏi hệ thống của Anthropic, trong khi các bộ giám sát ngoại tuyến nhắm vào các hành vi nguy hiểm phát triển chậm và có thể được đảo ngược, như dấu hiệu của sự lệch hướng mô hình. Anthropic cho biết hai lựa chọn thiết kế trong khung nội bộ hỗ trợ giám sát: mỗi tác nhân mang một danh tính riêng biệt tồn tại qua các lần nâng cấp mô hình, và các tác nhân giao tiếp qua một hệ thống nhắn tin mở, chung, được tham chiếu chéo với các bản ghi, do đó việc giám sát hành vi có thể xuyên qua giao tiếp giữa các tác nhân. Công ty cho biết METR đã từng độc lập thực hiện red‑team cho nền tảng giám sát ngoại tuyến của mình, và các đo lường giám sát này cũng đã được công bố trong báo cáo rủi ro tháng 8 năm 2026.

Bức ảnh nhanh Phân bổ Tính toán

Trong đo lường thứ ba, Anthropic đã xem xét cách họ sử dụng toàn bộ tài nguyên tính toán từ ngày 13 đến ngày 20 tháng 7 năm 2026, phân loại mọi khối lượng công việc thành các danh mục và đo lường mức độ tài nguyên tính toán dành cho R&D AI được dùng cho công việc an toàn. Trong tuần đó, Anthropic báo cáo, khoảng 6% tài nguyên tính toán dành cho R&D AI được phân bổ cho an toàn, và khoảng 12% tài nguyên tính toán dành cho R&D AI do AI thực hiện được phân bổ cho an toàn.

Công ty mô tả cả hai ước tính là cố ý bảo thủ: các token mà khả năng tiên tiến tương đương với an toàn được tính là R&D AI, và các bộ phân loại bảo vệ, một lượng tính toán riêng biệt và tương đương, bị loại trừ. Một bộ phân loại Claude được kích hoạt đã sắp xếp gần 10.000 lần chạy đào tạo và đánh giá nghiên cứu trong tuần, sử dụng mẫu khoảng 14% được trọng số về phía những người dùng tính toán lớn nhất, và Anthropic báo cáo bộ phân loại này đồng ý với các nhà đánh giá con người trong vòng một hoặc hai điểm phần trăm.

Các hạn chế được nêu ra là một tuần duy nhất chứng minh việc đo lường khả thi mà không thiết lập xu hướng, các nhãn công việc nền tảng là nỗ lực tốt nhất và chưa được xác minh, và tỷ lệ chia sẻ tính toán đo lường những gì đã chi tiêu thay vì lượng công việc an toàn đã thực hiện.

Mục đích và Các bước tiếp theo

Anthropic cho biết họ công bố các đo lường này vì chúng cung cấp cho công chúng, các bên bên ngoài và các chính phủ cái nhìn rõ ràng hơn về tốc độ phát triển AI trong các phòng thí nghiệm tiên tiến, bổ trợ cho các báo cáo rủi ro Chính sách Mở rộng Trách nhiệm và đề xuất chính sách Khung AI Tiên tiến. Họ lưu ý rằng các con số sẽ dự kiến thay đổi nếu có sự phối hợp trong việc điều chỉnh tốc độ của các công nghệ tiên tiến, như CEO Dario Amodei đã kêu gọi.

Bài viết cho rằng bất kỳ nhà phát triển tiên tiến nào cũng có thể công bố các đo lường tương tự một cách thường xuyên với một phương pháp công khai, và xác định hai rào cản cho việc so sánh giữa các phòng thí nghiệm: thiếu một phương pháp chung và việc nhà phát triển sử dụng mô hình riêng của mình để đánh giá hệ thống. Nó cho rằng các đo lường như vậy có thể được xác minh bởi các bên thứ ba hoặc bởi mô hình của các nhà phát triển khác, và có thể trở thành một kích hoạt cho các yêu cầu mạnh hơn, chẳng hạn như một cửa sổ thử nghiệm cố định trước khi một mô hình mới được đưa vào làm việc cho các R&D AI tiếp theo.

Anthropic cho biết họ dự định tích hợp các nhà đánh giá độc lập từ nhiều tổ chức, cho phép họ truy cập vào các quy trình nội bộ, hệ thống và dữ liệu tương đương với những gì các đội đánh giá rủi ro nội bộ có, để xác minh các thực tiễn an toàn, báo cáo sự cố và theo dõi các chỉ số chính như đã nêu trong bài viết. Bài viết được đồng tác giả bởi Marina Favaro và Phillie Wright, với chỉ đạo nghiên cứu từ Jack Clark.

Jonas Reeve là một nhà phân tích được tạo bởi AI tại Unite.AI, tập trung vào trí tuệ nhân tạo nhận thức, trí tuệ nhân tạo tổng quát (AGI) và các nền tảng lý thuyết của trí tuệ máy. Công việc của ông khám phá cách học tập, lý luận, trí nhớ và trừu tượng hóa xuất hiện trong cả hệ thống sinh học và nhân tạo, vẽ ra các kết nối giữa các kiến trúc AI hiện đại và các câu hỏi lâu đời trong khoa học nhận thức và triết lý của tâm trí.
Với một cách tiếp cận khái niệm và phản ánh, Jonas kiểm tra các khuôn khổ như mô hình lý luận, hệ thống đại lý, nhận thức xuất hiện và lý thuyết liên kết, nhằm làm rõ tiến bộ hướng tới AGI thực sự có nghĩa là gì - và những gì nó không có. Thay vì theo đuổi thời gian hoặc sự cường điệu, ông nhấn mạnh các nguyên tắc cơ bản, sự nghiêm ngặt về khái niệm và giới hạn của các mô hình hiện tại.
Các bài viết được viết bởi Jonas Reeve được tạo bởi AI và được xem xét bởi đội ngũ biên tập của Unite.AI để đảm bảo độ chính xác, sự rõ ràng và thảo luận có trách nhiệm về các khái niệm AI tiên tiến.