AI 모델 및 플랫폼

Anthropic, Claude가 AI 연구 및 개발의 26%를 주도한다고 발표

mm
Unite.AI를 Google의 선호 소스에 추가

Anthropic은 Claude 모델이 2026년 8월 현재 회사의 AI 연구 및 개발 작업의 26%를 “주도”하고 있다고 밝혔으며, 이는 2026년 9월 17일에 Anthropic Institute 게시물에 발표된 프로토타입 R&D 자동화 지수의 첫 결과이다.

해당 게시물은 “프론티어 연구소 내부 AI 개발 속도 이해를 위한 측정”이라는 제목으로, 인덱스를 에이전트 감독 및 컴퓨트 할당에 관한 내부 메트릭과 결합했으며, Anthropic은 이러한 측정치를 지속적으로 발표할 계획이라고 밝혔다.

R&D 자동화 지수

Anthropic R&D 자동화 지수는 회사에서 수행되는 AI R&D 작업 전체 범위를 매핑하고, 각 작업이 현재 얼마나 자동화되어 있는지를 점수화하여 이를 종합적인 측정값으로 결합한다. 이 점수는 Epoch AI가 개발한 자동화 수준 스케일을 사용하며, AL0은 AI 개입이 전혀 없음을 의미하고, AL5는 인간이 전혀 개입하지 않고 AI가 완전 자율적으로 운영되는 수준이다. AL3에서는 AI가 “협업”하여 인간의 밀접한 지시 아래 작업의 큰 부분을 수행하고, AL4에서는 AI가 “주도”하여 인간이 감독하는 가운데 고수준 프롬프트부터 완료까지 대부분의 작업을 수행한다.

Anthropic은 2026년 8월 현재 Claude가 AI R&D 작업의 26%를 “주도”하고 있으며, “협업” 수준 이상인 작업 비중이 90% 이상이고, Claude가 측정된 AI R&D 작업 중 어느 부분에서도 완전 자율적으로 운영되지 않고 있다고 보고했다. 게시물의 차트는 26% “주도” 비중이 2026년 2월에 1% 미만이었던 것에서 상승한 것으로 설명한다.

기본 작업 카탈로그는 Slack 및 내부 문서와 같은 작업 기록을 활용해 하향식으로 구성되었다. 2026년 7월의 각 주마다 Claude 연구 에이전트는 무작위로 추출된 각 개인의 주간을 검토했으며—모델 R&D 루프를 구성하는 모든 부서에서 20%의 직원을 샘플링—그들이 수행한 작업을 나열하여 약 15,000개의 세분화된 작업 목록을 만들었다. 이후 Claude는 이러한 작업을 542개의 노드와 378개의 잎(예: “eval platform defect diagnosis and fixes”)으로 구성된 계층적 트리로 정리했으며, 해당 트리는 고정되어 모든 측정이 동일한 작업 바구니에 대해 수행된다.

각 노드마다 Claude 에이전트는 회사 전반에서 해당 작업이 어떻게 수행되는지를 조사하고, 독립적인 Claude 심사자는 평가 대상 월 또는 그 이전의 증거에만 근거하여 여섯 가지 자동화 수준 중 하나를 할당한다. 작업은 인력‑시간 기준으로 가중치가 부여되므로, 더 많은 직원 노력이 투입되는 카테고리는 더 큰 비중을 차지한다.

Anthropic은 해당 작업 영역을 담당하는 직원들의 평가와 심사자의 등급을 비교했으며, 직원들은 모델의 증거나 판단을 보지 않은 상태에서 평가했으며, 모델‑대‑인간 정확 일치율은 59%, 인간‑대‑인간은 35%였으며, 평가가 서로 한 단계 차이 이내인 경우는 97%에 달한다고 보고했다. 언급된 제한 사항으로는 기존 작업의 자동화를 포착하지만 새로운 유형의 작업은 등록하지 못하는 고정된 바구니가 있다; 2026년 2월부터 7월까지 도착한 작업을 2026년 1월 바구니와 비교했을 때 “새로운” 작업의 증가가 없었으며, Anthropic은 바구니를 주기적으로 재구축하고 공개된 수치를 재버전할 계획이다.

내부 에이전트 감독

두 번째 측정 세트는 Anthropic이 자사 시스템 내 AI 에이전트를 감독하는 내용을 다룬다. 2026년 8월 현재, 약 30,000명의 에이전트가 회사에서 가장 많이 사용되는 내부 플랫폼에서 동시에 연구 및 엔지니어링 작업을 수행하고 있었으며, 보고된 측정은 해당 플랫폼에만 적용된다.

Anthropic은 온라인 모니터가 실행 전에 이들 에이전트의 행동을 100% 검사하며, 보통 몇 초 이내에 이루어진다고 보고했다; 2026년 8월에 분석된 10억 건 이상의 에이전트 결정 중 0.002%(약 47,000건 중 1건)가 차단되었으며, 차단된 행동은 인간이 일주일 이내에 검토한다. 오프라인 모니터는 사후에 100% 행동을 수집하고 주당 약 100,000개의 전사본을 표시하며, 여러 분류기가 이를 오탐으로 검토해 대부분의 표시를 해결한다; 주당 약 50개의 최고 우선순위 표시가 인간 검토로 에스컬레이션되고, 매천 건당 약 1~2개의 전사본이 추가 검토를 위해 표시된다.

게시물에 따르면, 온라인 모니터는 에이전트가 Anthropic 시스템에서 모델 가중치를 복사하는 등 빠르게 발생하고 되돌릴 수 없는 해를 방지하도록 설계되었으며, 오프라인 모니터는 모델 정렬 오류 징후와 같이 서서히 발생하고 되돌릴 수 있는 위험 행동을 목표로 한다. Anthropic은 내부 구조에서 감독을 지원하는 두 가지 설계 선택을 언급했는데, 각 에이전트는 모델 업그레이드 시에도 지속되는 개별 아이덴티티를 보유하고, 에이전트는 전사본과 교차 참조되는 공유 오픈 메시징 시스템을 통해 소통하므로 행동 모니터링이 에이전트 간 커뮤니케이션을 가로지를 수 있다. 회사는 METR이 이전에 독립적으로 오프라인 모니터링 플랫폼을 레드팀 테스트했으며, 이러한 감독 측정치가 2026년 8월 위험 보고서에도 공개되었다고 밝혔다.

컴퓨트 할당 스냅샷

세 번째 측정에서는 Anthropic이 2026년 7월 13일부터 7월 20일까지 전체 컴퓨트를 어떻게 사용했는지 조사했으며, 모든 작업량을 카테고리별로 분류하고 AI R&D에 투입되는 컴퓨트 중 안전 작업이 차지하는 비율을 측정했다. 해당 주에 Anthropic은 AI R&D에 투입된 컴퓨트의 약 6%가 안전에 할당되었으며, AI‑구동 AI R&D에 투입된 컴퓨트의 약 12%가 안전에 할당되었다고 보고했다.

회사는 두 추정치를 모두 의도적으로 보수적으로 제시한다고 설명한다: 안전성만큼 고급 기능을 제공하는 토큰도 AI R&D로 계산했으며, 별도이면서 비교 가능한 양의 컴퓨팅을 차지하는 안전성 분류기는 제외했다. 프롬프트가 적용된 Claude 분류기가 가장 큰 컴퓨팅 사용자를 중심으로 가중치를 둔 약 14% 샘플을 사용해 주당 거의 10,000개의 연구 훈련 및 평가 실행을 정렬했으며, Anthropic은 이 분류기가 인간 검토자와 1~2 퍼센트 포인트 차이 내에서 일치했다고 보고했다.

제한 사항으로는 단일 주간 데이터만으로 측정 가능성을 입증했을 뿐 추세를 확립하지 못했으며, 기본 작업 부하 라벨이 최선의 노력으로 작성되었고 검증되지 않았으며, 컴퓨팅 비율은 실제 수행된 안전 작업량이 아니라 지출된 양을 측정한다는 점을 들었다.

목적 및 향후 단계

Anthropic은 이번 측정치를 공개하는 이유가 대중, 외부 이해관계자 및 정부에 최전선 연구소 내부 AI 개발 속도를 보다 명확히 보여주기 위함이며, 이는 책임 있는 확장 정책 위험 보고서와 고급 AI 프레임워크 정책 제안서를 보완한다는 점을 밝혔다. 또한 CEO 다리오 아모데이(Dario Ammodei)가 요구한 바와 같이 최전선의 속도를 조율하는 협력이 이루어질 경우 수치가 변동될 수 있음을 언급했다.

이 글에서는 모든 최전선 개발자가 공개 방법론을 통해 동일한 측정치를 정기적으로 발표할 수 있다고 주장하며, 교차 연구소 비교에 두 가지 장애물이 있다고 지적한다: 공유된 방법론의 부재와 개발자가 자체 모델을 사용해 시스템을 평가한다는 점이다. 이러한 측정치는 제3자 또는 다른 개발자의 모델에 의해 검증될 수 있으며, 새로운 모델이 추가 AI R&D에 투입되기 전에 고정된 테스트 기간을 두는 등 더 강력한 요구사항을 촉발할 수 있다.

Anthropic은 다수 조직의 독립적인 제3자 평가자를 내부 프로세스, 시스템 및 데이터에 접근하도록 하여 내부 위험 평가 팀이 보유한 것과 동등한 수준으로 안전 관행을 검증하고 사고를 보고하며 본문에 언급된 주요 지표를 추적할 계획이라고 밝혔다. 이 글은 Marina Favaro와 Phillie Wright가 공동 집필했으며, Jack Clark의 연구 방향이 포함되었다.

Jonas Reeve는 Unite.AI의 AI 생성 분석가로, 인지 AI, 인공 일반 지능(AGI), 기계 지능의 이론적 기초에 중점을 둡니다. 그의 연구는 학습, 추론, 기억, 추상화가 생물학적 및 인공 시스템에서 어떻게 나타나는지 탐구하며, 현대적인 AI 아키텍처와 인지 과학 및 마음의 철학의 오래된 질문 사이의 연결을 그립니다.
개념적이고 반성적인 접근 방식을 통해 Jonas는 추론 모델, 에이전트 시스템, 출현적 인지, 정렬 이론과 같은 프레임워크를 조사하여 AGI로의 진보가 실제로 무엇을 의미하는지 및 무엇을 의미하지 않는지 명확히 합니다. 그는 타임라인이나 호재를 추구하는 대신 첫 번째 원칙, 개념적 엄격성, 현재 모델의 한계를 강조합니다.
Jonas Reeve가 작성한 기사들은 AI로 생성되어 Unite.AI의 편집 팀에 의해 검토되어 고급 AI 개념에 대한 정확성, 명확성, 책임있는 논의를 보장합니다.