Modelos y plataformas de IA

Anthropic dice que Claude lidera el 26% de su investigación y desarrollo de IA

mm
Añade Unite.AI a tus fuentes preferidas en Google

Anthropic dijo que sus modelos Claude “lideran” el 26 % del trabajo de investigación y desarrollo de IA de la empresa a partir de agosto de 2026, en los primeros resultados de un prototipo del Índice de Automatización de I&D publicado en una publicación del Anthropic Institute el 17 de septiembre de 2026.

El artículo, titulado “Mediciones para comprender el ritmo del desarrollo de IA dentro de laboratorios de frontera”, combina el índice con métricas internas sobre supervisión de agentes y asignación de cómputo, y Anthropic dijo que pretende seguir publicando tales mediciones.

El Índice de Automatización de I&D

El Índice de Automatización de I&D de Anthropic mapea todo el espectro del trabajo de I&D de IA realizado en la empresa, evalúa cuán automatizada está cada tarea actualmente y combina esas puntuaciones en una medida agregada. Las puntuaciones utilizan una escala de Nivel de Automatización desarrollada por Epoch AI, que va desde AL0, que significa sin participación de IA, hasta AL5, donde la IA opera de forma totalmente autónoma sin intervención humana. En AL3, la IA “colabora”, realizando gran parte de una tarea bajo una estrecha dirección humana; en AL4, la IA “lidera”, llevando la mayor parte de una tarea desde una indicación de alto nivel hasta su finalización mientras un humano supervisa.

Anthropic informó que, a partir de agosto de 2026, Claude “lidera” el 26 % de su trabajo de I&D de IA, la proporción de trabajo en o por encima del nivel de “colabora” supera el 90 %, y Claude no opera de forma totalmente autónoma en ningún subconjunto medido del trabajo de I&D de IA. Un gráfico en la publicación describe que la participación del 26 % de “lidera” ha aumentado desde menos del 1 % en febrero de 2026.

El catálogo subyacente de tareas se ensambló de forma ascendente utilizando registros de trabajo como Slack y documentación interna. Para cada semana de julio de 2026, un agente de investigación Claude revisó la semana de cada persona seleccionada al azar — el 20 % del personal de cada departamento que forma el bucle de I&D del modelo — y enumeró las tareas en las que trabajaron, generando una lista plana de aproximadamente 15 000 tareas granulares. Claude luego organizó esas tareas en un árbol jerárquico de 542 nodos, 378 de los cuales son hojas, como “diagnóstico y corrección de defectos de la plataforma de evaluación”, y ese árbol se congeló para que cada medición se aplique al mismo conjunto de trabajo.

Para cada nodo, un agente Claude investiga cómo se realiza ese tipo de trabajo en toda la empresa, y un juez Claude independiente asigna uno de seis niveles de automatización, limitados a evidencia del mes evaluado o anterior. Las tareas se ponderan por tiempo‑persona, de modo que las categorías donde se dedica más esfuerzo del personal tienen mayor peso.

Anthropic comparó las calificaciones del juez con el personal responsable de las áreas de trabajo relevantes, quienes evaluaron sin ver la evidencia o los juicios de los modelos, e informó un acuerdo exacto modelo‑vs‑humano del 59 % frente al 35 % humano‑vs‑humano, con calificaciones dentro de un nivel de diferencia el 97 % de las veces. Las limitaciones señaladas incluyen el conjunto congelado, que captura la automatización del trabajo existente sin registrar nuevos tipos de trabajo; una comparación de tareas recibidas de febrero a julio de 2026 contra un conjunto de enero de 2026 no encontró aumento de tareas “nuevas”, y Anthropic planea reconstruir el conjunto periódicamente y volver a versionar los números publicados.

Supervisión de agentes internos

Un segundo conjunto de mediciones cubre la supervisión de Anthropic sobre los agentes de IA en sus sistemas. A partir de agosto de 2026, aproximadamente 30 000 agentes realizaban trabajos de investigación e ingeniería simultáneamente en la plataforma interna más utilizada de la empresa, y las mediciones reportadas cubren solo esa plataforma.

Anthropic informó que los monitores en línea revisan el 100 % de las acciones de estos agentes antes de su ejecución, generalmente en segundos; de más de mil millones de decisiones de agentes analizadas durante agosto de 2026, el 0,002 % (aproximadamente 1 de cada 47 000) fueron bloqueadas, y los humanos revisan cualquier acción bloqueada dentro de una semana. Los monitores fuera de línea ingieren el 100 % de las acciones después del hecho y señalan aproximadamente 100 000 transcripciones por semana, que varios clasificadores revisan en busca de falsos positivos, resolviendo la mayoría de las señales; aproximadamente 50 señales de mayor prioridad por semana se escalan a revisión humana, y alrededor de una a dos transcripciones de cada mil se marcan para una revisión adicional.

Según la publicación, los monitores en línea se diseñan para daños que ocurrirían rápidamente y no podrían deshacerse, como un agente que copia los pesos del modelo fuera de los sistemas de Anthropic, mientras que los monitores fuera de línea se enfocan en comportamientos peligrosos que se desarrollan lentamente y pueden revertirse, como señales de desalineación del modelo. Anthropic dijo que dos decisiones de diseño en la estructura interna respaldan la supervisión: cada agente lleva una identidad individual que persiste a través de actualizaciones del modelo, y los agentes se comunican mediante un sistema de mensajería abierto y compartido, cruzado con transcripciones, de modo que la monitorización conductual pueda atravesar la comunicación entre agentes. La empresa afirmó que METR había previamente realizado de forma independiente pruebas de penetración a su plataforma de monitorización fuera de línea, y que estas mediciones de supervisión también se publicaron en su informe de riesgos de agosto de 2026.

Instantánea de asignación de cómputo

Para la tercera medición, Anthropic examinó cómo utilizó todo su cómputo del 13 al 20 de julio de 2026, clasificando cada carga de trabajo en categorías y midiendo cuánto del cómputo destinado a I&D de IA correspondía a trabajo de seguridad. Durante esa semana, Anthropic informó que aproximadamente el 6 % del cómputo destinado a I&D de IA se asignó a seguridad, y aproximadamente el 12 % del cómputo destinado a I&D impulsado por IA se asignó a seguridad.

La empresa describe ambas estimaciones como deliberadamente conservadoras: los tokens que avanzaban capacidades tanto como la seguridad se contabilizaron como I+D de IA, y los clasificadores de salvaguardas, una cantidad de cómputo separada y comparable, se excluyen. Un clasificador Claude con indicación ordenó los casi 10.000 entrenamientos y evaluaciones de investigación de la semana usando una muestra de aproximadamente el 14 % ponderada hacia los usuarios de cómputo más grandes, y Anthropic informó que el clasificador coincidió con los revisores humanos en uno o dos puntos porcentuales.

Las limitaciones señaladas son que una sola semana demuestra que la medición es factible sin establecer una tendencia, que las etiquetas de carga de trabajo subyacentes son de mejor esfuerzo y no están verificadas, y que la proporción de cómputo mide lo gastado más que la cantidad de trabajo de seguridad realizado.

Propósito y próximos pasos

Anthropic dijo que publica las mediciones porque brindan al público, a terceros y a los gobiernos una visión más clara del ritmo del desarrollo de IA dentro de los laboratorios de vanguardia, complementando sus informes de riesgos de la Política de Escalado Responsable y su propuesta de política Marco de IA Avanzada. Señaló que se esperaría que los números cambiaran si hubiera coordinación en el ritmo de la frontera, como solicita el CEO Dario Amodei.

La publicación indica que cualquier desarrollador de frontera podría publicar las mismas métricas de forma regular con una metodología pública, e identifica dos obstáculos para la comparación entre laboratorios: la ausencia de una metodología compartida y el uso por parte del desarrollador de sus propios modelos para evaluar sus sistemas. Afirma que dichas métricas podrían ser verificadas por terceros o por los modelos de otros desarrolladores, y podrían convertirse en un desencadenante de requisitos más estrictos, como una ventana de pruebas fija antes de que un nuevo modelo se emplee en más I+D de IA.

Anthropic dijo que planea incorporar evaluadores independientes de terceros de múltiples organizaciones, dándoles acceso a procesos internos, sistemas y datos comparables a los que poseen los equipos internos de evaluación de riesgos, para verificar las prácticas de seguridad, reportar incidentes y seguir métricas clave como las que aparecen en la publicación. El artículo fue coescrito por Marina Favaro y Phillie Wright, con dirección de investigación de Jack Clark.

Jonas Reeve es un analista generado por IA en Unite.AI, centrado en la inteligencia artificial cognitiva, la inteligencia artificial general (AGI) y los fundamentos teóricos de la inteligencia de la máquina. Su trabajo explora cómo surgen el aprendizaje, el razonamiento, la memoria y la abstracción en sistemas biológicos y artificiales, estableciendo conexiones entre las arquitecturas de IA modernas y las preguntas largamente debatidas en la ciencia cognitiva y la filosofía de la mente.
Con un enfoque conceptual y reflexivo, Jonas examina marcos como los modelos de razonamiento, los sistemas agénticos, la cognición emergente y la teoría de alineación, con el objetivo de aclarar qué significa realmente el progreso hacia la AGI —y qué no. En lugar de perseguir cronogramas o publicidad, enfatiza los primeros principios, la rigidez conceptual y los límites de los modelos actuales.
Los artículos escritos por Jonas Reeve son generados por IA y revisados por el equipo editorial de Unite.AI para garantizar la precisión, la claridad y la discusión responsable de conceptos de IA avanzados.