Modelos y plataformas de IA

¿Cómo piensa Claude? La búsqueda de Anthropic para desbloquear la caja negra de la IA

mm
Añade Unite.AI a tus fuentes preferidas en Google

Los modelos de lenguaje grande (LLM) como Claude han cambiado la forma en que utilizamos la tecnología. Proporcionan herramientas como chatbots, ayudan a escribir ensayos e incluso crean poesía. Sin embargo, a pesar de sus increíbles habilidades, estos modelos siguen siendo un misterio en muchos sentidos. La gente los llama a menudo “caja negra” porque podemos ver lo que dicen, pero no cómo llegan a esa conclusión. Esta falta de comprensión crea problemas, especialmente en áreas importantes como la medicina o la ley, donde los errores o sesgos ocultos podrían causar daños reales.

Entender cómo funcionan los LLM es esencial para generar confianza. Si no podemos explicar por qué un modelo dio una respuesta en particular, es difícil confiar en sus resultados, especialmente en áreas sensibles. La interpretación también ayuda a identificar y corregir sesgos o errores, asegurando que los modelos sean seguros y éticos. Por ejemplo, si un modelo favorece consistentemente ciertos puntos de vista, saber por qué puede ayudar a los desarrolladores a corregirlo. Esta necesidad de claridad es lo que impulsa la investigación para hacer que estos modelos sean más transparentes.

Anthropic, la empresa detrás de Claude, ha estado trabajando para abrir esta caja negra. Han hecho un progreso emocionante en descubrir cómo piensan los LLM, y este artículo explora sus avances en hacer que los procesos de Claude sean más fáciles de entender.

Mapa de los pensamientos de Claude

A mediados de 2024, el equipo de Anthropic hizo un descubrimiento emocionante. Crearon un mapa básico de cómo Claude procesa la información. Utilizando una técnica llamada aprendizaje de diccionario, encontraron millones de patrones en el “cerebro” de Claude, su red neuronal. Cada patrón, o “característica”, se conecta a una idea específica. Por ejemplo, algunas características ayudan a Claude a identificar ciudades, personas famosas o errores de codificación. Otras se relacionan con temas más complejos, como el sesgo de género o la secrecía.

Los investigadores descubrieron que estas ideas no están aisladas dentro de neuronas individuales. En cambio, están distribuidas a lo largo de muchas neuronas de la red de Claude, con cada neurona contribuyendo a varias ideas. Esa superposición hizo que Anthropic encontrara difícil descifrar estas ideas en un principio. Sin embargo, al detectar estos patrones recurrentes, los investigadores de Anthropic comenzaron a descodificar cómo Claude organiza sus pensamientos.

Seguimiento del razonamiento de Claude

A continuación, Anthropic quería ver cómo Claude utiliza esos pensamientos para tomar decisiones. Recientemente construyeron una herramienta llamada gráficos de atribución, que funciona como una guía paso a paso del proceso de pensamiento de Claude. Cada punto en el gráfico es una idea que se enciende en la mente de Claude, y las flechas muestran cómo una idea fluye hacia la siguiente. Este gráfico permite a los investigadores rastrear cómo Claude convierte una pregunta en una respuesta.

Para entender mejor el funcionamiento de los gráficos de atribución, consideremos este ejemplo: cuando se le pregunta “¿Cuál es la capital del estado donde se encuentra Dallas?”, Claude debe darse cuenta de que Dallas está en Texas, y luego recordar que la capital de Texas es Austin. El gráfico de atribución mostró exactamente este proceso, una parte de Claude señaló “Texas”, lo que llevó a otra parte a seleccionar “Austin”. El equipo incluso lo probó modificando la parte de “Texas”, y efectivamente, cambió la respuesta. Esto muestra que Claude no está simplemente adivinando, sino que está trabajando a través del problema, y ahora podemos ver cómo sucede.

Por qué esto es importante: Una analogía de las ciencias biológicas

Para ver por qué esto es importante, es conveniente pensar en algunos de los grandes avances en las ciencias biológicas. Al igual que la invención del microscopio permitió a los científicos descubrir las células, los bloques de construcción ocultos de la vida, estas herramientas de interpretación están permitiendo a los investigadores de IA descubrir los bloques de construcción del pensamiento dentro de los modelos. Y al igual que cartografiar los circuitos neuronales en el cerebro o secuenciar el genoma allanó el camino para avances en la medicina, cartografiar los mecanismos internos de Claude podría allanar el camino para una inteligencia máquina más fiable y controlable. Estas herramientas de interpretación podrían desempeñar un papel vital, ayudándonos a echar un vistazo al proceso de pensamiento de los modelos de IA.

Los desafíos

Incluso con todo este progreso, todavía estamos lejos de entender completamente los LLM como Claude. Actualmente, los gráficos de atribución solo pueden explicar alrededor de una de cada cuatro decisiones de Claude. Mientras que el mapa de sus características es impresionante, cubre solo una parte de lo que sucede dentro del cerebro de Claude. Con miles de millones de parámetros, Claude y otros LLM realizan cálculos innumerables para cada tarea. Rastrear cada uno para ver cómo se forma una respuesta es como tratar de seguir cada neurona que se dispara en un cerebro humano durante un solo pensamiento.

También hay el desafío de la “alucinación“. A veces, los modelos de IA generan respuestas que suenan plausibles pero son en realidad falsas, como afirmar confiadamente un hecho incorrecto. Esto ocurre porque los modelos confían en patrones de sus datos de entrenamiento en lugar de una comprensión real del mundo. Entender por qué se desvían hacia la fabricación sigue siendo un problema difícil, lo que destaca las lagunas en nuestra comprensión de sus mecanismos internos.

El sesgo es otro obstáculo significativo. Los modelos de IA aprenden de vastos conjuntos de datos recopilados de Internet, que inherentemente llevan sesgos humanos, estereotipos, prejuicios y otros defectos sociales. Si Claude adopta estos sesgos de su entrenamiento, puede reflejarlos en sus respuestas. Desempacar dónde se originan estos sesgos y cómo influyen en el razonamiento del modelo es un desafío complejo que requiere tanto soluciones técnicas como una consideración cuidadosa de los datos y la ética.

En resumen

El trabajo de Anthropic para hacer que los modelos de lenguaje grande (LLM) como Claude sean más comprensibles es un paso importante hacia la transparencia de la IA. Al revelar cómo Claude procesa la información y toma decisiones, están avanzando hacia la dirección de abordar preocupaciones clave sobre la responsabilidad de la IA. Este progreso abre la puerta para la integración segura de LLM en sectores críticos como la atención médica y el derecho, donde la confianza y la ética son vitales.

A medida que se desarrollan métodos para mejorar la interpretación, las industrias que han sido cautelosas al adoptar la IA pueden reconsiderar. Modelos transparentes como Claude proporcionan un camino claro hacia el futuro de la IA, máquinas que no solo replican la inteligencia humana, sino que también explican su razonamiento.

El Dr. Tehseen Zia es un profesor asociado titular en la Universidad COMSATS de Islamabad, con un doctorado en Inteligencia Artificial de la Universidad Técnica de Viena, Austria. Especializado en Inteligencia Artificial, Aprendizaje Automático, Ciencia de Datos y Visión por Computadora, ha hecho contribuciones significativas con publicaciones en revistas científicas reputadas. El Dr. Tehseen también ha liderado varios proyectos industriales como investigador principal y ha servido como consultor de Inteligencia Artificial.