Modelos y plataformas de IA

Gemma: Google Brinda Capacidades Avanzadas de IA a TravÃĐs de CÃģdigo Abierto

mm
AÃąade Unite.AI a tus fuentes preferidas en Google

El campo de la inteligencia artificial (IA) ha experimentado un gran progreso en los Últimos aÃąos, impulsado en gran medida por los avances en aprendizaje profundo y procesamiento de lenguaje natural (NLP). En la vanguardia de estos avances se encuentran los modelos de lenguaje grande (LLM) – sistemas de IA entrenados en grandes cantidades de datos de texto que pueden generar texto similar al humano y participar en tareas conversacionales.

Los LLM como PaLM de Google (GOOGL ), Claude de Anthropic y Gopher de DeepMind han demostrado capacidades notables, desde codificaciÃģn hasta razonamiento comÚn. Sin embargo, la mayoría de estos modelos no han sido liberados abiertamente, lo que limita su acceso para la investigaciÃģn, el desarrollo y las aplicaciones beneficiosas.

Esto cambiÃģ con la reciente liberaciÃģn de cÃģdigo abierto de Gemma – una familia de LLM de Google’s DeepMind basada en sus potentes modelos Gemini propietarios. En este artículo, analizaremos Gemma, su arquitectura, proceso de entrenamiento, rendimiento y lanzamiento responsable.

VisiÃģn General de Gemma

En febrero de 2023, DeepMind liberÃģ el cÃģdigo abierto de dos tamaÃąos de modelos Gemma – una versiÃģn de 2 mil millones de parÃĄmetros optimizada para la implementaciÃģn en dispositivos, y una versiÃģn mÃĄs grande de 7 mil millones de parÃĄmetros diseÃąada para el uso de GPU/TPU.

Gemma aprovecha una arquitectura basada en transformadores y una metodología de entrenamiento similar a la de los modelos Gemini de DeepMind. Fue entrenada en hasta 6 billones de tokens de texto de documentos web, matemÃĄticas y cÃģdigo.

DeepMind liberÃģ los puntos de partida preentrenados sin procesar de Gemma, así como versiones afinadas con aprendizaje supervisado y retroalimentaciÃģn humana para mejorar las capacidades en ÃĄreas como el diÃĄlogo, el seguimiento de instrucciones y la codificaciÃģn.

Comenzando con Gemma

La liberaciÃģn de cÃģdigo abierto de Gemma hace que sus capacidades de IA avanzadas sean accesibles para desarrolladores, investigadores y entusiastas. Aquí hay una guía rÃĄpida para comenzar:

ImplementaciÃģn AgnÃģstica de Plataforma

Una de las fortalezas clave de Gemma es su flexibilidad – puede ejecutarse en CPUs, GPUs o TPUs. Para CPU, utilice TensorFlow Lite o HuggingFace Transformers. Para un rendimiento acelerado en GPU/TPU, use TensorFlow. Los servicios en la nube como Vertex AI de Google Cloud tambiÃĐn ofrecen una escalabilidad sin problemas.

Acceso a Modelos Preentrenados

Gemma viene en diferentes variantes preentrenadas dependiendo de sus necesidades. Los modelos de 2B y 7B ofrecen fuertes capacidades generativas fuera de la caja. Para una afinaciÃģn personalizada, los modelos 2B-FT y 7B-FT son puntos de partida ideales.

Construir Aplicaciones Emocionantes

Puede construir una amplia gama de aplicaciones con Gemma, como la generaciÃģn de historias, la traducciÃģn de lenguaje, la respuesta a preguntas y la producciÃģn de contenido creativo. La clave es aprovechar las fortalezas de Gemma a travÃĐs de la afinaciÃģn en sus propios conjuntos de datos.

Arquitectura

Gemma utiliza una arquitectura de transformador solo decodificador, basada en avances como la atenciÃģn multi-consulta y las incrustaciones posicionales rotativas:

  • Transformadores: Introducidos en 2017, la arquitectura de transformador basada Únicamente en mecanismos de atenciÃģn se ha vuelto ubicua en NLP. Gemma hereda la capacidad del transformador para modelar dependencias de largo alcance en el texto.
  • Solo decodificador: Gemma solo utiliza una pila de decodificadores de transformador, a diferencia de los modelos codificador-decodificador como BART o T5. Esto proporciona fuertes capacidades generativas para tareas como la generaciÃģn de texto.
  • AtenciÃģn multi-consulta: Gemma emplea la atenciÃģn multi-consulta en su modelo mÃĄs grande, lo que permite que cada cabeza de atenciÃģn procese mÚltiples consultas en paralelo para una inferencia mÃĄs rÃĄpida.
  • Incrustaciones posicionales rotativas: Gemma representa la informaciÃģn de posiciÃģn utilizando incrustaciones rotativas en lugar de codificaciones de posiciÃģn absoluta. Esta tÃĐcnica reduce el tamaÃąo del modelo mientras mantiene la informaciÃģn de posiciÃģn.

El uso de tÃĐcnicas como la atenciÃģn multi-consulta y las incrustaciones posicionales rotativas permite que los modelos Gemma alcancen un equilibrio Ãģptimo entre rendimiento, velocidad de inferencia y tamaÃąo del modelo.

Datos y Proceso de Entrenamiento

Gemma fue entrenada en hasta 6 billones de tokens de texto, principalmente en inglÃĐs. Esto incluyÃģ documentos web, texto matemÃĄtico y cÃģdigo. DeepMind invirtiÃģ esfuerzos significativos en la filtraciÃģn de datos, eliminando contenido tÃģxico o perjudicial utilizando clasificadores y heurísticas.

El entrenamiento se realizÃģ utilizando la infraestructura TPUv5 de Google, con hasta 4096 TPUs utilizadas para entrenar a Gemma-7B. TÃĐcnicas de paralelismo de modelo y datos eficientes permitieron entrenar a los modelos masivos con hardware estÃĄndar.

Se utilizÃģ un entrenamiento por etapas, ajustando continuamente la distribuciÃģn de datos para centrarse en texto de alta calidad y relevante. Las etapas finales de afinaciÃģn utilizaron una mezcla de ejemplos de instrucciÃģn y retroalimentaciÃģn humana para mejorar las capacidades en ÃĄreas como el diÃĄlogo y el seguimiento de instrucciones.

Rendimiento del Modelo

DeepMind evaluÃģ rigurosamente los modelos Gemma en un conjunto amplio de mÃĄs de 25 benchmarks que abarcan preguntas y respuestas, razonamiento, matemÃĄticas, codificaciÃģn, sentido comÚn y capacidades de diÃĄlogo.

Gemma logra resultados de vanguardia en comparaciÃģn con modelos de cÃģdigo abierto de tamaÃąo similar en la mayoría de los benchmarks. Algunos aspectos destacados:

  • MatemÃĄticas: Gemma sobresale en pruebas de razonamiento matemÃĄtico como GSM8K y MATH, superando a modelos como Codex y Claude de Anthropic en mÃĄs de 10 puntos.
  • CodificaciÃģn: Gemma iguala o supera el rendimiento de Codex en benchmarks de programaciÃģn como MBPP, a pesar de no haber sido entrenada específicamente en cÃģdigo.
  • DiÃĄlogo: Gemma demuestra una fuerte capacidad conversacional con una tasa de victoria del 51,7% sobre Mistral-7B de Anthropic en pruebas de preferencia humana.
  • Razonamiento: En tareas que requieren inferencia como ARC y Winogrande, Gemma supera a otros modelos de 7B en 5-10 puntos.

La versatilidad de Gemma en diversas disciplinas demuestra sus fuertes capacidades de inteligencia general. Aunque persisten brechas con el rendimiento humano, Gemma representa un salto adelante en NLP de cÃģdigo abierto.

Seguridad y Responsabilidad

La liberaciÃģn de pesos de modelos grandes de cÃģdigo abierto plantea desafíos en torno al uso intencional incorrecto y los sesgos inherentes del modelo. DeepMind tomÃģ medidas para mitigar los riesgos:

  • FiltraciÃģn de datos: Se eliminÃģ el texto potencialmente tÃģxico, ilegal o sesgado del conjunto de entrenamiento utilizando clasificadores y heurísticas.
  • Evaluaciones: Gemma se probÃģ en mÃĄs de 30 benchmarks diseÃąados para evaluar la seguridad, la equidad y la robustez. IgualÃģ o superÃģ a otros modelos.
  • AfinaciÃģn: La afinaciÃģn del modelo se centrÃģ en mejorar las capacidades de seguridad, como la filtraciÃģn de informaciÃģn y los comportamientos de negaciÃģn/refugo adecuados.
  • TÃĐrminos de uso: Los tÃĐrminos de uso prohíben aplicaciones ofensivas, ilegales o poco ÃĐticas de los modelos Gemma. Sin embargo, el cumplimiento sigue siendo un desafío.
  • Tarjetas de modelo: Se publicaron tarjetas que detallan las capacidades, limitaciones y sesgos del modelo para promover la transparencia.

Aunque existen riesgos asociados con la liberaciÃģn de cÃģdigo abierto, DeepMind determinÃģ que la liberaciÃģn de Gemma proporciona beneficios netos para la sociedad basados en su perfil de seguridad y su capacidad para habilitar la investigaciÃģn. Sin embargo, el monitoreo constante de los posibles daÃąos serÃĄ fundamental.

Habilitando la PrÃģxima Ola de InnovaciÃģn en IA

La liberaciÃģn de Gemma como una familia de modelos de cÃģdigo abierto estÃĄ a punto de desbloquear el progreso en toda la comunidad de IA:

  • Accesibilidad: Gemma reduce las barreras para que las organizaciones construyan con NLP de vanguardia, que anteriormente enfrentaban altos costos de cÃģmputo y datos para entrenar sus propios LLM.
  • Nuevas aplicaciones: Al liberar puntos de partida preentrenados y afinados, DeepMind permite un desarrollo mÃĄs fÃĄcil de aplicaciones beneficiosas en ÃĄreas como la educaciÃģn, la ciencia y la accesibilidad.
  • PersonalizaciÃģn: Los desarrolladores pueden personalizar aÚn mÃĄs Gemma para aplicaciones específicas de la industria o el dominio a travÃĐs del entrenamiento continuo en datos propietarios.
  • InvestigaciÃģn: Los modelos abiertos como Gemma fomentan una mayor transparencia y auditoría de los sistemas actuales de NLP, iluminando direcciones de investigaciÃģn futuras.
  • InnovaciÃģn: La disponibilidad de modelos de referencia sÃģlidos como Gemma acelerarÃĄ el progreso en ÃĄreas como la mitigaciÃģn de sesgos, la facticidad y la seguridad de la IA.

Al proporcionar las capacidades de Gemma a todos a travÃĐs de la liberaciÃģn de cÃģdigo abierto, DeepMind espera impulsar el desarrollo responsable de la IA para el bien social.

El Camino por Delante

Con cada salto en la IA, nos acercamos mÃĄs a modelos que rivalizan o superan la inteligencia humana en todos los dominios. Sistemas como Gemma subrayan cÃģmo los avances rÃĄpidos en los modelos auto-supervisados estÃĄn desbloqueando capacidades cognitivas cada vez mÃĄs avanzadas.

Sin embargo, queda trabajo por hacer para mejorar la confiabilidad, la interpretabilidad y el control de la IA – ÃĄreas donde la inteligencia humana todavía es supremamente superior. Dominios como las matemÃĄticas resaltan estas brechas persistentes, con Gemma obteniendo un 64% en MMLU en comparaciÃģn con un rendimiento humano estimado del 89%.

Cerrar estas brechas mientras se garantiza la seguridad y la ÃĐtica de los sistemas de IA cada vez mÃĄs capaces serÃĄ el desafío central en los aÃąos venideros. Encontrar el equilibrio adecuado entre la apertura y la precauciÃģn serÃĄ fundamental, ya que DeepMind busca democratizar el acceso a los beneficios de la IA mientras gestiona los riesgos emergentes.

Iniciativas para promover la seguridad de la IA, como ANC de Dario Amodei, el equipo de Ética y Sociedad de DeepMind y la IA Constitucional de Anthropic, seÃąalan un creciente reconocimiento de esta necesidad de matizaciÃģn. Un progreso significativo requerirÃĄ un diÃĄlogo abierto y basado en evidencia entre investigadores, desarrolladores, formuladores de políticas y el pÚblico.

Si se navega de manera responsable, Gemma representa no la cima de la IA, sino un campamento base para la prÃģxima generaciÃģn de investigadores de IA que siguen los pasos de DeepMind hacia una IA general artificial justa y beneficiosa.

ConclusiÃģn

La liberaciÃģn de los modelos Gemma por parte de DeepMind marca una nueva era para la IA de cÃģdigo abierto – una que trasciende los estrechos benchmarks hacia capacidades de inteligencia generalizadas. Probada extensivamente para la seguridad y ampliamente accesible, Gemma establece un nuevo estÃĄndar para la liberaciÃģn responsable de cÃģdigo abierto en la IA.

Impulsada por un espíritu competitivo templado con valores cooperativos, compartir avances como Gemma eleva a todos los involucrados en el ecosistema de la IA. La comunidad entera ahora tiene acceso a una familia de LLM versÃĄtil para impulsar o apoyar sus iniciativas.

Aunque persisten riesgos, la diligencia tÃĐcnica y ÃĐtica de DeepMind proporciona confianza en que los beneficios de Gemma superan sus posibles daÃąos. A medida que las capacidades de la IA crecen cada vez mÃĄs avanzadas, mantener esta matizaciÃģn entre la apertura y la precauciÃģn serÃĄ fundamental.

Gemma nos acerca un paso mÃĄs a la IA que beneficia a toda la humanidad. Pero muchas grandes desafíos siguen esperando en el camino hacia una IA general artificial benevolente. Si los investigadores de IA, los desarrolladores y la sociedad en general pueden mantener un progreso colaborativo, Gemma puede ser vista un día como un histÃģrico campamento base, en lugar de la cima final.

He dedicado los Últimos cinco aÃąos sumergiÃĐndome en el fascinante mundo de Machine Learning y Deep Learning. Mi pasiÃģn y experiencia me han llevado a contribuir a mÃĄs de 50 proyectos de ingeniería de software diversos, con un enfoque particular en AI/ML. Mi curiosidad en curso tambiÃĐn me ha llevado hacia el Procesamiento de Lenguaje Natural, un campo que estoy ansioso por explorar mÃĄs a fondo.