Modelos y plataformas de IA

Gemma: Google Brinda Capacidades Avanzadas de IA a Través de Código Abierto

mm
Añade Unite.AI a tus fuentes preferidas en Google

El campo de la inteligencia artificial (IA) ha experimentado un gran progreso en los últimos años, impulsado en gran medida por los avances en aprendizaje profundo y procesamiento de lenguaje natural (NLP). En la vanguardia de estos avances se encuentran los modelos de lenguaje grande (LLM) – sistemas de IA entrenados en grandes cantidades de datos de texto que pueden generar texto similar al humano y participar en tareas conversacionales.

Los LLM como PaLM de Google , Claude de Anthropic y Gopher de DeepMind han demostrado capacidades notables, desde codificación hasta razonamiento común. Sin embargo, la mayoría de estos modelos no han sido liberados abiertamente, lo que limita su acceso para la investigación, el desarrollo y las aplicaciones beneficiosas.

Esto cambió con la reciente liberación de código abierto de Gemma – una familia de LLM de Google’s DeepMind basada en sus potentes modelos Gemini propietarios. En este artículo, analizaremos Gemma, su arquitectura, proceso de entrenamiento, rendimiento y lanzamiento responsable.

Visión General de Gemma

En febrero de 2023, DeepMind liberó el código abierto de dos tamaños de modelos Gemma – una versión de 2 mil millones de parámetros optimizada para la implementación en dispositivos, y una versión más grande de 7 mil millones de parámetros diseñada para el uso de GPU/TPU.

Gemma aprovecha una arquitectura basada en transformadores y una metodología de entrenamiento similar a la de los modelos Gemini de DeepMind. Fue entrenada en hasta 6 billones de tokens de texto de documentos web, matemáticas y código.

DeepMind liberó los puntos de partida preentrenados sin procesar de Gemma, así como versiones afinadas con aprendizaje supervisado y retroalimentación humana para mejorar las capacidades en áreas como el diálogo, el seguimiento de instrucciones y la codificación.

Comenzando con Gemma

La liberación de código abierto de Gemma hace que sus capacidades de IA avanzadas sean accesibles para desarrolladores, investigadores y entusiastas. Aquí hay una guía rápida para comenzar:

Implementación Agnóstica de Plataforma

Una de las fortalezas clave de Gemma es su flexibilidad – puede ejecutarse en CPUs, GPUs o TPUs. Para CPU, utilice TensorFlow Lite o HuggingFace Transformers. Para un rendimiento acelerado en GPU/TPU, use TensorFlow. Los servicios en la nube como Vertex AI de Google Cloud también ofrecen una escalabilidad sin problemas.

Acceso a Modelos Preentrenados

Gemma viene en diferentes variantes preentrenadas dependiendo de sus necesidades. Los modelos de 2B y 7B ofrecen fuertes capacidades generativas fuera de la caja. Para una afinación personalizada, los modelos 2B-FT y 7B-FT son puntos de partida ideales.

Construir Aplicaciones Emocionantes

Puede construir una amplia gama de aplicaciones con Gemma, como la generación de historias, la traducción de lenguaje, la respuesta a preguntas y la producción de contenido creativo. La clave es aprovechar las fortalezas de Gemma a través de la afinación en sus propios conjuntos de datos.

Arquitectura

Gemma utiliza una arquitectura de transformador solo decodificador, basada en avances como la atención multi-consulta y las incrustaciones posicionales rotativas:

  • Transformadores: Introducidos en 2017, la arquitectura de transformador basada únicamente en mecanismos de atención se ha vuelto ubicua en NLP. Gemma hereda la capacidad del transformador para modelar dependencias de largo alcance en el texto.
  • Solo decodificador: Gemma solo utiliza una pila de decodificadores de transformador, a diferencia de los modelos codificador-decodificador como BART o T5. Esto proporciona fuertes capacidades generativas para tareas como la generación de texto.
  • Atención multi-consulta: Gemma emplea la atención multi-consulta en su modelo más grande, lo que permite que cada cabeza de atención procese múltiples consultas en paralelo para una inferencia más rápida.
  • Incrustaciones posicionales rotativas: Gemma representa la información de posición utilizando incrustaciones rotativas en lugar de codificaciones de posición absoluta. Esta técnica reduce el tamaño del modelo mientras mantiene la información de posición.

El uso de técnicas como la atención multi-consulta y las incrustaciones posicionales rotativas permite que los modelos Gemma alcancen un equilibrio óptimo entre rendimiento, velocidad de inferencia y tamaño del modelo.

Datos y Proceso de Entrenamiento

Gemma fue entrenada en hasta 6 billones de tokens de texto, principalmente en inglés. Esto incluyó documentos web, texto matemático y código. DeepMind invirtió esfuerzos significativos en la filtración de datos, eliminando contenido tóxico o perjudicial utilizando clasificadores y heurísticas.

El entrenamiento se realizó utilizando la infraestructura TPUv5 de Google, con hasta 4096 TPUs utilizadas para entrenar a Gemma-7B. Técnicas de paralelismo de modelo y datos eficientes permitieron entrenar a los modelos masivos con hardware estándar.

Se utilizó un entrenamiento por etapas, ajustando continuamente la distribución de datos para centrarse en texto de alta calidad y relevante. Las etapas finales de afinación utilizaron una mezcla de ejemplos de instrucción y retroalimentación humana para mejorar las capacidades en áreas como el diálogo y el seguimiento de instrucciones.

Rendimiento del Modelo

DeepMind evaluó rigurosamente los modelos Gemma en un conjunto amplio de más de 25 benchmarks que abarcan preguntas y respuestas, razonamiento, matemáticas, codificación, sentido común y capacidades de diálogo.

Gemma logra resultados de vanguardia en comparación con modelos de código abierto de tamaño similar en la mayoría de los benchmarks. Algunos aspectos destacados:

  • Matemáticas: Gemma sobresale en pruebas de razonamiento matemático como GSM8K y MATH, superando a modelos como Codex y Claude de Anthropic en más de 10 puntos.
  • Codificación: Gemma iguala o supera el rendimiento de Codex en benchmarks de programación como MBPP, a pesar de no haber sido entrenada específicamente en código.
  • Diálogo: Gemma demuestra una fuerte capacidad conversacional con una tasa de victoria del 51,7% sobre Mistral-7B de Anthropic en pruebas de preferencia humana.
  • Razonamiento: En tareas que requieren inferencia como ARC y Winogrande, Gemma supera a otros modelos de 7B en 5-10 puntos.

La versatilidad de Gemma en diversas disciplinas demuestra sus fuertes capacidades de inteligencia general. Aunque persisten brechas con el rendimiento humano, Gemma representa un salto adelante en NLP de código abierto.

Seguridad y Responsabilidad

La liberación de pesos de modelos grandes de código abierto plantea desafíos en torno al uso intencional incorrecto y los sesgos inherentes del modelo. DeepMind tomó medidas para mitigar los riesgos:

  • Filtración de datos: Se eliminó el texto potencialmente tóxico, ilegal o sesgado del conjunto de entrenamiento utilizando clasificadores y heurísticas.
  • Evaluaciones: Gemma se probó en más de 30 benchmarks diseñados para evaluar la seguridad, la equidad y la robustez. Igualó o superó a otros modelos.
  • Afinación: La afinación del modelo se centró en mejorar las capacidades de seguridad, como la filtración de información y los comportamientos de negación/refugo adecuados.
  • Términos de uso: Los términos de uso prohíben aplicaciones ofensivas, ilegales o poco éticas de los modelos Gemma. Sin embargo, el cumplimiento sigue siendo un desafío.
  • Tarjetas de modelo: Se publicaron tarjetas que detallan las capacidades, limitaciones y sesgos del modelo para promover la transparencia.

Aunque existen riesgos asociados con la liberación de código abierto, DeepMind determinó que la liberación de Gemma proporciona beneficios netos para la sociedad basados en su perfil de seguridad y su capacidad para habilitar la investigación. Sin embargo, el monitoreo constante de los posibles daños será fundamental.

Habilitando la Próxima Ola de Innovación en IA

La liberación de Gemma como una familia de modelos de código abierto está a punto de desbloquear el progreso en toda la comunidad de IA:

  • Accesibilidad: Gemma reduce las barreras para que las organizaciones construyan con NLP de vanguardia, que anteriormente enfrentaban altos costos de cómputo y datos para entrenar sus propios LLM.
  • Nuevas aplicaciones: Al liberar puntos de partida preentrenados y afinados, DeepMind permite un desarrollo más fácil de aplicaciones beneficiosas en áreas como la educación, la ciencia y la accesibilidad.
  • Personalización: Los desarrolladores pueden personalizar aún más Gemma para aplicaciones específicas de la industria o el dominio a través del entrenamiento continuo en datos propietarios.
  • Investigación: Los modelos abiertos como Gemma fomentan una mayor transparencia y auditoría de los sistemas actuales de NLP, iluminando direcciones de investigación futuras.
  • Innovación: La disponibilidad de modelos de referencia sólidos como Gemma acelerará el progreso en áreas como la mitigación de sesgos, la facticidad y la seguridad de la IA.

Al proporcionar las capacidades de Gemma a todos a través de la liberación de código abierto, DeepMind espera impulsar el desarrollo responsable de la IA para el bien social.

El Camino por Delante

Con cada salto en la IA, nos acercamos más a modelos que rivalizan o superan la inteligencia humana en todos los dominios. Sistemas como Gemma subrayan cómo los avances rápidos en los modelos auto-supervisados están desbloqueando capacidades cognitivas cada vez más avanzadas.

Sin embargo, queda trabajo por hacer para mejorar la confiabilidad, la interpretabilidad y el control de la IA – áreas donde la inteligencia humana todavía es supremamente superior. Dominios como las matemáticas resaltan estas brechas persistentes, con Gemma obteniendo un 64% en MMLU en comparación con un rendimiento humano estimado del 89%.

Cerrar estas brechas mientras se garantiza la seguridad y la ética de los sistemas de IA cada vez más capaces será el desafío central en los años venideros. Encontrar el equilibrio adecuado entre la apertura y la precaución será fundamental, ya que DeepMind busca democratizar el acceso a los beneficios de la IA mientras gestiona los riesgos emergentes.

Iniciativas para promover la seguridad de la IA, como ANC de Dario Amodei, el equipo de Ética y Sociedad de DeepMind y la IA Constitucional de Anthropic, señalan un creciente reconocimiento de esta necesidad de matización. Un progreso significativo requerirá un diálogo abierto y basado en evidencia entre investigadores, desarrolladores, formuladores de políticas y el público.

Si se navega de manera responsable, Gemma representa no la cima de la IA, sino un campamento base para la próxima generación de investigadores de IA que siguen los pasos de DeepMind hacia una IA general artificial justa y beneficiosa.

Conclusión

La liberación de los modelos Gemma por parte de DeepMind marca una nueva era para la IA de código abierto – una que trasciende los estrechos benchmarks hacia capacidades de inteligencia generalizadas. Probada extensivamente para la seguridad y ampliamente accesible, Gemma establece un nuevo estándar para la liberación responsable de código abierto en la IA.

Impulsada por un espíritu competitivo templado con valores cooperativos, compartir avances como Gemma eleva a todos los involucrados en el ecosistema de la IA. La comunidad entera ahora tiene acceso a una familia de LLM versátil para impulsar o apoyar sus iniciativas.

Aunque persisten riesgos, la diligencia técnica y ética de DeepMind proporciona confianza en que los beneficios de Gemma superan sus posibles daños. A medida que las capacidades de la IA crecen cada vez más avanzadas, mantener esta matización entre la apertura y la precaución será fundamental.

Gemma nos acerca un paso más a la IA que beneficia a toda la humanidad. Pero muchas grandes desafíos siguen esperando en el camino hacia una IA general artificial benevolente. Si los investigadores de IA, los desarrolladores y la sociedad en general pueden mantener un progreso colaborativo, Gemma puede ser vista un día como un histórico campamento base, en lugar de la cima final.

He dedicado los últimos cinco años sumergiéndome en el fascinante mundo de Machine Learning y Deep Learning. Mi pasión y experiencia me han llevado a contribuir a más de 50 proyectos de ingeniería de software diversos, con un enfoque particular en AI/ML. Mi curiosidad en curso también me ha llevado hacia el Procesamiento de Lenguaje Natural, un campo que estoy ansioso por explorar más a fondo.