Modelos y plataformas de IA

DeepMind presenta el algoritmo JEST: Haciendo que el entrenamiento de modelos de IA sea más rápido, económico y respetuoso con el medio ambiente

mm
Añade Unite.AI a tus fuentes preferidas en Google

La inteligencia artificial generativa está logrando avances increíbles, transformando áreas como la medicina, la educación, las finanzas, el arte, los deportes, etc. Este progreso se debe principalmente a la mejora de la capacidad de la IA para aprender de conjuntos de datos más grandes y construir modelos más complejos con miles de millones de parámetros. Aunque estos avances han impulsado importantes descubrimientos científicos, han creado nuevas oportunidades comerciales y han llevado al crecimiento industrial, tienen un costo alto, especialmente si se consideran los impactos financieros y ambientales del entrenamiento de estos modelos a gran escala. Los algoritmos de aprendizaje necesitan una gran potencia computacional para entrenar modelos de IA generativa con conjuntos de datos grandes, lo que lleva a un alto consumo de energía y una notable huella de carbono.

Mientras que los esfuerzos anteriores para hacer que la IA generativa sea sostenible se han centrado en mejorar la eficiencia del hardware para el entrenamiento de la IA y desarrollar modelos más pequeños con menos parámetros, Google DeepMind ha adoptado un enfoque innovador, con el objetivo de mejorar la eficiencia del algoritmo de entrenamiento de la IA generativa. Han sido pioneros en un nuevo algoritmo, JEST (Selección de Ejemplos Conjunta), que opera 13 veces más rápido y es diez veces más eficiente en términos de energía que las técnicas actuales.

En este artículo, exploramos los desafíos del entrenamiento de la IA y cómo JEST aborda estos problemas. Además, consideramos las implicaciones más amplias y las direcciones de investigación futuras para el algoritmo JEST, visualizando su posible impacto más allá de mejorar la velocidad, la eficiencia en términos de costo y la amabilidad con el medio ambiente en el entrenamiento de la IA.

Desafíos del entrenamiento de la IA: Altos costos y impacto ambiental

El entrenamiento de modelos de IA generativa presenta importantes desafíos debido a los altos costos y el impacto ambiental significativo.

  • Costos financieros: El entrenamiento de modelos de IA generativa es una empresa costosa. Las estimaciones recientes indican que el entrenamiento de un solo modelo grande, como el GPT-3 de OpenAI con 175.000 millones de parámetros, puede costar alrededor de $4,6 millones. Se estima que el entrenamiento de ChatGPT-4 le costó a OpenAI aproximadamente $100 millones. Estos gastos se deben en gran medida a los recursos computacionales masivos, el procesamiento de datos extensivo y los tiempos de entrenamiento prolongados requeridos.
  • Consumo de energía: Los procesos de entrenamiento de la IA generativa son extremadamente intensivos en términos de energía. El entrenamiento de estos modelos implica miles de GPU y consume múltiples gigavatios-hora de energía, lo que hace que el proceso sea extremadamente intensivo en términos de energía. Los centros de datos, que albergan la infraestructura de cómputo para el entrenamiento de la IA, consumen alrededor de 200 teravatios-hora (TWh) de electricidad anualmente, aproximadamente 1% de la demanda de electricidad global. Un informe de McKinsey predice que el consumo de energía de los centros de datos en EE. UU. podría aumentar de 17 gigavatios (GW) en 2017 a 35 GW para 2030, lo que requeriría la producción equivalente a nueve presas de Hoover para satisfacer esta demanda adicional.
  • Huella de carbono: El alto consumo de energía del entrenamiento de modelos de IA generativa contribuye significativamente a las emisiones de gases de efecto invernadero, exacerbando el cambio climático. Un estudio de la Universidad de Massachusetts Amherst encontró que el entrenamiento de un modelo de IA grande puede emitir tanto dióxido de carbono como cinco automóviles a lo largo de sus vidas. En particular, el entrenamiento de un solo modelo de IA puede emitir más de 626.000 libras de CO2, equivalente a la huella de carbono de 315 vuelos transamericanos.

Estos desafíos se deben principalmente a dos fuentes principales: la dependencia de hardware computacional que consume mucha energía y la ineficiencia de los algoritmos de entrenamiento actuales. Si bien la comunidad de la IA ha hecho avances en el desarrollo de hardware eficiente en términos de energía, es necesario poner más énfasis en la creación de algoritmos más inteligentes que puedan optimizar el uso de los datos y reducir los tiempos de entrenamiento. El algoritmo JEST de Google es una investigación pionera hacia la creación de algoritmos de entrenamiento más inteligentes. Al seleccionar inteligentemente los datos que importan, JEST mejora significativamente la eficiencia del entrenamiento de la IA, allanando el camino para un entrenamiento más sostenible y económico de modelos de IA generativa.

Entendiendo el algoritmo JEST

JEST es un algoritmo de aprendizaje diseñado para entrenar modelos de IA generativa multimodales de manera más eficiente. Para entender cómo funciona JEST, piense en el entrenamiento de la IA como resolver un rompecabezas complejo, donde cada pieza (punto de datos) ayuda a construir la imagen completa (modelo de IA). JEST actúa como un solucionador de rompecabezas experimentado, haciendo que el proceso sea más eficiente. Al igual que un solucionador de rompecabezas selecciona las piezas más importantes y distintivas, JEST identifica y selecciona los lotes de datos más valiosos del conjunto de datos, asegurando que cada lote desempeñe un papel crucial en el desarrollo de la IA.

JEST emplea un modelo de IA más pequeño para evaluar la calidad de los lotes de datos. Estos lotes se clasifican según su eficacia en el entrenamiento del modelo. Con estos lotes cuidadosamente seleccionados, JEST los ensambla estratégicamente para entrenar el modelo. Al igual que un solucionador de rompecabezas organiza las piezas del rompecabezas para maximizar la eficiencia y la coherencia, JEST acelera significativamente el proceso de entrenamiento al priorizar y seleccionar los lotes más informativos.

Una parte clave del enfoque de JEST es el aprendizaje contrastivo multimodal. Esta técnica se centra en aprender la correspondencia entre diferentes tipos de datos, como texto e imágenes. JEST emplea un método de aprendizaje contrastivo multimodal para evaluar la eficacia de una muestra de datos multimodal en el entrenamiento del modelo. Además de la eficacia de las muestras de datos individuales, JEST también evalúa la aprendizabilidad colectiva de las muestras de datos para seleccionar un lote pequeño de datos de un “superlote” más grande. Este proceso ayuda a JEST a seleccionar y priorizar lotes que ofrecen desafíos y oportunidades de aprendizaje rico.

Mirando hacia adelante: JEST más allá del entrenamiento de la IA más rápido, económico y respetuoso con el medio ambiente

A medida que exploramos las implicaciones futuras de JEST (Selección de Ejemplos Conjunta), es evidente que sus contribuciones van más allá de simplemente acelerar el entrenamiento de la IA, reducir costos y promover la sostenibilidad ambiental. Aquí, exploramos cómo JEST puede seguir mejorando y transformando el campo de la IA generativa:

  • Rendimiento y precisión del modelo mejorados: El enfoque innovador de JEST para la selección y priorización de datos conduce a tiempos de entrenamiento más rápidos y a un mejor rendimiento del modelo. Al centrarse en los lotes de datos más informativos, JEST garantiza que los modelos de IA se entrenen con entradas de alta calidad, mejorando su precisión y robustez. Esta ventaja es crucial en aplicaciones donde la precisión y la confiabilidad son fundamentales, como la diagnóstica médica, la previsión financiera y los sistemas autónomos.
  • Identificación y mitigación de sesgos en los datos: La IA es propensa a conjuntos de datos sesgados donde ciertos grupos o perspectivas están subrepresentados o mal representados. El enfoque de selección de datos de JEST implica evaluar la calidad y la informatividad de los lotes de datos. Al priorizar muestras de datos diversas y representativas, JEST puede ayudar a los sistemas de IA a aprender de un conjunto de datos más equilibrado, reduciendo así los sesgos en los datos de entrenamiento. Por ejemplo, en aplicaciones de IA en atención médica, JEST puede seleccionar lotes de datos que abarquen varios factores demográficos, asegurando que los modelos de diagnóstico médica se entrenen en poblaciones de pacientes diversas. Esta selección reduce el riesgo de sesgos que podrían afectar desproporcionadamente a ciertos grupos en función de la raza, el género o el estatus socioeconómico.
  • Fomento de la innovación y la investigación: Al reducir significativamente los recursos computacionales y el tiempo necesarios para el entrenamiento de modelos de IA, JEST reduce las barreras de entrada para los investigadores y los innovadores. Esta accesibilidad fomenta un ecosistema más vibrante de desarrollo de la IA, donde los equipos y las organizaciones más pequeños pueden experimentar y desplegar soluciones de IA avanzadas. Además, las ganancias de eficiencia que ofrece JEST liberan recursos que se pueden redirigir hacia la exploración de nuevas fronteras en la IA, como arquitecturas novedosas, algoritmos avanzados y marcos éticos de la IA.
  • Promoción del desarrollo de la IA inclusiva: El desarrollo de la IA debe involucrar perspectivas y aportes diversos para mitigar eficazmente los sesgos y las preocupaciones éticas. La capacidad de JEST para seleccionar datos en función de su valor informativo y representatividad fomenta prácticas inclusivas en la curación de conjuntos de datos. Los desarrolladores de la IA pueden asegurarse de que JEST aborde eficazmente los sesgos y las consideraciones éticas involucrando a equipos multidisciplinarios en la definición de los criterios de selección de datos, incluyendo a expertos en ética, ciencias sociales y campos específicos. Este enfoque colaborativo fomenta un desarrollo más inclusivo y responsable de las tecnologías de la IA.

En resumen

La presentación del algoritmo JEST por parte de DeepMind representa un gran avance en el entrenamiento de la IA generativa. Al acelerar significativamente los procesos de entrenamiento y reducir el consumo de energía, JEST ofrece ahorros de costos sustanciales y aborda las preocupaciones ambientales relacionadas con el desarrollo de la IA. Más allá de estas ventajas, JEST tiene el potencial de mejorar la precisión del modelo, mitigar los sesgos en los datos, fomentar la innovación y promover el desarrollo inclusivo de la IA. La continua refinación y aplicación de JEST están destinadas a redefinir el futuro de la IA, avanzando hacia soluciones de IA más eficientes, sostenibles y éticamente responsables.

El Dr. Tehseen Zia es un profesor asociado titular en la Universidad COMSATS de Islamabad, con un doctorado en Inteligencia Artificial de la Universidad Técnica de Viena, Austria. Especializado en Inteligencia Artificial, Aprendizaje Automático, Ciencia de Datos y Visión por Computadora, ha hecho contribuciones significativas con publicaciones en revistas científicas reputadas. El Dr. Tehseen también ha liderado varios proyectos industriales como investigador principal y ha servido como consultor de Inteligencia Artificial.