Modelos y plataformas de IA

Gigantes Destilados: Por Qué Debemos Repensar el Desarrollo de la Inteligencia Artificial Pequeña

mm
Añade Unite.AI a tus fuentes preferidas en Google

En los últimos años, la carrera por desarrollar modelos de inteligencia artificial cada vez más grandes ha cautivado a la industria tecnológica. Estos modelos, con sus miles de millones de parámetros, prometen avances innovadores en diversos campos, desde el procesamiento de lenguaje natural hasta el reconocimiento de imágenes. Sin embargo, esta búsqueda incansable de tamaño conlleva importantes desventajas en forma de altos costos y un impacto ambiental significativo. Aunque la inteligencia artificial pequeña ofrece una alternativa prometedora, proporcionando eficiencia y un menor consumo de energía, el enfoque actual para construirla todavía requiere recursos sustanciales. A medida que perseguimos una inteligencia artificial pequeña y más sostenible, explorar nuevas estrategias que aborden estas limitaciones de manera efectiva es crucial.

Inteligencia Artificial Pequeña: Una Solución Sostenible para los Altos Costos y la Demanda de Energía

Desarrollar y mantener modelos de inteligencia artificial grandes es una empresa costosa. Estimaciones sugieren que entrenar GPT-3 cuesta más de $4 millones, con modelos más avanzados que podrían alcanzar decenas de millones. Estos costos, incluyendo hardware, almacenamiento, potencia computacional y recursos humanos necesarios, son prohibitivos para muchas organizaciones, particularmente empresas más pequeñas e instituciones de investigación. Esta barrera financiera crea un campo de juego desigual, limitando el acceso a la tecnología de inteligencia artificial de vanguardia y obstaculizando la innovación.

Además, la demanda de energía asociada con el entrenamiento de modelos de inteligencia artificial grandes es asombrosa. Por ejemplo, entrenar un modelo de lenguaje grande como GPT-3 se estima que consume casi 1.300 megavatios-hora (MWh) de electricidad, equivalente al consumo de energía anual de 130 hogares estadounidenses. A pesar de este costo de entrenamiento sustancial, cada solicitud de ChatGPT incurre en un costo de inferencia de 2,9 vatios-hora. La IEA estima que la demanda de energía colectiva de la inteligencia artificial, los centros de datos y las criptomonedas representó casi el 2 por ciento de la demanda de energía global. Esta demanda se proyecta que se duplicará para 2026, acercándose al consumo total de electricidad de Japón. El alto consumo de energía no solo aumenta los costos operativos, sino que también contribuye a la huella de carbono, empeorando la crisis ambiental. Para ponerlo en perspectiva, los investigadores estiman que entrenar un solo modelo de inteligencia artificial grande puede emitir más de 626.000 libras de CO2, equivalente a las emisiones de cinco automóviles durante su vida útil.

En medio de estos desafíos, la Inteligencia Artificial Pequeña proporciona una solución práctica. Está diseñada para ser más eficiente y escalable, requiriendo mucha menos datos y potencia computacional. Esto reduce los costos generales y hace que la tecnología de inteligencia artificial avanzada sea más accesible para organizaciones más pequeñas y equipos de investigación. Además, los modelos de inteligencia artificial pequeña tienen una menor demanda de energía, lo que ayuda a reducir los costos operativos y minimiza su impacto ambiental. Al utilizar algoritmos y métodos optimizados, como el aprendizaje de transferencia, la inteligencia artificial pequeña puede lograr un rendimiento alto con menos recursos. Este enfoque no solo hace que la inteligencia artificial sea más asequible, sino que también apoya la sostenibilidad al minimizar tanto el consumo de energía como las emisiones de carbono.

Cómo se Construyen los Modelos de Inteligencia Artificial Pequeña en la Actualidad

Reconociendo las ventajas de la inteligencia artificial pequeña, las principales empresas tecnológicas como Google (GOOGL ), OpenAI y Meta se han centrado cada vez más en desarrollar modelos compactos. Este cambio ha llevado a la evolución de modelos como Gemini Flash, GPT-4o Mini y Llama 7B. Estos modelos más pequeños se desarrollan principalmente utilizando una técnica llamada destilación de conocimiento.

En su núcleo, la destilación implica transferir el conocimiento de un modelo grande y complejo a una versión más pequeña y eficiente. En este proceso, un modelo “maestro” (modelo de inteligencia artificial grande) se entrena en conjuntos de datos extensos para aprender patrones y matices intrincados. Este modelo genera predicciones o “etiquetas suaves” que encapsulan su profunda comprensión.

El modelo “estudiante”, que es el modelo de inteligencia artificial pequeña, se entrena para replicar estas etiquetas suaves. Al imitar el comportamiento del maestro, el modelo estudiante captura gran parte de su conocimiento y rendimiento mientras opera con muchos menos parámetros.

Por Qué Debemos Ir Más Allá de la Destilación de la Inteligencia Artificial Grande

Aunque la destilación de la inteligencia artificial grande en versiones más pequeñas y manejables se ha convertido en un enfoque popular para construir inteligencia artificial pequeña, hay varias razones convincentes por las que este enfoque puede no ser una solución para todos los desafíos en el desarrollo de la inteligencia artificial grande.

  • Dependencia Continua de Modelos Grandes: Aunque la destilación crea modelos de inteligencia artificial más pequeños y eficientes, y mejora la eficiencia computacional y energética en el momento de la inferencia, todavía depende en gran medida de entrenar modelos de inteligencia artificial grandes inicialmente. Esto significa que construir modelos de inteligencia artificial pequeña todavía requiere recursos computacionales y energéticos significativos, lo que lleva a altos costos y un impacto ambiental incluso antes de que ocurra la destilación. La necesidad de entrenar repetidamente modelos grandes para la destilación desplaza la carga de recursos en lugar de eliminarla. Aunque la destilación apunta a reducir el tamaño y el costo de los modelos de inteligencia artificial, no elimina los costos iniciales sustanciales asociados con el entrenamiento de los modelos “maestros” grandes. Estos gastos iniciales pueden ser especialmente desafiantes para organizaciones y grupos de investigación más pequeños. Además, el impacto ambiental de entrenar estos modelos grandes puede anular algunos de los beneficios de utilizar modelos más pequeños y eficientes, ya que la huella de carbono de la fase de entrenamiento inicial sigue siendo considerable.
  • Alcance de Innovación Limitado: Depender de la destilación puede limitar la innovación al centrarse en replicar modelos grandes existentes en lugar de explorar nuevos enfoques. Esto puede frenar el desarrollo de arquitecturas o métodos de inteligencia artificial novedosos que podrían proporcionar mejores soluciones para problemas específicos. La dependencia de la inteligencia artificial grande restringe el desarrollo de la inteligencia artificial pequeña en manos de unas pocas empresas ricas en recursos. Como resultado, los beneficios de la inteligencia artificial pequeña no se distribuyen de manera uniforme, lo que puede obstaculizar el avance tecnológico más amplio y limitar las oportunidades de innovación.
  • Desafíos de Generalización y Adaptación: Los modelos de inteligencia artificial pequeña creados a través de la destilación a menudo luchan con nuevos datos no vistos. Esto ocurre porque el proceso de destilación puede no capturar completamente la capacidad del modelo más grande para generalizar. Como resultado, aunque estos modelos más pequeños pueden rendir bien en tareas familiares, a menudo encuentran dificultades cuando se enfrentan a nuevas situaciones. Además, adaptar modelos destilados a nuevas modalidades o conjuntos de datos a menudo implica volver a entrenar o ajustar el modelo más grande primero. Este proceso iterativo puede ser complejo y exigente en términos de recursos, lo que hace que sea desafiante adaptar rápidamente los modelos de inteligencia artificial pequeña a necesidades tecnológicas o aplicaciones en constante evolución.

En Resumen

Aunque destilar modelos de inteligencia artificial grandes en versiones más pequeñas puede parecer una solución práctica, sigue dependiendo de los altos costos de entrenar modelos grandes. Para avanzar genuinamente en la inteligencia artificial pequeña, debemos explorar prácticas más innovadoras y sostenibles. Esto significa crear modelos diseñados para aplicaciones específicas, mejorar los métodos de entrenamiento para que sean más eficientes en términos de costo y energía, y centrarnos en la sostenibilidad ambiental. Al perseguir estas estrategias, podemos avanzar en el desarrollo de la inteligencia artificial de una manera que sea responsable y beneficiosa tanto para la industria como para el planeta.

El Dr. Tehseen Zia es un profesor asociado titular en la Universidad COMSATS de Islamabad, con un doctorado en Inteligencia Artificial de la Universidad Técnica de Viena, Austria. Especializado en Inteligencia Artificial, Aprendizaje Automático, Ciencia de Datos y Visión por Computadora, ha hecho contribuciones significativas con publicaciones en revistas científicas reputadas. El Dr. Tehseen también ha liderado varios proyectos industriales como investigador principal y ha servido como consultor de Inteligencia Artificial.