Modelos y plataformas de IA
Google está haciendo que el entrenamiento de IA sea un 28% más rápido utilizando SLM como maestros
Entrenar grandes modelos de lenguaje (LLM) se ha convertido en algo inalcanzable para la mayoría de las organizaciones. Con costos que alcanzan millones y requisitos de cómputo que harían sudar a un supercomputador, el desarrollo de IA ha permanecido bloqueado detrás de las puertas de los gigantes tecnológicos. Pero Google (GOOGL ) acaba de dar la vuelta a esta historia con un enfoque tan simple que hace que te preguntes por qué nadie pensó en ello antes: utilizando modelos de IA más pequeños como maestros.
Cómo funciona SALT: Un nuevo enfoque para entrenar modelos de IA
En un reciente artículo de investigación titulado “Un poco de ayuda va muy lejos: Entrenamiento eficiente de LLM mediante el uso de pequeños LMs,” Google Research y DeepMind presentaron SALT (Entrenamiento de modelos grandes con ayuda de modelos pequeños). Este es el método innovador que desafía nuestro enfoque tradicional para entrenar LLM.
¿Por qué es significativa esta investigación? Actualmente, entrenar grandes modelos de IA es como tratar de enseñar a alguien todo lo que necesita saber sobre un tema de una vez – es ineficiente, costoso y a menudo restringido a organizaciones con recursos informáticos masivos. SALT toma un camino diferente, introduciendo un proceso de entrenamiento de dos etapas que es innovador y práctico.
Desglosando cómo funciona SALT en realidad:
Etapa 1: Destilación de conocimiento
- Un modelo de lenguaje más pequeño (SLM) actúa como maestro, compartiendo su comprensión con el modelo más grande
- El modelo más pequeño se enfoca en transferir su “conocimiento aprendido” a través de lo que los investigadores llaman “etiquetas suaves”
- Piensa en ello como un asistente de enseñanza que maneja conceptos fundamentales antes de que un estudiante pase a temas avanzados
- Esta etapa es particularmente efectiva en “regiones fáciles” de aprendizaje – áreas donde el modelo más pequeño tiene una confianza predictiva fuerte
Etapa 2: Aprendizaje auto-supervisado
- El modelo más grande transita a un aprendizaje independiente
- Se enfoca en dominar patrones complejos y tareas desafiantes
- Este es el momento en que el modelo desarrolla capacidades más allá de lo que su “maestro” más pequeño podría proporcionar
- La transición entre etapas utiliza estrategias cuidadosamente diseñadas, incluyendo la disminución lineal y la disminución de la relación lineal del peso de la pérdida de destilación
En términos no técnicos, imagina que el modelo de IA más pequeño es como un tutor útil que guía al modelo más grande en las primeras etapas del entrenamiento. Este tutor proporciona información adicional junto con sus respuestas, indicando qué tan seguro está de cada respuesta. Esta información adicional, conocida como “etiquetas suaves”, ayuda al modelo más grande a aprender más rápido y de manera más efectiva.
- Disminución lineal: Es como bajar gradualmente el volumen de la voz del tutor. La orientación del tutor se vuelve menos prominente con cada paso, permitiendo que el modelo más grande se enfoque más en aprender de los datos brutos en sí.
- Disminución de la relación lineal: Es como ajustar el equilibrio entre el consejo del tutor y la tarea real en cuestión. A medida que avanza el entrenamiento, el énfasis se desplaza más hacia la tarea original, mientras que la entrada del tutor se vuelve menos dominante.
Los resultados son convincentes. Cuando los investigadores de Google probaron SALT utilizando un SLM de 1.5 mil millones de parámetros para entrenar un LLM de 2.8 mil millones de parámetros en el conjunto de datos Pile, vieron:
- Una reducción del 28% en el tiempo de entrenamiento en comparación con los métodos tradicionales
- Mejoras significativas en el rendimiento después de la afinación:
- La precisión en problemas matemáticos saltó al 34.87% (en comparación con el 31.84% de la línea de base)
- La comprensión lectora alcanzó una precisión del 67% (frente al 63.7%)
Pero lo que hace que SALT sea verdaderamente innovador es su marco teórico. Los investigadores descubrieron que incluso un modelo de “maestro” más débil puede mejorar el rendimiento del estudiante al lograr lo que llaman un “intercambio favorable entre sesgo y varianza”. En términos más simples, el modelo más pequeño ayuda al más grande a aprender patrones fundamentales de manera más eficiente, creando una base más sólida para el aprendizaje avanzado.
Por qué SALT podría cambiar el campo de desarrollo de IA
Recuerda cuando la computación en la nube transformó quién podía iniciar una empresa de tecnología. SALT podría hacer lo mismo para el desarrollo de IA.
He estado siguiendo las innovaciones en el entrenamiento de IA durante años, y la mayoría de los avances han beneficiado principalmente a los gigantes tecnológicos. Pero SALT es diferente.
Aquí está lo que podría significar para el futuro:
Para organizaciones con recursos limitados:
- Ya no necesitarás una infraestructura informática masiva para desarrollar modelos de IA capaces
- Los laboratorios de investigación más pequeños y las empresas podrían experimentar con el desarrollo de modelos personalizados
- La reducción del 28% en el tiempo de entrenamiento se traduce directamente en costos informáticos más bajos
- Lo más importante es que podrías comenzar con recursos informáticos modestos y aún así lograr resultados profesionales
Para el panorama de desarrollo de IA:
- Más actores podrían entrar en el campo, lo que llevaría a soluciones de IA más diversas y especializadas
- Las universidades y las instituciones de investigación podrían realizar más experimentos con sus recursos existentes
- La barrera de entrada para la investigación de IA disminuye significativamente
- Podríamos ver nuevas aplicaciones en campos que anteriormente no podían costear el desarrollo de IA
Qué significa esto para el futuro
Al utilizar modelos más pequeños como maestros, no solo estamos haciendo que el entrenamiento de IA sea más eficiente, sino que también estamos cambiando fundamentalmente quién puede participar en el desarrollo de IA. Las implicaciones van mucho más allá de las mejoras técnicas.
Puntos clave a tener en cuenta:
- La reducción del 28% en el tiempo de entrenamiento es la diferencia entre iniciar un proyecto de IA o considerarlo inalcanzable
- Las mejoras en el rendimiento (34.87% en matemáticas, 67% en tareas de lectura) muestran que la accesibilidad no siempre significa comprometer la calidad
- El enfoque de SALT prueba que a veces las mejores soluciones provienen de repensar los fundamentos en lugar de simplemente agregar más potencia informática
Qué buscar:
- Mantén un ojo en las organizaciones más pequeñas que comienzan a desarrollar modelos de IA personalizados
- Observa nuevas aplicaciones en campos que anteriormente no podían costear el desarrollo de IA
- Busca innovaciones en cómo se utilizan los modelos más pequeños para tareas especializadas
Recuerda: El valor real de SALT radica en cómo podría cambiar quién puede innovar en IA. Ya sea que estés dirigiendo un laboratorio de investigación, gestionando un equipo de tecnología o simplemente interesado en el desarrollo de IA, este es el tipo de avance que podría hacer que tu próxima gran idea sea posible.
Tal vez comiences a pensar en ese proyecto de IA que creías que estaba fuera de tu alcance. Puede que sea más posible de lo que imaginabas.










