Modelos y plataformas de IA

Investigadores descubren subredes altamente eficientes dentro de las redes neuronales de aprendizaje profundo

mm
Añade Unite.AI a tus fuentes preferidas en Google

Las redes neuronales de aprendizaje profundo suelen ser enormes y requieren grandes cantidades de poder computacional, pero un nuevo descubrimiento demuestra cómo esto se puede reducir para completar tareas de manera más eficiente. Jonathan Frankle y su equipo de MIT han desarrollado la “hipótesis del boleto de lotería”, que muestra cómo existen subredes más delgadas dentro de las redes neuronales más grandes. Estas subredes pueden completar la tarea en cuestión de manera más eficiente con menos poder computacional requerido, y uno de los mayores desafíos es encontrar esas subredes, o boletos de lotería ganadores, como los llama el equipo.

El equipo descubrió estas subredes dentro de BERT, la técnica de aprendizaje de máquina de vanguardia para el procesamiento de lenguaje natural (NLP). El NLP, que es un subcampo de la inteligencia artificial (IA), es responsable de descifrar y analizar el lenguaje humano, y se utiliza para aplicaciones como la generación de texto predictivo y los chatbots.

Sin embargo, BERT es grande y requiere poder computacional de supercomputadora, que es inaccesible para la mayoría de los usuarios. Con el nuevo descubrimiento de estas subredes, podría abrirse el acceso, permitiendo que más usuarios utilicen la tecnología para desarrollar herramientas de NLP.

“Estamos llegando al punto en el que tendremos que hacer que estos modelos sean más delgados y eficientes”, dice Frankle.

Según él, este desarrollo podría “reducir las barreras de entrada” para el NLP.

BERT – “Obscenamente caro”  

BERT es fundamental para cosas como el motor de búsqueda de Google y ha recibido mucha atención desde que Google lo lanzó en 2018. Es un método para crear redes neuronales y se entrena intentando llenar los pasajes en blanco de las piezas de escritura. Una de las características más impresionantes de BERT es su gran conjunto de datos de entrenamiento inicial.

Puede ser ajustado por los usuarios para tareas específicas, como chatbots de servicio al cliente, pero una vez más, requiere grandes cantidades de poder de procesamiento, con la posibilidad de que los parámetros alcancen 1.000 millones.

“Un modelo BERT estándar de estos días – el de jardín – tiene 340 millones de parámetros”, dice Frankle. “Esto es simplemente obscenamente caro. Está mucho más allá de la capacidad computacional de usted o yo”.

Según el autor principal Tianlong Chen de la Universidad de Texas en Austin, los modelos como BERT “sufren de un tamaño de red enorme”, pero gracias a la nueva investigación, “la hipótesis del boleto de lotería parece ser una solución”.

Subredes eficientes 

Chen y el equipo buscaron un modelo más pequeño ubicado dentro de BERT, y compararon el rendimiento de las subredes descubiertas con el modelo BERT original. Esto se probó en una variedad de tareas de NLP diferentes, incluyendo responder preguntas y llenar palabras en blanco en una oración.

El equipo descubrió subredes exitosas que eran un 40 a 90 por ciento más delgadas que el modelo BERT original, dependiendo de la tarea. Además, pudieron identificarlas antes de la afinación específica de la tarea, lo que resulta en costos computacionales aún más reducidos. Otra ventaja fue que algunas de las subredes seleccionadas para una tarea específica podían reutilizarse para otra.

“Me sorprendió un poco que esto funcionara”, dice Frankle. “No es algo que diera por sentado. Esperaba un resultado mucho más desordenado de lo que obtuvimos”.

Según Ari Morcos, científico de Facebook (META ) AI Research, este descubrimiento es “convincente”, y “Estos modelos se están volviendo cada vez más comunes. Así que es importante entender si la hipótesis del boleto de lotería se mantiene”.

Morcos también dice que si estas subredes pudieran ejecutarse utilizando mucho menos poder computacional, esto “sería muy impactante, ya que estos modelos enormes son actualmente muy costosos de ejecutar”.

“No sé cuánto más grande podemos ir utilizando estos cálculos de estilo de supercomputadora”, agrega Frankle. “Tendremos que reducir la barrera de entrada”.

“La esperanza es que esto reduzca el costo, que haga que sea más accesible para todos… para los pequeños que solo tienen una laptop”, concluye.

La investigación se presentará en la Conferencia sobre Sistemas de Procesamiento de Información Neural.

Alex dirige las operaciones de noticias impulsadas por IA de Unite.AI, combinando periodismo, investigación y automatización para respaldar una cobertura oportuna y escalable de la inteligencia artificial. Su trabajo ayuda a garantizar que los desarrollos emergentes de IA se presenten de manera eficiente, al tiempo que se mantienen los estándares editoriales de la publicación.