Modelos y plataformas de IA

Los sistemas de inteligencia artificial pueden preferir el lenguaje humano en lugar de datos numéricos

mm
Añade Unite.AI a tus fuentes preferidas en Google

Nueva investigación de la Universidad de Columbia sugiere que los sistemas de inteligencia artificial (IA) prefieren el lenguaje humano en lugar de datos numéricos como 1s y 0s. El nuevo estudio es de los profesores Hod Lipson y Boyuan Chen, y demostró que los sistemas de IA podrían alcanzar niveles de rendimiento más altos si se les programa con archivos de sonido de lenguaje humano. 

En una comparación lado a lado, los investigadores encontraron que una red neuronal entrenada con archivos de sonido alcanzó niveles de rendimiento más altos en la identificación de objetos, en comparación con la otra red entrenada con entradas binarias simples.

Lipson es profesor de Innovación y miembro del Instituto de Ciencia de Datos de Columbia. 

“Para entender por qué este hallazgo es significativo, es útil entender cómo se programan normalmente las redes neuronales, y por qué usar el sonido de la voz humana es un experimento radical”, dijo. 

Usar números binarios es compacto y preciso, mientras que el lenguaje humano es más complejo y no binario cuando se captura en un archivo digital. Los programadores normalmente no se desvían de los números cuando desarrollan una red neuronal, ya que es muy eficiente.

El equipo emprendió esta investigación después de pensar que las redes neuronales no estaban alcanzando su máximo potencial, y creían que podrían ser más rápidas y mejores si se les entrenaba con la voz humana y palabras específicas. 

Entrenando las Redes

Cuando se prueba una nueva técnica de aprendizaje automático, los investigadores de IA a menudo entrenan una red neuronal para reconocer objetos y animales específicos en una colección de fotografías. 

El equipo, que incluía a Chen, Lipson, Yu Li y Susan Raghupathi, configuró un experimento controlado para probar su hipótesis, y crearon dos nuevas redes neuronales. Se propusieron entrenarlas para reconocer 10 tipos diferentes de objetos entre 50,000 fotografías llamadas “imágenes de entrenamiento”. 

Uno de los sistemas de IA se entrenó de manera más tradicional con valores numéricos, mientras que la red neuronal experimental se entrenó de manera muy diferente. Se le proporcionó una tabla de datos con filas que contenían una fotografía de un animal u objeto, y la segunda columna tenía un archivo de audio de voz humana, que expresaba la palabra para el animal u objeto. No había 1s ni 0s involucrados con la red experimental.

Ambos sistemas de IA se entrenaron durante un total de 15 horas. Los resultados mostraron que la red original respondió con una serie de diez 1s y 0s, mientras que la red neuronal experimental produjo una voz que claramente intentaba “decir” qué objeto estaba en la imagen. Mientras que la voz original no era comprensible, eventualmente alcanzó un punto de ser en gran parte correcta.

Las dos redes realizaron igual de bien, identificando el animal u objeto correctamente el 92% de las veces. Los investigadores decidieron ejecutar el experimento por segunda vez, pero esta vez utilizaron menos fotografías durante el proceso.

La red tradicional se desempeñó mal debido a la escasez de datos, como se esperaba, cayendo a alrededor del 35% de precisión. Sin embargo, la red experimental lo hizo dos veces mejor, con una precisión del 70%, a pesar de tener menos datos. 

https://www.youtube.com/watch?v=Iq2YjHCAPRQ

 

Resultados Sorprendentes

La próxima vez, el equipo utilizó imágenes más difíciles, como una imagen corrupta de un perro. Incluso con las imágenes más difíciles, la red neuronal entrenada con voz fue correcta alrededor del 50% de las veces, mientras que la red tradicional fue solo del 20% precisa. 

Boyuan Chen es el investigador principal del estudio.

“Nuestros hallazgos van directamente en contra de cómo muchos expertos han sido entrenados para pensar sobre computadoras y números; es una suposición común que las entradas binarias son una forma más eficiente de transmitir información a una máquina que las corrientes de audio de información similar ‘riqueza'”, explicó Chen. “De hecho, cuando presentamos esta investigación a una gran conferencia de IA, un revisor anónimo rechazó nuestro artículo simplemente porque sintió que nuestros resultados eran ‘demasiado sorprendentes e intuitivos'”.

“Si se piensa en el hecho de que el lenguaje humano ha estado pasando por un proceso de optimización durante decenas de miles de años, entonces tiene sentido perfecto que nuestras palabras habladas hayan encontrado un buen equilibrio entre ruido y señal”, dijo Lipson. “Por lo tanto, cuando se ve a través de la lente de la entropía de Shannon, tiene sentido que una red neuronal entrenada con lenguaje humano supere a una red neuronal entrenada con simples 1s y 0s”.

El estudio se presentará en la Conferencia Internacional sobre Representaciones de Aprendizaje el 3 de mayo de 2021. 

“Debemos pensar en utilizar formas novedosas y mejores para entrenar a los sistemas de IA en lugar de recopilar conjuntos de datos más grandes”, dijo Chen. “Si repensamos cómo presentamos los datos de entrenamiento a la máquina, podríamos hacer un mejor trabajo como maestros”.

“Uno de los mayores misterios de la evolución humana es cómo nuestros antepasados adquirieron lenguaje y cómo los niños aprenden a hablar con tanta facilidad”, agrega Lipson. “Si los niños humanos aprenden mejor con instrucciones habladas repetitivas, entonces quizás los sistemas de IA también puedan”.

Alex McFarland es un periodista y escritor de inteligencia artificial que explora los últimos desarrollos en inteligencia artificial. Ha colaborado con numerosas startups y publicaciones de inteligencia artificial en todo el mundo.