Modelos y plataformas de IA

El Aprendizaje Multimodal EstÃĄ Ganando Prominencia Entre los Desarrolladores de IA

mm
AÃąade Unite.AI a tus fuentes preferidas en Google

Venture Beat (VB) dedicÃģ uno de sus informes semanales a las ventajas del aprendizaje multimodal en el desarrollo de la inteligencia artificial. Su punto de partida fue un informe de ABI Research sobre el tema.

El concepto clave radica en el hecho de que “los conjuntos de datos son los bloques de construcciÃģn fundamentales de los sistemas de IA”, y que sin conjuntos de datos, “los modelos no pueden aprender las relaciones que informan sus predicciones”. El informe de ABI predice que “mientras que la base instalada total de dispositivos de IA crecerÃĄ de 2.69 mil millones en 2019 a 4.47 mil millones en 2024, comparativamente pocos serÃĄn interoperables en el corto plazo”.

Esto podría representar un desperdicio considerable de tiempo, energía y recursos, “en lugar de combinar los gigabytes a petabytes de datos que fluyen a travÃĐs de ellos en un solo modelo o marco de IA, trabajarÃĄn de forma independiente y heterogÃĐnea para dar sentido a los datos que se les proporcionan”.

Para superar esto, ABI propone aprendizaje multimodal, una metodología que podría consolidar datos “de varios sensores y entradas en un solo sistema. El aprendizaje multimodal puede llevar informaciÃģn complementaria o tendencias, que a menudo solo se vuelven evidentes cuando se incluyen todas en el proceso de aprendizaje”.

VB presenta un ejemplo viable que considera imÃĄgenes y subtítulos de texto. “Si diferentes palabras se emparejan con imÃĄgenes similares, es probable que estas palabras se utilicen para describir las mismas cosas u objetos. Por el contrario, si algunas palabras aparecen junto a diferentes imÃĄgenes, esto implica que estas imÃĄgenes representan el mismo objeto. Dado esto, debería ser posible para un modelo de IA predecir objetos de imagen a partir de descripciones de texto, y de hecho, una gran cantidad de literatura acadÃĐmica ha demostrado que esto es el caso”.

A pesar de las posibles ventajas, ABI seÃąala que incluso los gigantes tecnolÃģgicos como IBM, Microsoft (MSFT ), Amazon (AMZN ) y Google (GOOGL ) siguen centrados principalmente en sistemas unimodales. Una de las razones es el desafío que representaría un cambio de este tipo.

Sin embargo, los investigadores de ABI anticipan que “la cantidad total de dispositivos enviados crecerÃĄ de 3,94 millones en 2017 a 514,12 millones en 2023, impulsado por la adopciÃģn en segmentos como la robÃģtica, el consumidor, la atenciÃģn mÃĐdica y los medios y entretenimiento”. Entre los ejemplos de empresas que ya estÃĄn implementando el aprendizaje multimodal, citan Waymo, que estÃĄ utilizando este enfoque para construir “vehículos autÃģnomos hiperconscientes”, y Intel Labs (INTC ), donde el equipo de ingeniería de la empresa estÃĄ “investigando tÃĐcnicas para la recopilaciÃģn de datos de sensores en entornos del mundo real”.

El ingeniero principal de Intel Labs, Omesh Tickoo, explicÃģ a VB que “Lo que hicimos fue, utilizando tÃĐcnicas para determinar el contexto, como la hora del día, construimos un sistema que te dice cuÃĄndo los datos de un sensor no son de la mÃĄs alta calidad. Dado ese valor de confianza, pondera diferentes sensores contra cada uno en diferentes intervalos y elige la mezcla adecuada para darnos la respuesta que estamos buscando”.

VB seÃąala que el aprendizaje unimodal seguirÃĄ siendo predominante donde sea altamente efectivo – en aplicaciones como el reconocimiento de imÃĄgenes y el procesamiento del lenguaje natural. Al mismo tiempo, predice que “a medida que la electrÃģnica se vuelva mÃĄs asequible y el cÃģmputo mÃĄs escalable, el aprendizaje multimodal probablemente solo aumentarÃĄ en prominencia”.

Ex diplomÃĄtico y traductor para la ONU, actualmente periodista/escritor/investigador freelance, centrado en la tecnología moderna, la inteligencia artificial y la cultura moderna.