Modelos y plataformas de IA
El Aprendizaje Multimodal EstÃĄ Ganando Prominencia Entre los Desarrolladores de IA
Venture Beat (VB) dedicÃģ uno de sus informes semanales a las ventajas del aprendizaje multimodal en el desarrollo de la inteligencia artificial. Su punto de partida fue un informe de ABI Research sobre el tema.
El concepto clave radica en el hecho de que âlos conjuntos de datos son los bloques de construcciÃģn fundamentales de los sistemas de IAâ, y que sin conjuntos de datos, âlos modelos no pueden aprender las relaciones que informan sus prediccionesâ. El informe de ABI predice que âmientras que la base instalada total de dispositivos de IA crecerÃĄ de 2.69 mil millones en 2019 a 4.47 mil millones en 2024, comparativamente pocos serÃĄn interoperables en el corto plazoâ.
Esto podrÃa representar un desperdicio considerable de tiempo, energÃa y recursos, âen lugar de combinar los gigabytes a petabytes de datos que fluyen a travÃĐs de ellos en un solo modelo o marco de IA, trabajarÃĄn de forma independiente y heterogÃĐnea para dar sentido a los datos que se les proporcionanâ.
Para superar esto, ABI propone aprendizaje multimodal, una metodologÃa que podrÃa consolidar datos âde varios sensores y entradas en un solo sistema. El aprendizaje multimodal puede llevar informaciÃģn complementaria o tendencias, que a menudo solo se vuelven evidentes cuando se incluyen todas en el proceso de aprendizajeâ.
VB presenta un ejemplo viable que considera imÃĄgenes y subtÃtulos de texto. âSi diferentes palabras se emparejan con imÃĄgenes similares, es probable que estas palabras se utilicen para describir las mismas cosas u objetos. Por el contrario, si algunas palabras aparecen junto a diferentes imÃĄgenes, esto implica que estas imÃĄgenes representan el mismo objeto. Dado esto, deberÃa ser posible para un modelo de IA predecir objetos de imagen a partir de descripciones de texto, y de hecho, una gran cantidad de literatura acadÃĐmica ha demostrado que esto es el casoâ.
A pesar de las posibles ventajas, ABI seÃąala que incluso los gigantes tecnolÃģgicos como IBM, Microsoft (MSFT ), Amazon (AMZN ) y Google (GOOGL ) siguen centrados principalmente en sistemas unimodales. Una de las razones es el desafÃo que representarÃa un cambio de este tipo.
Sin embargo, los investigadores de ABI anticipan que âla cantidad total de dispositivos enviados crecerÃĄ de 3,94 millones en 2017 a 514,12 millones en 2023, impulsado por la adopciÃģn en segmentos como la robÃģtica, el consumidor, la atenciÃģn mÃĐdica y los medios y entretenimientoâ. Entre los ejemplos de empresas que ya estÃĄn implementando el aprendizaje multimodal, citan Waymo, que estÃĄ utilizando este enfoque para construir âvehÃculos autÃģnomos hiperconscientesâ, y Intel Labs (INTC ), donde el equipo de ingenierÃa de la empresa estÃĄ âinvestigando tÃĐcnicas para la recopilaciÃģn de datos de sensores en entornos del mundo realâ.
El ingeniero principal de Intel Labs, Omesh Tickoo, explicÃģ a VB que âLo que hicimos fue, utilizando tÃĐcnicas para determinar el contexto, como la hora del dÃa, construimos un sistema que te dice cuÃĄndo los datos de un sensor no son de la mÃĄs alta calidad. Dado ese valor de confianza, pondera diferentes sensores contra cada uno en diferentes intervalos y elige la mezcla adecuada para darnos la respuesta que estamos buscandoâ.
VB seÃąala que el aprendizaje unimodal seguirÃĄ siendo predominante donde sea altamente efectivo â en aplicaciones como el reconocimiento de imÃĄgenes y el procesamiento del lenguaje natural. Al mismo tiempo, predice que âa medida que la electrÃģnica se vuelva mÃĄs asequible y el cÃģmputo mÃĄs escalable, el aprendizaje multimodal probablemente solo aumentarÃĄ en prominenciaâ.












