KI-Modelle und Plattformen
Multimodales Lernen wird bei KI-Entwicklern immer beliebter
Venture Beat (VB) hat einen seiner wÃķchentlichen Berichte den Vorteilen des multimodalen Lernens in der Entwicklung von kÞnstlicher Intelligenz gewidmet. Der Anlass war ein Bericht von ABI Research zu diesem Thema.
Das SchlÞsselkonzept liegt darin, dass âDatensÃĪtze die fundamentalen Bausteine von KI-Systemen sindâ und dass ohne DatensÃĪtze âModelle die Beziehungen nicht lernen kÃķnnen, die ihre Vorhersagen informierenâ. Der ABI-Bericht prognostiziert, dass âwÃĪhrend die Gesamtzahl der installierten KI-GerÃĪte von 2,69 Milliarden im Jahr 2019 auf 4,47 Milliarden im Jahr 2024 ansteigen wird, nur wenige davon in naher Zukunft interoperabel sein werdenâ.
Dies kÃķnnte einen erheblichen Zeit-, Energie- und Ressourcenverlust darstellen, âda sie anstelle von Gigabytes bis Petabytes an Daten, die durch sie flieÃen, in ein einzelnes KI-Modell oder -Framework zu kombinieren, unabhÃĪngig und heterogen arbeiten, um die Daten zu verstehen, die sie erhaltenâ.
Um dies zu Þberwinden, schlÃĪgt ABI multimodales Lernen vor, eine Methode, die Daten âaus verschiedenen Sensoren und Eingaben in ein einzelnes System konsolidieren kÃķnnte. Multimodales Lernen kann komplementÃĪre Informationen oder Trends tragen, die oft nur dann offensichtlich werden, wenn sie alle in den Lernprozess einbezogen werdenâ.
VB prÃĪsentiert ein plausibles Beispiel, das Bilder und Textbeschreibungen berÞcksichtigt. âWenn verschiedene WÃķrter mit ÃĪhnlichen Bildern gepaart werden, werden diese WÃķrter wahrscheinlich verwendet, um dieselben Dinge oder Objekte zu beschreiben. Umgekehrt, wenn einige WÃķrter neben verschiedenen Bildern erscheinen, bedeutet dies, dass diese Bilder das gleiche Objekt darstellen. Angesichts dessen sollte es mÃķglich sein, dass ein KI-Modell Bildobjekte aus Textbeschreibungen vorhersagt, und tatsÃĪchlich hat eine Reihe akademischer Literatur bewiesen, dass dies der Fall istâ.
Trotz der mÃķglichen Vorteile weist ABI darauf hin, dass sogar Technologie-Riesen wie IBM, Microsoft (MSFT ), Amazon (AMZN ) und Google (GOOGL ) sich weiterhin hauptsÃĪchlich auf unimodale Systeme konzentrieren. Einer der GrÞnde dafÞr ist die Herausforderung, die ein solcher Wechsel darstellen wÞrde.
Dennoch gehen die ABI-Forscher davon aus, dass âdie Gesamtzahl der ausgelieferten GerÃĪte von 3,94 Millionen im Jahr 2017 auf 514,12 Millionen im Jahr 2023 ansteigen wird, getrieben durch die Adoption in den Bereichen Robotik, Consumer, Gesundheitswesen und Medien und Unterhaltungâ. Als Beispiele fÞr Unternehmen, die bereits multimodales Lernen implementieren, nennen sie Waymo, das solche AnsÃĪtze verwendet, um âhyper-empfindliche selbstfahrende Fahrzeugeâ zu bauen, und Intel Labs (INTC ), wo das Ingenieurteam des Unternehmens âTechniken fÞr die Kollation von Sensordaten in realen Umgebungenâ untersucht.
Omesh Tickoo, leitender Ingenieur bei Intel Labs, erklÃĪrte VB, dass âwir mithilfe von Techniken, um den Kontext wie die Tageszeit zu ermitteln, ein System entwickelt haben, das uns sagt, wenn die Daten eines Sensors nicht von hÃķchster QualitÃĪt sind. Angesichts dieses Vertrauenswerts wiegt es verschiedene Sensoren gegen verschiedene Intervalle und wÃĪhlt die richtige Mischung, um uns die Antwort zu geben, die wir suchenâ.
VB weist darauf hin, dass unimodales Lernen dort, wo es hoch effektiv ist, weiterhin vorherrschen wird â in Anwendungen wie Bilderkennung und Sprachverarbeitung. Gleichzeitig prognostiziert es, dass âwenn Elektronik gÞnstiger und Rechenleistung skalierbarer wird, multimodales Lernen wahrscheinlich nur an Bedeutung gewinnen wirdâ.












