AI-modeller og plattformer

Se, tenk, forklar: Oppsvinget av visuell språkmodell i AI

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

For omtrent et tiår siden var kunstig intelligens delt mellom bildegenkjenning og språkforståelse. Visuelle modeller kunne se objekter, men kunne ikke beskrive dem, og språkmodeller kunne generere tekst, men kunne ikke “se”. I dag forsvinner denne skillelinjen raskt. Visuell språkmodell (VLM) kombinerer nå visuelle og språklige ferdigheter, og lar dem tolke bilder og forklare dem på måter som føles nesten menneskelige. Det som gjør dem virkelig bemerkelsesverdige er deres steg-for-steg resonneringsprosess, kjent som Chain-of-Thought, som hjelper med å gjøre disse modellene til kraftfulle, praktiske verktøy over hele industrien, som helsevesen og utdanning. I denne artikkelen vil vi utforske hvordan VLM fungerer, hvorfor deres resonnering er viktig, og hvordan de omdefinerer fagområder fra medisin til selvstyrt biler.

Forståelse av visuell språkmodell

Visuell språkmodell, eller VLM, er en type kunstig intelligens som kan forstå både bilder og tekst samtidig. I motsetning til eldre AI-systemer som bare kunne håndtere tekst eller bilder, kombinerer VLM disse to ferdighetene. Dette gjør dem usedvanlig fleksible. De kan se på et bilde og beskrive hva som skjer, svare på spørsmål om en video, eller til og med lage bilder basert på en skriftlig beskrivelse.

For eksempel, hvis du ber en VLM om å beskrive et bilde av en hund som løper i en park. En VLM sier ikke bare “Det er en hund.” Den kan fortelle deg “Hunden jager en ball nær et stort eiketre.” Den ser bildet og kobler det til ord på en måte som gjør mening. Denne evnen til å kombinere visuell og språklig forståelse åpner opp for alle muligheter, fra å hjelpe deg med å søke etter bilder på nettet til å assistere i mer komplekse oppgaver som medisinsk bildebehandling.

Ved sin kerne fungerer VLM ved å kombinere to nøkkelkomponenter: et visuelt system som analyserer bilder og et språklig system som prosesserer tekst. Det visuelle systemet oppdager detaljer som former og farger, mens det språklige systemet omgjør disse detaljene til setninger. VLM er trent på massive datasett som inneholder milliarder av bilde-tekst-par, og gir dem omfattende erfaring for å utvikle en sterk forståelse og høy nøyaktighet.

Hva Chain-of-Thought resonnering betyr i VLM

Chain-of-Thought resonnering, eller CoT, er en måte å få AI til å tenke steg for steg, på samme måte som vi løser et problem ved å bryte det ned. I VLM betyr det at AI-en ikke bare gir et svar når du spør den noe om et bilde, men også forklarer hvordan den kom frem til svaret, og forklarer hver logisk steg langs veien.

La oss si du viser en VLM et bilde av en fødselsdagskake med lys og spør “Hvor gammel er personen?” Uten CoT kunne den bare gjettet et tall. Med CoT tenker den det igjennom: “Okay, jeg ser en kake med lys. Lys viser vanligvis alderen. La oss telle dem, det er 10. Så er personen sannsynligvis 10 år gammel.” Du kan følge resonneringen mens den utvikler seg, og det gjør svaret mye mer troverdig.

På samme måte, når en VLM vises en trafikk-scene og spørres “Er det trygt å krysse?” kan den resonere: “Fotgjengerlyset er rødt, så du bør ikke krysse det. Det er også en bil som svinger i nærheten, og den er i bevegelse, ikke stanset. Det betyr at det ikke er trygt akkurat nå.” Ved å gå igjennom disse stegene viser AI-en deg nøyaktig hva den fokuserer på i bildet og hvorfor den bestemmer seg for å gjøre det den gjør.

Hvorfor Chain-of-Thought er viktig i VLM

Integrasjonen av CoT-resonnering i VLM åpner opp for flere nøkkel fordeler.

Først og fremst gjør det AI-en lettere å stole på. Når den forklarer sine steg, får du en tydelig forståelse av hvordan den kom frem til svaret. Dette er viktig i områder som helsevesenet. For eksempel, når en VLM ser på en MR-skanning, kan den si: “Jeg ser en skygge på venstre side av hjernen. Denne regionen kontrollerer tale, og pasienten har problemer med å snakke, så det kan være en svulst.” En lege kan følge denne logikken og føle seg trygg på AI-ens innputt.

For det andre hjelper det AI-en med å løse komplekse problemer. Ved å bryte ting ned, kan den håndtere spørsmål som trenger mer enn et raskt blikk. For eksempel, å telle lys er enkelt, men å avgjøre tryggheten på en travel gate krever flere steg, inkludert å sjekke lyssignaler, å identifisere bevegelige kjøretøy og å vurdere hastighet. CoT muliggjør at AI-en kan håndtere denne kompleksiteten ved å dele den inn i flere steg.

Til slutt gjør det AI-en mer tilpasningsdyktig. Når den resonnerer steg for steg, kan den anvende hva den vet på nye situasjoner. Hvis den aldri har sett en bestemt type kake før, kan den likevel finne ut av lys-alder-forbindelsen fordi den tenker det igjennom, og ikke bare baserer seg på memoriserte mønster.

Hvordan Chain-of-Thought og VLM omdefinerer industrier

Kombinasjonen av CoT og VLM har en betydelig innvirkning på ulike fagområder:

  • Helsevesen: I medisin bruker VLM-er som Google’s Med-PaLM 2 (GOOGL ) CoT til å bryte ned komplekse medisinske spørsmål i mindre diagnostiske steg. For eksempel, når den får en røntgen av brystet og symptomer som hoste og hodepine, kan AI-en tenke: “Disse symptomene kan være en forkjølelse, allergi eller noe verre. Ingen forstørrede lymfeknuter, så det er ikke sannsynlig en alvorlig infeksjon. Lungene ser klare ut, så det er sannsynligvis ikke lungebetennelse. En vanlig forkjølelse passer best.” Den går igjennom alternativene og lander på et svar, og gir leger en tydelig forklaring å arbeide med.
  • Selvstyrt biler: For selvstyrt biler forbedrer CoT-forbedrede VLM sikkerheten og beslutningstakingen. For eksempel kan en selvstyrt bil analysere en trafikk-scene steg for steg: sjekke fotgjenger-signal, identifisere bevegelige kjøretøy og bestemme om det er trygt å fortsette. Systemer som Wayve’s LINGO-1 genererer naturlig språk-kommentar for å forklare handlinger som å sakke ned for en syklist. Dette hjelper ingeniører og passasjerer å forstå bilens resonneringsprosess. Stegvis logikk muliggjør også bedre håndtering av uvanlige veiforhold ved å kombinere visuelle innputt med kontekstuell kunnskap.
  • Geospatial analyse: Google’s Gemini-modell anvender CoT-resonnering på geografiske data som kart og satellittbilder. For eksempel kan den vurdere skade etter en orkan ved å integrere satellittbilder, værprognoser og demografiske data, og deretter generere klare visualiseringer og svar på komplekse spørsmål. Denne evnen akselerer krisehåndtering ved å gi beslutningstakere rask og nyttig innsikt uten å kreve teknisk ekspertise.
  • Robotikk: I robotikk muliggjør integrasjonen av CoT og VLM at roboter kan planlegge og utføre fler-stegs oppgaver bedre. For eksempel, når en robot får i oppdrag å plukke opp et objekt, tillater CoT-aktivert VLM den å identifisere kopp, bestemme de beste grep-punktene, planlegge en kollisjonsfri rute og utføre bevegelsen, samtidig som den “forklarer” hver steg av prosessen. Prosjekter som RT-2 demonstrerer hvordan CoT muliggjør at roboter kan tilpasse seg nye oppgaver og reagere på komplekse kommandoer med tydelig resonnering.
  • Utdanning: I utdanning bruker AI-tutorene som Khanmigo CoT til å undervise bedre. For et matematisk problem kan den veilede en student: “Først, skriv ned ligningen. Deretter, isoler variabelen ved å trekke 5 fra begge sider. Nå, del på 2.” I stedet for å gi svaret, går den igjennom prosessen, og hjelper studentene å forstå konseptene steg for steg.

Det siste ord

Visuell språkmodell (VLM) lar AI tolke og forklare visuelle data ved hjelp av menneskelignende, steg-for-steg resonnering gjennom Chain-of-Thought (CoT)-prosesser. Denne tilnærmingen øker tillit, tilpasning og problemløsning over industrier som helsevesen, selvstyrt biler, geospatial analyse, robotikk og utdanning. Ved å omdefinere hvordan AI håndterer komplekse oppgaver og støtter beslutningstaking, setter VLM en ny standard for pålitelig og praktisk intelligent teknologi.

Dr. Tehseen Zia er en fast ansatt associate professor ved COMSATS University Islamabad, med en PhD i AI fra Vienna University of Technology, Østerrike. Som spesialist i kunstig intelligens, maskinlæring, datavitenskap og datavisjon, har han gjort betydelige bidrag med publikasjoner i anerkjente vitenskapelige tidsskrifter. Dr. Tehseen har også ledet flere industriprosjekter som hovedundersøker og tjenestegjort som AI-konsulent.