AI-modeller og platforme

AI-startup Diffbot læser hele det offentlige internet for at fremme faktuel tekstgenerering

mm
Føj Unite.AI til dine foretrukne kilder på Google

De seneste fremskridt i naturlig sprogbehandling og tekstgenerering, som er opnået af OpenAI gennem deres GPT-2 og GPT-3 sprogmodeller, har været imponerende og kan generere tekst, der ligner den, der er skrevet af en menneske. Desværre er disse modeller, selvom de er gode til at skrive naturlig lydende tekst, ikke udstyret til at skrive tekst, der er faktuel. Avancerede sprogmodeller samler sætninger sammen fra ord, der giver mest mening i sammenhæng, uden at lægge vægt på sandheden i påstandene i den genererede tekst. Ifølge MIT Technology Review har en startup ved navn Diffbot til formål at løse dette problem ved at lade en AI udtrække så mange fakta, som muligt, fra internettet.

Diffbot er en startup, der håber at gøre AI mere nyttig for praktiske tekstgenereringsopgaver som automatisk udfyldning af regneark og autokomplettering af sætninger eller kode. For at den tekst, der genereres af AI, skal være pålidelig, skal AI selv være troværdig og have en forestilling om, hvad der er faktisk og hvad der er fiktivt. Diffbots tilgang til at give et tekstgenereringsprogram evnen til at generere faktuelle udsagn begynder med at indsamle massive mængder tekst fra stort set hele det offentlige web. Diffbot parser tekst på flere sprog og opdeler tekst i sæt af faktuel triplett, hvor subjekt, objekt og verbum for en given faktum bruges til at linke ét begreb til et andet. For eksempel kunne det repræsentere fakta om Bill Gates og Microsoft (MSFT ) på følgende måde:

Bill Gates er grundlægger af Microsoft. Microsoft er et computerteknologiselskab.

Diffbot tager alle disse korte faktuelle oplysninger og forbinder dem til at skabe et videnkart. Videnkart skaber netværk af relationer mellem begreber, ofte sammen med en reasoner, der hjælper med at skabe nye konklusioner baseret på disse relationer. For at sige det på en anden måde, bruger videnkart dataforbindelse, og de kan hjælpe maskinelæringsalgoritmer med at modelere videnområder. Videnkart har faktisk været til stede i årtier, og mange tidlige AI-forskere anså dem for at være vigtige værktøjer for at give AI mulighed for at forstå den menneskelige verden. Imidlertid blev videnkart typisk skabt manuelt, hvilket er en svær og tidskrævende proces. Automatisering af skabelsen af videnkart kunne give AI mulighed for at opnå en langt større, kontekstuel forståelse af begreber og producere tekst, der er faktuel.

Google (GOOGL ) begyndte at bruge videnkart for nogle år siden for at hjælpe med at give sammenfattelser af information, når en populær emne søges. Videnkartet bruges til at trække de mest relevante faktuelle oplysninger og repræsentere dem som en sammenfattelse. Diffbot ønsker at gøre det samme for alle emner, ikke kun de mest populære. Dette kræver opbygning af et absolut massivt videnkart, som er samlet ved at crawle hele det offentlige web, noget som kun Google og Microsoft gør ellers. Diffbot scannrer hele webben og opdaterer videnkartet med nye oplysninger hver 4. eller 5. dag, og over en måneds tid tilføjer det mellem 100 millioner og 150 millioner poster.

Diffbot læser ikke tekst på en hjemmeside som normale web-crawlers, men bruger i stedet computer vision-algoritmer til at udtrække de rå pixels af en web-side og trække video-, billed-, artikel- og diskussionsdata fra siden. Det identificerer de nøgleelementer på web-siden og udtrækker derefter fakta på flere sprog i overensstemmelse med den tredelte faktumsskema.

For tiden tilbyder Diffbot både betalt og gratis adgang til sit videnkart. Forskere kan få adgang til kartet gratis, mens selskaber som DuckDuckGo og Snapchat bruger det til at sammenfatte tekst og trække udvalg af populære nyhedsartikler. Imens bruger Nike og Adidas platformen til at finde sider, der sælger falske produkter, hvilket er muligt, fordi Diffbot kan afgøre, hvilke sider, der faktisk sælger sko, og ikke bare diskuterer dem.

I fremtiden planlægger Diffbot at udvide sine evner og tilføje en naturlig sproggrænseflade til platformen, der kan svare på næsten alle spørgsmål, du stiller, og bakke op om disse svar med kilder. Ideelt set ville Diffbots evner kombineres med en kraftfuld sprog-syntese-model som GPT-3.

Blogger og programmør med specialer i Machine Learning og Deep Learning emner. Daniel håber at hjælpe andre med at bruge AI's kraft til sociale formål.