AI-modellen en platforms

AI-startup Diffbot leest het hele openbare internet om feitgebaseerde tekstgeneratie na te streven

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

De recente vooruitgang in natuurlijke taalverwerking en tekstgeneratie die is behaald door OpenAI met hun GPT-2 en GPT-3 taalmodellen is indrukwekkend, in staat om tekst te genereren die eruitziet alsof het echt door een mens is geschreven. Helaas zijn deze modellen, hoewel ze uitstekend zijn in het schrijven van natuurlijk klinkende tekst, niet in staat om feitelijke tekst te schrijven. Geavanceerde taalmodellen combineren zinnen uit woorden die het meeste zin hebben in de context, zonder aandacht te schenken aan de waarheid van de claims in de gegenereerde tekst. Volgens een rapport van MIT Technology Review probeert een startup genaamd Diffbot dit probleem op te lossen door een AI te laten extraheren zoveel mogelijk feiten uit het internet.

Diffbot is een startup die hoopt AI meer bruikbaar te maken voor praktische tekstgeneratie-taken zoals het automatisch invullen van spreadsheets en het automatisch aanvullen van zinnen of code. Om ervoor te zorgen dat de door de AI gegenereerde tekst betrouwbaar is, moet de AI zelf betrouwbaar zijn en moet het een concept hebben van feitelijke versus fictieve verklaringen. Diffbot’s aanpak om een tekstgeneratieprogramma de mogelijkheid te geven om feitelijke verklaringen te genereren, begint met het verzamelen van enorme hoeveelheden tekst van praktisch het hele openbare web. Diffbot parseert tekst in meerdere talen en splitst deze op in sets van feit-gebaseerde triplets, met het onderwerp, object en werkwoord van een bepaald feit dat wordt gebruikt om een concept te koppelen aan een ander. Bijvoorbeeld, het kan feiten over Bill Gates en Microsoft (MSFT ) weergeven als:

Bill Gates is de oprichter van Microsoft. Microsoft is een computer technologiebedrijf.

Diffbot neemt al deze korte feitjes en combineert ze om een kennisgrafiek te creëren. Kennisgrafieken creëren webs van relaties tussen concepten, vaak samen met een redeneerder die helpt bij het creëren van nieuwe conclusies op basis van deze relaties. Om het anders te zeggen, kennisgrafieken gebruiken gegevenskoppeling en kunnen helpen bij het modelleren van kennisdomeinen met machine learning-algoritmes. Kennisgrafieken bestaan al decennia lang en veel vroege AI-onderzoekers beschouwden ze als belangrijke instrumenten om AI in staat te stellen de menselijke wereld te begrijpen. Echter, kennisgrafieken werden meestal met de hand gemaakt, wat een moeilijk en tijdrovend proces is. Het automatiseren van de creatie van kennisgrafieken kan AI’s in staat stellen om een veel grotere, contextuele begrip van concepten te verkrijgen en feit-gebaseerde tekst te produceren.

Google (GOOGL ) begon een paar jaar geleden met het gebruik van kennisgrafieken om te helpen bij het bieden van samenvattingen van informatie wanneer een populaire onderwerp wordt gezocht. De kennisgrafiek wordt gebruikt om de meest relevante feitjes te verzamelen en ze weer te geven als een samenvatting. Diffbot wil hetzelfde doen voor elk onderwerp, niet alleen de meest populaire. Dit vereist het opbouwen van een absoluut enorme kennisgrafiek, samengesteld door het crawlen van het hele openbare web, iets wat alleen Google en Microsoft anders doen. Diffbot scant het hele web en werkt de kennisgrafiek bij met nieuwe informatie elke vier of vijf dagen, en over de loop van een maand voegt het tussen de 100 miljoen en 150 miljoen entries toe.

Diffbot leest de tekst van een website niet zoals normale webcrawlers, maar gebruikt in plaats daarvan computer visie-algoritmes om de ruwe pixels van een webpagina te extraheren en video-, afbeeldings-, artikel- en discussiegegevens van de pagina te halen. Het identificeert de belangrijkste elementen van de webpagina en haalt vervolgens feiten uit in een verscheidenheid aan talen, in overeenstemming met het drieledige feitjeschema.

Diffbot biedt momenteel zowel betaalde als gratis toegang tot zijn kennisgrafiek. Onderzoekers kunnen de grafiek gratis gebruiken, terwijl bedrijven zoals DuckDuckGo en Snapchat het gebruiken om tekst samen te vatten en snippets van trending nieuwsartikelen te extraheren. Intussen gebruiken Nike en Adidas het platform om websites te vinden die valse producten verkopen, wat mogelijk is omdat Diffbot in staat is om te bepalen welke websites daadwerkelijk schoenen verkopen, in plaats van alleen maar discussies over hen te hebben.

In de toekomst plant Diffbot om zijn mogelijkheden uit te breiden en een natuurlijke taalinterface toe te voegen aan het platform, in staat om bijna elke vraag te beantwoorden die je het stelt en de antwoorden te ondersteunen met bronnen. Idealiter zouden de mogelijkheden van Diffbot worden gecombineerd met een krachtig taalsynthesemodel zoals GPT-3.

Blogger en programmeur met specialisaties in Machine Learning en Deep Learning onderwerpen. Daniel hoopt anderen te helpen de kracht van AI te gebruiken voor het sociale goede.