Modelli e piattaforme di IA
Startup di intelligenza artificiale Diffbot legge l’intero internet pubblico per perseguire la generazione di testo basata sui fatti
I recenti progressi nel campo dell’elaborazione del linguaggio naturale e della generazione di testo realizzati da OpenAI attraverso i modelli di linguaggio GPT-2 e GPT-3 sono stati impressionanti, in grado di generare testo che sembra essere stato scritto da un essere umano. Purtroppo, sebbene questi modelli siano in grado di generare testo che suona naturale, non sono in grado di generare testo che sia fattuale. I modelli di linguaggio avanzati assemblano frasi utilizzando parole che hanno più senso nel contesto, senza prestare attenzione alla veridicità delle affermazioni all’interno del testo generato. Come riportato da MIT technology review, una startup chiamata Diffbot mira a risolvere questo problema facendo in modo che un’intelligenza artificiale estraia quanti più fatti possibile da internet.
Diffbot è una startup che spera di rendere l’intelligenza artificiale più utile per compiti di generazione di testo pratici come l’autocompletamento di fogli di calcolo e l’autocompletamento di frasi o codice. Affinché il testo generato dall’intelligenza artificiale sia affidabile, l’intelligenza artificiale stessa deve essere degna di fiducia e deve avere un concetto di affermazioni fattuali vs. affermazioni fittizie. L’approccio di Diffbot per dare a un programma di generazione di testo la capacità di generare affermazioni fattuali inizia con la raccolta di enormi quantità di testo da quasi l’intero web pubblico. Diffbot analizza il testo in più lingue e lo divide in insiemi di triplette basate sui fatti, con il soggetto, l’oggetto e il verbo di un dato fatto utilizzati per collegare un concetto all’altro. Ad esempio, potrebbe rappresentare fatti riguardanti Bill Gates e Microsoft (MSFT ) come questo:
Bill Gates è il fondatore di Microsoft. Microsoft è un’azienda di tecnologia informatica.
Diffbot prende tutti questi brevi fatti e li unisce per creare un grafo di conoscenza. I grafi di conoscenza creano reti di relazioni tra concetti, spesso con un ragionatore che aiuta nella creazione di nuove conclusioni basate su queste relazioni. In altre parole, i grafi di conoscenza utilizzano il collegamento dei dati e possono aiutare gli algoritmi di apprendimento automatico a modellare i domini della conoscenza. I grafi di conoscenza esistono già da decenni e molti ricercatori di intelligenza artificiale li consideravano strumenti importanti per consentire all’intelligenza artificiale di comprendere il mondo umano. Tuttavia, i grafi di conoscenza venivano solitamente creati a mano, il che è un processo difficile e laborioso. L’automatizzazione della creazione di grafi di conoscenza potrebbe consentire all’intelligenza artificiale di acquisire una comprensione molto più grande e contestuale dei concetti e produrre testo basato sui fatti.
Google (GOOGL ) ha iniziato a utilizzare i grafi di conoscenza alcuni anni fa per aiutare a fornire riassunti di informazioni quando si cerca un argomento popolare. Il grafo di conoscenza viene utilizzato per estrarre i fatti più rilevanti e rappresentarli come un riassunto. Diffbot vuole fare la stessa cosa per ogni argomento, non solo per quelli più popolari. Ciò richiede la creazione di un grafo di conoscenza assolutamente enorme, compilato attraverso la scansione dell’intero web pubblico, qualcosa che solo Google e Microsoft fanno altrimenti. Diffbot scansiona l’intero web e aggiorna il grafo di conoscenza con nuove informazioni ogni quattro o cinque giorni, e nel corso di un mese aggiunge tra 100 milioni e 150 milioni di voci.
Diffbot non legge il testo di un sito web come i normali web-crawler, ma utilizza algoritmi di visione artificiale per estrarre i pixel grezzi di una pagina web e estrarre dati di video, immagini, articoli e discussioni dalla pagina. Identifica gli elementi chiave della pagina web e quindi estrae fatti in più lingue, in conformità con lo schema dei fatti a tre parti.
Attualmente, Diffbot offre accesso sia gratuito che a pagamento al suo grafo di conoscenza. Mentre i ricercatori possono accedere al grafo gratuitamente, aziende come DuckDuckGo e Snapchat lo utilizzano per riassumere il testo ed estrarre snippet di notizie di tendenza. Nel frattempo, Nike e Adidas utilizzano la piattaforma per trovare siti che vendono prodotti contraffatti, il che è possibile perché Diffbot è in grado di determinare quali siti stanno effettivamente vendendo scarpe, non solo discutendone.
Diffbot non legge il testo di un sito web come i normali web-crawler, ma utilizza algoritmi di visione artificiale per estrarre i pixel grezzi di una pagina web e estrarre dati di video, immagini, articoli e discussioni dalla pagina. Identifica gli elementi chiave della pagina web e quindi estrae fatti in più lingue, in conformità con lo schema dei fatti a tre parti.
Nel futuro, Diffbot prevede di ampliare le sue capacità e aggiungere un’interfaccia a linguaggio naturale alla piattaforma, in grado di rispondere a quasi tutte le domande che le vengono poste e di supportare quelle risposte con fonti. Idealmente, le capacità di Diffbot sarebbero combinate con un potente modello di sintesi linguistica come GPT-3.












