KI-Modelle und Plattformen
KI-Startup Diffbot liest das gesamte öffentliche Internet, um faktengestützte Textgenerierung zu verfolgen
Die jüngsten Fortschritte im Bereich der natürlichen Sprachverarbeitung und Textgenerierung, die von OpenAI durch ihre Sprachmodelle GPT-2 und GPT-3 erzielt wurden, sind beeindruckend und können Texte generieren, die wie von einem Menschen geschrieben wirken. Leider sind diese Modelle, obwohl sie natürliche Texte schreiben können, nicht in der Lage, faktengestützte Texte zu schreiben. Fortgeschrittene Sprachmodelle setzen Sätze aus Wörtern zusammen, die im Kontext am meisten Sinn ergeben, ohne auf die Wahrheit der Aussagen im generierten Text zu achten. Laut einem Bericht von MIT Technology Review will ein Startup namens Diffbot dieses Problem lösen, indem es eine KI entwickelt, die so viele Fakten wie möglich aus dem Internet extrahiert.
Diffbot ist ein Startup, das darauf abzielt, KI für praktische Textgenerierungsaufgaben wie das Autopopulieren von Tabellen und das Autocomplete von Sätzen oder Code nützlicher zu machen. Damit der von der KI generierte Text zuverlässig ist, muss die KI selbst vertrauenswürdig sein und ein Konzept von faktischen versus fiktiven Aussagen haben. Diffbots Ansatz, um einem Textgenerierungsprogramm die Fähigkeit zu geben, faktische Aussagen zu generieren, beginnt mit der Sammlung von großen Mengen an Texten aus praktisch dem gesamten öffentlichen Web. Diffbot analysiert Texte in mehreren Sprachen und teilt sie in Satzpaare auf, wobei das Subjekt, Objekt und Verb eines bestimmten Faktums verwendet werden, um ein Konzept mit einem anderen zu verlinken. Zum Beispiel könnte es Fakten über Bill Gates und Microsoft (MSFT ) wie folgt darstellen:
Bill Gates ist der Gründer von Microsoft. Microsoft ist ein Unternehmen für Computer-Technologie.
Diffbot nimmt all diese kurzen Fakten und verbindet sie, um ein Wissensgraph zu erstellen. Wissensgraphen erstellen Beziehungsnetzwerke zwischen Konzepten, oft zusammen mit einem Reasoner, der bei der Erstellung neuer Schlussfolgerungen auf der Grundlage dieser Beziehungen hilft. Um es anders auszudrücken, nutzen Wissensgraphen Datenverknüpfung und können maschinellen Lernalgorithmen helfen, Wissensbereiche zu modellieren. Wissensgraphen gibt es bereits seit Jahrzehnten, und viele frühe KI-Forscher betrachteten sie als wichtige Werkzeuge, um es der KI zu ermöglichen, die Welt der Menschen zu verstehen. Allerdings wurden Wissensgraphen typischerweise von Hand erstellt, was ein schwieriger und zeitaufwändiger Prozess ist. Die Automatisierung der Wissensgraph-Erstellung könnte es KIs ermöglichen, ein viel größeres, kontextuelles Verständnis von Konzepten zu erlangen und faktengestützte Texte zu produzieren.
Google (GOOGL ) begann vor einigen Jahren, Wissensgraphen zu verwenden, um die Zusammenfassung von Informationen zu unterstützen, wenn ein beliebtes Thema gesucht wird. Der Wissensgraph wird verwendet, um die relevantesten Fakten zu extrahieren und als Zusammenfassung darzustellen. Diffbot will dasselbe für jedes Thema tun, nicht nur für die beliebtesten. Dazu ist es notwendig, einen absolut massiven Wissensgraph zu erstellen, der durch das Crawlen des gesamten öffentlichen Webs kompiliert wird, was normalerweise nur Google und Microsoft tun. Diffbot scannet das gesamte Web und aktualisiert den Wissensgraph alle vier oder fünf Tage mit neuen Informationen, und im Laufe eines Monats werden zwischen 100 Millionen und 150 Millionen Einträge hinzugefügt.
Diffbot liest den Text einer Website nicht wie normale Web-Crawler, sondern verwendet Computer-Vision-Algorithmen, um die rohen Pixel einer Webseite zu extrahieren und Video-, Bild-, Artikel- und Diskussionsdaten von der Seite zu ziehen. Es identifiziert die wichtigsten Elemente der Webseite und extrahiert dann Fakten in verschiedenen Sprachen, entsprechend dem dreiteiligen Faktenschema.
Aktuell bietet Diffbot sowohl kostenpflichtigen als auch kostenlosen Zugang zu seinem Wissensgraph an. Während Forscher den Graphen kostenlos nutzen können, verwenden Unternehmen wie DuckDuckGo und Snapchat ihn, um Texte zusammenzufassen und Ausschnitte von Trends zu extrahieren. Nike und Adidas nutzen die Plattform, um Seiten zu finden, die gefälschte Produkte verkaufen, was möglich ist, weil Diffbot erkennen kann, welche Seiten tatsächlich Schuhe verkaufen und nicht nur darüber diskutieren.
In der Zukunft plant Diffbot, seine Fähigkeiten zu erweitern und eine natürliche Sprach Schnittstelle zur Plattform hinzuzufügen, die in der Lage ist, fast jede Frage zu beantworten und diese Antworten mit Quellen zu untermauern. Ideal wäre es, wenn die Fähigkeiten von Diffbot mit einem leistungsstarken Sprachsynthese-Modell wie GPT-3 kombiniert würden.












