KI-Modelle und Plattformen

Quantum Stat veröffentlicht „Big Bad NLP-Datenbank“

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Quantum Stat hat ihre „Big Bad NLP-Datenbank“ veröffentlicht, was ein großer Schritt für die Verarbeitung von natürlicher Sprache (NLP) ist. Die Datenbank enthält Hunderte von verschiedenen Datensätzen, die von Entwicklern für maschinelles Lernen genutzt werden können.

Laut dem Unternehmen bietet es Lösungen für NLP- und KI-Initiativen an. Dies erfolgt durch Dienstleistungen wie Vorverarbeitung, Web-App-Entwicklung, ein mehrfach gefächertes Ansatz, der maschinelles Lernen und tiefe neuronale Netze, Chatbot- und Dialogmanagement sowie die neue NLP-Datenbank umfasst.

Das Unternehmen führt auch Primär- und Sekundärforschung durch, um Einzelpersonen bei der Analyse von Entwicklungen in den Branchen zu helfen.

Zentrales NLP-Datenhub

Die Entscheidung, die Datenbank zu erstellen, die die größte Datenbibliothek in der Verarbeitung von natürlicher Sprache ist, resultierte aus der Notwendigkeit eines zentralen Hubs, um NLP-Daten zu speichern. Das Unternehmen zielte darauf ab, es leichter zugänglich und durchsuchbar zu machen als die Alternative, bei der Forscher oft durch mehrere Drittanbieter-Bibliotheken suchen müssen.

Das Unternehmen hat die Datenbank über mehrere Wochen hinweg entwickelt; derzeit verfügen sie über etwa 200 Datensätze. Es gibt eine Vielzahl von verschiedenen Datensätzen, nicht nur die Klassiker. Das Unternehmen hat solche wie CommonCrawl und Penn Treebank aufgenommen.

Zusammen mit einer Reihe von verschiedenen Datenbanken kommen verschiedene NLP-Aufgaben. Es gibt solche, die sich auf Klassifizierung und Fragebeantwortung konzentrieren, aber es gibt auch Datensätze für Text-zu-SQL, Spracherkennung und Multi-Modal.

Quantum Stat möchte, dass die Datenbank community-getrieben ist, mit Beiträgen von Benutzern. Das Unternehmen hat seine Türen für jeden geöffnet, um einen neuen Datensatz zu senden oder Änderungen vorzuschlagen.

Ein weiterer Schwerpunkt ist es, Datensätze hinzuzufügen, die die Sprache diversifizieren, weg von der ausschließlichen Verwendung von Englisch. Ihr Ziel ist es, die Bibliothek globaler und für andere zugänglicher zu machen.

Wenn man die „Big Bad NLP-Datenbank“ betritt, wird man mit einem sauberen und organisierten Layout konfrontiert. Der Name des Datensatzes ist aufgeführt, gefolgt von der Sprache und einer detaillierten Beschreibung. Es listet auch Instanzen, Format, Aufgabe, Jahr der Erstellung und den Ersteller auf. Jede Datenbank hat einen Download-Link.

Verschiedene Datenbanken

Man wird auf Datenbanken wie Historical Newspapers Daily World Time Series-Datensatz stoßen, der die täglichen Inhalte von Zeitungen in den USA und Großbritannien von 1836 bis 1922 enthält; SciQ-Datensatz, der 13.679 crowdsourcete Wissenschaftsexamensfragen in den Bereichen Physik, Biologie und Chemie enthält; CommonCrawl, der Daten von 25 Milliarden Webseiten enthält; und MovieLens, eine Datenbank, die 22.000.000 Bewertungen und 580.000 Tags für 33.000 Filme von 240.000 Benutzern enthält.

Quantum Stats beeindruckende Datenbank kommt zu einer Zeit, in der Forscher aufgrund von Fortschritten im Deep Learning größere und vielfältigere Datensätze benötigen. Aufgrund der riesigen Menge an Daten, die in der menschlichen Sprache enthalten sind, macht jeder einzigartige Datensatz es ein wenig einfacher, diese zu verarbeiten. Der Fortschritt in der NLP hängt von diesen Datenbanken ab, und Quantum Stat hat durch die Zusammenstellung so vieler Datensätze an einem Ort dazu beigetragen, diesen Fortschritt zu beschleunigen.

NLP wird in vielen Aspekten der Gesellschaft wichtig sein. Es kann helfen, Krankheiten auf der Grundlage von elektronischen Gesundheitsakten und der Sprache eines Patienten vorherzusagen, Unternehmen dabei helfen, herauszufinden, was Kunden über ein Produkt sagen, und gefälschte Nachrichten in einer Welt, in der sie überhandnehmen, identifizieren.

Die Technologie entwickelt sich extrem schnell, und es wird nicht lange dauern, bis sie in der Lage ist, diese komplexen Anwendungen zu bewältigen.

Alex McFarland ist ein KI-Journalist und Schriftsteller, der die neuesten Entwicklungen im Bereich der künstlichen Intelligenz erforscht. Er hat mit zahlreichen KI-Startups und Veröffentlichungen weltweit zusammengearbeitet.