AI-mallit ja alustat

Quantum Stat julkaisee “Big Bad NLP Database”

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Quantum Stat on julkaissut “Big Bad NLP Database” -tietokannan, joka on merkittävä askel eteenpäin luonnollisen kielen prosessoinnissa (NLP). Tietokanta sisältää satoja eri tietoja koneoppimisen kehittäjille.

Yhtiön mukaan he tarjoavat ratkaisuja NLP- ja AI-aloitteille. He tekevät tämän esikäsittelyyn, web-sovelluskehitykseen, monitahoiseen lähestymistapaan, joka sisältää koneoppimisen ja syvän neuroverkkotekniikan, chatbotin ja dialogin hallinnan, sekä uuden NLP-tietokannan.

Yhtiö suorittaa myös ensi- ja jälkimmäistä tutkimusta auttamaan yksilöitä analysoimaan kehitystä aloilla.

NLP-tiedon keskus

Päätös tietokannan luomisesta, joka on maailman suurin NLP-tietokanta, johtui tarpeesta keskuspaikalle NLP-tiedolle. Yhtiö pyrki tekemään siitä helpommin saatavilla ja haettavissa kuin vaihtoehto, joka usein vaatii tutkijoita etsimään useita kolmannen osapuolen kirjastoja.

Yhtiö on kehittänyt tietokantaa useita viikkoja; heillä on tällä hetkellä noin 200 tietoa. On erilaisia tietoja, ei vain perusasioita. Yhtiö on sisällyttänyt sellaisia kuin CommonCrawl ja Penn Treebank.

Erilaisten tietokantojen mukana tulee erilaisia NLP-tehtäviä. On tehtäviä, jotka keskittyvät luokitteluun ja kysymyksiin, mutta on myös tietoja teksti-SQL:lle, puheentunnistamiselle ja monimodaaliselle.

Quantum Stat haluaa tietokannan olevan yhteisölähtöinen, jossa on käyttäjien osallistuminen. Yhtiö on avannut ovensa kaikille, jotka voivat lähettää uuden tietokannan tai ehdottaa muutoksia.

Toinen tavoite on lisätä tietoja, jotka monipuolistavat kieltä, poistamalla englannin kielen. Heidän tavoitteena on tehdä kirjastosta globaali ja helpommin saatavilla muille.

Kun käyttäjä sisäänkirjautuu “Big Bad NLP Databaseen”, hän kohtaa siistin ja järjestelmällisen ulkoasun. Tietokannan nimi on lueteltu, seuraavana kieli ja yksityiskohtainen kuvaus. Se listaa myös instansseja, muotoa, tehtävää, luomisvuotta ja luojaa. Kunkin tietokannan kohdalla on latauslinkki.

Erilaiset tietokannat

Yksi kohtaa tietokantoja, kuten Historical Newspapers Daily World Time Series -tietokanta, joka sisältää sanomalehtien päivittäiset sisällöt Yhdysvalloissa ja Isossa-Britanniassa vuosina 1836-1922; SciQ Dataset, joka sisältää 13 679 joukkorahoitettua tieteen kokeen kysymystä fysiikan, biologian ja kemian aloilla; CommonCrawl, joka sisältää 25 miljardin verkkosivun tiedot; ja MovieLens, joka sisältää 22 miljoonaa arvostelua ja 580 000 tagia 33 000 elokuvalle 240 000 käyttäjältä.

Quantum Statin vaikuttava tietokanta tulee aikana, jolloin tutkijat tarvitsevat suurempia ja monipuolisempia tietoja syvän oppimisen edetessä. Koska ihmisen kielen sisältämä valtava määrä tietoa, kunkin yksilöllisen tietokannan ansiosta se tekee prosessoinnista hieman helpompaa. NLP:n edistymisen riippuu näistä tietokannoista, ja Quantum Stat on edistänyt nopeutumista keräämällä niin monta tietokantaa yhteen paikkaan.

NLP on tärkeä monilla yhteiskunnan aloilla. Se voi auttaa ennustamaan sairauksia perustuen sähköisiin terveydenhoitotietoihin ja potilaan puheeseen, auttaa yrityksiä selvittämään, mitä asiakkaat sanovat tuotteesta, ja tunnistamaan väärää uutisointia maailmassa, jossa se on yleistä.

Teknologia kehittyy erittäin nopeasti, ja se ei ole kauan, kunnes se pystyy käsittelemään näitä monimutkaisia sovelluksia.

Alex McFarland on AI-toimittaja ja kirjailija, joka tutkii viimeisimpiä kehityksiä tekoälyssä. Hän on tehnyt yhteistyötä useiden AI-startup-yritysten ja julkaisujen kanssa maailmanlaajuisesti.