Μοντέλα και πλατφόρμες AI

Η Quantum Stat κυκλοφόρησε το «Big Bad NLP Database»

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η Quantum Stat κυκλοφόρησε το «Big Bad NLP Database» σε ένα μεγάλο βήμα προς τα εμπρός για την επεξεργασία φυσικής γλώσσας (NLP). Η βάση δεδομένων περιέχει εκατοντάδες διαφορετικά σύνολα δεδομένων για τους développers machine learning να τα χρησιμοποιήσουν.

Σύμφωνα με την εταιρεία, παρέχουν λύσεις για τις πρωτοβουλίες NLP και AI. Το κάνουν αυτό μέσω υπηρεσιών όπως η προεπεξεργασία έως την ανάπτυξη web εφαρμογών, μια πολυεπίπεδη προσέγγιση που περιλαμβάνει machine learning και deep neural networks, διαχείριση chatbot και διαλόγου, και τη νέα βάση δεδομένων NLP.

Η εταιρεία διεξάγει επίσης πρωτογενείς και δευτερογενείς έρευνες για να βοηθήσει τους ανθρώπους να αναλύσουν τις εξελίξεις στα诀ια.

Κεντρικό Κέντρο Δεδομένων NLP

Η απόφαση να δημιουργηθεί η βάση δεδομένων, η οποία είναι η μεγαλύτερη βιβλιοθήκη δεδομένων στη φυσική γλώσσα, προέκυψε από την ανάγκη για ένα κεντρικό κέντρο να κρατήσει τα δεδομένα NLP. Η εταιρεία στόχευε να το κάνει πιο εύκολα προσβάσιμο και αναζητήσιμο από το εναλλακτικό, το οποίο συχνά απαιτεί από τους ερευνητές να αναζητήσουν σε πολλές βιβλιοθήκες τρίτων.

Η εταιρεία έχει αναπτύξει τη βάση δεδομένων για αρκετές εβδομάδες· έχουν τώρα περίπου 200 σύνολα δεδομένων. Υπάρχουν διάφορα διαφορετικά σύνολα δεδομένων, όχι μόνο τα κλασικά. Η εταιρεία έχει περιλάβει αυτά όπως το CommonCrawl και το Penn Treebank.

Μαζί με μια σειρά από διαφορετικές βάσεις δεδομένων έρχονται και διάφορες εργασίες NLP. Υπάρχουν αυτές που επικεντρώνονται στην ταξινόμηση και την απάντηση ερωτημάτων, αλλά υπάρχουν επίσης σύνολα δεδομένων για text-to-SQL, αναγνώριση ομιλίας και multi-modal.

Η Quantum Stat θέλει τη βάση δεδομένων να είναι κοινότητα-κεντρική με συνεισφορές από τους χρήστες. Η εταιρεία έχει ανοίξει τις πόρτες για οποιονδήποτε να στείλει ένα νέο σύνολο δεδομένων ή να προτείνει αλλαγές.

Ένας άλλος στόχος είναι να προστεθούν σύνολα δεδομένων που να ποικίλουν στη γλώσσα, απομακρυσμένα από το να είναι αυστηρά αγγλικά. Ο στόχος τους είναι να κάνουν τη βιβλιοθήκη πιο παγκόσμια και προσβάσιμη σε άλλους.

Όταν εισέρχεται στη «Big Bad NLP Database», ο χρήστης θα συναντήσει ένα καθαρό και οργανωμένο layout. Το όνομα του συνόλου δεδομένων αναγράφεται, ακολουθούμενο από τη γλώσσα και μια λεπτομερή περιγραφή. Αναγράφονται επίσης οι περιπτώσεις, το format, η εργασία, το έτος δημιουργίας και ο δημιουργός. Κάθε βάση δεδομένων έχει einen σύνδεσμο λήψης.

Διάφορες Βάσεις Δεδομένων

Θα συναντήσετε βάσεις δεδομένων όπως το Historical Newspapers Daily World Time Series dataset, που περιέχει τα καθημερινά περιεχόμενα εφημερίδων στις ΗΠΑ και το Ηνωμένο Βασίλειο από το 1836 έως το 1922· το SciQ Dataset, που περιέχει 13.679 crowdsourced ερωτήσεις εξετάσεων επιστημών στα πεδία Φυσικής, Βιολογίας και Χημείας· το CommonCrawl, που περιέχει δεδομένα από 25 δισεκατομμύρια σελίδες web· και το MovieLens, μια βάση δεδομένων που περιέχει 22.000.000 αξιολογήσεων και 580.000 ετικέτες για 33.000 ταινίες από 240.000 χρήστες.

Η εντυπωσιακή βάση δεδομένων της Quantum Stat έρχεται σε μια εποχή που οι ερευνητές απαιτούν μεγαλύτερες και πιο ποικίλες βάσεις δεδομένων λόγω των προόδων στη βαθιά μάθηση. Λόγω του τεράστιου όγκου δεδομένων που περιέχεται στη γλώσσα, κάθε μοναδικό σύνολο δεδομένων το κάνει λίγο πιο εύκολο να επεξεργαστεί. Η πρόοδος της NLP εξαρτάται από αυτές τις βάσεις δεδομένων, και η Quantum Stat έχει συμβάλλει στην ταχύτερη πρόοδο αυτής της πρόοδου συλλέγοντας τόσο πολλά σύνολα δεδομένων σε ένα χώρο.

Η NLP θα είναι σημαντική σε πολλούς τομείς της κοινωνίας. Μπορεί να βοηθήσει στην πρόβλεψη ασθενειών με βάση τα ηλεκτρονικά ιατρικά αρχεία και την ομιλία του ασθενούς, να βοηθήσει τις εταιρείες να ανακαλύψουν τι λένε οι πελάτες για ένα προϊόν, και να αναγνωρίσει ψευδείς ειδήσεις σε ένα κόσμο όπου κυριαρχούν.

Η τεχνολογία προχωράει εξαιρετικά γρήγορα, και δεν θα χρειαστεί πολύ καιρό πριν είναι ικανή να αντιμετωπίσει αυτές τις σύνθετες εφαρμογές.

Ο Alex McFarland είναι δημοσιογράφος και συγγραφέας του AI που εξερευνά τις τελευταίες εξελίξεις στην τεχνητή νοημοσύνη. Έχει συνεργαστεί με πολλές startups και εκδόσεις του AI σε όλο τον κόσμο.