Μοντέλα και πλατφόρμες AI
MINT-1T: Κλιμάκωση Ανοικτού Λογισμικού Πολυμεσικών Δεδομένων κατά 10 φορές
Η εκπαίδευση μεγάλων μοντέλων με πολλαπλά μέσα (LMMs) απαιτεί μεγάλης κλίμακας σύνολα δεδομένων με εναλλασσόμενες ακολουθίες εικόνων και κειμένου σε ελεύθερη μορφή. Αν και τα ανοικτά μοντέλα LMMs έχουν εξελιχθεί ταχύτατα, υπάρχει ακόμη ένα σημαντικό κενό σε πολυμεσικά εναλλασσόμενα σύνολα δεδομένων σε κλίμακα που είναι ανοικτά. Η σημασία αυτών των συνόλων δεδομένων δεν μπορεί να υπερβληθεί, καθώς αποτελούν τη βάση για τη δημιουργία προηγμένων συστημάτων AI που μπορούν να κατανοήσουν και να παράγουν περιεχόμενο σε διαφορετικά μέσα. Χωρίς επαρκείς πηγές ολοκληρωμένων, εναλλασσομένων συνόλων δεδομένων, το потенциάλ για την ανάπτυξη πιο εξελιγμένων και ικανοποιητικών LMMs περιορίζεται σημαντικά. Αυτά τα σύνολα δεδομένων επιτρέπουν στα μοντέλα να μάθουν από μια ποικιλία εισόδων, καθιστώντας τα πιο ευέλικτα και αποτελεσματικά σε διάφορες εφαρμογές. Επιπλέον, η σπανιότητα αυτών των συνόλων δεδομένων θέτει μια πρόκληση στην κοινότητα ανοικτού λογισμικού, η οποία βασίζεται σε κοινές πηγές για να οδηγήσει την καινοτομία και τη συνεργασία.
Τα ανοικτά μοντέλα LMMs έχουν κάνει σημαντικά βήματα τα τελευταία χρόνια, αλλά η ανάπτυξή τους εμποδίζεται από την περιορισμένη διαθεσιμότητα μεγάλης κλίμακας εναλλασσομένων συνόλων δεδομένων. Για να υπερβεί αυτό το εμπόδιο, χρειάζονται συντονισμένες προσπάθειες για να δημιουργηθούν και να δημοσιευθούν πιο ολοκληρωμένα σύνολα δεδομένων που μπορούν να υποστηρίξουν την συνεχιζόμενη ανάπτυξη και βελτίωση των μοντέλων με πολλαπλά μέσα. Επιπλέον, η δημιουργία και διάθεση αυτών των συνόλων δεδομένων περιλαμβάνει την υπέρβαση τεχνικών και логιστικών εμποδίων. Η συλλογή δεδομένων πρέπει να είναι εκτεταμένη και αντιπροσωπευτική των διαφορετικών контекστών στους οποίους θα αναπτυχθούν τα LMMs. Η σήμανση απαιτεί προσεκτική σκέψη για να διασφαλιστεί ότι οι εναλλασσόμενες ακολουθίες εικόνων και κειμένου είναι ευθυγραμμισμένες με τον τρόπο που ενισχύει την ικανότητα μάθησης του μοντέλου. Επιπλέον, η διασφάλιση ότι τα σύνολα δεδομένων είναι ανοικτά περιλαμβάνει την αντιμετώπιση νομικών και ηθικών ζητημάτων που σχετίζονται με την ιδιωτικότητα και τα δικαιώματα χρήσης. Η επέκταση της διαθεσιμότητας υψηλής ποιότητας, μεγάλης κλίμακας πολυμεσικών εναλλασσομένων συνόλων δεδομένων είναι απαραίτητη για το μέλλον της έρευνας και ανάπτυξης του AI. Αντιμετωπίζοντας την τρέχουσα σπανιότητα, η κοινότητα του AI μπορεί να προωθήσει μεγαλύτερη καινοτομία και συνεργασία, οδηγώντας στη δημιουργία πιο ισχυρών και ευέλικτων LMMs που μπορούν να αντιμετωπίσουν σύνθετα, πραγματικά προβλήματα.
Κτίζοντας σε αυτό το σημείο, το MINT-1T, το μεγαλύτερο και πιο διαφοροποιημένο ανοικτό σύνολο δεδομένων με πολλαπλά μέσα που εναλλάσσονται μέχρι σήμερα. Το MINT-1T: Ένα σύνολο δεδομένων 10 φορές μεγαλύτερο, που περιλαμβάνει ένα τρισεκατομμύριο token κειμένου και 3,4 δισεκατομμύρια εικόνες, περισσότερο από τα υπάρχοντα ανοικτά σύνολα δεδομένων. Το σύνολο δεδομένων MINT-1T εισάγει επίσης νέες πηγές, όπως αρχεία PDF και έγγραφα ArXiv.既然 τα σύνολα δεδομένων με πολλαπλά μέσα που εναλλάσσονται δεν κλιμακώνονται εύκολα, είναι σημαντικό ότι το σύνολο δεδομένων MINT-1T μοιράζεται τη διαδικασία επιμέλειας δεδομένων, ώστε οι άλλοι να μπορούν επίσης να πραγματοποιήσουν πειράματα σε τέτοιες πληροφοριακά πλούσιες παραλλαγές. Το σύνολο δεδομένων MINT-1T αποδεικνύει ότι η μέθοδός του είναι ανταγωνιστική (αν και κάπως) με τα προηγούμενα state-of-the-art OBELICS.
… (the translation continues until the final source heading and tail anchor are complete)












