Μοντέλα και πλατφόρμες AI

Μέσα στο DBRX: Η Databricks Απελευθερώνει Ένα Powerful Ανοιχτό Λογισμικό LLM

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Στο γρήγορα εξελισσόμενο πεδίο των μεγάλων μοντέλων γλώσσας (LLM), ένα νέο ισχυρό μοντέλο έχει εμφανιστεί – το DBRX, ένα ανοιχτό μοντέλο που δημιουργήθηκε από τη Databricks. Αυτό το LLM κάνει κύματα με την κορυφαία απόδοσή του σε eine ευρεία γκάμα επιδόσεων, ακόμη και ανταγωνιζόμενο τις ικανότητες των βιομηχανικών γιγάντων όπως το GPT-4 της OpenAI.

Το DBRX αντιπροσωπεύει ένα σημαντικό ορόσημο στη δημοκρατικοποίηση της τεχνητής νοημοσύνης, παρέχοντας στους ερευνητές, τους développers και τις επιχειρήσεις ανοιχτή πρόσβαση σε ένα κορυφαίο μοντέλο γλώσσας. Αλλά τι ακριβώς είναι το DBRX και τι το κάνει τόσο đặc biệt; Σε αυτή τη τεχνική αναλυτική έρευνα, θα εξερευνήσουμε την καινοτόμο αρχιτεκτονική, τη διαδικασία εκπαίδευσης και τις βασικές ικανότητες που έχουν ωθήσει το DBRX στο προσκήνιο του ανοιχτού τοπίου LLM.

Η Γέννηση του DBRX Η δημιουργία του DBRX οδηγήθηκε από την αποστολή της Databricks να κάνει την ευφυΐα δεδομένων προσβάσιμη σε όλες τις επιχειρήσεις. Ως ηγέτης στις πλατφόρμες ανάλυσης δεδομένων, η Databricks αναγνώρισε το τεράστιο δυναμικό των LLM και έθεσε ως στόχο να αναπτύξει ένα μοντέλο που θα μπορούσε να ανταγωνιστεί ή ακόμη και να υπερβεί την απόδοση των ιδιωτικών προσφορών.

Μετά από μήνες εντατικής έρευνας, ανάπτυξης και μιας επένδυσης πολλών εκατομμυρίων δολαρίων, η ομάδα της Databricks πέτυχε ένα ορόσημο με το DBRX. Η εντυπωσιακή απόδοση του μοντέλου σε eine ευρεία γκάμα επιδόσεων, συμπεριλαμβανομένης της κατανόησης γλώσσας, της προγραμματισμού και των μαθηματικών, καθιέρωσε σθεναρά το DBRX ως ένα νέο state-of-the-art στα ανοιχτά LLM.

Καινοτόμος Αρχιτεκτονική

Η Δύναμη των Mixture-of-Experts Στο κέντρο της εξαιρετικής απόδοσης του DBRX βρίσκεται η καινοτόμος αρχιτεκτονική mixture-of-experts (MoE). Αυτή η πρωτοποριακή σχεδίαση αντιπροσωπεύει μια απόσταση από τα παραδοσιακά πυκνά μοντέλα, υιοθετώντας μια σπάνια προσέγγιση που ενισχύει τόσο την eficiência της προ-εκπαίδευσης όσο και την ταχύτητα της εύρεσης.

Στο πλαίσιο του MoE, μόνο μια επιλεγμένη ομάδα 구성τικών, που ονομάζονται “ειδικοί”, ενεργοποιούνται για κάθε είσοδο. Αυτή η εξειδίκευση επιτρέπει στο μοντέλο να αντιμετωπίζει ένα ευρύ φάσμα εργασιών με μεγαλύτερη ικανότητα, ενώ ταυτόχρονα βελτιώνει τους υπολογιστικούς πόρους.

Το DBRX πηγαίνει ακόμη παραπέρα με την αρχιτεκτονική του fine-grained MoE. Σε αντίθεση με κάποια άλλα μοντέλα MoE που χρησιμοποιούν ένα μικρότερο αριθμό μεγαλύτερων ειδικών, το DBRX χρησιμοποιεί 16 ειδικούς, με 4 ειδικούς ενεργούς για οποιαδήποτε δεδομένη είσοδο. Αυτή η σχεδίαση παρέχει μια εκπληκτική 65 φορές περισσότερες πιθανές συνδυαστικές ειδικές, συμβάλλοντας άμεσα στην υπεροχή του DBRX.

Το DBRX διακρίνεται με πολλές καινοτόμες λειτουργίες:

  • Rotary Position Encodings (RoPE): Βελτιώνει την κατανόηση των θέσεων των token, που είναι κρίσιμη για τη δημιουργία контекστοποιημένου κειμένου.
  • Gated Linear Units (GLU): Εισάγει einen μηχανισμό πύλης που ενισχύει την ικανότητα του μοντέλου να μάθει σύνθετα πρότυπα πιο αποτελεσματικά.
  • Grouped Query Attention (GQA): Βελτιώνει την eficiência του μοντέλου βελτιώνοντας τον μηχανισμό προσοχής.
  • Advanced Tokenization: Χρησιμοποιεί τον tokenizer του GPT-4 για να επεξεργαστεί τις εισόδους πιο αποτελεσματικά.

Η αρχιτεκτονική MoE είναι ιδιαίτερα κατάλληλη για μεγάλα μοντέλα γλώσσας, καθώς επιτρέπει μια πιο αποτελεσματική κλιμάκωση και καλύτερη αξιοποίηση των υπολογιστικών πόρων. Διανέμοντας τη διαδικασία μάθησης σε πολλαπλά εξειδικευμένα υποδίκτυα, το DBRX μπορεί να ανατεθεί αποτελεσματικά δεδομένα και υπολογιστική δύναμη για κάθε εργασία, εξασφαλίζοντας τόσο υψηλής ποιότητας έξοδο όσο και βέλτιστη eficiência.

Εκτεταμένα Δεδομένα Εκπαίδευσης και Αποτελεσματική Βελτιστοποίηση Ενώ η αρχιτεκτονική του DBRX είναι αναμφισβήτητα εντυπωσιακή, η αληθινή του δύναμη βρίσκεται στη μεθοδική διαδικασία εκπαίδευσης και τον τεράστιο όγκο δεδομένων που εκτέθηκε. Το DBRX ήταν προ-εκπαιδευμένο σε ένα εκπληκτικό 12 τρισεκατομμύρια token κειμένου και κώδικα, που επιμελώς επιλέχθηκαν για να διασφαλίσουν υψηλή ποιότητα και ποικιλία.

Τα δεδομένα εκπαίδευσης επεξεργάστηκαν χρησιμοποιώντας το σύνολο εργαλείων της Databricks, συμπεριλαμβανομένων του Apache Spark για την επεξεργασία δεδομένων, του Unity Catalog για τη διαχείριση και τη διακυβέρνηση δεδομένων και του MLflow για την παρακολούθηση πειραμάτων. Αυτό το綜合 εργαλείο επέτρεψε στην ομάδα της Databricks να διαχειριστεί αποτελεσματικά, να εξερευνήσει και να βελτιστοποιήσει το τεράστιο σύνολο δεδομένων, θέτοντας τις βάσεις για την εξαιρετική απόδοση του DBRX.

Για να ενισχύσει περαιτέρω τις ικανότητες του μοντέλου, η Databricks χρησιμοποίησε ένα δυναμικό πρόγραμμα προ-εκπαίδευσης, που ποικίλλει καινοτόμα την смесь δεδομένων κατά τη διάρκεια της εκπαίδευσης. Αυτή η στρατηγική επέτρεψε σε κάθε token να επεξεργαστεί αποτελεσματικά χρησιμοποιώντας τους 36 δισεκατομμύρια ενεργούς παραμέτρους, οδηγώντας σε ένα πιο γύρω και προσαρμόσιμο μοντέλο.

Επιπλέον, η διαδικασία εκπαίδευσης του DBRX ήταν βελτιστοποιημένη για eficiência, αξιοποιώντας το σύνολο των ιδιόκτητων εργαλείων και βιβλιοθηκών της Databricks, συμπεριλαμβανομένων του Composer, LLM Foundry, MegaBlocks και Streaming. Χρησιμοποιώντας τεχνικές όπως η εκπαίδευση με πρόγραμμα και βελτιστοποιημένες στρατηγικές βελτιστοποίησης, η ομάδα πέτυχε σχεδόν τετραπλάσια βελτίωση στην υπολογιστική eficiência σε σύγκριση με τα προηγούμενα μοντέλα.

Εκπαίδευση και Αρχιτεκτονική

Το DBRX εκπαιδεύτηκε χρησιμοποιώντας ένα μοντέλο προβλέψεων επόμενου token σε ένα κολοσσιαίο σύνολο δεδομένων 12 τρισεκατομμυρίων token, που τονίζει τόσο το κείμενο όσο και τον κώδικα. Αυτό το σύνολο δεδομένων εκπαίδευσης πιστεύεται ότι είναι σημαντικά πιο αποτελεσματικό από αυτά που χρησιμοποιούνται σε προηγούμενα μοντέλα, εξασφαλίζοντας μια πλούσια κατανόηση και ικανότητα απόκρισης σε διάφορες προτροπές.

Η αρχιτεκτονική του DBRX δεν είναι μόνο ένα μαρτύριο της τεχνικής ικανότητας της Databricks, αλλά επίσης υπογραμμίζει την εφαρμογή της σε πολλαπλά τομείς. Από την ενίσχυση των αλληλεπιδράσεων των chatbot έως την ενδυνάμωση των σύνθετων εργασιών ανάλυσης δεδομένων, το DBRX μπορεί να ενσωματωθεί σε διάφορους τομείς που απαιτούν νηφαλή κατανόηση γλώσσας.

Εξαιρετικά, το DBRX Instruct甚至 ανταγωνίζεται κάποια από τα πιο προηγμένα κλειστά μοντέλα στην αγορά. Σύμφωνα με τις μετρήσεις της Databricks, υπερβαίνει το GPT-3.5 και είναι ανταγωνιστικό με το Gemini 1.0 Pro και το Mistral Medium σε διάφορες επιδόσεις, συμπεριλαμβανομένων της γενικής γνώσης, της κοινής λογικής, της προγραμματισμού και της μαθηματικής λογικής.

Για παράδειγμα, στο MMLU benchmark, που μετρά την κατανόηση γλώσσας, το DBRX Instruct πέτυχε ένα σκορ 73,7%, υπερβαίνοντας το GPT-3.5 με 70,0%. Στο HellaSwag benchmark της κοινής λογικής, το DBRX Instruct πέτυχε ένα εντυπωσιακό 89,0%, υπερβαίνοντας το GPT-3.5 με 85,5%.

Το DBRX Instruct πραγματικά λάμπει, επιτυγχάνοντας μια εντυπωσιακή ακρίβεια 70,1% στο HumanEval benchmark, υπερβαίνοντας όχι μόνο το GPT-3.5 (48,1%) αλλά και το ειδικό μοντέλο CodeLLaMA-70B Instruct (67,8%).

Αυτά τα εξαιρετικά αποτελέσματα υπογραμμίζουν την πολυμορφία του DBRX και την ικανότητά του να εξέχει σε eine ευρεία γκάμα εργασιών, από την κατανόηση γλώσσας έως τη σύνθετη προγραμματισμό και την μαθηματική επίλυση προβλημάτων.

Αποτελεσματική Έξοδος και Κλιμάκωση Μια από τις βασικές πλεονεκτήματα της αρχιτεκτονικής MoE του DBRX είναι η eficiência κατά την έξοδο. Χάρη στην σπάνια ενεργοποίηση των παραμέτρων, το DBRX μπορεί να επιτύχει έξοδο που είναι μέχρι δύο έως τρεις φορές ταχύτερη από τα πυκνά μοντέλα με τον ίδιο συνολικό αριθμό παραμέτρων.

Σε σύγκριση με το LLaMA2-70B, ένα δημοφιλές ανοιχτό μοντέλο LLM, το DBRX δεν μόνο επιδεικνύει υψηλότερη ποιότητα αλλά και διπλασιάζει την ταχύτητα έξοδου, παρά την ύπαρξη περίπου μισών ενεργών παραμέτρων. Αυτή η eficiência καθιστά το DBRX μια ελκυστική επιλογή για ανάπτυξη σε eine ευρεία γκάμα εφαρμογών, από τη δημιουργία περιεχομένου έως την ανάλυση δεδομένων και πέρα.

Επιπλέον, η Databricks έχει αναπτύξει ένα ρομποτικό στάδιο εκπαίδευσης που επιτρέπει στις επιχειρήσεις να εκπαιδεύσουν τα δικά τους μοντέλα DBRX-class από την αρχή ή να συνεχίσουν την εκπαίδευση πάνω από τα παρεχόμενα checkpoints. Αυτή η ικανότητα ενδυναμώνει τις επιχειρήσεις να αξιοποιήσουν πλήρως το DBRX και να το προσαρμόσουν στις συγκεκριμένες ανάγκες τους, δημοκρατίζοντας περαιτέρω την πρόσβαση στην κορυφαία τεχνολογία LLM.

Προσβασιμότητα και Ολοκλήρωση

Σε συνδυασμό με την αποστολή της για την προώθηση της ανοιχτής πρόσβασης στην τεχνητή νοημοσύνη, η Databricks έχει κάνει το DBRX διαθέσιμο μέσω πολλαπλών καναλιών. Τα βάρη του βασικού μοντέλου (DBRX Base) και του μοντέλου fine-tuned (DBRX Instruct) φιλοξενούνται στην πλατφόρμα Hugging Face, επιτρέποντας στους ερευνητές και τους développers να κατεβάσουν και να εργαστούν με το μοντέλο.

Επιπλέον, το αποθετήριο του μοντέλου DBRX είναι διαθέσιμο στο GitHub, παρέχοντας διαφάνεια και ενεργοποιώντας περαιτέρω εξερεύνηση και προσαρμογή του κώδικα του μοντέλου.

inference throughput for various model configurations on our optimized serving infrastructure using NVIDIA TensorRT-LLM at 16-bit precision with the best optimization flags we could find.

Για τους πελάτες της Databricks, το DBRX Base και το DBRX Instruct είναι άμεσα προσβάσιμα μέσω των API Foundation Model της Databricks, επιτρέποντας μια άρτια ολοκλήρωση στις υπάρχουσες εργασίες και εφαρμογές. Αυτό όχι μόνο απλοποιεί τη διαδικασία ανάπτυξης αλλά και διασφαλίζει τη διακυβέρνηση και την ασφάλεια δεδομένων για ευαίσθητες περιπτώσεις.

Επιπλέον, το DBRX έχει ήδη ολοκληρωθεί σε διάφορες τρίτες πλατφόρμες και υπηρεσίες, όπως το You.com και το Perplexity Labs, επεκτείνοντας την εμβέλεια και τις πιθανές εφαρμογές του. Αυτές οι ολοκληρώσεις δείχνουν το αυξανόμενο ενδιαφέρον για το DBRX και τις ικανότητές του, καθώς και την αυξανόμενη υιοθέτηση των ανοιχτών LLM σε διάφορους τομείς και περιπτώσεις.

Ικανότητες Μακράς Παράστασης και Αναζήτηση-Ενισχυμένη Γενίκευση Μια από τις εξαιρετικές λειτουργίες του DBRX είναι η ικανότητά του να χειρίζεται εισόδους μακράς παράστασης, με μέγιστο μήκος παράστασης 32.768 token. Αυτή η ικανότητα επιτρέπει στο μοντέλο να επεξεργαστεί και να γεννήσει κείμενο με βάση εκτεταμένες πληροφορίες πλαισίου, καθιστώντας το κατάλληλο για εργασίες όπως η περίληψη εγγράφων, η απάντηση ερωτήσεων και η ανάκτηση πληροφοριών.

Σε επιδόσεις που αξιολογούν την απόδοση μακράς παράστασης, όπως το KV-Pairs και το HotpotQAXL, το DBRX Instruct υπερέβη το GPT-3.5 Turbo σε διάφορους μήκους ακολουθιών και θέσεις πλαισίου.

DBRX outperforms established open source models on language understanding (MMLU), Programming (HumanEval), and Math (GSM8K).

DBRX outperforms established open source models on language understanding (MMLU), Programming (HumanEval), and Math (GSM8K).

Περιορισμοί και Μελλοντική Εργασία

Ενώ το DBRX αντιπροσωπεύει μια σημαντική επιτυχία στο πεδίο των ανοιχτών LLM, είναι απαραίτητο να αναγνωριστούν οι περιορισμοί και οι περιοχές για μελλοντική βελτίωση. Όπως κάθε μοντέλο AI, το DBRX μπορεί να παράγει ανακριβείς ή προκατειλημμένες απαντήσεις, ανάλογα με την ποιότητα και την ποικιλία των δεδομένων εκπαίδευσής του.

Επιπλέον, ενώ το DBRX excels σε γενικούς σκοπούς εργασίες, ορισμένες εφαρμογές ειδικού τομέα μπορεί να απαιτήσουν περαιτέρω fine-tuning ή εξειδικευμένη εκπαίδευση για να επιτύχουν βέλτιστη απόδοση. Για παράδειγμα, σε σενάρια όπου η ακρίβεια και η πιστότητα είναι της υψίστης σημασίας, η Databricks συνιστά τη χρήση τεχνικών αναζήτησης-ενισχυμένης γενίκευσης (RAG) για να βελτιστοποιήσει την έξοδο του μοντέλου.

Επιπλέον, το τρέχον σύνολο δεδομένων εκπαίδευσης του DBRX αποτελείται κυρίως από περιεχόμενο στην αγγλική γλώσσα, που μπορεί να περιορίσει την απόδοσή του σε μη αγγλικές εργασίες. Μελλοντικές ιτερές του μοντέλου μπορεί να περιλαμβάνουν την επέκταση του συνόλου δεδομένων εκπαίδευσης για να περιλαμβάνει μια πιο ποικιλόμορφη γκάμα γλωσσών και πολιτισμικών πλαισίων.

Η Databricks είναι δεσμευμένη να βελτιστοποιήσει συνεχώς τις ικανότητες του DBRX και να αντιμετωπίσει τους περιορισμούς του. Η μελλοντική εργασία θα επικεντρωθεί στην βελτίωση της απόδοσης, της κλιμάκωσης και της χρηστικότητας του μοντέλου σε διάφορες εφαρμογές και περιπτώσεις, καθώς και στην εξερεύνηση τεχνικών για την μείωση των πιθανών προκαταλήψεων και την προώθηση της ηθικής χρήσης της τεχνητής νοημοσύνης.

Επιπλέον, η εταιρεία σχεδιάζει να βελτιστοποιήσει περαιτέρω τη διαδικασία εκπαίδευσης, αξιοποιώντας προηγμένες τεχνικές όπως η ομοσπονδιακή εκπαίδευση και οι μεθόδους προστασίας της ιδιωτικής ζωής για να διασφαλίσει την προστασία και την ασφάλεια των δεδομένων.

Ο Δρόμος Εμπρός

Το DBRX αντιπροσωπεύει ένα σημαντικό βήμα στην δημοκρατικοποίηση της ανάπτυξης της τεχνητής νοημοσύνης. Εμπιστεύεται ένα μέλλον όπου κάθε επιχείρηση θα έχει τη δυνατότητα να ελέγχει τα δεδομένα της και το μέλλον της στην εμφερίζουσα κόσμου της γενετικής τεχνητής νοημοσύνης.

Ανοίγοντας το DBRX και παρέχοντας πρόσβαση στα ίδια εργαλεία και την υποδομή που χρησιμοποιήθηκαν για την ανάπτυξή του, η Databricks ενδυναμώνει τις επιχειρήσεις και τους ερευνητές να αναπτύξουν τα δικά τους μοντέλα DBRX-class, προσαρμοσμένα στις συγκεκριμένες ανάγκες τους.

Μέσω της πλατφόρμας της Databricks, οι πελάτες μπορούν να αξιοποιήσουν το σύνολο εργαλείων επεξεργασίας δεδομένων της εταιρείας, συμπεριλαμβανομένων του Apache Spark, του Unity Catalog και του MLflow, για να κατεβάσουν και να διαχειριστούν τα δεδομένα εκπαίδευσής τους. Στη συνέχεια, μπορούν να αξιοποιήσουν τα βελτιστοποιημένα εργαλεία εκπαίδευσης της Databricks, όπως το Composer, το LLM Foundry, το MegaBlocks και το Streaming, για να εκπαιδεύσουν τα δικά τους μοντέλα DBRX-class αποτελεσματικά και σε κλίμακα.

Αυτή η δημοκρατικοποίηση της ανάπτυξης της τεχνητής νοημοσύνης έχει το δυναμικό να ξεκλειδώσει μια νέα κυματική καινοτομίας, καθώς οι επιχειρήσεις κάνουν την τεχνητή νοημοσύνη για eine ευρεία γκάμα εφαρμογών, από τη δημιουργία περιεχομένου και την ανάλυση δεδομένων έως την υποστήριξη αποφάσεων και πέρα.

Επιπλέον, προωθώντας ένα ανοιχτό και συνεργατικό οικοσύστημα γύρω από το DBRX, η Databricks στοχεύει να επιταχύνει το ρυθμό της έρευνας και της ανάπτυξης στο πεδίο των μεγάλων μοντέλων γλώσσας. Όσο περισσότερες οργανώσεις και άτομα συνεισφέρουν την εμπειρογνωσία και τις γνώσεις τους, η συλλογική γνώση και κατανόηση αυτών των ισχυρών συστημάτων AI θα συνεχίσει να μεγαλώνει, ανοίγοντας το δρόμο για ακόμη πιο προηγμένα και ικανά μοντέλα στο μέλλον.

Συμπέρασμα

Το DBRX είναι ένα game-changer στον κόσμο των ανοιχτών μοντέλων μεγάλης κλίμακας γλώσσας. Με την καινοτόμο αρχιτεκτονική mixture-of-experts, την εκτεταμένη εκπαίδευση και την κορυφαία απόδοση, έχει θέσει einen νέο chuẩn για το τι είναι δυνατό με τα ανοιχτά LLM.

Δημοκρατίζοντας την πρόσβαση στην κορυφαία τεχνολογία AI, το DBRX ενδυναμώνει τους ερευνητές, τους développers και τις επιχειρήσεις να εξερευνήσουν νέους ορίζοντες στην επεξεργασία φυσικής γλώσσας, τη δημιουργία περιεχομένου, την ανάλυση δεδομένων και πέρα. Όσο η Databricks συνεχίζει να βελτιστοποιεί και να ενισχύει το DBRX, οι πιθανές εφαρμογές και ο αντίκτυπος του ισχυρού μοντέλου αυτού είναι πραγματικά απεριόριστοι.

Έχω περάσει τα τελευταία πέντε χρόνια βυθισμένος στον συναρπαστικό κόσμο της Μηχανικής Μάθησης και του Βαθιάς Μάθησης. Η δέσμευσή μου και η εξειδίκευσή μου με οδήγησαν να συμβάλλω σε πάνω από 50 διαφορετικά projects μηχανικής λογισμικού, με ιδιαίτερη έμφαση στο AI/ML. Η συνεχής περιέργειά μου με έχει οδηγήσει επίσης προς την Επεξεργασία Φυσικής Γλώσσας, ένα πεδίο που είμαι πρόθυμος να εξερευνήσω περαιτέρω.