Μοντέλα και πλατφόρμες AI

Πώς το DeepSeek έσπασε τον φραγμό του κόστους με $5,6 εκατ.

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η συμβατική σοφία της τεχνητής νοημοσύνης υποδηλώνει ότι η κατασκευή μεγάλων μοντέλων γλωσσικών μοντέλων (LLMs) απαιτεί βαθιά τσέπες – συνήθως δισεκατομμύρια σε επένδυση. Αλλά το DeepSeek, ένα κινεζικό=startup της τεχνητής νοημοσύνης, έσπασε αυτό το σχήμα με την τελευταία τους επιτυχία: την ανάπτυξη ενός παγκόσμιου μοντέλου AI για μόλις $5,6 εκατομμύρια.

Το μοντέλο V3 του DeepSeek μπορεί να ανταγωνιστεί τους γίγαντες της βιομηχανίας όπως το Google’s Gemini και τις πρόσφατες προσφορές του OpenAI, χρησιμοποιώντας μόνο ένα κλάσμα των τυπικών υπολογιστικών πόρων. Η επιτυχία này έκανε την προσοχή πολλών ηγετών της βιομηχανίας, και αυτό που την κάνει ιδιαίτερα αξιοσημείωτη είναι ότι η εταιρεία το κατάφερε παρά τις περιοριστικές εξαγωγές των ΗΠΑ που περιόριζαν την πρόσβασή τους στις τελευταίες τσιπ Nvidia (NVDA ).

Η Οικονομία της Αποδοτικής Τεχνητής Νοημοσύνης

Τα νούμερα διηγούνται μια πειστική ιστορία αποδοτικότητας. Ενώ τα περισσότερα προηγμένα μοντέλα AI απαιτούν μεταξύ 16.000 και 100.000 GPU για εκπαίδευση, το DeepSeek διαχειρίστηκε με μόνο 2.048 GPU που εκτελούνταν για 57 ημέρες. Η εκπαίδευση του μοντέλου κατανάλωσε 2,78 εκατομμύρια ώρες GPU στις τσιπ Nvidia H800 – αξιοσημείωτα μετριοπαθή για ένα μοντέλο 671 δισεκατομμυρίων παραμέτρων.

Για να τοποθετήσουμε αυτό σε προοπτική, η Meta χρειαζόταν περίπου 30,8 εκατομμύρια ώρες GPU – περίπου 11 φορές περισσότερη υπολογιστική δύναμη – για την εκπαίδευση του μοντέλου Llama 3, το οποίο στην πραγματικότητα έχει λιγότερες παραμέτρους, 405 δισεκατομμύρια. Η προσέγγιση του DeepSeek μοιάζει με ένα μάστερ κλάς στην βελτιστοποίηση υπό περιορισμούς. Εργαζόμενοι με τσιπ H800 – τσιπ AI που σχεδιάστηκαν από την Nvidia ειδικά για την κινεζική αγορά με μειωμένες ικανότητες – η εταιρεία μετέτρεψε τις πιθανές περιορισμούς σε καινοτομία. Αντί να χρησιμοποιούν λύσεις off-the-shelf για την επικοινωνία των επεξεργαστών, ανέπτυξαν εξατομικευμένες λύσεις που μεγιστοποιούσαν την αποδοτικότητα.

Ενώ οι ανταγωνιστές συνεχίζουν να λειτουργούν υπό την υπόθεση ότι οι τεράστιες επενδύσεις είναι απαραίτητες, το DeepSeek αποδεικνύει ότι η εφευρετικότητα και η αποδοτική χρήση των πόρων μπορεί να ισοπεδώσει το πεδίο.

Εικόνα: Artificial Analysis

Η Μηχανική του Αδύνατου

Η επιτυχία του DeepSeek έγκειται στην καινοτόμο τεχνική τους προσέγγιση, δείχνοντας ότι μερικές φορές οι πιο σημαντικές επιτυχίες προέρχονται από την εργασία εντός περιορισμών και όχι από την ρίψη απεριόριστων πόρων σε ένα πρόβλημα.

Στην καρδιά αυτής της καινοτομίας βρίσκεται μια στρατηγική που ονομάζεται “auxiliary-loss-free load balancing”. Σκεφτείτε το σαν την διεύθυνση ενός τεράστιου παράλληλου συστήματος επεξεργασίας όπου παραδοσιακά, θα χρειαζόσασταν σύνθετα κανόνες και ποινές για να διατηρήσετε όλα σε λειτουργία. Το DeepSeek αναστρέψει αυτή τη συμβατική σοφία, αναπτύσσοντας ένα σύστημα που διατηρεί φυσικά την ισορροπία χωρίς το επιπλέον βάρος των παραδοσιακών προσεγγίσεων.

Η ομάδα επίσης ανέπτυξε αυτό που ονομάζουν “Multi-Token Prediction” (MTP) – μια τεχνική που επιτρέπει στο μοντέλο να σκέφτεται μπροστά, προβλέποντας πολλαπλά tokens ταυτόχρονα. Σε πρακτική εφαρμογή, αυτό μεταφράζεται σε ένα εντυπωσιακό 85-90% ποσοστό αποδοτικότητας για αυτές τις προβλέψεις σε διάφορα θέματα, παρέχοντας 1,8 φορές ταχύτερες ταχύτητες επεξεργασίας από προηγούμενες προσεγγίσεις.

Η τεχνική αρχιτεκτονική είναι ένα αριστούργημα της αποδοτικότητας. Το μοντέλο V3 του DeepSeek χρησιμοποιεί μια προσέγγιση mixture-of-experts με 671 δισεκατομμύρια συνολικά παράμετρους, αλλά εδώ είναι το έξυπνο μέρος – ενεργοποιεί μόνο 37 δισεκατομμύρια για κάθε token. Αυτή η επιλεκτική ενεργοποίηση σημαίνει ότι λαμβάνουν τα οφέλη ενός τεράστιου μοντέλου ενώ διατηρούν την πρακτική αποδοτικότητα.

Η επιλογή τους για το πλαίσιο εκπαίδευσης FP8 mixed precision είναι ένα άλλο βήμα μπροστά. Αντί να αποδεχτούν τις συμβατικές περιορισμούς της μειωμένης ακρίβειας, ανέπτυξαν εξατομικευμένες λύσεις που διατηρούν την ακρίβεια ενώ μειώνουν σημαντικά τις απαιτήσεις μνήμης και υπολογισμού.

Οι Κυματικές Επιπτώσεις στο Οικοσύστημα της Τεχνητής Νοημοσύνης

Η επίδραση της επιτυχίας του DeepSeek εκτείνεται πολύ πέρα από ένα単ικό επιτυχημένο μοντέλο.

Για την ανάπτυξη της τεχνητής νοημοσύνης στην Ευρώπη, αυτή η επιτυχία είναι ιδιαίτερα σημαντική. Πολλά προηγμένα μοντέλα δεν φτάνουν στην ΕΕ επειδή εταιρείες όπως η Meta και το OpenAI είτε δεν μπορούν είτε δεν θέλουν να προσαρμοστούν στο Ευρωπαϊκό Νόμο για την Τεχνητή Νοημοσύνη. Η προσέγγιση του DeepSeek δείχνει ότι η κατασκευή προηγμένων μοντέλων AI δεν απαιτεί πάντα τεράστιους GPU cluster – είναι περισσότερο για την αποτελεσματική χρήση των διαθέσιμων πόρων.

Αυτή η ανάπτυξη δείχνει επίσης πώς οι περιορισμοί εξαγωγής μπορούν να οδηγήσουν στην καινοτομία. Η περιορισμένη πρόσβαση του DeepSeek σε υψηλής απόδοσης υλικό τους ανάγκασε να σκεφτούν διαφορετικά, οδηγώντας σε βελτιστοποιήσεις λογισμικού που μπορεί να μην είχαν εμφανιστεί σε ένα περιβάλλον με πλούσιους πόρους. Αυτό το principio θα μπορούσε να αναμορφώσει τον τρόπο που αντιμετωπίζουμε την ανάπτυξη της τεχνητής νοημοσύνης παγκοσμίως.

Οι επιπτώσεις της δημοκρατικοποίησης είναι βαθιές. Ενώ οι γίγαντες της βιομηχανίας συνεχίζουν να καίνε δισεκατομμύρια, το DeepSeek έχει δημιουργήσει ένα σχέδιο για αποτελεσματική και οικονομική ανάπτυξη AI. Αυτό θα μπορούσε να ανοίξει πόρτες για μικρότερες εταιρείες και ερευνητικά ιδρύματα που προηγουμένως δεν μπορούσαν να ανταγωνιστούν λόγω περιορισμών πόρων.

Ωστόσο, αυτό δεν σημαίνει ότι η μεγάλη κλίμακα υπολογιστικών υποδομών γίνεται ξεπερασμένη. Η βιομηχανία μετατοπίζει την εστίασή της στην κλίμακα του χρόνου συναγωγής – πόσο χρόνο χρειάζεται ένα μοντέλο για να παράγει απαντήσεις. Όσο συνεχίζεται αυτή η τάση, σημαντικοί υπολογιστικοί πόροι θα είναι ακόμη απαραίτητοι, πιθανότατα ακόμη περισσότερο με την πάροδο του χρόνου.

Αλλά το DeepSeek έχει ουσιαστικά αλλάξει τη συζήτηση. Οι μακροπρόθεσμες επιπτώσεις είναι σαφείς: εισερχόμαστε σε μια εποχή όπου η καινοτόμος σκέψη και η αποτελεσματική χρήση των πόρων θα μπορούσαν να σημαίνουν περισσότερο από την απλή υπολογιστική δύναμη. Για την κοινότητα της τεχνητής νοημοσύνης, αυτό σημαίνει ότι πρέπει να εστιάσουμε όχι μόνο στους πόρους που έχουμε, αλλά και στο πώς τους χρησιμοποιούμε δημιουργικά και αποτελεσματικά.

Ο Alex McFarland είναι δημοσιογράφος και συγγραφέας του AI που εξερευνά τις τελευταίες εξελίξεις στην τεχνητή νοημοσύνη. Έχει συνεργαστεί με πολλές startups και εκδόσεις του AI σε όλο τον κόσμο.