Μοντέλα και πλατφόρμες AI
Η Spectro Cloud Εκκινεί το PaletteAI Inference Launchpad για Βοήθεια των Επιχειρήσεων να Ελέγχουν τα Κόστη των Token AI

Spectro Cloud έχει εκκινήσει το PaletteAI Inference Launchpad, μια τοπικά διαχειριζόμενη πλατφόρμα inference που σχεδιάστηκε για να βοηθήσει τις επιχειρήσεις να μειώσουν την εξάρτησή τους από εξωτερικές υπηρεσίες μοντέλων και να αποκτήσουν μεγαλύτερο έλεγχο над το αυξανόμενο κόστος των εργασιών τεχνητής νοημοσύνης.
Η εταιρεία αναφέρει ότι οι οργανισμοί μπορούν να μειώσουν τα εξωτερικά κόστη token έως και 70%, ανάλογα με το μείγμα εργασιών, την υποδομή και την επιλογή μοντέλων. Η Spectro Cloud έχει επίσης επεκτείνει την υποστήριξη του PaletteAI για υποδομή AMD, δίνοντας στους πελάτες μια ευρύτερη επιλογή από μονάδες επεξεργασίας γραφικών (GPU), inference runtimes και τεχνολογίες εξυπηρέτησης μοντέλων.
Οι ανακοινώσεις αντανακλούν μια ευρύτερη μετατόπιση στην επιχειρηματική τεχνητή νοημοσύνη. Όσο οι εταιρείες προχωρούν πέρα από την πειραματική χρήση και εφαρμόζουν την τεχνητή νοημοσύνη σε υπηρεσίες πελατών, ανάπτυξη λογισμικού, ανάλυση και εσωτερικές λειτουργίες, το κόστος επεξεργασίας εισόδων και εξόδων μοντέλων γίνεται ένα σημαντικό ζήτημα υποδομής.
Φέρνοντας την Εύρεση της Τεχνητής Νοημοσύνης Κοντά στα Δεδομένα της Επιχείρησης
Το PaletteAI Inference Launchpad είναι χτισμένο γύρω από μια τοπική προσέγγιση στην εύρεση. Αντί να στέλνει αυτόματα κάθε αίτηση σε εξωτερικά φιλοξενούμενα μοντέλα, οι οργανισμοί μπορούν να εκτελέσουν τις κατάλληλες εργασίες σε υποδομή που βρίσκεται στα δικά τους κέντρα δεδομένων, ιδιωτικές νεφώσεις, ελεγχόμενα περιβάλλοντα ή περιφερειακές τοποθεσίες.
Οι επιχειρήσεις μπορούν ακόμη να διατηρήσουν την πρόσβαση σε εξωτερικά φιλοξενούμενα μοντέλα για εργασίες που απαιτούν τις ικανότητές τους. Η πλατφόρμα προορίζεται να κατευθύνει αιτήσεις μεταξύ τοπικών και εξωτερικών μοντέλων με βάση παράγοντες όπως το κόστος, η απόδοση, οι απαιτήσεις διακυβέρνησης και η复잡ικότητα της εργασίας.
Αυτό το υβριδικό μοντέλο μπορεί να γίνει όλο και πιο σημαντικό καθώς οι οργανισμοί υιοθετούν μικρότερα και πιο εξειδικευμένα μοντέλα. Μια αίτηση υποστήριξης πελατών, μια εργασία ταξινόμησης εγγράφου ή μια εσωτερική ερώτηση γνώσεων μπορεί να μην απαιτεί την ίδια ικανότητα μοντέλου με προηγμένη σκέψη, σύνθετο κωδικοποίηση ή πολυμορφική ανάλυση.
Η διατήρηση των κατάλληλων εργασιών σε τοπικό επίπεδο μπορεί επίσης να μειώσει την καθυστέρηση μεταφέροντας την εύρεση κοντά στις εφαρμογές, τους χρήστες και τις πηγές δεδομένων. Για τους οργανισμούς που λειτουργούν σε ρυθμιζόμενους κλάδους, η τοπική επεξεργασία μπορεί να παρέχει μεγαλύτερο έλεγχο sobre το πού χειρίζονται ευαίσθητες πληροφορίες.
Η Χρήση Token Γίνεται Ένας Δείκτης Υποδομής
Τα token είναι οι μονάδες στις οποίες τα μοντέλα τεχνητής νοημοσύνης διαιρούν και επεξεργάζονται κείμενο, κώδικα και άλλες πληροφορίες. Κάθε πρόκληση και δημιουργημένη απάντηση καταναλώνει token, και πολλές εμπορικές υπηρεσίες μοντέλων χρεώνουν ανάλογα με τον αριθμό των token που επεξεργάζονται.
Αυτό σημαίνει ότι τα κόστη AI μπορούν να αυξηθούν γρήγορα καθώς τα συστήματα μεταβαίνουν από ελεγχόμενες δοκιμές σε εφαρμογές που εξυπηρετούν χιλιάδες υπαλλήλους ή πελάτες. Το πρόβλημα γίνεται ακόμη πιο περίπλοκο με τους एजέντες AI, οι οποίοι μπορεί να κάνουν επαναλαμβανόμενες κλήσεις μοντέλων, να ανακτούν πληροφορίες, να αξιολογούν αποτελέσματα και να χρησιμοποιούν εξωτερικά εργαλεία πριν ολοκληρώσουν μια εργασία.
Η έρευνα της Goldman Sachs αναμένεται ότι η μηνιαία κατανάλωση token AI θα αυξηθεί 24 φορές μεταξύ 2026 και 2030, φτάνοντας περίπου 120 quadrillion token το μήνα. Αυτή η προβλεπόμενη αύξηση οφείλεται στην επέκταση της υιοθέτησης επιχειρήσεων και την εμφάνιση περισσότερων αυτόνομων एजέντων AI.
Το Inference Launchpad αντιμετωπίζει αυτό το ζήτημα παρέχοντας στους ομάδες υποδομής εργαλεία για να μετρήσουν την κατανάλωση token, να καθορίσουν ποσοστούς και να εφαρμόσουν πολιτικές χρήσης. Αυτά τα ελέγχοι θα μπορούσαν να βοηθήσουν τις εταιρείες να κατανοήσουν ποια τμήματα, εφαρμογές και μοντέλα είναι υπεύθυνα για τις δαπάνες AI τους αντί να αντιμετωπίζουν την εύρεση ως μια απρόβλεπτη εξωτερική χρέωση υπηρεσίας.
Η μείωση 70% που αναφέρεται από την Spectro Cloud πρέπει να θεωρηθεί ως ένα πιθανό αποτέλεσμα και όχι ως εγγυημένη εξοικονόμηση. Τα πραγματικά οικονομικά θα εξαρτηθούν από το κόστος απόκτησης ή ενοικίασης GPU, τα ποσοστά χρησιμοποίησης, την κατανάλωση ενέργειας, την αποτελεσματικότητα μοντέλων, τον όγκο αιτήσεων και την τιμολόγηση των εξωτερικών παρόχων.
Τοπικά Μοντέλα Χωρίς την Εξάλειψη των Μοντέλων Frontier
Οι ικανότητες δρομολόγησης μοντέλων της πλατφόρμας σχεδιάστηκαν για να αποφευχθεί η ανάγκη των επιχειρήσεων να λάβουν μια απόφαση all-τοπική ή all-νεφελώδης.
Οι οργανισμοί μπορούν να χρησιμοποιήσουν μικρότερα τοπικά μοντέλα για προβλέψιμες ή ευαίσθητες εργασίες ενώ στέλνουν πιο απαιτητικές αιτήσεις σε μοντέλα frontier. Οι πολιτικές μπορούν επίσης να καθορίσουν ποια μοντέλα επιτρέπονται για συγκεκριμένα τμήματα, δικαιοδοσίες ή ταξινομήσεις δεδομένων.
Αυτό εισάγει τη διακυβέρνηση trực tiếp στο επίπεδο εύρεσης. Ένα χρηματοοικονομικό ίδρυμα, για παράδειγμα, θα μπορούσε να αποτρέψει την εξαγωγή ορισμένων πληροφοριών από ένα ελεγχόμενο περιβάλλον, ενώ θα επιτρέψει μη ευαίσθητες αιτήσεις να χρησιμοποιήσουν ένα εξωτερικό μοντέλο. Μια πολυεθνική εταιρεία θα μπορούσε να εφαρμόσει διαφορετικές κανόνες δρομολόγησης με βάση τις περιφερειακές απαιτήσεις δεδομένων.
Η Spectro Cloud έχει τοποθετήσει την επιλογή μοντέλων και τη διακυβέρνηση ως μέρος της ευρύτερης στρατηγικής διαχείρισης υποδομής του PaletteAI. Η πλατφόρμα υποστηρίζει κοινές περιβάλλοντες GPU, ρόλους πρόσβασης, ποσοστούς πόρων και ελέγχους επιπέδου μισθωτή που προορίζονται να επιτρέψουν σε πολλαπλά τμήματα να χρησιμοποιήσουν την ίδια υποδομή χωρίς να έχουν ανεμπόδιστη πρόσβαση στα υποκείμενα συστήματα.
Επεκτάσεις Υποστήριξης για Υποδομή AMD AI
Παράλληλα με το Inference Launchpad, η Spectro Cloud ανακοίνωσε μια ευρύτερη υποστήριξη για περιβάλλοντα AI που βασίζονται σε AMD.
Η ενσωμάτωση καλύπτει τις GPU AMD, τον AMD GPU Operator, το λογισμικό ROCm και τις υπηρεσίες AMD Inference Microservices, γνωστές ως AIMs. Αυτά τα компонέντα αντιμετωπίζουν διαφορετικά επίπεδα της υποδομής που απαιτείται για την λειτουργία μοντέλων AI σε παραγωγή.
Ο AMD GPU Operator απλοποιεί τη διαμόρφωση και τη διαχείριση των επιταχυντών AMD Instinct μέσα σεクラστερ Kubernetes. Το ROCm παρέχει το υποκείμενο ανοιχτό λογισμικό, συμπεριλαμβανομένων οδηγών, βιβλιοθηκών, χρόνων εκτέλεσης και εργαλείων ανάπτυξης που χρησιμοποιούνται για την εκτέλεση εργασιών AI και υψηλής απόδοσης υπολογιστών σε υλικό AMD.
Οι AIMs παρέχουν стандαρδικές υπηρεσίες inference microservices για την εξυπηρέτηση μοντέλων σε GPU AMD Instinct. Σκοπός τους είναι να συσκευάσουν βελτιστοποιημένα μοντέλα και υποστηρικτικό λογισμικό σε υπηρεσίες που μπορούν να αναπτυχθούν, μειώνοντας κάποια από το έργο ενσωμάτωσης που απαιτείται συνήθως για να μεταφερθεί ένα μοντέλο σε παραγωγή.
Για τους πελάτες επιχειρήσεων, αυτή η επέκταση υποστήριξης θα μπορούσε να κάνει πιο εύκολη την λειτουργία περιβαλλόντων GPU μεικτής τεχνολογίας αντί να χτίζουν ξεχωριστές διαδικασίες διαχείρισης για υποδομή NVIDIA (NVDA ) και AMD.












