Leader di pensiero
Non costruire il tuo Enterprise AI sull’accesso preso in prestito

Tutte le applicazioni AI e i deploy aziendali sono stati costruiti fino ad ora con l’assunzione che l’accesso ai modelli AI di frontiera rimarrà possibile e quasi illimitato. Quello era il giusto atteggiamento, fino ad ora. La tendenza era che le nuove capacità dei modelli di frontiera venivano commodificate o open-source entro 6 mesi e quindi l’attenzione era solo sull’understanding delle future capacità il più presto possibile. Le aziende, i team o le persone che potevano costruire prodotti comprendendo e adattandosi alle nuove capacità di frontiera il più presto possibile per costruire applicazioni stavano vincendo. Tuttavia, diversi segnali potrebbero indicare che questa era si fermerà presto. La decisione del Dipartimento del Commercio degli Stati Uniti di limitare l’accesso ai modelli Fable e Mythos di Anthropic ai cittadini statunitensi è stato solo un primo segnale. Tuttavia, quella restrizione è stata successivamente revocata dopo la coordinazione con Anthropic, mostrando quanto velocemente le condizioni di accesso possano cambiare e la necessità di sistemi AI aziendali adattabili.
I quattro motivi per cui l’accesso ai modelli di frontiera non è garantito
La mentalità di costruire solo per i modelli di frontiera potrebbe smettere di essere quella giusta se la loro disponibilità smette di essere garantita. Ci sono almeno quattro motivi per cui potrebbe accadere. In primo luogo, l’economia dell’AI di frontiera si basa su prezzi sovvenzionati che non dureranno. I recenti preparativi per l’IPO di OpenAI e Anthropic li hanno costretti a aprire i libri e hanno chiaramente rivelato il costo reale dei servizi AI attualmente sponsorizzati, che potrebbe non essere economicamente sostenibile dopo l’IPO. Si dice che l’abbonamento privato da 200 dollari offerto da Anthropic costi in realtà diverse migliaia di dollari all’azienda. Pertanto, si prevede che i prezzi dei token continueranno ad aumentare e l’era dell’accesso ai modelli di frontiera a prezzi artificialmente bassi finirà.
In secondo luogo, i modelli di frontiera non stanno diventando più economici da eseguire. A differenza del calcolo classico, dove la legge di Moore riduceva costantemente il costo di qualsiasi operazione nel tempo, l’AI non sembra seguire questa curva. I modelli stanno diventando più grandi, ma anche più intensivi in termini di calcolo. Tutti i nostri ingegneri hanno esaurito i crediti Claude entro 10 minuti dopo la (temporanea) release di Fable 5. Ciò potrebbe suggerire che i prossimi modelli di frontiera richiederanno più token, più calcolo e più infrastrutture con ogni iterazione.
In terzo luogo, sembra che sempre meno giocatori stiano realmente rimanendo nella corsa per i veri modelli di frontiera. Mistral, un tempo la speranza dell’Europa per competere nel campo dei modelli di frontiera, ha rivisto le sue ambizioni per diventare un modesto follower. I modelli cinesi sono veloci follower, ma continuano a rimanere indietro rispetto alle migliori release dei laboratori leader.
Infine, i modelli di frontiera potrebbero essere semplicemente troppo pericolosi per essere utilizzati in ogni applicazione. Non utilizziamo reattori nucleari miniaturizzati nelle auto, in parte perché questo campo è altamente regolamentato e pericoloso. Gli esperimenti di Anthropic mostrano che è molto difficile tenere un modello di frontiera sotto controllo per garantire che rimanga innocuo mentre preserva le sue capacità. Ciò potrebbe essere una lezione a lungo termine e una ragione sottostante alla regolamentazione degli Stati Uniti su Fable 5. In ogni caso, è molto probabile che i modelli di frontiera saranno trattati come asset strategici dagli stati e quindi non saranno più disponibili come lo sono ora.
Pertanto, potremmo stare entrando in un mondo in cui i costi dei token contano e in cui i modelli di frontiera non sono disponibili per tutte le applicazioni in tutti i paesi.
Entra il livello di applicazione
In un mondo in cui non ogni chiamata al modello va al miglior modello disponibile, come possiamo ancora garantire che ogni compito venga risolto in modo affidabile e con il miglior livello di prestazione possibile? La risposta potrebbe giacere nel cosiddetto “livello di applicazione”.
Il CEO di NVIDIA, Jensen Huang, ha descritto l’AI come una torta a 5 strati: energia, chip, centri dati, modelli e applicazioni. Sostiene che il livello di applicazione sia sia il più importante che quello ancora largamente assente.
Per alcune applicazioni, come i chatbot, questo livello è estremamente sottile – essenzialmente solo un’interfaccia di chat. In altri, come le applicazioni industriali e ingegneristiche avanzate, è molto più importante e critico. È il livello determinante nella catena del valore. Poiché l’accesso a un modello di frontiera specifico non sarà più garantito, il ruolo del livello di applicazione sarà quello di uniformare i risultati tra i modelli e di mantenere i costi dei token sotto controllo.
Concretamente, se voglio eseguire un compito complesso e critico come ridisegnare la mia catena di produzione per un nuovo modello di aereo, chiederò a un potente modello di frontiera di aiutarmi. Il modello potrebbe essere in grado di capire come farlo da solo, costruire uno strumento di pianificazione per me e comunicare il risultato a tutti i miei team. Tuttavia, se cambio modello con uno più capace, meno costoso o di un fornitore diverso, potrei perdere prestazioni o perdere coerenza nel mio output finale. In molti casi pratici in ambienti aziendali, questa imprevedibilità non è accettabile. È qui che il ruolo del livello di applicazione è critico: piuttosto che lasciare che il modello operi in uno spazio aperto e affidarsi alle sue capacità grezze per produrre il risultato, il livello di applicazione definisce un chiaro canovaccio, un insieme limitato di azioni disponibili e un perimetro definito all’interno del quale può operare. Il modello non è più chiamato a capire tutto da solo, gli viene dato un canovaccio ben definito che migliorerà notevolmente la probabilità che qualsiasi modello si esibisca bene.
Per quanto riguarda i costi, il mio modello potrebbe anche decidere di eseguire azioni a basso livello per raggiungere il suo obiettivo. Potrebbe riscrivere un algoritmo di pianificazione da zero, costruire una nuova interfaccia per me per visualizzare il suo lavoro o addirittura sviluppare un nuovo solver di ottimizzazione. Ma ciò potrebbe essere incredibilmente costoso in termini di token, mentre linee guida o strumenti pre-costruiti potrebbero aiutare il modello a raggiungere lo stesso risultato con meno token. Questo è il ruolo del livello di applicazione. La buona notizia è che i modelli tendono a essere pigri e cercano percorsi più brevi, quindi potremmo non doverli limitare troppo una volta che hanno accesso al giusto set di abilità, strumenti e risorse di calcolo.
In breve, un buon livello di applicazione fornirà abilità, strumenti e linee guida chiare per far funzionare il modello in modo affidabile e costo-efficiente. Oltre a migliorare le prestazioni e a controllare i costi dei token, ciò significa anche che la dipendenza da un modello specifico diminuisce. Se si incorpora la propria intelligenza nel livello di applicazione piuttosto che nel modello stesso, il modello sottostante diventa intercambiabile. In molti casi, potrebbe essere ciò che fa la differenza tra AI aziendale sperimentale e scalabile.
Appello all’azione per i leader aziendali
In tutti i settori, incontriamo ogni giorno leader aziendali che lavorano per stabilire la loro pila AI. La maggior parte delle aziende inizia con uno o più fornitori di modelli di frontiera per stabilire il loro necessario livello di modello nella loro pila. Per il livello di applicazione, si affidano a strumenti costruiti in casa, capacità completamente acquistate o una combinazione di entrambi.
Il divieto di Anthropic è stato un promemoria che questa pila può essere interrotta da un giorno all’altro. Le architetture delle aziende devono essere pronte per quando accadrà di nuovo. Per essere pronti, le aziende devono considerare la velocità di deploy, ma anche costruire soluzioni che mitigano gli effetti dei cambiamenti del modello e dei costi dei token in aumento. Non è un percorso facile, ma il mio consiglio sarebbe:
- Investire strategicamente e presto nel livello di applicazione. Le aziende che perdono il treno avranno sempre un gap rispetto ai primi adottanti
- Rendere l’agnosticismo del modello un principio di progettazione, non un workaround
- Il costo di switching dei modelli non dovrebbe essere una questione esistenziale per le vostre operazioni
- Collaborare con aziende specializzate che possano benchmarkare i modelli, validare le prestazioni in più setup e aiutare a garantire garanzie di prestazione a lungo termine.
Le aziende che vinceranno il gioco nella prossima fase dell’AI aziendale non sono necessariamente quelle con accesso ai migliori modelli, ma quelle che avranno costruito il livello giusto intorno a loro. Le aziende che possono benchmarkare i modelli, validare le prestazioni in più setup e aiutare a garantire garanzie di prestazione a lungo termine saranno quelle che vinceranno il gioco.












