Leader di pensiero

LLM personalizzati per ogni azienda? DeepSeek ci mostra la strada

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

C’era una volta, il richiamo tecnologico era “telefoni cellulari per tutti” – e in effetti le comunicazioni mobili hanno rivoluzionato il business (e il mondo). Oggi, l’equivalente di quel richiamo è dare a tutti l’accesso alle applicazioni di intelligenza artificiale. Ma il vero potere dell’IA risiede nell’utilizzarla per soddisfare le esigenze specifiche delle aziende e delle organizzazioni. Il percorso segnato dal startup cinese DeepSeek dimostra come l’IA possa essere utilizzata da tutti, soprattutto da coloro che hanno budget limitati, per soddisfare le loro esigenze specifiche. In effetti, l’avvento di soluzioni di IA a basso costo promette di cambiare il modello profondamente radicato di soluzioni di IA spesso fuori portata per molte piccole aziende e organizzazioni a causa dei requisiti di costo.

I modelli di linguaggio di grandi dimensioni (LLM) sono – o erano – un’impresa costosa, che richiede l’accesso a grandi quantità di dati, un gran numero di potenti computer per elaborare i dati e tempo e risorse investite nella formazione del modello. Ma queste regole stanno cambiando. Operando con un budget ridotto, DeepSeek ha sviluppato il proprio LLM e un’applicazione di tipo ChatGPT per le query – con un investimento molto inferiore a quello delle società americane ed europee. L’approccio di DeepSeek apre una finestra sullo sviluppo di LLM per le organizzazioni più piccole che non hanno miliardi da spendere. In effetti, il giorno in cui la maggior parte delle piccole organizzazioni potrà sviluppare i propri LLM per soddisfare le proprie esigenze specifiche non è lontano, fornendo solitamente una soluzione più efficace rispetto ai LLM generali come ChatGPT.

Mentre il dibattito sulla vera entità del costo di DeepSeek continua, non è solo il costo che lo distingue e modelli simili: è il fatto che si sia basato su chip meno avanzati e su un approccio più focalizzato alla formazione. In quanto società cinese soggetta a restrizioni alle esportazioni degli Stati Uniti, DeepSeek non ha potuto accedere ai chip Nvidia avanzati generalmente utilizzati per l’elaborazione dei dati necessaria per lo sviluppo di LLM e si è quindi dovuta basare su chip Nvidia (NVDA ) H-800 meno potenti, che non possono elaborare i dati altrettanto velocemente o efficientemente.

Per compensare la mancanza di potenza, DeepSeek ha adottato un approccio diverso, più focalizzato e diretto, allo sviluppo del proprio LLM. Invece di lanciare montagne di dati contro un modello e affidarsi alla forza di calcolo per etichettare e applicare i dati, DeepSeek ha ridotto la formazione, utilizzando una piccola quantità di dati di alta qualità “cold-start” e applicando l’apprendimento per rinforzo iterativo, con l’algoritmo che applica i dati a diversi scenari e ne apprende. Questo approccio focalizzato consente al modello di apprendere più velocemente, con meno errori e meno sprechi di potenza di calcolo.

Allo stesso modo in cui i genitori possono guidare i movimenti specifici di un bambino, aiutandolo a rotolare con successo per la prima volta – invece di lasciarlo scoprire da solo o insegnargli una varietà più ampia di movimenti che potrebbe aiutare a rotolare – gli scienziati dei dati che formano questi modelli di IA più focalizzati si concentrano su ciò che è più necessario per determinati compiti e risultati. Tali modelli non hanno probabilmente un’applicazione affidabile altrettanto ampia come i LLM più grandi come ChatGPT, ma possono essere affidati per applicazioni specifiche e portarle a termine con precisione e efficienza. Anche i critici di DeepSeek ammettono che il suo approccio snello allo sviluppo ha aumentato notevolmente l’efficienza, consentendogli di fare di più con molto meno.

Questo approccio consiste nel fornire all’IA i migliori input in modo che possa raggiungere i suoi obiettivi nel modo più intelligente e efficiente possibile e può essere prezioso per qualsiasi organizzazione che desideri sviluppare un LLM per le proprie esigenze e compiti specifici. Un tale approccio è sempre più prezioso per le piccole aziende e le organizzazioni. Il primo passo consiste nell’iniziare con i dati giusti. Ad esempio, un’azienda che desidera utilizzare l’IA per aiutare i propri team di vendita e marketing dovrebbe formare il proprio modello su un set di dati selezionati con cura che si concentra su conversazioni di vendita, strategie e metriche. Ciò mantiene il modello dall’impiegare tempo e potenza di calcolo su informazioni non pertinenti. Inoltre, la formazione deve essere strutturata in fasi, assicurandosi che il modello padroneggi ogni compito o concetto prima di passare al successivo.

Anche questo ha paralleli nell’allevare un bambino, come ho imparato io stesso da quando sono diventato madre alcuni mesi fa. In entrambi gli scenari, un approccio guidato e passo dopo passo evita di sprecare risorse e riduce l’attrito. Infine, un tale approccio con sia i bambini umani che i modelli di IA porta a un miglioramento iterativo. Man mano che il bambino cresce o il modello apprende di più, le sue capacità migliorano. Ciò significa che i modelli possono essere raffinati e migliorati per gestire meglio le situazioni del mondo reale.

Questo approccio mantiene i costi bassi, impedendo che i progetti di IA diventino un drenaggio di risorse, rendendoli più accessibili ai team e alle organizzazioni più piccoli. Ciò porta anche a una migliore performance dei modelli di IA più velocemente; e, poiché i modelli non sono sovraccarichi di dati superflui, possono anche essere adattati per adattarsi a nuove informazioni e alle esigenze aziendali in evoluzione – un aspetto chiave nei mercati competitivi.

L’arrivo di DeepSeek e del mondo di IA a basso costo e più efficiente – sebbene abbia inizialmente diffuso il panico nel mondo dell’IA e nei mercati azionari – è nel complesso uno sviluppo positivo per il settore dell’IA. La maggiore efficienza e i minori costi dell’IA, almeno per alcune applicazioni focalizzate, porteranno alla fine a un uso più ampio dell’IA in generale, trainando la crescita per tutti, dagli sviluppatori ai produttori di chip agli utenti finali. In effetti, DeepSeek illustra il paradosso di Jevons – dove una maggiore efficienza porterà probabilmente a un uso maggiore di una risorsa, non minore. Poiché questa tendenza sembra destinata a continuare, le piccole aziende che si concentrano sull’utilizzo dell’IA per soddisfare le proprie esigenze specifiche saranno anche meglio posizionate per la crescita e il successo. In effetti, DeepSeek illustra il paradosso di Jevons – dove una maggiore efficienza porterà probabilmente a un uso maggiore di una risorsa, non minore. Come questa tendenza sembra destinata a continuare, le piccole aziende che si concentrano sull’utilizzo dell’IA per soddisfare le proprie esigenze specifiche saranno anche meglio posizionate per la crescita e il successo. In effetti, DeepSeek illustra il paradosso di Jevons – dove una maggiore efficienza porterà probabilmente a un uso maggiore di una risorsa, non minore. Come questa tendenza sembra destinata a continuare, le piccole aziende che si concentrano sull’utilizzo dell’IA per soddisfare le proprie esigenze specifiche saranno anche meglio posizionate per la crescita e il successo.

Stav Levi-Neumark è l'amministratore delegato e co-fondatore di Alta e un esperto in gestione dei prodotti e crescita dei ricavi. In precedenza, è stato uno dei primi dipendenti di Monday.com, dove ha aiutato a sviluppare "BigBrain", uno strumento di business intelligence interno utilizzato per le operazioni quotidiane dell'azienda. Stav si è laureato in scienze dell'informazione e statistica all'Università Ebraica di Gerusalemme.