Leader di pensiero

Spostare i Modelli Linguistici di Grande Scala (LLM) nelle Applicazioni Commerciali del Mondo Reale

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

I modelli linguistici di grande scala sono ovunque. Ogni conversazione con i clienti o ogni pitch con i venture capitalisti coinvolge domande su quanto sia pronta la tecnologia LLM e come guiderà le applicazioni future. Ho trattato alcuni pattern su questo argomento nel mio precedente post. Qui parlerò di alcuni pattern del mondo reale per un’applicazione nel settore farmaceutico su cui ha lavorato Persistent Systems.

Modelli Linguistici di Grande Scala e Punti di Forza Core

I LLM sono bravi a comprendere il linguaggio, è il loro forte. Il pattern più comune che stiamo vedendo con le applicazioni è la generazione aumentata di recupero (RAG), dove la conoscenza è compilata esternamente da fonti di dati e fornita nel contesto come prompt per il LLM per parafrasare una risposta. In questo caso, meccanismi di ricerca super-veloci come i database vettoriali e i motori basati su Elasticsearch servono come prima linea di ricerca. Quindi i risultati della ricerca vengono compilati in un prompt e inviati al LLM principalmente come chiamata API.

Un altro pattern è la generazione di una query su dati strutturati alimentando il LLM con un modello di dati come prompt e una specifica query dell’utente. Questo pattern potrebbe essere utilizzato per sviluppare un’interfaccia “parla con i tuoi dati” avanzata per database SQL come Snowflake, nonché per database grafici come Neo4j.

Sfruttare i Pattern LLM per Ottenere Informazioni del Mondo Reale

Persistent Systems ha recentemente esaminato un pattern per Blast Motion, un’azienda di telemetria sportiva (analisi del movimento per il baseball, il golf, ecc.), dove abbiamo analizzato dati di serie temporali di riassunti dei giocatori per ottenere raccomandazioni.

Per applicazioni più complesse, spesso dobbiamo concatenare le richieste LLM con l’elaborazione tra le chiamate. Per un’azienda farmaceutica, abbiamo sviluppato un’app intelligente per la selezione dei pazienti per i trial clinici in base ai criteri estratti dal documento del trial clinico. Qui abbiamo utilizzato un approccio a catena LLM. In primo luogo, abbiamo sviluppato un LLM per leggere il documento del trial in formato PDF e utilizzare il pattern RAG per estrarre i criteri di inclusione ed esclusione.

Per questo, è stato utilizzato un LLM relativamente semplice come GPT-3.5-Turbo (ChatGPT). Quindi abbiamo combinato queste entità estratte con il modello di dati del database SQL dei pazienti in Snowflake, per creare un prompt. Questo prompt viene alimentato con un LLM più potente come GPT4, il che ci fornisce una query SQL per filtrare i pazienti, pronta per essere eseguita su Snowflake. Poiché utilizziamo la catena LLM, possiamo utilizzare più LLM per ogni passaggio della catena, il che ci consente di gestire i costi.

Attualmente, abbiamo deciso di mantenere questa catena deterministica per un miglior controllo. Ciò significa che abbiamo deciso di avere più intelligenza nelle catene e mantenere l’orchestrazione molto semplice e prevedibile. Ogni elemento della catena è un’applicazione complessa di per sé, che richiederebbe alcuni mesi per essere sviluppata nei giorni pre-LLM.

Alimentare Casi d’Uso più Avanzati

Per un caso più avanzato, potremmo utilizzare agenti come ReAct per alimentare il LLM e creare istruzioni passo-passo da seguire per una specifica query dell’utente. Ciò richiederebbe naturalmente un LLM di alta gamma come GPT4 o Cohere o Claude 2. Tuttavia, allora c’è il rischio che il modello prenda un passaggio errato che dovrà essere verificato utilizzando guardrail. Questo è un compromesso tra spostare l’intelligenza in collegamenti controllabili della catena o rendere l’intera catena autonoma.

Oggi, mentre ci abituiamo all’era dell’Intelligenza Artificiale Generativa per il linguaggio, l’industria inizia ad adottare applicazioni LLM con catene prevedibili. Man mano che questa adozione cresce, presto inizieremo a sperimentare con più autonomia per queste catene tramite agenti. Questo è ciò di cui parla il dibattito sull’AGI e siamo interessati a vedere come tutto ciò si evolve nel tempo.

Dattaraj Rao, Chief Data Scientist at Persistent Systems, è l'autore del libro “Keras to Kubernetes: The Journey of a Machine Learning Model to Production.” At Persistent Systems, Dattaraj guida il laboratorio di ricerca sull'AI che esplora algoritmi all'avanguardia in Computer Vision, Natural Language Understanding, programmazione probabilistica, Reinforcement Learning, Explainable AI, ecc. e dimostra l'applicabilità nei settori sanitari, bancari e industriali. Dattaraj ha 11 brevetti in Machine Learning e Computer Vision.