Interviste

Rob May, CEO e Co-Fondatore di NeuroMetric – Intervista

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Rob May, CEO e Co-Fondatore di NeuroMetric, è un imprenditore e investitore esperto con una lunga esperienza che copre il cloud computing, le startup di intelligenza artificiale e il venture capital, attualmente alla guida di Neurometric AI e anche Managing Director di HalfCourt Ventures, dove ha finanziato oltre 100 aziende tecnologiche. Oltre ai suoi ruoli operativi e di investimento, ha co-fondato la comunità di innovatori di intelligenza artificiale e in precedenza ha costruito e ceduto aziende come Backupify, riflettendo una profonda esperienza in più cicli tecnologici. È anche ampiamente noto per la sua lunga serie di newsletter Investing in AI, che ha iniziato a scrivere oltre un decennio fa per analizzare le tendenze emergenti di intelligenza artificiale, strategie di investimento e cambiamenti di mercato, e che è poi evoluta in una piattaforma per approfondire le conoscenze sul rapido evolversi del panorama di intelligenza artificiale.

NeuroMetric AI si concentra sulla risoluzione di una delle sfide più critiche nell’intelligenza artificiale di oggi: il costo e l’efficienza dell’inferenza su larga scala. La piattaforma valuta dinamicamente i carichi di lavoro di intelligenza artificiale e applica strategie di ottimizzazione – come la combinazione di modelli più piccoli e specializzati con tecniche di calcolo avanzate nel tempo di test – per migliorare le prestazioni riducendo drasticamente i costi, consentendo alle aziende di ottenere un miglior ritorno sugli investimenti dai dispiegamenti di intelligenza artificiale. Orchestrandosi i carichi di lavoro e adattando l’utilizzo dei modelli a compiti specifici, Neurometric mira a rendere i sistemi di intelligenza artificiale significativamente più veloci e più accessibili, posizionandosi all’intersezione dell’infrastruttura di intelligenza artificiale, dell’efficienza e della scalabilità nel mondo reale mentre le organizzazioni passano dall’esperimentazione alla produzione.

Avete fondato e guidato diverse aziende di intelligenza artificiale, investito in oltre 100 startup attraverso HalfCourt Ventures e in precedenza costruito e ceduto Backupify. Come hanno plasmato queste esperienze la vostra prospettiva su dove si crea valore duraturo nell’intelligenza artificiale oggi?

Credo che la maggior parte degli investitori e degli imprenditori stiano inseguendo barriere protettive a breve termine – cose che sembrano lacune ovvie nel mercato oggi ma lacune che saranno rapidamente chiuse dalle aziende esistenti. L’intelligenza artificiale renderà l’esecuzione di un’attività commerciale una serie di decisioni probabilistiche. Le aziende in cui investire o costruire sono quelle che hanno le migliori stime complessive di quelle probabilità. A volte ciò derivará dall’integrazione verticale e a volte dalla scala orizzontale – dipende dal mercato.

Nella vostra newsletter Investing in AI, avete sostenuto che i modelli stanno diventando sempre più interscambiabili e che la vera difensibilità si sposta verso lo strato dei sistemi. Cosa sembra una vera “barriera sistemica” nella pratica?

Una vera barriera sistemica ha tre proprietà: si accumula con l’uso, è specifica per il cliente e non può essere replicata sostituendo un modello migliore.

La difensibilità vive in ciò che chiamo un “Sistema di Contesto” – un’architettura integrata che collega i modelli di base a tutto ciò che rende un’azienda unica: i suoi dati, i suoi flussi di lavoro, le sue conoscenze di dominio, la sua storia decisionale. Il sistema cattura il segnale da ogni interazione – quali modelli hanno successo in quali compiti, dove la latenza è importante, quali modelli aziendali specifici emergono – e li alimenta per migliorare se stesso.

Il punto chiave è che ciò crea una ruota di mulino moltiplicativa, non additiva. Non si sta solo accumulando un registro di ricerca delle decisioni passate. Si sta generando un segnale di formazione che produce modelli specializzati che migliorano il routing, che catturano dati più preziosi. La barriera si allarga con ogni inferenza.

Nella pratica, una barriera sistemica sembra un’integrazione profonda del flusso di lavoro in cui i costi di commutazione non riguardano le API – riguardano la riscrittura della logica aziendale. Sembra un contesto proprietario che nessun concorrente può replicare perché è stato generato attraverso mesi di utilizzo in produzione all’interno di una specifica azienda. E sembra un ciclo di specializzazione continuo in cui il sistema diventa significativamente migliore per quel cliente in modi che un fornitore di modelli generici non potrà mai fare.

L’era dei modelli ci ha dato la capacità grezza. L’era dei sistemi è dove quella capacità diventa valore nel mondo reale.

Come dovrebbero le aziende pensare alla costruzione di una strategia multi-modello, inclusi la logica di routing, i percorsi di escalation e la valutazione continua, invece di affidarsi a un singolo modello all’avanguardia?

La prima cosa che le aziende devono interiorizzare è che “usare il miglior modello” è una strategia perdente su larga scala. È equivalente a eseguire ogni query attraverso il proprio ingegnere più anziano. È costoso, è lento e – contrariamente all’intuizione – spesso non produce i migliori risultati.

Questo porta a ciò che chiamo la Frontiera Irregolare dell’Inferenza: le prestazioni del modello sono specifiche del compito e imprevedibili. I modelli all’avanguardia perdono contro modelli più piccoli e specializzati in compiti specifici tutto il tempo. Abbiamo visto sistemi composti multi-modello raggiungere il 72,7% di accuratezza in compiti CRM dove i modelli all’avanguardia hanno segnato il 58%. La superficie delle prestazioni non correla in modo netto con il numero di parametri. Quindi la vera domanda non è “quale modello è il migliore?” – è “quale modello è il migliore per questo compito specifico?”

Quella riformulazione è la base di una vera strategia multi-modello. Ecco come direi alle aziende di pensarci in tre strati.

La logica di routing inizia con la mappatura del paesaggio dell’inferenza. Censire ogni punto nel sistema in cui viene effettuata una chiamata LLM e, per ognuno, documentare il tipo di compito, la complessità di input/output, i requisiti di latenza, la soglia di accuratezza e il volume di chiamate. Ciò fornisce una mappa di calore. Si scoprirà rapidamente che la maggior parte del volume è costituito da lavoro ad alta frequenza e a portata ristretta – classificazione, estrazione di entità, routing di intenti, generazione di modelli – dove un modello più piccolo e fine-tunato corrisponde o supera il modello all’avanguardia a una frazione del costo. Riservare le costose chiamate all’avanguardia per i compiti che richiedono realmente un ragionamento complesso. Un agente che effettua 50 chiamate per compito non ha bisogno di GPT-4 per tutte e 50.

I percorsi di escalazione sono sulla costruzione di fallback intelligenti, non solo di failover. Il sistema deve riconoscere quando un modello più piccolo restituisce risultati a bassa fiducia e escalare a un modello più capace – o a una combinazione di modello-strategia completamente diversa. È qui che entrano in gioco le strategie di calcolo nel tempo di test. A volte la risposta giusta non è un modello più grande – è lo stesso modello con catena di pensiero, ricerca a fascio o campionamento del miglior N. La configurazione ottimale cambia non solo per modello, ma anche per l’algoritmo di pensiero che lo si abbina.

La valutazione continua è il pezzo che la maggior parte delle aziende perde completamente, ed è dove emerge la vera difensibilità. La selezione del modello non è una decisione una tantum – è un problema di ottimizzazione continuo. I nuovi modelli vengono rilasciati costantemente, i casi d’uso evolvono e le prestazioni peggiorano in modi che falliscono silenziosamente. Non si saprà che il proprio bot di servizio clienti ha dato una risposta peggiore del 40% perché si è utilizzato il modello sbagliato per quel tipo di query – si vedrà solo la perdita di clienti tre mesi dopo. È necessario avere un’infrastruttura che misuri continuamente cosa funziona realmente attraverso combinazioni di modello-compito e regoli il routing in base ai dati di prestazione reali, non ai benchmark.

Il motivo per cui la maggior parte delle aziende non ha fatto questo passaggio è che nessuno viene licenziato per aver scelto il modello all’avanguardia – è il “nessuno viene licenziato per aver comprato IBM” dell’intelligenza artificiale. L’ecosistema dei fornitori spinge l’avanguardia perché lì sono i margini. E l’infrastruttura di orchestrazione richiesta per eseguire realmente un’architettura multi-modello – logica di routing, meccanismi di fallback, gestione dei modelli, osservabilità – semplicemente non esiste nella maggior parte delle aziende. Sono bloccate in un optimum locale in cui i costi di commutazione e l’incertezza del multi-modello sembrano più alti del sovraccarico continuo sull’inferenza all’avanguardia.

Quali sono gli errori più grandi che vedete le aziende commettere quando passano da piloti di intelligenza artificiale a sistemi di produzione di livello?

Assumono che le loro scelte possano essere statiche e durature. In realtà, ogni livello dello stack tecnologico per l’intelligenza artificiale sta cambiando rapidamente. Le aziende devono prendere decisioni che forniscono opzionalità e flessibilità.

In quali tipi di flussi di lavoro avete visto modelli più piccoli e specifici del compito superare i grandi modelli all’avanguardia, e perché ciò è strategicamente importante?

Li abbiamo visti quasi in ogni compito di lavoro quotidiano comune – cose come la contabilità di base, la sintesi di testo, l’estrazione di entità da vari documenti. Abbiamo esplorato SLM per centinaia di compiti di lavoro e vincono quasi sempre se il problema è strutturato correttamente.

Avete scritto del calo del costo marginale di implementazione dell’intelligenza artificiale in nuovi casi d’uso. Come ciò sposta la lungimiranza economica dell’adozione di intelligenza artificiale per le aziende?

La narrazione della bolla presume che i ricavi di intelligenza artificiale richiedano investimenti di ricerca e sviluppo proporzionali in nuovi modelli. Non è così. I modelli sono stati costruiti. L’infrastruttura esiste. Ogni caso d’uso aggiuntivo è un prompt, una connessione di dati, forse un po’ di fine-tuning leggero – non un’altra corsa di formazione da 100 milioni di dollari. La curva del costo marginale si piega verso il basso mentre la piattaforma matura.

Questo è l’opposto delle ferrovie o delle telecomunicazioni, dove ogni nuovo miglio di binario era costoso. Nell’intelligenza artificiale, costruire il motore è stato costoso. Collegare le cose al motore è economico e diventa sempre più economico – i costi di inferenza sono scesi approssimativamente di 1.000 volte in due anni. La domanda per le aziende non è se l’intelligenza artificiale si ripaga. È quanti casi d’uso possono essere impilati sulla stessa infrastruttura prima che la curva dei ricavi superi la curva dei costi.

Quali segnali dovrebbero utilizzare i team tecnici per determinare quando passare a modelli diversi, effettuare il fine-tuning o costruire modelli specializzati per piccoli compiti?

I segnali non sono necessariamente tecnici. Sono più guidati dalle prestazioni o economicamente guidati. Ad esempio, passare a un modello o effettuare il fine-tuning di un modello o costruire un SLM personalizzato potrebbero tutti funzionare. La decisione dipende da ciò per cui si sta ottimizzando – se per la latenza o per il costo, con quale frequenza il compito viene eseguito e quanto tempo ci vuole per costruire e distribuire ogni soluzione.

Come progettare paratie, monitoraggio e governance in modo che scalino effettivamente con l’utilizzo invece di diventare un collo di bottiglia?

L’errore che la maggior parte delle aziende commette è trattare la governance come un checkpoint – uno strato di revisione manuale fissato sopra i flussi di lavoro di intelligenza artificiale. Ciò non scala. Diventa il collo di bottiglia nel momento in cui l’utilizzo aumenta.

La governance deve essere incorporata nello strato di orchestrazione stesso. Quando la vostra infrastruttura di routing già valuta ogni chiamata di inferenza – quale modello, quale compito, quale livello di fiducia – aggiungere paratie è un costo marginale, non un nuovo sistema. Lo stesso livello che decide quale modello gestisce una query può applicare le politiche: filtro PII prima della chiamata, convalida dell’output dopo, tracce di audit catturate automaticamente, allocazione dei costi per dipartimento.

Il punto chiave è che le aziende non falliscono all’interno dei sistemi di intelligenza artificiale. Falliscono tra di essi – nelle consegne, nelle escalation e nelle eccezioni. La governance che scala sembra un piano di controllo che rende ogni azione di intelligenza artificiale sicura, verificabile e ripetibile come sottoprodotto dell’esecuzione, non un ostacolo ad essa.

Avete paragonato il paesaggio dell’intelligenza artificiale di oggi al passaggio dalle mainframe ai PC. Cosa significa questa decentralizzazione per le startup che costruiscono nello strato dei sistemi?

Siamo nella fase mainframe dell’intelligenza artificiale proprio adesso. I grandi modelli di intelligenza artificiale centralizzati di OpenAI, Anthropic e Google (GOOGL ) erano necessari per focalizzare gli sforzi e dimostrare cosa poteva fare l’intelligenza artificiale. Quella fase ha funzionato. Le capacità sono ben comprese. Ma proprio come il calcolo non è rimasto centralizzato, l’intelligenza artificiale non lo sarà. Stiamo entrando nell’era del PC – un ecosistema decentralizzato in cui modelli più piccoli e specializzati eseguono il lavoro più vicino al luogo di lavoro.

I dati di spesa riflettono già questo. Gli investimenti aziendali in intelligenza artificiale sono ora divisi quasi equamente tra infrastruttura e applicazioni, e la quota delle applicazioni sta crescendo più velocemente. L’espansione è laterale – attraverso risorse umane, giuridiche, marketing, operazioni, finanza – non verticale in modelli più grandi.

Per le startup che costruiscono nello strato dei sistemi, questa è l’opportunità di una generazione. In un mondo centralizzato, il fornitore di modelli cattura la maggior parte del valore. In un mondo decentralizzato, il valore migra alle aziende che risolvono l’orchestrazione, il routing, la valutazione e la specializzazione – le sfide operative del dispiegamento di un ecosistema di modelli eterogeneo su larga scala.

La mia proiezione è che circa il 25% dell’inferenza di intelligenza artificiale richiederà modelli all’avanguardia. Queste aziende staranno bene – sarà un paio di trilioni di dollari di mercato potenziale. Ma il 75% sarà eseguito su modelli open-source e modelli di compito specializzati più piccoli. Abbiamo addestrato un modello da 4 miliardi di parametri che ha superato i modelli all’avanguardia in un compito CRM specifico e costa così poco da eseguire che è quasi gratuito. Questo è il futuro – e richiede un intero nuovo strato di sistemi per gestirlo.

L’analogia si mantiene per tutto il percorso: i venditori di mainframe hanno fatto bene, ma la vera creazione di ricchezza è avvenuta nell’ecosistema del PC. La stessa cosa sarà vera nell’intelligenza artificiale.

Guardando cinque anni avanti, credete che i fornitori di modelli all’avanguardia cattureranno la maggior parte del valore o che la maggior parte dell’impatto economico verrà dall’orchestrazione, dall’ottimizzazione e dai sistemi applicati costruiti intorno a loro?

Credo che il mercato dell’inferenza di intelligenza artificiale sarà uno dei più grandi mercati della storia del mondo. Ciò significa che i laboratori di modelli all’avanguardia faranno incredibilmente bene e ci saranno ancora enormi opportunità per le aziende che costruiscono intorno a loro. Quando si hanno mercati da trilioni di dollari, risolvere piccoli casi limite in quei mercati può trasformarsi in aziende da miliardi di dollari.

Grazie per la grande intervista, i lettori che desiderano saperne di più possono visitare NeuroMetric AI, o possono iscriversi alla newsletter Investing in AI.

Antoine è un leader visionario e socio fondatore di Unite.AI, guidato da una passione incrollabile per plasmare e promuovere il futuro dell'AI e della robotica. Un imprenditore seriale, crede che l'AI sarà così disruptiva per la società come l'elettricità, e spesso si lascia trasportare dall'entusiasmo per il potenziale delle tecnologie disruptive e dell'AGI.

Come futurista, è dedicato a esplorare come queste innovazioni plasmeranno il nostro mondo. Inoltre, è il fondatore di Securities.io, una piattaforma focalizzata sugli investimenti in tecnologie all'avanguardia che stanno ridefinendo il futuro e riplasmando interi settori.