Interviste

Etan Ginsberg, Co-Fondatore di Martian – Serie di Interviste

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Etan Ginsberg è il Co-Fondatore di Martian, una piattaforma che instrada dinamicamente ogni prompt al miglior modello di linguaggio. Attraverso l’instradamento, Martian raggiunge prestazioni più elevate e costi più bassi rispetto a qualsiasi fornitore individuale, incluso GPT-4. Il sistema è costruito sulla tecnologia di mappatura dei modelli unica dell’azienda, che scompatta i modelli di linguaggio dalle scatole nere complesse in un’architettura più interpretabile, rendendolo la prima applicazione commerciale di interpretazione meccanicistica.

Etan ha iniziato a codificare, progettare siti web e costruire e-business per clienti fin da quando era alle scuole medie. Un polimata, Etan è un concorrente ai Campionati Mondiali di Memoria e si è classificato secondo ai Campionati Mondiali di Lettura Veloce a Shenzhen, in Cina.

È un concorrente ai hackathon di video. I premi passati includono il terzo premio a Tech Crunch SZ, finalista tra i primi 7 al Princeton Hackathon e 3 premi dell’industria allo Yale Hackathon.

Sei un ex fondatore di due startup, quali erano queste aziende e cosa hai imparato da queste esperienze?

La mia prima azienda era la prima piattaforma per la promozione e lo sviluppo dello sport di American Ninja Warrior. Nel 2012, ho visto American Ninja Warrior come uno sport underground (simile alla MMA negli anni ’90) e ho creato la prima piattaforma in cui le persone potevano acquistare progetti, ordinare ostacoli e trovare palestre in cui allenarsi. Ho consultato aziende che desideravano aprire le loro palestre, incluso assistere le Forze Speciali degli Stati Uniti con un corso di addestramento e ampliare una struttura da uno schizzo su un tovagliolo a 300.000 dollari di entrate nei primi 3 mesi. Sebbene fossi alle scuole superiori, ho avuto la mia prima esperienza nella gestione di squadre di oltre 20 lavoratori e ho imparato a gestire in modo efficace e a sviluppare relazioni interpersonali.

La mia seconda azienda era una società di gestione di attività alternative che ho co-fondata nel 2017, prima dell’ondata dei ICO nella criptovaluta. Questa è stata la mia prima esposizione al NLP, dove abbiamo utilizzato l’analisi del sentimento dei dati dei social media come strategia di investimento.

Ho imparato molte delle competenze tecniche e non tecniche che sono necessarie per gestire una startup, dalle competenze di gestione di una squadra agli aspetti tecnici del NLP. Allo stesso tempo, ho anche imparato molto su di me e su ciò che desideravo lavorare. Credo che le aziende più di successo siano quelle fondate da fondatori che hanno una visione più ampia o un obiettivo che li guida. Ho lasciato la criptovaluta nel 2017 per concentrarmi sul NLP perché aumentare e comprendere l’intelligenza umana è qualcosa che mi appassiona veramente. Sono stato felice di scoprire questo.

Mentre frequentavi l’Università della Pennsylvania, hai svolto alcune ricerche sull’IA, cosa hai studiato specificamente?

Le nostre ricerche si sono concentrate inizialmente sulla costruzione di applicazioni di modelli di linguaggio. In particolare, abbiamo lavorato su applicazioni educative dei modelli di linguaggio e stavamo costruendo il primo tutor cognitivo alimentato da modelli di linguaggio. I risultati sono stati piuttosto buoni – abbiamo visto un miglioramento di 0,3 deviazioni standard negli esiti degli studenti negli esperimenti iniziali – e il nostro sistema è stato utilizzato dall’Università della Pennsylvania all’Università del Bhutan.

Puoi discutere come questa ricerca ti ha portato a co-fondare Martian?

Perché eravamo tra le prime persone a costruire applicazioni su modelli di linguaggio, siamo stati anche tra le prime a incontrare i problemi che le persone affrontano quando costruiscono applicazioni su modelli di linguaggio. Ciò ha guidato la nostra ricerca verso lo strato di infrastruttura. Ad esempio, molto presto, stavamo sintonizzando modelli più piccoli sui risultati di modelli più grandi come GPT-3 e sintonizzando modelli su fonti di dati specializzate per attività come la programmazione e la risoluzione di problemi matematici. Ciò ci ha portato a problemi relativi alla comprensione del comportamento del modello e all’instradamento del modello.

Le origini del nome Martian e la sua relazione con l’intelligenza sono anche interessanti, puoi condividere la storia di come questo nome è stato scelto?

La nostra azienda si chiama come un gruppo di scienziati ungheresi-americani noti come “I marziani”. Questo gruppo, che visse nel XX secolo, era composto da alcune delle persone più intelligenti che siano mai vissute:

  • Il più famoso tra loro era John Von Neumann; ha inventato la teoria dei giochi, l’architettura del computer moderno, la teoria degli automi e ha fatto contributi fondamentali in decine di altri campi.
  • Paul Erdos era il matematico più prolifico di tutti i tempi, avendo pubblicato oltre 1500 articoli.
  • Theodore Von Karman ha stabilito le teorie fondamentali dell’aerodinamica e ha aiutato a fondare il programma spaziale americano. Il confine tra la Terra e lo spazio esterno è chiamato “linea di Karman” in riconoscimento del suo lavoro.
  • Leo Szilard ha inventato la bomba atomica, la terapia radiante e gli acceleratori di particelle.

Questi scienziati e altri 14 come loro (inclusi l’inventore della bomba all’idrogeno, l’uomo che ha introdotto la teoria dei gruppi nella fisica moderna e contributori fondamentali a campi come la combinatoria, la teoria dei numeri, l’analisi numerica e la teoria della probabilità) condividevano una somiglianza notevole – erano tutti nati nella stessa parte di Budapest. Ciò ha portato le persone a chiedersi: qual è la fonte di tanta intelligenza?

In risposta, Szilard scherzò che “I marziani sono già qui e si chiamano ungheresi!” In realtà… nessuno lo sa.

L’umanità si trova in una posizione simile oggi rispetto a un nuovo insieme di menti potenzialmente superintelligenti: l’Intelligenza Artificiale. Le persone sanno che i modelli possono essere incredibilmente intelligenti, ma non hanno idea di come funzionino.

La nostra missione è rispondere a quella domanda – comprendere e sfruttare la superintelligenza moderna.

Hai una storia di incredibili imprese di memoria, come sei stato coinvolto in queste sfide di memoria e come questa conoscenza ti ha aiutato con il concetto di Martian?

Nella maggior parte degli sport, un atleta professionista può eseguire circa 2-3 volte meglio della persona media (confronta quanto lontano una persona media possa calciare un goal o quanto velocemente possa lanciare una palla da baseball rispetto a un professionista). Gli sport della memoria sono affascinanti perché gli atleti di vertice possono memorizzare 100 volte o addirittura 1000 volte più della persona media con meno addestramento di molti sport. Inoltre, queste sono spesso persone con una memoria naturale media che attribuiscono le loro prestazioni a tecniche specifiche che chiunque può imparare. Voglio massimizzare la conoscenza umana e ho visto i campionati mondiali di memoria come un’intuizione sottovalutata su come possiamo ottenere rendimenti straordinari aumentando l’intelligenza umana.

Volevo utilizzare le tecniche di memoria in tutto il sistema educativo, quindi ho iniziato a esplorare come il NLP e i modelli di linguaggio potessero aiutare a ridurre il costo di configurazione che impedisce ai metodi educativi più efficaci di essere utilizzati nel sistema educativo mainstream. Yash e io abbiamo creato il primo tutor cognitivo alimentato da modelli di linguaggio e ciò ci ha portato a scoprire i problemi con l’implementazione dei modelli di linguaggio che risolviamo oggi.

Martian è essenzialmente un’astrazione della decisione su quale modello di linguaggio utilizzare, perché attualmente questo è un punto dolente per gli sviluppatori?

Sta diventando sempre più facile creare modelli di linguaggio – il costo del calcolo sta diminuendo, gli algoritmi stanno diventando più efficienti e ci sono più strumenti open source disponibili per creare questi modelli. Di conseguenza, più aziende e sviluppatori stanno creando modelli personalizzati addestrati su dati personalizzati. Poiché questi modelli hanno costi e capacità diversi, è possibile ottenere prestazioni migliori utilizzando più modelli, ma è difficile testarli tutti e trovare quelli giusti da utilizzare. Ci occupiamo di quello per gli sviluppatori.

Puoi discutere come il sistema capisce quale modello di linguaggio è meglio utilizzare per ogni attività specifica?

Il routing efficace è fondamentalmente un problema di comprensione dei modelli. Per instradare efficacemente tra i modelli, si desidera essere in grado di comprendere cosa causa il loro fallimento o successo. Essere in grado di comprendere queste caratteristiche con la mappatura dei modelli ci consente di determinare quanto bene un modello dato eseguirà una richiesta senza dover eseguire quel modello. Di conseguenza, possiamo inviare quella richiesta al modello che produrrà il miglior risultato.

Puoi discutere il tipo di risparmio di costo che può essere visto ottimizzando il modello di linguaggio utilizzato?

Ci consentono agli utenti di specificare come bilanciare costo e prestazioni. Se si desidera solo la prestazione, possiamo superare GPT-4 su openai/evals. Se si sta cercando un costo specifico per far funzionare la propria economia, ci consentono di specificare il massimo costo per la propria richiesta, quindi trovare il miglior modello per completare quella richiesta. E se si desidera qualcosa di più dinamico, ci consentono di specificare quanto si è disposti a pagare per una risposta migliore – in modo che, se due modelli hanno prestazioni simili ma una grande differenza di costo, possiamo utilizzare il modello meno costoso. Alcuni dei nostri clienti hanno visto una riduzione dei costi fino al 12 volte.

Qual è la tua visione per il futuro di Martian?

Ogni volta che miglioriamo la nostra comprensione fondamentale dei modelli, si verifica un cambiamento di paradigma per l’IA. La sintonizzazione fine è il paradigma guidato dalla comprensione dei risultati. La promptazione è il paradigma guidato dalla comprensione degli input. Quella singola differenza nella nostra comprensione dei modelli è gran parte di ciò che differenzia il ML tradizionale (“costruire un regressore”) e l’IA generativa moderna (“promptare un baby AGI”).

Il nostro obiettivo è consegnare costantemente innovazioni nell’interpretazione fino a quando l’IA non sarà completamente compresa e avremo una teoria dell’intelligenza robusta come le nostre teorie della logica o del calcolo.

Per noi, ciò significa costruire. Significa creare strumenti di IA incredibili e metterli nelle mani delle persone. Significa rilasciare cose che rompono lo stampo, che nessuno ha fatto prima, e che – più di ogni altra cosa – sono interessanti e utili.

Nelle parole di Sir Francis Bacon, “La conoscenza è potere”. Di conseguenza, il modo migliore per essere sicuri che comprendiamo l’IA è rilasciare strumenti potenti. A nostro avviso, un router di modelli è uno strumento di quel tipo. Siamo entusiasti di costruirlo, farlo crescere e metterlo nelle mani delle persone.

Questo è il primo di molti strumenti che rilasceremo nei prossimi mesi. Per scoprire una bella teoria dell’intelligenza artificiale, per consentire nuovi tipi di infrastrutture di IA, per aiutare a costruire un futuro più luminoso per l’uomo e la macchina – non vediamo l’ora di condividere quegli strumenti con voi.

Grazie per la grande intervista, i lettori che desiderano saperne di più possono visitare Martian.

Antoine è un leader visionario e socio fondatore di Unite.AI, guidato da una passione incrollabile per plasmare e promuovere il futuro dell'AI e della robotica. Un imprenditore seriale, crede che l'AI sarà così disruptiva per la società come l'elettricità, e spesso si lascia trasportare dall'entusiasmo per il potenziale delle tecnologie disruptive e dell'AGI.

Come futurista, è dedicato a esplorare come queste innovazioni plasmeranno il nostro mondo. Inoltre, è il fondatore di Securities.io, una piattaforma focalizzata sugli investimenti in tecnologie all'avanguardia che stanno ridefinendo il futuro e riplasmando interi settori.