Entrevistas
Jay Dawani é Co-fundador e CEO da Lemurian Labs – Série de Entrevistas

Jay Dawani é Co-fundador e CEO da Lemurian Labs. Lemurian Labs está em uma missão para entregar computadores de IA acessíveis, acessíveis e eficientes, impulsionados pela crença de que a IA não deve ser um luxo, mas uma ferramenta acessível a todos. A equipe de fundadores da Lemurian Labs combina expertise em IA, compiladores, algoritmos numéricos e arquitetura de computadores, unidos por um único propósito: reimaginar o processamento acelerado.
Pode nos contar sobre sua formação e o que o levou a se interessar por IA?
Claro. Eu comecei a programar quando tinha 12 anos e a criar meus próprios jogos e coisas assim, mas eu realmente me interessei por IA quando tinha 15 anos, graças a um amigo de meu pai que era apaixonado por computadores. Ele alimentou minha curiosidade e me deu livros para ler, como “O Computador e o Cérebro” de Von Neumann, “Perceptrons” de Minsky e “IA: Uma Abordagem Moderna” de Russel e Norvig. Esses livros influenciaram muito meu pensamento e pareceu quase óbvio que a IA seria transformadora e que eu precisava fazer parte disso.
Quando chegou a hora de ir para a universidade, eu realmente queria estudar IA, mas não encontrei nenhuma universidade que oferecesse isso, então decidi me formar em matemática aplicada. Um pouco depois, quando cheguei à universidade, ouvi falar sobre os resultados do AlexNet no ImageNet, o que foi muito emocionante. Naquela época, tive um momento de “agora ou nunca” e mergulhei de cabeça na leitura de todos os artigos e livros que pude encontrar relacionados a redes neurais e procurei todos os líderes do campo para aprender com eles, porque quantas vezes você tem a chance de estar lá no nascimento de uma nova indústria e aprender com seus pioneiros?
Muito rapidamente, percebi que não gosto de pesquisa, mas gosto de resolver problemas e criar produtos habilitados por IA. Isso me levou a trabalhar em carros autônomos e robôs, IA para descoberta de materiais, modelos gerativos para simulações de multi-física, simuladores de treinamento de motoristas de carros de corrida e configurações de carros, robôs espaciais, negociação algorítmica e muito mais.
Agora, tendo feito tudo isso, estou tentando reduzir o custo de treinamento e implantação de IA, porque isso será o maior obstáculo que enfrentaremos em nosso caminho para permitir que todos e todas as empresas tenham acesso a e se beneficiem da IA da maneira mais econômica possível.
Muitas empresas que trabalham em computação acelerada têm fundadores que construíram carreiras em semicondutores e infraestrutura. Como você acha que sua experiência passada em IA e matemática afeta sua capacidade de entender o mercado e competir efetivamente?
Na verdade, acho que não vir da indústria me dá a vantagem de ser um outsider. Eu encontrei muitas vezes que não ter conhecimento de normas da indústria ou sabedoria convencional me dá a liberdade de explorar mais livremente e ir mais fundo do que a maioria das pessoas, porque não estou limitado por preconceitos.
Eu tenho a liberdade de fazer perguntas “mais estúpidas” e testar suposições de uma maneira que a maioria das pessoas não faria, porque muitas coisas são verdades aceitas. Nos últimos dois anos, tive várias conversas com pessoas dentro da indústria que são muito dogmáticas sobre algo, mas não podem me dizer a proveniência da ideia, o que acho muito intrigante. Eu gosto de entender por que certas escolhas foram feitas e quais suposições ou condições estavam presentes naquela época e se elas ainda são válidas.
Vindo de um background de IA, eu tendo a olhar para as cargas de trabalho atuais e todas as maneiras possíveis pelas quais elas podem mudar com o tempo, e modelar toda a pipeline de ML para treinamento e inferência para entender os gargalos, o que me diz onde estão as oportunidades para entregar valor. E porque venho de uma formação matemática, eu gosto de modelar as coisas para chegar o mais perto da verdade que posso, e ter isso me guiar. Por exemplo, construímos modelos para calcular o desempenho do sistema para o custo total de propriedade e podemos medir o benefício que podemos trazer aos clientes com software e/ou hardware e entender melhor nossas limitações e os diferentes controles disponíveis para nós, e dezenas de outros modelos para várias coisas. Somos muito orientados por dados e usamos as informações desses modelos para guiar nossos esforços e trade-offs.
Parece que o progresso em IA tem vindo principalmente do escalonamento, o que requer exponencialmente mais computação e energia. Parece que estamos em uma corrida armamentista com todas as empresas tentando construir o maior modelo, e não parece haver um fim à vista. Você acha que há uma maneira de sair disso?
Sempre há maneiras. O escalonamento provou ser extremamente útil, e não acho que tenhamos visto o fim ainda. Logo veremos modelos sendo treinados com um custo de pelo menos um bilhão de dólares. Se você quiser ser um líder em IA gerativa e criar modelos de base de ponta, precisará gastar pelo menos alguns bilhões por ano em computação. Agora, há limites naturais para o escalonamento, como ser capaz de construir um conjunto de dados grande o suficiente para um modelo desse tamanho, obter acesso a pessoas com o conhecimento certo e obter acesso a computação suficiente.
O escalonamento contínuo do tamanho do modelo é inevitável, mas também não podemos transformar a superfície toda da Terra em um supercomputador do tamanho do planeta para treinar e servir LLMs por motivos óbvios. Para controlar isso, temos várias opções que podemos jogar: conjuntos de dados melhores, novas arquiteturas de modelo, novos métodos de treinamento, compiladores melhores, melhorias algorítmicas e explorações, melhorias de arquitetura de computador e assim por diante. Se fizermos tudo isso, há cerca de três ordens de magnitude de melhoria a ser encontrada. Essa é a melhor saída.
Você é um defensor do pensamento de primeira ordem, como isso molda sua mentalidade para como você está executando a Lemurian Labs?
Definitivamente empregamos muito pensamento de primeira ordem na Lemurian. Eu sempre encontrei a sabedoria convencional enganosa porque esse conhecimento foi formado em um determinado momento, quando certas suposições eram válidas, mas as coisas sempre mudam e você precisa retestar suposições com frequência, especialmente quando vivendo em um mundo tão rápido.
Eu me pego frequentemente fazendo perguntas como “isso parece uma ideia muito boa, mas por que isso pode não funcionar”, ou “o que precisa ser verdade para que isso funcione”, ou “o que sabemos que são verdades absolutas e quais são as suposições que estamos fazendo e por quê?”, ou “por que acreditamos que essa abordagem particular é a melhor maneira de resolver esse problema”. O objetivo é invalidar e matar ideias o mais rápido e barato possível. Queremos tentar maximizar a quantidade de coisas que estamos tentando a qualquer momento.
Mas o pensamento de primeira ordem não é muito útil por si só. Costumamos combiná-lo com uma abordagem de “backcasting”, que basicamente significa imaginar um resultado ideal ou desejado e trabalhar para trás para identificar as diferentes etapas ou ações necessárias para realizar isso. Isso garante que convergimos em uma solução significativa que não é apenas inovadora, mas também fundamentada na realidade.
Tudo isso combinado é para nos dar agilidade, ciclos de iteração rápida para desviar itens rapidamente e nos ajudou a ajustar estratégias com alta confiança e fazer muito progresso em problemas muito difíceis em um curto período de tempo.
Inicialmente, você estava focado em IA de borda, o que o fez mudar o foco e mudar para computação em nuvem?
Começamos com IA de borda porque, naquela época, eu estava muito focado em tentar resolver um problema específico que eu havia enfrentado ao tentar introduzir um mundo de robótica autônoma de propósito geral. A robótica autônoma promete ser a maior mudança de plataforma em nossa história coletiva, e parecia que tínhamos tudo o que precisávamos para construir um modelo de base para robótica, mas estávamos faltando o chip de inferência ideal com o equilíbrio certo de throughput, latência, eficiência de energia e programabilidade para executar o modelo de base.
Eu não estava pensando no datacenter naquela época porque havia mais do que o suficiente de empresas se concentrando lá e eu esperava que elas figurassem isso. Desenhamos uma arquitetura muito poderosa para esse espaço de aplicativos e estávamos prontos para gravar, e então ficou claro que o mundo havia mudado e o problema estava realmente no datacenter. A taxa com que os LLMs estavam escalando e consumindo computação superava muito o ritmo de progresso na computação, e quando você fatora a adoção, começa a pintar um quadro preocupante.
Parecia que era onde deveríamos focar nossos esforços, para reduzir o custo de energia da IA nos datacenters o máximo possível, sem impor restrições sobre onde e como a IA deveria evoluir. E então, começamos a trabalhar para resolver esse problema.
Pode compartilhar a história de como co-fundou a Lemurian Labs?
A história começa em 2018. Eu estava trabalhando no treinamento de um modelo de base para autonomia de propósito geral, juntamente com um modelo para simulação de multi-física gerativa para treinar o agente e ajustá-lo para diferentes aplicações, e algumas outras coisas para ajudar a escalar em ambientes de multi-agente. Mas muito rapidamente, esgotei a quantidade de computação que eu tinha, e estimei precisar de mais de 20.000 GPUs V100. Tentei levantar o suficiente para obter acesso à computação, mas o mercado não estava pronto para esse tipo de escala ainda. Isso, no entanto, me fez pensar sobre o lado da implantação e eu me sentei para calcular quanto desempenho eu precisaria para servir esse modelo nos ambientes-alvo e percebi que não havia chip que pudesse me levar até lá.
Um par de anos depois, em 2020, eu me encontrei com Vassil – meu eventual co-fundador – para me atualizar e eu compartilhei os desafios que eu enfrentei ao construir um modelo de base para autonomia, e ele sugeriu construir um chip de inferência que pudesse executar o modelo de base, e ele compartilhou que ele havia pensado muito sobre formatos de número e melhores representações ajudariam não apenas em fazer com que as redes neurais retivessem a precisão em bit-widths mais baixos, mas também em criar arquiteturas mais poderosas.
Foi uma ideia intrigante, mas estava muito fora da minha área de expertise. Mas não me deixou, o que me levou a passar meses e meses aprendendo as complexidades da arquitetura de computadores, conjuntos de instruções, tempos de execução, compiladores e modelos de programação. Eventualmente, construir uma empresa de semicondutores começou a fazer sentido e eu havia formado uma tese sobre o que o problema era e como abordá-lo. E, então, para o final do ano, começamos a Lemurian.
Você falou anteriormente sobre a necessidade de abordar o software primeiro ao construir hardware, pode elaborar sobre sua visão de por que o problema de hardware é, antes de mais nada, um problema de software?
O que muitas pessoas não percebem é que o lado de software dos semicondutores é muito mais difícil do que o hardware em si. Construir uma arquitetura de computador útil para os clientes usar e obter benefícios é um problema de pilha completa, e se você não tiver essa compreensão e preparação indo, você acabará com uma arquitetura bonita e performática e eficiente, mas totalmente inutilizável por desenvolvedores, o que é o que realmente importa.
Há outros benefícios em adotar uma abordagem de software primeiro, como um tempo de mercado mais rápido. Isso é crucial em um mundo em movimento rápido, onde ser muito otimista sobre uma arquitetura ou recurso pode significar que você perde o mercado inteiramente.
Não adotar uma visão de software primeiro geralmente resulta em não ter desviado os itens importantes necessários para a adoção do produto no mercado, não ser capaz de responder às mudanças no mercado, por exemplo, quando as cargas de trabalho evoluem de uma maneira inesperada, e ter hardware subutilizado. Todos não são coisas boas. Essa é uma grande razão pela qual nos importamos muito em ser centrados em software e por que nossa visão é que você não pode ser uma empresa de semicondutores sem realmente ser uma empresa de software.
Pode discutir seus objetivos imediatos de pilha de software?
Quando estávamos projetando nossa arquitetura e pensando sobre a estrada à frente e onde estavam as oportunidades para trazer mais desempenho e eficiência de energia, começou a ficar claro que íamos ver muito mais heterogeneidade, o que criaria muitos problemas de software. E não precisamos apenas ser capazes de programar arquiteturas heterogêneas de forma produtiva, precisamos lidar com elas em escala de datacenter, o que é um desafio do tipo que não encontramos antes.
Isso nos preocupou porque a última vez que tivemos que passar por uma transição importante foi quando a indústria mudou de arquiteturas de núcleo único para arquiteturas de multi-núcleo, e naquela época, levou 10 anos para fazer com que o software funcionasse e as pessoas o usassem. Não podemos esperar 10 anos para descobrir como fazer o software funcionar para a heterogeneidade em escala, isso precisa ser resolvido agora. E então, começamos a trabalhar para entender o problema e o que precisa existir para que essa pilha de software exista.
Atualmente, estamos nos engajando com muitas das principais empresas de semicondutores e provedores de serviços de nuvem e lançaremos nossa pilha de software nos próximos 12 meses. É um modelo de programação unificado com um compilador e tempo de execução capaz de direcionar qualquer tipo de arquitetura, e orquestrando o trabalho em clusters compostos por diferentes tipos de hardware, e capaz de escalar de um nó único para um cluster de mil nós para o melhor desempenho possível.
Obrigado pela grande entrevista, leitores que desejam aprender mais devem visitar Lemurian Labs.












