Entrevistas

Kismat Singh, Co-Fundador e CEO da MachGen AI – Série de Entrevistas

mm
Adicione Unite.AI às suas fontes preferidas no Google

Kismat Singh, Co-Fundador e CEO da MachGen AI, é um executivo de infraestrutura e engenharia de IA com mais de duas décadas de experiência na construção de sistemas de computação de alto desempenho e aprendizado de máquina. Antes de cofundar a MachGen AI, Singh atuou como VP de Engenharia de Frameworks de IA na Intel e anteriormente ocupou cargos de engenharia sênior na NVIDIA, AMD, HP e outras empresas de tecnologia. Seu trabalho incluiu contribuições para bibliotecas e compiladores de deep learning, otimização de frameworks de IA e melhorias na resiliência de treinamento em hiperescala. Na Intel, ele esteve intimamente envolvido nas iniciativas de PyTorch da empresa e falou publicamente sobre tornar os frameworks de IA mais acessíveis em diferentes plataformas de hardware.

MachGen AI é uma empresa de infraestrutura de IA focada em tornar os modelos generativos de imagem e vídeo dramaticamente mais rápidos e econômicos de executar. Fundada por Kismat Singh e Manoj Krishnan, a empresa está desenvolvendo uma pilha de inferência e ajuste fino de alto desempenho projetada especificamente para modelos de difusão, em vez de adaptar infraestrutura originalmente construída para grandes modelos de linguagem. A MachGen otimiza áreas incluindo computação de atenção, cache, kernels de GPU, gerenciamento de memória, paralelismo, agendamento e implantação para reduzir a latência de geração mantendo a qualidade do modelo. Sua plataforma oferece APIs para geração de texto‑para‑imagem, imagem‑para‑imagem, texto‑para‑vídeo, imagem‑para‑vídeo e referência‑para‑vídeo, com a tecnologia subjacente voltada a habilitar aplicações de baixa latência, como criação interativa de conteúdo, avatares em tempo real, jogos e publicidade personalizada.

Você passou mais de duas décadas trabalhando com vídeo, computação GPU e desempenho de IA, incluindo TensorRT na NVIDIA, software de IA na Intel, otimização de GPU na AMD e trabalhos anteriores em codificação de vídeo em tempo real. O que você observou durante esses anos que acabou convencendo você a deixar grandes empresas de tecnologia e cofundar a MachGen, e por que acreditou que a inferência de difusão era o problema de infraestrutura que valia a pena construir uma empresa em torno?

Meu cofundador Manoj e eu jogamos badminton na mesma academia por quase 10 anos. Na maior parte desse período, estávamos tentando contratar o outro. Finalmente, decidimos que era mais fácil trabalhar juntos do que continuar recrutando um ao outro.

A razão pela qual escolhemos esse problema é que ambos assistimos a uma pilha de inferência amadurecer de dentro. Eu ajudei a construir a equipe de plataforma de inferência da NVIDIA e depois liderei o software de IA na Intel. Manoj desenvolveu a infraestrutura de treinamento de grandes modelos por trás do PyTorch na Meta. Observamos anos de trabalho em cache, loteamento, agendamento e kernels transformar sistemas de pesquisa de LLM iniciais em infraestrutura de produção que serve trilhões de tokens.

A difusão está aproximadamente onde a inferência de LLM estava há três anos. Modelos de imagem e vídeo avançaram rapidamente, mas os sistemas que os servem permanecem lentos, caros e difíceis de escalar. A maior parte da infraestrutura existente foi projetada para LLMs, com a difusão adicionada posteriormente.

Três fatores que tornaram o momento certo: os modelos se tornaram suficientemente bons para construir produtos reais, o problema exigia exatamente as habilidades que desenvolvemos ao longo de nossas carreiras, e o impacto é grande o bastante para construir uma empresa generacional em torno dele. Quando um vídeo que antes levava vários minutos pode ser gerado em segundos a uma fração do custo, a geração interativa, a publicidade personalizada, avatares em tempo real e produtos criativos totalmente novos se tornam possíveis.

A MachGen argumenta que muitas das técnicas que transformaram a inferência de grandes modelos de linguagem não se transferem de forma limpa para modelos de difusão. O que é fundamentalmente diferente ao servir modelos de imagem e vídeo, e onde estão os maiores gargalos de desempenho que a infraestrutura convencional de IA tende a perder?

LLMs e modelos de difusão têm padrões computacionais fundamentalmente diferentes. LLMs são autoregressivos, com um pré-preenchimento intensivo em computação seguido por uma decodificação token a token limitada por memória. Técnicas como cache KV e a desagregação de pré-preenchimento/decodificação foram projetadas em torno dessa estrutura.

Modelos de difusão são não autoregressivos e permanecem limitados por computação ao longo de todo o processo de denoising. A geração de vídeo também envolve grandes quantidades de dados espaciais e temporais, criando demandas diferentes em relação à atenção, memória, comunicação e paralelismo.

Como resultado, muitas das otimizações desenvolvidas para LLMs não se transferem de forma limpa. O cache KV convencional não resolve o mesmo problema, o paralelismo padrão pode introduzir uma sobrecarga de comunicação substancial, e os kernels de código aberto disponíveis são muito menos maduros. O agendador, o modelo de memória, a estratégia de cache, os kernels e o paralelismo precisam ser projetados em torno da própria difusão. É por isso que construímos a MachGen com a difusão como um cidadão de primeira classe.

A MachGen relata aproximadamente de 4 a 6 vezes menor latência em alguns modelos de imagem e cerca de 6 vezes de melhoria em vários modelos de vídeo ao executar os modelos originais, não destilados. Quais são os principais avanços técnicos por trás desses ganhos, e como você garante que as melhorias de desempenho não venham à custa da qualidade da saída?

Os ganhos vêm de várias partes da pilha trabalhando em conjunto. A atenção domina o orçamento de computação em muitos modelos de vídeo, portanto nos concentramos em receitas de menor precisão, atenção esparsa e técnicas relacionadas. Também desenvolvemos métodos de cache que exploram a redundância espacial e temporal, kernels altamente otimizados para arquiteturas de difusão e técnicas de paralelismo que reduzem a sobrecarga de comunicação.

Juntas, essas melhorias permitem que a MachGen entregue o HiDream em um segundo contra seis segundos e o Flux em 1,5 segundo contra 6,2 segundos. Para vídeo, o Wan 2.2 roda em 16,5 segundos contra 98 segundos, enquanto o LTX 2.3 roda em 10,7 segundos contra 67 segundos. Os custos de inferência também são 2–4 vezes menores para modelos de imagem e 2–3 vezes menores para vídeo.

Esses resultados utilizam os modelos originais, não destilados. Estamos aprimorando a forma como os modelos são executados sem sacrificar a qualidade da saída. Para a adoção em produção, velocidade, custo e qualidade precisam funcionar em conjunto.

Trusted TV é um exemplo interessante porque reduzir a geração de minutos para segundos altera mais do que a conta de infraestrutura. Quando a geração de vídeo se torna rápida o suficiente para produzir milhares de campanhas e variações criativas personalizadas, que novos modelos de negócios ou experiências de produto se tornam possíveis e que antes simplesmente não eram viáveis?

TrustedTV ajuda empresas a criar comerciais prontos para transmissão com IA e distribuí‑los em plataformas de TV conectada como Prime Video, Roku e DirecTV. Muitos de seus clientes são pequenas empresas. Produzir um comercial de TV da maneira tradicional exigia uma equipe de filmagem e edição, com custos a partir de milhares de dólares e geralmente chegando a dezenas de milhares. Trusted TV reduz isso a zero. Um pequeno empresário pode criar um comercial completo a partir de um smartphone em cerca de cinco minutos e visualizá‑lo antes de pagar qualquer coisa. Mais de 10.000 campanhas foram criadas na plataforma.

Ian, CEO da Trusted TV, viu o benchmark de latência da MachGen no Artificial Analysis e não acreditou. Ele se inscreveu para testá‑lo pessoalmente. Seu primeiro render retornou em cerca de 25 segundos sem perda de qualidade e, quando realizou testes de concorrência, as melhorias se mantiveram em escala. Eles migraram todo o fluxo de produção para a MachGen em menos de 48 horas, e a MachGen agora alimenta toda a nova criação de vídeo deles. Na implantação mais recente, estamos mais próximos de 10 ou 11 segundos nesse modelo, e continuaremos a aprimorá‑lo.

O efeito do produto é que os anunciantes deixam de fazer um ou dois comerciais genéricos. Seus usuários rotacionam duas ou três novas propagandas por semana, testam criativos em diferentes segmentos de público e iteram em vez de se comprometer. O que vem a seguir é a personalização por geografia e nível de audiência em escala, algo antes reservado a empresas com orçamentos de vários milhões de dólares.

Uma versão que penso pessoalmente: hoje, recebo um anúncio de tênis filmado em uma rua em Manhattan. Eu moro na Bay Area, então não significa nada para mim. O que eu quero é o mesmo anúncio com o Mission Peak ao fundo. Não se trata de um comercial mais barato; é um tipo diferente de publicidade, e só se torna economicamente viável quando a geração é rápida e barata o suficiente para produzir milhares de variantes.

Para empresas que incorporam geração de imagem ou vídeo diretamente em produtos, como devem pensar sobre a economia da inferência? Em que escala a otimização da utilização de GPU se torna estrategicamente importante, em vez de simplesmente pagar a um provedor de API por cada geração?

O ponto de inflexão ocorre quando a inferência começa a afetar a experiência do cliente ou as margens da empresa.

Uma API de uso geral pode fazer sentido enquanto uma equipe valida um produto. Quando a geração se torna central para esse produto, as equipes precisam olhar além do preço listado por saída. Latência, concorrência, qualidade, confiabilidade e utilização de GPU passam a fazer parte da economia.

Uma geração pode parecer barata, mas ainda cria um problema de negócios se os usuários tiverem que esperar vários minutos e abandonarem o fluxo de trabalho. Uma arquitetura que exige que a capacidade de GPU cresça na mesma taxa do uso também pressionará cada vez mais as margens.

Não há um único limiar de volume de solicitações porque o compute necessário para um clipe curto de 540p é muito diferente de um vídeo mais longo em 1080p. A otimização se torna estratégica quando o aumento do uso faz os custos subir quase na mesma proporção, a demanda de pico cria filas ou a latência começa a limitar a experiência do produto.

A MachGen opera em várias camadas, incluindo kernels GPU personalizados, cache, otimização de precisão, agendamento e paralelismo. À medida que os modelos continuam evoluindo rapidamente, qual camada da pilha de inferência você acredita que oferece a maior oportunidade restante para melhorias dramáticas em velocidade e custo?

Para geração de vídeo, a atenção representa uma das maiores oportunidades restantes, pois domina o orçamento de computação em muitos modelos. Ainda há espaço significativo para melhorar receitas de menor precisão, atenção esparsa e kernels de atenção específicos para difusão.

A atenção é apenas uma parte da oportunidade. Os maiores ganhos gerais virão da combinação de melhorias em toda a pilha. O cache é um exemplo. As técnicas de cache KV usadas em LLMs não se transferem diretamente, mas os modelos de difusão contêm redundância espacial e temporal que podem ser exploradas com a abordagem correta.

O paralelismo apresenta outra oportunidade. Adicionar GPUs não produz automaticamente um aumento de velocidade proporcional, pois a sobrecarga de comunicação pode compensar o benefício. Desenvolvemos kernels personalizados que sobrepõem a comunicação à computação independente de dados e a encadeiam com o trabalho dependente de dados.

Atenção, cache, kernels, paralelismo, memória e agendamento afetam uns aos outros. Otimizar apenas uma camada acaba criando um gargalo em outro ponto. As maiores melhorias virão de tratar a pilha como um sistema completo projetado para o perfil computacional da difusão.

Com os modelos de vídeo mais recentes aproximando os tempos de geração do tempo real, quão perto estamos de um vídeo generativo verdadeiramente interativo e quais barreiras técnicas ainda precisam ser superadas antes que a geração de vídeo em tempo real se torne comum?

Já estamos alcançando velocidades interativas para certas aplicações. O MachGen gera um vídeo Vidu Q3 Turbo de cinco segundos em 720p em cerca de seis segundos e em 540p em menos de três. Isso é rápido o suficiente para iterações criativas ágeis e coloca avatares responsivos e vídeo interativo ao nosso alcance.

Um exemplo do que eu considero interativo. Imagine que você está assistindo a uma história, pode ver para onde o final está indo e não gosta disso. Em vez de ficar passivamente, você redireciona: esses dois personagens deveriam descobrir o que o terceiro está escondendo e confrontá‑lo, em vez de deixar que tudo se desenrole. Conteúdo que você controla em vez de conteúdo que recebe. É isso que a geração rápida e barata possibilita, e muda quase tudo o que consumimos.

Chegar lá geralmente requer mais de um benchmark de latência robusto. Toda a experiência precisa permanecer responsiva sob tráfego de produção, mantendo qualidade visual, consistência quadro a quadro e custo previsível. Vídeos mais longos, resoluções mais altas e solicitações simultâneas aumentam a carga da infraestrutura, e o sistema ainda precisa provisionar capacidade, rotear solicitações e se recuperar de falhas de hardware sem que o usuário perceba.

Chegará caso a caso. Clipes curtos, avatares, jogos e ferramentas criativas provavelmente serão os primeiros, pois a geração medida em segundos já é suficiente para eles. À medida que a qualidade dos modelos e o desempenho de inferência melhoram juntos, mais aplicações ultrapassarão esse limite.

À medida que agentes de IA geram imagens e vídeos de forma autônoma, em vez de esperar que um humano pressione um botão, como isso altera os requisitos de infraestrutura? As cargas de trabalho dirigidas por agentes criam demandas fundamentalmente diferentes em termos de latência, simultaneidade, custo e confiabilidade?

Um agente transforma uma única solicitação do usuário em dezenas ou centenas de tarefas de geração. Ele cria várias opções, avalia‑as, revisa o prompt e repete o processo, sem intervenção humana entre as etapas.

Isso torna latência, simultaneidade, custo e confiabilidade muito mais importantes. Se cada geração leva minutos, o fluxo de trabalho do agente é lento demais para ser útil. Se cada tentativa for cara, a iteração autônoma se torna economicamente inviável. O sistema também precisa lidar com muitas solicitações simultâneas de forma confiável, pois uma falha pode interromper toda a cadeia de trabalho.

É aqui que recursos como provisionamento de GPUs, escalonamento automático e roteamento são tão importantes quanto a otimização ao nível do modelo. A demanda de agentes é muito mais explosiva que a demanda de uma aplicação criativa onde uma pessoa clica em um botão.

A unidade de trabalho relevante deixa de ser uma única imagem ou vídeo. É o ciclo completo de gerar, avaliar e refinar o conteúdo. A infraestrutura precisa tornar esse ciclo inteiro rápido, acessível e confiável.

Há uma competição intensa entre provedores de GPUs, nuvens de inferência, desenvolvedores de modelos e plataformas de otimização. À medida que o hardware em si se torna mais rápido, por que as empresas ainda precisarão de uma camada de inferência especializada como o MachGen, em vez de contar apenas com melhorias da NVIDIA, AMD, provedores de nuvem ou dos próprios desenvolvedores de modelos?

Hardware mais rápido eleva o teto. O software determina quanto desse teto será alcançado.

Vimos isso acontecer com LLMs. Novos aceleradores melhoraram o desempenho bruto a cada geração, e o batching contínuo, a gestão de KV‑cache, a decodificação especulativa e kernels especializados ainda foram o que levaram a indústria ao throughput e à economia de nível de produção. Nada disso veio do hardware.

Otimizar continuamente todo o caminho de produção para geração de imagens e vídeos é um trabalho diferente do que os fornecedores de hardware, provedores de nuvem e desenvolvedores de modelos estão fazendo, e não é uma prioridade central para nenhum deles.

Existem algumas abordagens para esse trabalho. Uma é o modelo de marketplace, onde os modelos são agregados e as solicitações são roteadas. Não acreditamos que isso seja defensável a longo prazo, porque não há controle sobre a camada onde reside o desempenho. Optamos por construir a pilha nós mesmos e hospedar nativamente, que é a única forma de alcançar os números de latência e custo que observamos.

Isso significa ajustar atenção, cache, kernels, precisão, memória e paralelismo por modelo e por acelerador, além de suportar APIs gerenciadas, nuvem dedicada e implantação auto-hospedada. À medida que o número de modelos e opções de hardware aumenta, a complexidade também cresce. Nosso papel é absorver isso para que nossos clientes possam dedicar seu tempo ao que diferencia seus produtos.

Você descreveu modelos de mundo como parte da visão de longo prazo da MachGen, com muitas de suas características computacionais assemelhando‑se a cargas de trabalho de difusão. Como deve ser a infraestrutura para modelos de mundo em escala de produção, e quais aplicações se tornam possíveis se gerar e simular ambientes visuais eventualmente se tornar tão barato e responsivo quanto gerar texto hoje?

Uma forma de pensar em nossa plataforma é compará‑la a um LLM de uso geral. O mesmo modelo redige um contrato legal e responde a uma pergunta sobre restaurantes. Para nós, a mesma pilha atende empresas de avatares de vídeo, publicidade em IA, geração de histórias e microdramas, e eventualmente modelos de mundo. Verticais diferentes, um conjunto de problemas de desempenho subjacentes.

Modelos de mundo não são nosso negócio principal hoje, mas são para onde estamos caminhando, e estamos trabalhando ativamente neles. Modelos de mundo em escala de produção precisarão de taxa de transferência muito alta e latência muito baixa, pois geram e atualizam continuamente um ambiente em vez de produzir uma única saída. Também exigem consistência espacial e temporal, capacidade de responder a ações e, frequentemente, a habilidade de simular múltiplos resultados possíveis simultaneamente. Isso gera problemas difíceis de memória, movimentação de dados, paralelismo e confiabilidade. Um modelo de mundo que controla um robô ou um jogo não pode levar minutos para produzir o próximo estado. O desempenho decide se esses sistemas são utilizáveis de fato.

Computacionalmente, os modelos de mundo atuais se assemelham muito a modelos de difusão, portanto a pilha que estamos construindo agora é a base natural. Ainda não existe uma camada de serviço madura de nível de produção para eles, comparável ao que existe para LLMs. Pretendemos construí‑la.

Se a simulação se tornar tão responsiva e acessível quanto a geração de texto hoje, robôs podem ensaiar situações raras antes de enfrentá‑las, jogos podem gerar ambientes que respondem a jogadores individuais e designers podem testar dezenas de possibilidades antes de construí‑las no mundo físico. A difusão é onde garantimos nossa subsistência atualmente. Modelos de mundo são nossa Estrela Guia.

Obrigado pela ótima entrevista, leitores que desejam saber mais devem visitar MachGen AI.

Antoine é um líder visionário e sócio-fundador da Unite.AI, impulsionado por uma paixão inabalável por moldar e promover o futuro da IA e da robótica. Um empreendedor serial, ele acredita que a IA será tão disruptiva para a sociedade quanto a eletricidade, e é frequentemente pego falando sobre o potencial das tecnologias disruptivas e da AGI.

Como um futurista, ele está dedicado a explorar como essas inovações moldarão nosso mundo. Além disso, ele é o fundador da Securities.io, uma plataforma focada em investir em tecnologias de ponta que estão redefinindo o futuro e remodelando setores inteiros.