Entrevistas
Rob May, CEO e Co-Fundador da NeuroMetric – Série de Entrevistas

Rob May, CEO e Co-Fundador da NeuroMetric, é um empreendedor experiente e investidor com um longo histórico que abrange computação em nuvem, startups de IA e capital de risco, atualmente liderando a NeuroMetric AI, além de servir como Diretor Geral da HalfCourt Ventures, onde apoiou mais de 100 empresas de tecnologia. Além de seus papéis operacionais e de investimento, ele co-fundou a Comunidade de Inovadores de IA e anteriormente construiu e vendeu empresas como a Backupify, refletindo uma profunda experiência em múltiplos ciclos tecnológicos. Ele também é amplamente conhecido por seu newsletter Investing in AI, que ele começou a escrever há mais de uma década para analisar tendências emergentes de IA, estratégias de investimento e mudanças no mercado, e que desde então evoluiu para uma plataforma para insights mais profundos sobre o cenário de IA em rápida evolução.
NeuroMetric AI está focada em resolver um dos desafios mais críticos da inteligência artificial hoje: o custo e a eficiência da inferência em escala. A plataforma avalia dinamicamente as cargas de trabalho de IA e aplica estratégias de otimização — como combinar modelos menores e especializados com técnicas de computação avançadas em tempo de teste — para melhorar o desempenho enquanto reduz drasticamente os custos, permitindo que as empresas alcancem um melhor retorno sobre o investimento em implantações de IA. Ao orquestrar as cargas de trabalho e personalizar o uso de modelos para tarefas específicas, a NeuroMetric visa tornar os sistemas de IA significativamente mais rápidos e acessíveis, posicionando-se na interseção da infraestrutura de IA, eficiência e escalabilidade no mundo real, à medida que as organizações passam da experimentação para a produção.
Você fundou e liderou várias empresas de IA, investiu em mais de 100 startups por meio da HalfCourt Ventures e anteriormente construiu e vendeu a Backupify. Como essas experiências moldaram sua perspectiva sobre onde o valor duradouro é criado na IA hoje?
Acho que a maioria dos investidores e empreendedores está perseguindo barreiras de curto prazo – coisas que parecem lacunas óbvias no mercado hoje, mas lacunas que serão rapidamente fechadas por empresas existentes. A IA vai fazer com que a gestão de um negócio se torne uma série de decisões probabilísticas. As empresas para investir ou construir são aquelas que têm as melhores estimativas gerais dessas probabilidades. Às vezes, isso virá da integração vertical e, às vezes, da escala horizontal – depende do mercado.
Em seu newsletter Investing in AI, você argumentou que os modelos estão se tornando cada vez mais intercambiáveis e que a verdadeira defensibilidade se desloca para a camada de sistemas. O que um “moat de sistemas” verdadeiro parece na prática?
Um moat de sistemas verdadeiro tem três propriedades: ele se acumula com o uso, é específico para o cliente e não pode ser replicado apenas trocando por um modelo melhor.
A defensibilidade vive no que eu chamo de “Sistema de Contexto” — uma arquitetura integrada que conecta modelos de base a tudo o que torna uma empresa única: seus dados, fluxos de trabalho, conhecimento de domínio, histórico de decisões. O sistema captura o sinal de cada interação — quais modelos têm sucesso em quais tarefas, onde a latência importa, quais padrões empresariais específicos surgem — e alimenta isso de volta para melhorar a si mesmo.
A chave para entender é que isso cria uma roda de flywheel multiplicativa, não aditiva. Você não está apenas acumulando um registro de decisões passadas. Você está gerando um sinal de treinamento que produz modelos especializados que melhoram o roteamento, o que captura dados mais valiosos. O moat se alarga com cada inferência.
Na prática, um moat de sistemas parece como uma integração profunda de fluxo de trabalho, onde os custos de troca não são sobre APIs — são sobre reescrever a lógica de negócios. Parece como contexto proprietário que nenhum concorrente pode replicar porque foi gerado por meio de meses de uso de produção dentro de uma empresa específica. E parece como o loop de especialização contínua, onde o sistema se torna significativamente melhor para aquele cliente de maneiras que um provedor de modelo genérico nunca fará.
A era dos modelos nos deu a capacidade bruta. A era dos sistemas é onde essa capacidade se torna valor real no mundo.
Como as empresas devem pensar sobre a construção de uma estratégia multi-modelo, incluindo lógica de roteamento, caminhos de escalada e avaliação contínua, em vez de confiar em um único modelo de fronteira?
A primeira coisa que as empresas precisam internalizar é que “apenas use o melhor modelo” é uma estratégia perdedora em escala. É o equivalente a executar cada consulta por meio do seu engenheiro mais sênior. É caro, é lento e — contraintuitivamente — nem sempre produz os melhores resultados.
Isso leva ao que eu chamo de Fronteira Irregular da Inferência: o desempenho do modelo é específico da tarefa e imprevisível. Modelos de fronteira perdem para modelos menores e especializados em tarefas específicas o tempo todo. Vimos sistemas compostos multi-modelo atingir 72,7% de precisão em tarefas de CRM, onde os modelos de fronteira marcaram 58%. A superfície de desempenho não se correlaciona nitidamente com a contagem de parâmetros. Então, a pergunta real não é “qual modelo é o melhor?” — é “qual modelo é o melhor para essa sub-tarefa específica?”
Essa reformulação é a base de uma estratégia multi-modelo real. Aqui está como eu diria às empresas para pensar sobre isso em três camadas.
Lógica de roteamento começa com a mapeamento do seu paisagem de inferência. Catalogue cada ponto no seu sistema onde uma chamada de LLM é feita, e para cada um, documente o tipo de tarefa, complexidade de entrada/saída, requisitos de latência, limiar de precisão e volume de chamadas. Isso lhe dá um mapa de calor. Você rapidamente encontrará que a maior parte do seu volume é trabalho de alta frequência e escopo estreito — classificação, extração de entidades, roteamento de intenção, geração de modelos — onde um modelo menor e ajustado pode igualar ou superar o modelo de fronteira a uma fração do custo. Reserve suas chamadas de fronteira caras para as tarefas que genuinamente requerem raciocínio complexo. Um agente que faz 50 chamadas por tarefa não precisa do GPT-4 para todas as 50.
Caminhos de escalada são sobre construir fallbacks inteligentes, não apenas failover. O sistema precisa reconhecer quando um modelo menor está retornando resultados de baixa confiança e escalar para um modelo mais capaz — ou para uma combinação de modelo-estratégia completamente diferente. É aqui que as estratégias de computação em tempo de teste entram. Às vezes, a resposta certa não é um modelo maior — é o mesmo modelo com chain-of-thought, beam search ou amostragem best-of-N. A configuração ótima muda não apenas por modelo, mas pela estratégia de pensamento que você a combina.
Avaliação contínua é a peça que a maioria das empresas perde completamente, e é onde a verdadeira defensibilidade emerge. A seleção de modelo não é uma decisão única — é um problema de otimização contínua. Novos modelos são lançados constantemente, seus casos de uso evoluem e o desempenho degrada de maneiras que falham silenciosamente. Você não saberá que seu bot de atendimento ao cliente deu uma resposta 40% pior porque usou o modelo errado para aquele tipo de consulta — você apenas verá a perda de clientes três meses depois. Você precisa de infraestrutura que continuamente mede o que realmente funciona em combinações de modelo-tarefa e ajusta o roteamento com base em dados de desempenho reais, não em benchmarks.
A razão pela qual a maioria das empresas não fez essa mudança é que ninguém é demitido por escolher o modelo de fronteira — é o “ninguém é demitido por comprar da IBM” da IA. O ecossistema de fornecedores impulsiona a fronteira porque é onde os lucros estão. E a infraestrutura de orquestração necessária para realmente executar uma arquitetura multi-modelo — lógica de roteamento, mecanismos de fallback, gerenciamento de modelo, observabilidade — simplesmente não existe na maioria das empresas. Elas estão presas em um ótimo local onde os custos de troca e a incerteza de multi-modelo parecem maiores do que o gasto contínuo em inferência de fronteira.
Quais são os maiores erros que você vê as empresas cometem ao mudar de pilotos de IA para sistemas de produção?
Eles assumem que suas escolhas podem ser estáticas e de longo prazo. Na realidade, cada camada da pilha de tecnologia para IA está mudando rapidamente. As empresas precisam tomar decisões que forneçam opções e flexibilidade.
Em que tipos de fluxos de trabalho você viu modelos menores e específicos da tarefa superarem os grandes modelos de fronteira, e por que isso importa estrategicamente?
Nós vimos isso em quase todas as tarefas de trabalho diário comuns – coisas como contabilidade básica, resumo de texto, extração de entidades de vários documentos. Nós exploramos SLMs para centenas de tarefas de trabalho e elas quase sempre vencem se o problema for estruturado corretamente.
Você escreveu sobre a diminuição do custo marginal de implantar IA em novos casos de uso. Como isso muda a economia de longo prazo da adoção de IA para as empresas?
A narrativa da bolha assume que a receita de IA exige investimento de R&D proporcional em novos modelos. Não é assim. Os modelos são construídos. A infraestrutura existe. Cada caso de uso adicional é um prompt, uma conexão de dados, talvez algum ajuste fino leve — não outra corrida de treinamento de $100M. A curva de custo marginal se curva para baixo à medida que a plataforma amadurece.
Isso é o oposto de ferrovias ou telecomunicações, onde cada milha de trilho nova era cara. Na IA, construir o motor foi caro. Conectar coisas ao motor é barato e está ficando mais barato — os custos de inferência caíram aproximadamente 1.000x em dois anos. A pergunta para as empresas não é se a IA compensa. É quantos casos de uso você pode empilhar na mesma infraestrutura antes de a curva de receita superar a curva de custo.
Quais sinais as equipes técnicas devem usar para determinar quando mudar de modelo, ajustar ou construir modelos pequenos e especializados para tarefas?
Os sinais não são necessariamente técnicos. São mais impulsionados pelo desempenho ou economicamente. Por exemplo, mudar de modelo ou ajustar um modelo ou construir um SLM personalizado podem funcionar. A decisão depende se você está otimizando para latência ou custo, como frequentemente a tarefa é executada e quanto tempo leva para construir e implantar cada solução.
Como você projeta guardrails, monitoramento e governança de forma que realmente escala com o uso em vez de se tornar um gargalo?
O erro que a maioria das empresas comete é tratar a governança como um ponto de verificação — uma camada de revisão manual acoplada ao topo dos fluxos de trabalho de IA. Isso não escala. Torna-se o gargalo no momento em que o uso aumenta.
A governança precisa ser incorporada à própria camada de orquestração. Quando sua infraestrutura de roteamento já avalia cada chamada de inferência — qual modelo, qual tarefa, qual nível de confiança — adicionar guardrails é um custo marginal, não um novo sistema. A mesma camada que decide qual modelo lida com uma consulta pode aplicar políticas: filtragem de PII antes da chamada, validação de saída após, rastros de auditoria capturados automaticamente, alocação de custos por departamento.
A chave para entender é que as empresas não falham dentro dos sistemas de IA. Elas falham entre eles — nas transferências, escaladas e exceções. A governança que escala parece um plano de controle que torna cada ação de IA segura, auditável e repetível como um subproduto da execução, não um obstáculo a ela.
Você comparou o cenário de IA de hoje à transição de mainframes para PCs. O que essa descentralização significa para as startups que constroem na camada de sistemas?
Estamos na fase de mainframe da IA agora. Modelos de fronteira grandes e centralizados da OpenAI, Anthropic e Google (GOOGL ) foram necessários para focar esforços e demonstrar o que a IA poderia fazer. Essa fase funcionou. As capacidades são bem compreendidas. Mas assim como a computação não permaneceu centralizada, a IA também não permanecerá. Estamos entrando na era do PC — um ecossistema descentralizado onde modelos menores e especializados são executados mais próximos do trabalho.
Os dados de gastos já refletem isso. O investimento de IA das empresas agora é dividido quase igualmente entre infraestrutura e aplicações, e a participação de aplicações está crescendo mais rapidamente. A expansão é lateral — através de RH, jurídico, marketing, operações, finanças — não vertical em modelos maiores.
Para as startups que constroem na camada de sistemas, essa é a oportunidade de uma geração. Em um mundo centralizado, o provedor de modelo captura a maior parte do valor. Em um mundo descentralizado, o valor migra para as empresas que resolvem orquestração, roteamento, avaliação e especialização — os desafios operacionais de implantar um ecossistema de modelo heterogêneo em escala.
Minha projeção é que cerca de 25% da inferência de IA exigirá modelos de fronteira. Essas empresas estarão bem — isso é um couple de trilhões em TAM. Mas 75% serão executados em modelos de código aberto e modelos de tarefa especializados pequenos. Treinamos um modelo de 4 bilhões de parâmetros que superou os modelos de fronteira em uma tarefa de CRM específica, e é tão barato para executar que é quase de graça. Esse é o futuro — e ele precisa de uma camada de sistemas completamente nova para gerenciá-lo.
A analogia se mantém em todos os aspectos: os fornecedores de mainframe fizeram bem, mas a criação de riqueza real aconteceu no ecossistema de PC. O mesmo será verdadeiro na IA.
Olhando cinco anos à frente, você acredita que os provedores de modelo de fronteira capturarão a maior parte do valor, ou a maioria do impacto econômico virá da orquestração, otimização e sistemas aplicados construídos em torno deles?
Acho que o mercado de inferência de IA será um dos maiores mercados da história do mundo. Isso significa que os laboratórios de modelo de fronteira farão incrivelmente bem e ainda haverá oportunidades massivas para as empresas que constroem em torno deles. Quando você tem mercados de trilhões de dólares, resolver pequenos casos de bordo nesses mercados pode se tornar empresas de bilhões de dólares.
Obrigado pela grande entrevista, leitores que desejam aprender mais devem visitar NeuroMetric AI, ou devem se inscrever no newsletter Investing in AI.












