Entrevistas

Christian Stano, Field CTO da Anyscale – Série de Entrevistas

mm
Adicione Unite.AI às suas fontes preferidas no Google

Christian Stano, Field CTO da Anyscale, construiu sua carreira na interseção de infraestrutura de AI em larga escala, plataformas de machine learning e computação distribuída. Antes de se juntar à Anyscale, ele liderou a organização de plataforma de AI/ML da Attentive, onde escalou a infraestrutura que suportava a personalização para mais de meio bilhão de assinantes e ajudou a impulsionar a adoção de sistemas de computação unificados baseados em Ray, que melhoraram a velocidade de desenvolvimento enquanto reduziam os custos operacionais. No início de sua carreira, ele trabalhou em cibersegurança, arquitetura de nuvem e iniciativas de AI do setor público em organizações como Coalfire e Deloitte, onde contribuiu para uma das primeiras plataformas de machine learning do Departamento de Defesa dos EUA. Seu background abrange engenharia de plataforma de AI, MLOps, infraestrutura nativa em nuvem, habilitação de desenvolvedores e escalabilidade organizacional, o que lhe dá uma profunda experiência em ajudar empresas a operacionalizar a AI em escala de produção.

Anyscale é a empresa por trás de Ray, o framework de computação distribuída de código aberto amplamente utilizado para escalonar workloads de AI e Python em clusters de CPUs e GPUs. Fundada pelos criadores originais do Ray da UC Berkeley’s RISELab, a empresa se concentra em simplificar o deploy, orquestração e gerenciamento de infraestrutura de AI em larga escala para treinamento, inferência, processamento de dados e workloads de AI agêntica. Sua plataforma permite que as organizações executem sistemas de AI distribuídos em ambientes de nuvem e locais, enquanto fornece observabilidade, governança e otimizações de desempenho projetadas para aplicações de AI modernas. O Ray se tornou uma camada fundamental na pilha de infraestrutura de AI emergente, ajudando os desenvolvedores a escalonar workloads de uma única máquina para milhares de nós com alterações mínimas no código Python existente.

Você trabalhou em tudo, desde segurança cibernética até sistemas de personalização em larga escala. Quais padrões você viu consistentemente quando as organizações tentam mudar de pilotos de AI para produção?

Em todas as indústrias, três padrões aparecem regularmente. Primeiro, as equipes não têm um caminho confiável pavimentado do desenvolvimento para a produção. Elas podem construir um modelo em um notebook, mas não há uma maneira padronizada de colocá-lo em execução em produção. Cada deploy se torna um caso único, e cada falha é uma surpresa. Em segundo lugar, a infraestrutura não consegue escalar com as necessidades. O sistema que funcionou no piloto falha quando você alimenta volumes de dados reais ou tráfego real. Em terceiro lugar, as equipes estão voando às cegas. Elas não têm a observabilidade para saber como seus sistemas estão realmente se saindo, onde eles estão prestes a quebrar e quando intervir.

O que conecta todos os três é o mesmo desafio de raiz — as equipes não têm um modelo mental sólido para escalonar. Elas tentam resolver tudo de uma vez em vez de serem deliberadas sobre a sequência. Eu penso nisso como três fases: fazer funcionar, fazer certo, fazer rápido. Essas fases não são marcos de uma vez — elas são iterativas. Você está constantemente priorizando entre o que está quebrado agora e o que vai quebrar em seguida. As equipes que têm sucesso sabem em qual fase elas estão e permanecem disciplinadas sobre não pular à frente antes que a fundação seja sólida.

Na Anyscale, vemos equipes chegar em todos os estágios. Algumas ainda estão tentando fazer funcionar — elas precisam de um caminho confiável do desenvolvimento para a produção. Outras têm isso, mas estão afogadas em complexidade operacional e precisam fazer certo. E muitas vêm até nós porque construíram algo que funciona, mas não conseguem impulsioná-lo para a escala que os negócios exigem. Uma camada de computação unificada ajuda em cada fase, mas o ponto de entrada depende de onde a dor é mais aguda.

Na Attentive, você ajudou a escalar sistemas de AI que suportam centenas de milhões de usuários. Quais foram os principais gargalos arquiteturais ou organizacionais que você teve que superar para atingir esse nível de escala?

O maior gargalo foi a curva em S da complexidade da infraestrutura. À medida que impulsionávamos nossos modelos para incorporar mais dados e atender mais clientes, atingimos um ponto de inflexão de computação onde mesmo os nós mais verticalmente escalonados estavam lançando erros de falta de memória, e a escalabilidade horizontal ingênua não estava funcionando. Nossa capacidade de computação não conseguia acompanhar a escala de nossos dados.

A resposta natural foi camada sobre camada de ferramentas para trabalhar em torno dos limites. Essa era a minha playbook interna a partir de experiências anteriores. Cada ferramenta resolvia um problema estreito, mas adicionava complexidade operacional. Nosso pipeline de ML enfrentava se tornar um patchwork de integrações, e cada novo caso de uso significava mais costura, mais modos de falha, maiores custos e mais sobrecarga para a equipe de plataforma.

O que finalmente desbloqueou a escala para nós foi unificar o processamento de dados, treinamento, inferência e serviço em Ray e Anyscale. O impacto foi imediato: com custos de infraestrutura dramaticamente mais baixos, ciclos de treinamento significativamente mais rápidos, mesmo à medida que os volumes de dados cresciam, e a capacidade de escalonar modelos para ordens de magnitude mais clientes.

O que motivou sua decisão de se juntar à Anyscale nessa etapa, e como você vê o papel de Field CTO moldando a adoção de AI empresarial?

Minha experiência em trazer a Anyscale para a Attentive fundamentalmente mudou minha playbook para construir plataformas de ML. Antes disso, uma parte significativa da engenharia de plataforma era o custo de costurar sistemas fragmentados. Com a Anyscale, fomos capazes de eliminar grande parte dessa sobrecarga e, em vez disso, nos concentrar na experiência do desenvolvedor, confiabilidade e desempenho. Essa mudança teve um impacto enorme tanto na produtividade da equipe quanto nos resultados do sistema. Se juntar à Anyscale foi uma oportunidade de trabalhar nesse problema em tempo integral e ajudar outras organizações a navegar pela mesma transição. Como Field CTO, meu papel é basicamente pegar essas lições do mundo real e transformá-las em padrões repetíveis que nossos clientes possam aplicar à medida que escalonam a AI.

Muitas empresas ainda estão presas na “fase de piloto” da AI. Do seu ponto de vista, o que especificamente quebra quando as empresas tentam escalar esses experimentos iniciais em sistemas de produção?

Quando as empresas se movem de experimentos de AI para produção, o que quebra raramente é apenas o modelo — é o sistema e operações circundantes. Em alguns casos, as equipes atingem limites de infraestrutura cedo e não conseguem treinar ou servir na escala desejada. Elas têm que limitar o número de clientes ou casos de uso que o modelo serve como resultado. Mais frequentemente, problemas surgem na produção por meio de casos de bordo inesperados ou mudanças nos dados. Um dos pontos de falha mais comuns é a memória: à medida que o tamanho dos dados, distribuição ou modalidade muda, os trabalhos ficam sem memória e falham. Esses problemas são difíceis de antecipar e ainda mais difíceis de se recuperar automaticamente. A realidade é que a falha é inevitável na AI de produção. O objetivo não é evitar completamente, mas detectar rapidamente, entender e construir sistemas auto-recuperáveis para resolver antes que afete os negócios.

Ray, o framework de computação distribuída criado pela equipe por trás da Anyscale, está ganhando tração como uma base para workloads de AI. Por que a execução distribuída está se tornando uma camada tão crítica na infraestrutura de AI moderna?

A execução distribuída e o gerenciamento de workloads se tornaram fundamentais para pipelines de AI. As workloads de AI modernas são intrinsicamente paralelas e intensivas em recursos. Treinamento, inferência e processamento de dados todos exigem a coordenação de grandes números de tarefas em CPUs e GPUs, frequentemente de forma dinâmica. No paisagem de computação de hoje, a complexidade de gerenciar essas workloads em recursos escassos é uma carga operacional maciça. Os sistemas tradicionais não foram projetados para esse nível de complexidade ou escala. Frameworks como o Ray são críticos porque permitem que as equipes escalonem workloads de forma transparente de uma única máquina para milhares de nós, automatizando a coordenação subjacente. Essa mudança reflete uma mudança mais ampla em direção à computação nativa de AI, onde a infraestrutura é projetada especificamente para os padrões de workloads de AI em vez de adaptada de paradigmas mais antigos.

À medida que mais empresas adotam o Ray por meio da plataforma da Anyscale, quais são as diferenças que você vê entre as organizações que padronizam em uma abordagem unificada versus aquelas que costuram ferramentas fragmentadas?

A diferença entre plataformas unificadas e ferramentas fragmentadas ultimately se resume a foco e eficiência. Quando as equipes dependem de sistemas desconexos, elas gastam uma quantidade significativa de tempo costurando esses sistemas, gerenciando inconsistências e respondendo a falhas em diferentes ambientes. Isso cria sobrecarga operacional e desacelera a experimentação. Em contraste, uma abordagem unificada permite que as equipes concentrem seus esforços em melhorar um único sistema, o que leva a uma melhor confiabilidade, desempenho mais forte e uma experiência de desenvolvedor mais fluida. Isso também simplifica os processos de chamada e depuração porque os padrões são consistentes e mais fáceis de entender. O resultado não é apenas eficiência técnica, mas clareza organizacional.

Com base em sua experiência em construir plataformas de ML de ponta a ponta, quão importante é a experiência do desenvolvedor (DevEx) na aceleração da adoção de AI em equipes?

A experiência do desenvolvedor é uma das áreas de maior alavancagem para acelerar a adoção de AI. Quando as equipes de plataforma investem em tornar os sistemas mais fáceis de usar por meio de fluxos de trabalho padronizados, modelos, redução da fricção da infraestrutura, elas amplificam a produtividade de cada engenheiro na organização. Isso é especialmente importante na AI, onde o ritmo de mudança é extremamente rápido e as equipes precisam iterar rapidamente para permanecer competitivas. Melhorias na experiência do desenvolvedor se traduzem diretamente em experimentação mais rápida, tempo mais rápido para produção e, em última análise, maior impacto nos negócios. As ferramentas de codificação de AI amplificam esses fundamentos de DevEx. De muitas maneiras, é a forma mais escalável de aumentar a velocidade em toda a organização.

A eficiência de custo está se tornando uma grande preocupação à medida que as workloads de AI escalonam. Quais são algumas das maneiras mais negligenciadas pelas quais as empresas podem reduzir os custos de infraestrutura sem sacrificar o desempenho?

À medida que as workloads de AI escalonam, o gerenciamento de custos se torna tanto mais importante quanto mais complexo. Um dos desafios mais negligenciados é como os custos podem se espiralar rapidamente devido a ineficiências, especialmente com infraestrutura baseada em GPU. Grandes clusters podem iniciar milhares de nós, e se os recursos não forem gerenciados ou desligados corretamente, os custos se acumulam rapidamente. Isso cria uma forma de sprawl de AI específica, onde o uso de computação cresce mais rápido do que as equipes podem rastrear ou controlar. Abordar isso requer uma combinação de governança sólida, visibilidade e automação, como escalabilidade automática, término automático e gerenciamento de recursos centralizado. Em escala, a eficiência de custo não é apenas uma preocupação operacional, é um aspecto fundamental do design do sistema.

Você trabalhou em tudo, desde lojas de recursos até sistemas de inferência em tempo real. Como você acha que o equilíbrio entre workloads de AI em lote e em tempo real está evoluindo?

O equilíbrio entre workloads de AI em lote e em tempo real não mudou fundamentalmente — permanece uma questão de requisitos de negócios. O processamento em lote é tipicamente mais rentável e mais fácil de operar, tornando-o adequado para muitos casos de uso. Os sistemas em tempo real são essenciais quando a latência afeta diretamente a experiência do usuário ou o resultado dos negócios, como em aplicativos de chat ou detecção de fraude. Ambas as abordagens continuarão a coexistir, e a chave para as organizações é construir plataformas que possam suportar cada uma de forma eficaz. A decisão ultimately se resume a trade-offs entre custo, latência e confiabilidade.

Olhando para frente, como uma plataforma de AI empresarial “madura” parece em 2–3 anos — e como as ferramentas como o Ray e as plataformas como a Anyscale se encaixam nesse futuro?

Nos próximos anos, as plataformas de AI empresarial maduras serão definidas por algumas características-chave. Elas confiarão em infraestrutura unificada que suporte todo o ciclo de vida de AI, desde o processamento de dados até o treinamento e inferência, em vez de uma coleção de ferramentas desconexas. Elas terão operações do Dia 2 fortes, com capacidades de observabilidade automatizada, confiabilidade e depuração rápida. O gerenciamento de custos será previsível e governado, permitindo que as organizações escalonem de forma sustentável. E talvez o mais importante, elas permitirão uma alta velocidade de desenvolvedor, tornando fácil para as equipes se moverem de ideia para produção rapidamente. Plataformas como o Ray e a Anyscale desempenham um papel central nesse futuro, fornecendo a base nativa de AI que torna esse nível de escala e eficiência possível.

Obrigado pela grande entrevista, leitores que desejam aprender mais devem visitar Anyscale.

Antoine é um líder visionário e sócio-fundador da Unite.AI, impulsionado por uma paixão inabalável por moldar e promover o futuro da IA e da robótica. Um empreendedor serial, ele acredita que a IA será tão disruptiva para a sociedade quanto a eletricidade, e é frequentemente pego falando sobre o potencial das tecnologias disruptivas e da AGI.

Como um futurista, ele está dedicado a explorar como essas inovações moldarão nosso mundo. Além disso, ele é o fundador da Securities.io, uma plataforma focada em investir em tecnologias de ponta que estão redefinindo o futuro e remodelando setores inteiros.