Entrevistas
Alex Ratner, CEO e Co-Fundador da Snorkel AI – Série de Entrevistas

Alex Ratner é o CEO e Co-Fundador da Snorkel AI, uma empresa nascida no laboratório de IA da Stanford.
Snorkel AI torna o desenvolvimento de IA rápido e prático, transformando processos manuais de desenvolvimento de IA em soluções programáticas. A Snorkel AI permite que as empresas desenvolvam IA que funciona para suas cargas de trabalho únicas, usando seus dados e conhecimento proprietários 10-100x mais rápido.
O que o atraiu inicialmente para a ciência da computação?
Há dois aspectos muito emocionais da ciência da computação quando você é jovem. Um, você pode aprender tão rápido quanto quiser, brincando e construindo, dado o feedback instantâneo, em vez de ter que esperar por um professor. Dois, você pode construir muito sem ter que pedir permissão a ninguém!
Eu me interessei por programação quando era um garoto por esses motivos. Eu também amava a precisão que exigia. Eu gostava do processo de abstrair processos e rotinas complexas e, em seguida, codificá-las de forma modular.
Depois, como adulto, eu retornei à ciência da computação profissionalmente por meio de um emprego de consultoria, onde fui encarregado de escrever scripts para fazer algumas análises básicas do corpus de patentes. Eu fiquei fascinado por quanto conhecimento humano – qualquer coisa que alguém já havia considerado patenteável – estava disponível, mas era tão inacessível porque era tão difícil fazer até mesmo as análises mais simples sobre texto técnico complexo e dados multimodais.
Isso me levou de volta ao buraco do coelho e, eventualmente, de volta à pós-graduação em Stanford, me concentrando em PLN, que é a área de usar ML/IA em linguagem natural.
Você começou e liderou o projeto de código aberto Snorkel enquanto estava em Stanford, pode nos contar sobre a jornada desses primeiros dias?
Naquela época, estávamos, como muitos na indústria, focados em desenvolver novos algoritmos e – ou seja, todas as coisas “fancy” de aprendizado de máquina que as pessoas na comunidade faziam pesquisas e publicavam artigos.
No entanto, estávamos sempre muito comprometidos em fundamentar isso em problemas do mundo real – principalmente com médicos e cientistas em Stanford. Mas toda vez que apresentávamos um novo modelo ou algoritmo, a resposta se tornava “sim, tentaríamos isso, mas precisaríamos de todos esses dados de treinamento rotulados que não temos tempo para criar!”
Nós estávamos vendo que o grande problema não dito era em torno do processo de rotulagem e curação desses dados de treinamento – então mudamos todo o nosso foco para isso, o que é como o projeto Snorkel e a ideia de “IA centrada em dados” começou.
A Snorkel tem uma abordagem de IA centrada em dados, pode definir o que isso significa e como difere do desenvolvimento de IA centrado em modelos?
IA centrada em dados significa se concentrar em construir melhores dados para construir melhores modelos.
Isso se opõe – mas trabalha em conjunto com – IA centrada em modelos. Na IA centrada em modelos, os cientistas de dados ou pesquisadores assumem que os dados são estáticos e destinam sua energia para ajustar arquiteturas de modelos e parâmetros para alcançar melhores resultados.
Pesquisadores ainda fazem um ótimo trabalho em IA centrada em modelos, mas os modelos e técnicas de auto ML melhoraram tanto que a escolha do modelo se tornou comoditizada no tempo de produção. Quando isso é o caso, a melhor maneira de melhorar esses modelos é fornecê-los com mais e melhores dados.
Quais são os princípios básicos de uma abordagem de IA centrada em dados?
O princípio básico da IA centrada em dados é simples: melhores dados constroem melhores modelos.
Em nosso trabalho acadêmico, chamamos isso de “programação de dados”. A ideia é que, se você alimentar um modelo robusto o suficiente com exemplos de entradas e saídas esperadas, o modelo aprenderá a duplicar esses padrões.
Isso apresenta um desafio maior do que você pode esperar. A grande maioria dos dados não tem rótulos – ou, pelo menos, não tem rótulos úteis para sua aplicação. Rotular esses dados à mão exige tediosidade, tempo e esforço humano.
Ter um conjunto de dados rotulados também não garante qualidade. O erro humano se infiltra em todos os lugares. Cada exemplo incorreto no seu conjunto de dados de treinamento degrada o desempenho do modelo final. Nenhuma quantidade de ajuste de parâmetros pode disfarçar essa realidade. Pesquisadores até encontraram registros incorretamente rotulados em conjuntos de dados de código aberto fundamentais.
Pode elaborar sobre o que significa para a IA centrada em dados ser programática?
Rotular dados manualmente apresenta desafios sérios. Isso exige muitas horas humanas e, às vezes, essas horas humanas podem ser caras. Documentos médicos, por exemplo, só podem ser rotulados por médicos.
Além disso, os sprints de rotulagem manual frequentemente se resumem a projetos de uso único. Os rotuladores anotam os dados de acordo com um esquema rígido. Se as necessidades de uma empresa mudam e exigem um conjunto diferente de rótulos, os rotuladores devem começar novamente do zero.
Abordagens programáticas para a IA centrada em dados minimizam ambos os problemas. O sistema de rotulagem programático da Snorkel AI incorpora sinais diversificados – de modelos legados a rótulos existentes a bases de conhecimento externas – para desenvolver rótulos probabilísticos em escala. Nossa principal fonte de sinal vem de especialistas em matéria que colaboram com cientistas de dados para construir funções de rotulagem. Essas funções codificam o julgamento de especialistas em regras escaláveis, permitindo que o esforço investido em uma decisão afete dezenas ou centenas de pontos de dados.
Essa estrutura também é flexível. Em vez de começar do zero quando as necessidades da empresa mudam, os usuários adicionam, removem e ajustam funções de rotulagem para aplicar novos rótulos em horas, em vez de dias.
Como essa abordagem de IA centrada em dados permite o escalonamento rápido de dados não rotulados?
Nossa abordagem programática para a IA centrada em dados permite o escalonamento rápido de dados não rotulados, ampliando o impacto de cada escolha. Uma vez que os especialistas em matéria estabelecem um conjunto inicial pequeno de dados de treinamento, eles começam a colaborar com cientistas de dados para iteração rápida. Eles definem algumas funções de rotulagem, treinam um modelo rápido, analisam o impacto de suas funções de rotulagem e, em seguida, adicionam, removem ou ajustam funções de rotulagem conforme necessário.
Cada ciclo melhora o desempenho do modelo até que atinja ou supere os objetivos do projeto. Isso pode reduzir meses de trabalho de rotulagem de dados para apenas horas. Em um projeto de pesquisa da Snorkel, dois de nossos pesquisadores rotularam 20.000 documentos em um único dia – um volume que poderia ter levado rotuladores manuais dez semanas ou mais.
A Snorkel oferece várias soluções de IA, incluindo Snorkel Flow, Snorkel GenGlow e Snorkel Foundry. Quais são as diferenças entre essas ofertas?
A suíte de IA da Snorkel permite que os usuários criem funções de rotulagem (por exemplo, procurando palavras-chave ou padrões em documentos) para rotular programaticamente milhões de pontos de dados em minutos, em vez de rotular manualmente um ponto de dados de cada vez.
Isso comprime o tempo necessário para as empresas traduzirem dados proprietários em modelos prontos para produção e começarem a extrair valor deles. A Snorkel AI permite que as empresas escalonem abordagens de humano no loop, incorporando eficientemente o julgamento humano e o conhecimento de especialistas em matéria.
Isso leva a IA mais transparente e explicável, equipando as empresas para gerenciar viés e entregar resultados responsáveis.
Para entrar nos detalhes, a IA da Snorkel permite que as empresas da Fortune 500:
- Desenvolvam dados rotulados de alta qualidade para treinar modelos ou melhorar RAG;
- Personalizem LLMs com ajuste fino;
- Destilem LLMs em modelos especializados que são muito menores e mais baratos para operar;
- Construam LLMs específicos de domínio e tarefa com pré-treinamento.
Você escreveu alguns artigos revolucionários, na sua opinião, qual é o seu artigo mais importante?
Um dos artigos-chave foi o original sobre programação de dados (rotulagem de dados de treinamento de forma programática) e sobre o Snorkel.
Qual é a sua visão para o futuro da Snorkel?
Eu vejo a Snorkel se tornando um parceiro confiável para todas as grandes empresas que estão sérias sobre IA.
A Snorkel Flow deve se tornar uma ferramenta ubíqua para equipes de ciência de dados em grandes empresas – seja para ajustar finamente modelos de linguagem grandes personalizados para suas organizações, construir modelos de classificação de imagens ou construir modelos de regressão logística simples e implantáveis.
Independentemente do tipo de modelos que uma empresa precise, eles precisarão de dados rotulados de alta qualidade para treinar.
Obrigado pela grande entrevista, leitores que desejam aprender mais devem visitar Snorkel AI,












