Entrevistas

Jason Knight é Co-fundador e VP de ML na OctoAI – Série de Entrevistas

mm
Adicione Unite.AI às suas fontes preferidas no Google

Jason Knight é Co-fundador e Vice-Presidente de Aprendizado de Máquina na OctoAI, a plataforma que entrega uma pilha completa para construtores de aplicativos executarem, ajustarem e dimensionarem seus aplicativos de IA na nuvem ou no local.

A OctoAI foi criada a partir da Universidade de Washington pelos criadores originais do Apache TVM, uma pilha de código aberto para portabilidade e desempenho de ML. O TVM permite que os modelos de ML sejam executados de forma eficiente em qualquer hardware de backend e rapidamente se tornou uma parte fundamental da arquitetura de dispositivos de consumo populares como o Amazon Alexa.

Você pode compartilhar a inspiração por trás da criação da OctoAI e o problema central que você visou resolver?

A IA tradicionalmente tem sido um campo complexo acessível apenas àqueles confortáveis com a matemática e o processamento de alto desempenho necessário para criar algo com ela. Mas a IA desbloqueia as interfaces de computação definitivas, aquelas de texto, voz e imagens programadas por exemplos e feedback, e traz o poder total da computação para todos na Terra. Antes da IA, apenas os programadores podiam fazer com que os computadores fizessem o que eles queriam escrevendo textos de linguagem de programação arcana.

A OctoAI foi criada para acelerar nosso caminho para essa realidade, para que mais pessoas possam usar e se beneficiar da IA. E as pessoas, por sua vez, podem usar a IA para criar ainda mais benefícios, acelerando as ciências, a medicina, a arte e muito mais.

Refletindo sobre sua experiência na Intel (INTC ), como seus papéis anteriores o prepararam para co-fundar e liderar o desenvolvimento na OctoAI?

A Intel e as startups de hardware de IA e biotecnologia antes dela me deram a perspectiva de ver como a IA é difícil mesmo para as empresas de tecnologia mais sofisticadas, e ainda assim como ela pode ser valiosa para aqueles que descobriram como usá-la. E vendo que a lacuna entre aqueles que se beneficiam da IA em comparação com aqueles que ainda não é principalmente uma questão de infraestrutura, computação e melhores práticas – e não magia.

O que diferencia a OctoStack de outras soluções de implantação de IA disponíveis no mercado hoje?

A OctoStack é a primeira pilha de tecnologia completa projetada especificamente para servir modelos de IA geradores em qualquer lugar. Ela oferece uma plataforma de produção de chave na mão que fornece inferência altamente otimizada, personalização de modelo e gerenciamento de ativos em escala empresarial.

A OctoStack permite que as organizações alcancem a autonomia da IA executando qualquer modelo em seu ambiente preferido com controle total sobre dados, modelos e hardware. Ela também entrega desempenho e eficiência de custo sem precedentes, com economias de até 12X em comparação com outras soluções como o GPT-4.

Você pode explicar as vantagens de implantar modelos de IA em um ambiente privado usando a OctoStack?

Os modelos hoje são onipresentes, mas montar a infraestrutura certa para executar esses modelos e aplicá-los com seus próprios dados é onde a roda de valor do negócio realmente começa a girar. Usar esses modelos em seus dados mais sensíveis e, em seguida, transformá-los em insights, melhor engenharia de prompt, pipelines RAG e fine-tuning é onde você pode obter o maior valor da IA geradora. Mas ainda é difícil para todas as empresas, exceto as mais sofisticadas, fazer isso sozinhas, é onde uma solução de chave na mão como a OctoStack pode acelerá-las e reunir as melhores práticas em um só lugar para seus praticantes.

Implantar modelos de IA em um ambiente privado usando a OctoStack oferece várias vantagens, incluindo segurança e controle aprimorados sobre dados e modelos. Os clientes podem executar aplicativos de IA geradora dentro de seus próprios VPCs ou no local, garantindo que seus dados permaneçam seguros e dentro de seus ambientes escolhidos. Essa abordagem também fornece às empresas a flexibilidade de executar qualquer modelo, seja ele de código aberto, personalizado ou proprietário, enquanto se beneficia de reduções de custo e melhorias de desempenho.

Quais desafios você enfrentou ao otimizar a OctoStack para suportar uma ampla gama de hardware e como esses desafios foram superados?

Otimizar a OctoStack para suportar uma ampla gama de hardware envolveu garantir a compatibilidade e o desempenho em vários dispositivos, como GPUs NVIDIA (NVDA ) e AMD e AWS Inferentia. A OctoAI superou esses desafios aproveitando sua profunda especialização em sistemas de IA, desenvolvida por meio de anos de pesquisa e desenvolvimento, para criar uma plataforma que atualiza continuamente e suporta tipos adicionais de hardware, casos de uso de GenAI e melhores práticas. Isso permite que a OctoAI entregue desempenho e eficiência de custo líderes no mercado.

Além disso, obter as últimas capacidades em IA geradora, como multimodalidade, chamada de função, seguindo estritamente o esquema JSON, hospedagem de fine-tuning eficiente e muito mais, nas mãos de seus desenvolvedores internos acelerará seu ponto de decolagem de IA.

A OctoAI tem uma rica história de aproveitar o Apache TVM. Como esse framework influenciou as capacidades da plataforma?

Criamos o Apache TVM para tornar fácil para desenvolvedores sofisticados escreverem bibliotecas de IA eficientes para GPUs e aceleradores de forma mais fácil. Fizemos isso porque obter o melhor desempenho do hardware de GPU e acelerador era crítico para a inferência de IA na época, assim como é agora.

Desde então, aproveitamos a mesma mentalidade e especialização para a pilha completa de servir Gen AI para entregar automação para um conjunto mais amplo de desenvolvedores.

Você pode discutir alguma melhoria significativa de desempenho que a OctoStack oferece, como o aumento de desempenho de 10 vezes em implantações em larga escala?

A OctoStack oferece melhorias significativas de desempenho, incluindo economias de até 12X em comparação com outros modelos como o GPT-4, sem sacrificar velocidade ou qualidade. Ela também fornece uma utilização de GPU 4X melhor e uma redução de 50% nos custos operacionais, permitindo que as organizações executem implantações em larga escala de forma eficiente e econômica.

Você pode compartilhar alguns casos de uso notáveis onde a OctoStack melhorou significativamente a implantação de IA para seus clientes?

Um caso de uso notável é o Apate.ai, um serviço global que combate golpes telefônicos usando IA conversacional geradora. O Apate.ai aproveitou a OctoStack para executar eficientemente sua suíte de modelos de linguagem em várias geografias, se beneficiando da flexibilidade, escala e segurança da OctoStack. Essa implantação permitiu que o Apate.ai entregasse modelos personalizados que suportam vários idiomas e dialetos regionais, atendendo aos requisitos de desempenho e segurança sensíveis.

Além disso, atendemos a centenas de fine-tunes para nosso cliente OpenPipe. Se eles criassem instâncias dedicadas para cada um deles, os casos de uso de seus clientes seriam inviáveis à medida que crescem e evoluem seus casos de uso e re-treinam continuamente seus fine-tunes de parâmetro eficiente para a qualidade máxima de saída a preços acessíveis.

Obrigado pela grande entrevista, leitores que desejam aprender mais devem visitar OctoAI.

Antoine é um líder visionário e sócio-fundador da Unite.AI, impulsionado por uma paixão inabalável por moldar e promover o futuro da IA e da robótica. Um empreendedor serial, ele acredita que a IA será tão disruptiva para a sociedade quanto a eletricidade, e é frequentemente pego falando sobre o potencial das tecnologias disruptivas e da AGI.

Como um futurista, ele está dedicado a explorar como essas inovações moldarão nosso mundo. Além disso, ele é o fundador da Securities.io, uma plataforma focada em investir em tecnologias de ponta que estão redefinindo o futuro e remodelando setores inteiros.