Modelos e plataformas de IA
Snowflake Arctic: O Modelo LLM de Ponta para Inteligência Empresarial
As empresas de hoje estão cada vez mais explorando maneiras de aproveitar os grandes modelos de linguagem (LLMs) para impulsionar a produtividade e criar aplicações inteligentes. No entanto, muitas das opções de LLMs disponíveis são modelos genéricos não personalizados para necessidades empresariais especializadas, como análise de dados, codificação e automação de tarefas. É aqui que entra o Snowflake Arctic – um modelo LLM de ponta projetado e otimizado para casos de uso empresariais essenciais.
Desenvolvido pela equipe de pesquisa de IA da Snowflake, o Arctic impulsiona os limites do que é possível com treinamento eficiente, custo-efetividade e um nível sem precedentes de abertura. Este modelo revolucionário se destaca em benchmarks empresariais essenciais, enquanto requer muito menos poder de processamento em comparação com os LLMs existentes. Vamos mergulhar no que torna o Arctic um jogo-changer para a IA empresarial.
Inteligência Empresarial Redefinida Em seu núcleo, o Arctic está focado em entregar desempenho excepcional em métricas que realmente importam para as empresas – codificação, consultas SQL, seguimento de instruções complexas e produção de saídas baseadas em fatos. A Snowflake combinou essas capacidades críticas em uma métrica de “inteligência empresarial” inovadora.
Os resultados falam por si mesmos. O Arctic atende ou supera modelos como LLAMA 7B e LLAMA 70B em benchmarks de inteligência empresarial, enquanto usa menos da metade do orçamento de computação para treinamento. Notavelmente, apesar de utilizar 17 vezes menos recursos de computação do que o LLAMA 70B, o Arctic alcança paridade em testes especializados, como codificação (HumanEval+, MBPP+), geração de SQL (Spider) e seguimento de instruções (IFEval).
Mas a capacidade do Arctic vai além de apenas acertar benchmarks empresariais. Ele mantém um desempenho sólido em comparação com a compreensão geral da linguagem, raciocínio e aptidão matemática em comparação com modelos treinados com orçamentos de computação exponencialmente mais altos, como o DBRX. Essa capacidade holística torna o Arctic uma escolha inigualável para atender às diversas necessidades de IA de uma empresa.
A Inovação
Arquitetura Híbrida de Transformador Dense-MoE Como a equipe da Snowflake construiu um LLM tão incrivelmente capaz e eficiente? A resposta está na arquitetura de ponta do Arctic, baseada no Dense Mixture-of-Experts (MoE) Hybrid Transformer.
Os modelos de transformador densos tradicionais se tornam cada vez mais caros para treinar à medida que seu tamanho cresce, com requisitos computacionais aumentando linearmente. O design MoE ajuda a contornar isso, utilizando várias redes feed-forward paralelas (especialistas) e ativando apenas um subconjunto para cada token de entrada.
No entanto, usar apenas uma arquitetura MoE não é suficiente – o Arctic combina as forças de componentes densos e MoE de forma ingênua. Ele combina um codificador de transformador denso com 10 bilhões de parâmetros com uma camada de MLP residual MoE com 128 especialistas. Esse modelo híbrido totaliza 480 bilhões de parâmetros, mas apenas 17 bilhões estão ativos a qualquer momento, usando a porta de topo-2.
As implicações são profundas – o Arctic alcança uma qualidade de modelo e capacidade sem precedentes, enquanto permanece notavelmente eficiente em termos de computação durante o treinamento e inferência. Por exemplo, o Arctic tem 50% menos parâmetros ativos do que modelos como o DBRX durante a inferência.
Mas a arquitetura do modelo é apenas uma parte da história. A excelência do Arctic é o resultado de várias técnicas e insights inovadores desenvolvidos pela equipe de pesquisa da Snowflake:
- Currículo de Treinamento de Dados Empresariais A equipe descobriu que habilidades genéricas, como raciocínio baseado no senso comum, devem ser aprendidas no início, enquanto especializações mais complexas, como codificação e SQL, são melhor adquiridas mais tarde no processo de treinamento. O currículo de dados do Arctic segue uma abordagem de três etapas que imita progressões de aprendizado humanas.
Os primeiros teratokens se concentram em construir uma base geral ampla. Os próximos 1,5 teratokens se concentram em desenvolver habilidades empresariais por meio de dados personalizados para SQL, tarefas de codificação e mais. Os teratokens finais refinam ainda mais as especializações do Arctic usando conjuntos de dados refinados.
- Escolhas Arquiteturais Ótimas Embora os MoEs prometam melhor qualidade por computação, escolher as configurações certas é crucial, mas mal compreendido. Através de uma pesquisa detalhada, a Snowflake chegou a uma arquitetura que emprega 128 especialistas com porta de topo-2 em cada camada, avaliando trocas de qualidade-eficiência.
Aumentar o número de especialistas fornece mais combinações, melhorando a capacidade do modelo. No entanto, isso também aumenta os custos de comunicação, então a Snowflake chegou a 128 especialistas “condensados” ativados via porta de topo-2 como o equilíbrio ótimo.
- Co-Design do Sistema Mas mesmo uma arquitetura de modelo ótima pode ser prejudicada por gargalos do sistema. Então, a equipe da Snowflake inovou aqui também – projetando a arquitetura do modelo em conjunto com os sistemas subjacentes de treinamento e inferência.
Para treinamento eficiente, os componentes densos e MoE foram estruturados para permitir sobreposição de comunicação e computação, escondendo sobrecargas de comunicação substanciais. No lado da inferência, a equipe aproveitou as inovações da NVIDIA (NVDA ) para permitir implantação altamente eficiente, apesar da escala do Arctic.
Técnicas como quantização FP8 permitem que o modelo completo seja ajustado em um único nó de GPU para inferência interativa. Lotes maiores engajam as capacidades de paralelismo do Arctic em vários nós, permanecendo impressionantemente eficientes em termos de computação devido aos seus 17B de parâmetros ativos compactos.
Com uma licença Apache 2.0, os pesos e o código do Arctic estão disponíveis sem restrições para qualquer uso pessoal, de pesquisa ou comercial. Mas a Snowflake foi muito além, abrindo todo o seu “receita” de dados, implementações de modelo, dicas e insights de pesquisa que impulsionam o Arctic.
O “Livro de Receitas do Arctic” é uma base de conhecimento abrangente que cobre todos os aspectos de construir e otimizar um modelo MoE de grande escala como o Arctic. Ele destila aprendizados-chave em fontes de dados, design de arquitetura de modelo, co-design de sistema, esquemas de treinamento/inferência otimizados e mais.
Desde a identificação de currículos de dados ótimos até a arquitetura de MoEs enquanto co-otimiza compiladores, agendadores e hardware – esse corpo extenso de conhecimento democratiza habilidades anteriormente confinadas a laboratórios de IA de elite. O Livro de Receitas do Arctic acelera as curvas de aprendizado e capacita empresas, pesquisadores e desenvolvedores globalmente a criar seus próprios LLMs personalizados, eficientes em termos de custo, para quase qualquer caso de uso.
Introdução ao Arctic
Para as empresas ansiosas para aproveitar o Arctic, a Snowflake oferece várias maneiras de começar rapidamente:
Inferência sem Servidor: Os clientes da Snowflake podem acessar o modelo Arctic gratuitamente no Snowflake Cortex, a plataforma de IA totalmente gerenciada da empresa. Além disso, o Arctic está disponível em todos os principais catálogos de modelos, como AWS, Microsoft Azure, NVIDIA e mais.
Comece do Zero: Os pesos do modelo e as implementações de código aberto permitem que os desenvolvedores integrem o Arctic diretamente em seus aplicativos e serviços. O repositório do Arctic fornece exemplos de código, tutoriais de implantação, receitas de ajuste fino e mais.
Construa Modelos Personalizados: Graças às diretrizes exaustivas do Livro de Receitas do Arctic, os desenvolvedores podem construir seus próprios modelos MoE personalizados do zero, otimizados para qualquer caso de uso especializado, usando aprendizados do desenvolvimento do Arctic.
Uma Nova Era de IA Empresarial Aberta O Arctic é mais do que apenas outro poderoso modelo de linguagem – ele marca o início de uma nova era de capacidades de IA especializadas, otimizadas para empresas e construídas com base em uma ética de abertura e eficiência.
Desde a revolução da análise de dados e da produtividade de codificação até o impulsionamento da automação de tarefas e aplicações mais inteligentes, o DNA empresarial do Arctic o torna uma escolha inigualável em comparação com LLMs genéricos. E, ao abrir não apenas o modelo, mas todo o processo de P&D por trás dele, a Snowflake está fomentando uma cultura de colaboração que elevará todo o ecossistema de IA.
À medida que as empresas abraçam cada vez mais a IA geradora, o Arctic oferece um modelo ousado para o desenvolvimento de modelos objetivamente superiores para cargas de trabalho de produção e ambientes empresariais. Sua combinação de pesquisa de ponta, eficiência inigualável e ética aberta estabelece um novo padrão para democratizar o potencial transformador da IA.
Aqui está uma seção com exemplos de código sobre como usar o modelo Snowflake Arctic:
Trabalhando com o Arctic
Agora que cobrimos o que torna o Arctic verdadeiramente inovador, vamos mergulhar em como os desenvolvedores e cientistas de dados podem começar a colocar este modelo poderoso em ação.
Pronto para uso, o Arctic está disponível pré-treinado e pronto para implantação por meio de principais hubs de modelos, como Hugging Face, e plataformas de IA parceiras. Mas seu verdadeiro poder emerge quando personalizado e ajustado para seus casos de uso específicos.
Com sua licença Apache 2.0, o Arctic oferece total liberdade para integrá-lo em seus aplicativos, serviços ou fluxos de trabalho de IA personalizados. Vamos percorrer alguns exemplos de código usando a biblioteca de transformadores para começar:
Gerando Texto Básico com o Arctic
Para casos de uso de geração de texto rápido, podemos carregar o Arctic e executar inferência básica muito facilmente:
[código em Python]from transformers import AutoTokenizer, AutoModelForCausalLM
# Carregar o tokenizador e o modelo
tokenizer = AutoTokenizer.from_pretrained(“Snowflake/snowflake-arctic-instruct”)
model = AutoModelForCausalLM.from_pretrained(“Snowflake/snowflake-arctic-instruct”)
# Criar uma entrada simples e gerar texto
input_text = “Aqui está uma pergunta básica: Qual é a capital da França?”
input_ids = tokenizer.encode(input_text, return_tensors=”pt”)
# Gerar resposta com o Arctic
output = model.generate(input_ids, max_length=150, do_sample=True, top_k=50, top_p=0.95, num_return_sequences=1)
generated_text = tokenizer.decode(output[0], skip_special_tokens=True)
print(generated_text)
[/código]
Isso deve produzir algo como:
“A capital da França é Paris. Paris é a maior cidade da França e o centro econômico, político e cultural do país. É lar de famosos pontos turísticos como a Torre Eiffel, o Museu do Louvre e a Catedral de Notre-Dame.”
Como você pode ver, o Arctic entende perfeitamente a consulta e fornece uma resposta detalhada e baseada em fatos, aproveitando suas robustas capacidades de compreensão de linguagem.
Ajuste Fino para Tarefas Especializadas
Embora impressionante pronto para uso, o Arctic realmente brilha quando personalizado e ajustado em seus próprios conjuntos de dados para tarefas especializadas. A Snowflake forneceu receitas abrangentes que cobrem:
- Criar conjuntos de dados de treinamento de alta qualidade personalizados para seu caso de uso
- Implementar currículos de treinamento personalizados em múltiplas etapas
- Aproveitar abordagens de ajuste fino eficientes, como LoRA, P-Tuning ou FactorizedFusion
- Otimizações para discernir habilidades de SQL, codificação ou outras habilidades empresariais-chave
Aqui está um exemplo de como ajustar o Arctic em seus próprios conjuntos de dados de codificação usando LoRA e as receitas da Snowflake:
[código em Python]from transformers import AutoModelForCausalLM, AutoTokenizer
from peft import LoraConfig, get_peft_model, prepare_model_for_int8_training
# Carregar o modelo base do Arctic
tokenizer = AutoTokenizer.from_pretrained(“Snowflake/snowflake-arctic-instruct”)
model = AutoModelForCausalLM.from_pretrained(“Snowflake/snowflake-arctic-instruct”, load_in_8bit=True)
# Inicializar configurações LoRA
lora_config = LoraConfig(
r=8,
lora_alpha=16,
target_modules=[“query_key_value”],
lora_dropout=0.05,
bias=”none”,
task_type=”CAUSAL_LM”
)
# Preparar o modelo para ajuste fino LoRA
model = prepare_model_for_int8_training(model)
model = get_peft_model(model, lora_config)
# Seus conjuntos de dados de codificação
data = load_coding_datasets()
# Ajustar com as receitas da Snowflake
train(model, data, …)
[/código]
Este código ilustra como você pode facilmente carregar o Arctic, inicializar uma configuração LoRA personalizada para geração de código e, em seguida, ajustar o modelo em seus próprios conjuntos de dados de codificação, aproveitando a orientação da Snowflake.
Personalizado e ajustado, o Arctic se torna uma força poderosa personalizada para entregar desempenho incomparável em seus fluxos de trabalho e necessidades empresariais essenciais.
Ciclo de Inovação Rápido do Arctic
Um dos aspectos mais impressionantes do Arctic é o ritmo alucinante com que a equipe de pesquisa de IA da Snowflake concebeu, desenvolveu e lançou este modelo de ponta para o mundo. Desde a concepção até o lançamento de código aberto, o projeto Arctic inteiro levou menos de três meses e utilizou apenas cerca de um oitavo do orçamento de computação típico para treinar modelos de linguagem de grande escala semelhantes.
Essa capacidade de iterar rapidamente, inovar e produzir pesquisas de IA de ponta é verdadeiramente notável. Isso demonstra as profundas capacidades técnicas da Snowflake e a posiciona para continuar impulsionando os limites no desenvolvimento de capacidades de IA otimizadas para empresas.
A Família Arctic e Incorporações
O Arctic é apenas o começo das ambições da Snowflake no espaço de LLMs empresariais. A empresa já abriu o código-fonte da família de modelos de incorporação de texto Arctic, otimizados para desempenho de recuperação em vários perfis de tamanho.
Como ilustrado abaixo, os modelos de Incorporação do Arctic alcançam precisão de recuperação de estado da arte no benchmark de recuperação de texto MTEB, superando outros modelos de incorporação líderes, incluindo ofertas fechadas de grandes gigantes da tecnologia.
[Inserir imagem mostrando resultados do benchmark de recuperação MTEB para modelos de Incorporação do Arctic]
Esses modelos de incorporação complementam o LLM do Arctic e permitem que as empresas construam soluções poderosas de questionamento e resposta e geração aumentada por recuperação a partir de uma pilha de código aberto integrada.
Mas a estrada da Snowflake se estende muito além do Arctic e das incorporações. Os pesquisadores de IA da empresa estão trabalhando arduamente na expansão da família do Arctic com novos modelos personalizados para tarefas multimodais, fala, vídeo e mais capacidades de fronteira – todos construídos usando os mesmos princípios de especialização, eficiência e abertura.
Parceria para um Ecossistema de IA Aberto A Snowflake entende que realizar o potencial total de IA empresarial de código aberto exige o cultivo de um ecossistema rico de parcerias em toda a comunidade de IA. O lançamento do Arctic já galvanizou colaborações com principais plataformas e provedores:
A NVIDIA se associou estreitamente à Snowflake para otimizar o Arctic para implantação eficiente usando a pilha de inferência de IA de ponta da NVIDIA, incluindo TensorRT, Triton e mais. Isso permite que as empresas sirvam o Arctic em escala de forma rentável.
A Hugging Face, o principal hub de modelos de código aberto, acolheu o Arctic em suas bibliotecas e repositórios de modelos. Isso permite a integração sem esforço do Arctic em fluxos de trabalho e aplicações de IA existentes baseados na Hugging Face.
Plataformas como Replicate, SageMaker e mais se movem rapidamente para oferecer demonstrações hospedadas, APIs e caminhos de integração fluentes para o Arctic, acelerando sua adoção.
O código aberto guiou o desenvolvimento do Arctic, e ecossistemas abertos permanecem centrais para sua evolução. A Snowflake está comprometida em fomentar uma colaboração rica com pesquisadores, desenvolvedores, parceiros e empresas globalmente para impulsionar os limites do que é possível com modelos de IA especializados e de código aberto.












