Modelos e plataformas de IA
A Batalha entre os Modelos de Linguagem de Código Aberto e Fechado: Uma Análise Técnica
Os grandes modelos de linguagem (LLMs) capturaram a atenção da comunidade de IA nos últimos anos, liderando avanços no processamento de linguagem natural. Por trás do hype, há um debate complexo – esses modelos poderosos devem ser de código aberto ou fechado?
Neste post, analisaremos a diferença técnica entre essas abordagens para entender as oportunidades e limitações que cada uma apresenta. Vamos cobrir os seguintes aspectos principais:
- Definindo os modelos de linguagem de código aberto e fechado
- Transparência arquitetônica e customizabilidade
- Benchmarks de desempenho
- Requisitos computacionais
- Versatilidade de aplicação
- Acessibilidade e licenciamento
- Privacidade e confidencialidade de dados
- Apoio e financiamento comercial
Ao final, você terá uma perspectiva informada sobre as compensações técnicas entre os modelos de linguagem de código aberto e fechado para guiar sua própria estratégia de IA. Vamos mergulhar!
Definindo os Modelos de Linguagem de Código Aberto e Fechado
Os modelos de linguagem de código aberto têm arquiteturas de modelo, código-fonte e parâmetros de peso públicos. Isso permite que os pesquisadores inspecionem os internos, avaliem a qualidade, reproduzam resultados e criem variantes personalizadas. Exemplos líderes incluem o ConstitutionalAI da Anthropic, o LLaMA da Meta e o GPT-NeoX da EleutherAI.
Em contraste, os modelos de linguagem de código fechado tratam a arquitetura do modelo e os pesos como ativos proprietários. Entidades comerciais como a Anthropic, a DeepMind e a OpenAI os desenvolvem internamente. Sem código ou detalhes de design acessíveis, a reprodutibilidade e a customização enfrentam limitações.
Transparência Arquitetônica e Customizabilidade
O acesso aos internos dos modelos de linguagem de código aberto desbloqueia oportunidades de customização simplesmente não possíveis com alternativas de código fechado.
Ajustando a arquitetura do modelo, os pesquisadores podem explorar técnicas como a introdução de conectividade esparsa entre camadas ou a adição de tokens de classificação dedicados para melhorar o desempenho em tarefas de nicho. Com acesso aos parâmetros de peso, os desenvolvedores podem transferir aprendizado de representações existentes ou inicializar variantes com blocos de construção pré-treinados como T5 e BERT.
Essa customizabilidade permite que os modelos de linguagem de código aberto atendam melhor a domínios especializados, como pesquisa biomédica, geração de código e educação. No entanto, a expertise necessária pode aumentar a barreira para a entrega de implementações de produção de qualidade.
Os modelos de linguagem de código fechado oferecem customização limitada, pois seus detalhes técnicos permanecem proprietários. No entanto, seus apoiadores comprometem recursos extensivos para pesquisa e desenvolvimento internos. Os sistemas resultantes empurram o envelope do que é possível com uma arquitetura de modelo de linguagem generalizada.
Portanto, embora menos flexíveis, os modelos de linguagem de código fechado são excelentes em tarefas de linguagem natural amplamente aplicáveis. Eles também simplificam a integração, conformando-se a interfaces estabelecidas como o padrão OpenAPI.
Benchmarks de Desempenho
Apesar da transparência arquitetônica, medir o desempenho dos modelos de linguagem de código aberto introduz desafios. Sua flexibilidade permite inúmeras configurações possíveis e estratégias de ajuste. Isso também permite que os modelos prefixados como “código aberto” incluam técnicas proprietárias que distorcem comparações.
Os modelos de linguagem de código fechado ostentam metas de desempenho mais claramente definidas, pois seus apoiadores benchmark e anunciam limiares de métricas específicas. Por exemplo, a Anthropic publiciza a precisão do ConstitutionalAI em conjuntos de problemas de NLU curados. A Microsoft (MSFT ) destaca como o GPT-4 supera os padrões humanos no toolkit de compreensão de linguagem SuperGLUE.
No entanto, esses benchmarks estreitamente definidos enfrentam críticas por superestimar o desempenho em tarefas do mundo real e subestimar falhas. A avaliação verdadeiramente imparcial de LLM permanece uma questão de pesquisa aberta – para ambas as abordagens de código aberto e fechado.
Requisitos Computacionais
Treinar grandes modelos de linguagem exige recursos computacionais extensivos. A OpenAI gastou milhões treinando o GPT-3 em infraestrutura de nuvem, enquanto a Anthropic consumiu cerca de $10 milhões em GPUs para o ConstitutionalAI.
A conta para tais modelos exclui a maioria dos indivíduos e equipes pequenas da comunidade de código aberto. De fato, a EleutherAI teve que remover o modelo GPT-J do acesso público devido a custos de hospedagem explodindo.
Sem bolsos profundos, as histórias de sucesso dos modelos de linguagem de código aberto dependem de recursos computacionais doados. A LAION curou seu modelo LAION-5B focado em tecnologia usando dados crowdsourced. O projeto ConstitutionalAI da Anthropic utilizou computação de voluntários.
O apoio de grandes empresas como Google (GOOGL ), Meta e Baidu fornece aos esforços de código fechado o combustível financeiro necessário para industrializar o desenvolvimento de LLM. Isso permite escalar para comprimentos inimagináveis para iniciativas de base.
Versatilidade de Aplicação
A customizabilidade dos modelos de linguagem de código aberto empodera o enfrentamento de casos de uso altamente especializados. Os pesquisadores podem modificar agressivamente os internos do modelo para aumentar o desempenho em tarefas de nicho, como previsão de estrutura de proteínas, geração de documentação de código e verificação de provas matemáticas.
No entanto, a capacidade de acessar e editar o código não garante uma solução de domínio específico eficaz sem os dados certos. Conjuntos de dados de treinamento abrangentes para aplicações estreitas levam esforço significativo para curar e manter atualizados.
Aqui, os modelos de linguagem de código fechado se beneficiam dos recursos para fontes de dados de repositórios internos e parceiros comerciais. Por exemplo, a DeepMind licencia bancos de dados como o ChEMBL para química e o UniProt para proteínas para expandir o alcance da aplicação. O acesso a dados em escala industrial permite que os modelos como o Gopher alcancem uma notável versatilidade, apesar da opacidade arquitetônica.
Acessibilidade e Licenciamento
A licença permissiva dos modelos de linguagem de código aberto promove o acesso gratuito e a colaboração. Modelos como o GPT-NeoX, o LLaMA e o Jurassic-1 Jumbo usam acordos como Creative Commons e Apache 2.0 para permitir a pesquisa não comercial e a comercialização justa.
Em contraste, os modelos de linguagem de código fechado carregam licenças restritivas que limitam a disponibilidade do modelo. Entidades comerciais controlam rigidamente o acesso para proteger potenciais fluxos de receita de APIs de previsão e parcerias empresariais.
É compreensível que organizações como a Anthropic e a Cohere cobrem pelo acesso às interfaces do ConstitutionalAI e do Cohere-512. No entanto, isso arrisca precificar fora importantes domínios de pesquisa, desviando o desenvolvimento para indústrias bem financiadas.
A licença aberta apresenta desafios também, notadamente em torno de atribuição e responsabilidade. Para casos de uso de pesquisa, no entanto, as liberdades concedidas pela acessibilidade de código aberto oferecem vantagens claras.
Privacidade e Confidencialidade de Dados
Os conjuntos de dados de treinamento para LLMs geralmente agregam conteúdo de várias fontes online, como páginas da web, artigos científicos e fóruns de discussão. Isso arrisca expor informações pessoalmente identificáveis ou outras informações sensíveis nos resultados do modelo.
Para os modelos de linguagem de código aberto, examinar a composição do conjunto de dados fornece a melhor proteção contra problemas de confidencialidade. Avaliar as fontes de dados, os procedimentos de filtragem e documentar exemplos preocupantes encontrados durante os testes pode ajudar a identificar vulnerabilidades.
Infelizmente, os modelos de linguagem de código fechado precluem essa auditoria pública. Em vez disso, os consumidores devem confiar na rigorosidade dos processos de revisão interna com base em políticas anunciadas. Por exemplo, os Serviços Cognitivos do Azure prometem filtrar dados pessoais, enquanto o Google especifica revisões de privacidade formais e rotulagem de dados.
No geral, os modelos de linguagem de código aberto permitem a identificação mais proativa de riscos de confidencialidade em sistemas de IA antes que essas falhas se manifestem em escala. Os contrapartes fechados oferecem transparência limitada nas práticas de manipulação de dados.
Apoio e Financiamento Comercial
O potencial de monetizar os modelos de linguagem de código fechado incentiva o investimento comercial significativo para desenvolvimento e manutenção. Por exemplo, antecipando retornos lucrativos de sua carteira de IA do Azure, a Microsoft concordou com parcerias de vários bilhões de dólares com a OpenAI em torno dos modelos GPT.
Em contraste, os modelos de linguagem de código aberto dependem de voluntários alocando tempo pessoal para manutenção ou subvenções que fornecem financiamento de prazo limitado. Essa assimetria de recursos arrisca a continuidade e a longevidade dos projetos de código aberto.
No entanto, as barreiras para a comercialização também libertam as comunidades de código aberto para se concentrar no progresso científico sobre o lucro. E a natureza descentralizada dos ecossistemas de código aberto mitiga a dependência do interesse sustentado de qualquer único apoiador.
Em última análise, cada abordagem carrega compensações em torno de recursos e incentivos. Os modelos de linguagem de código fechado desfrutam de maior segurança de financiamento, mas concentram a influência. Os ecossistemas de código aberto promovem a diversidade, mas sofrem incerteza aumentada.
Navegando o Paisagem de Modelos de Linguagem de Código Aberto e Fechado
Decidir entre modelos de linguagem de código aberto ou fechado exige combinar prioridades organizacionais, como customizabilidade, acessibilidade e escalabilidade, com as capacidades do modelo.
Para pesquisadores e startups, o código aberto concede mais controle para ajustar os modelos a tarefas específicas. A licença também facilita a partilha gratuita de insights entre colaboradores. No entanto, a responsabilidade de fontes de dados e infraestrutura pode minar a viabilidade no mundo real.
Por outro lado, os modelos de linguagem de código fechado prometem melhorias significativas de qualidade, cortesia do financiamento e dados abundantes. No entanto, as restrições em torno do acesso e das modificações limitam a transparência científica, enquanto vinculam os deploys aos cronogramas dos fornecedores.
Na prática, os padrões abertos em torno de especificações de arquitetura, checkpoints de modelo e dados de avaliação podem ajudar a compensar as desvantagens de ambas as abordagens. Fundações compartilhadas, como o Transformer da Google ou os benchmarks REALTO da Oxford, melhoram a reprodutibilidade. Padrões de interoperabilidade, como o ONNX, permitem a mistura de componentes de fontes abertas e fechadas.
Em última análise, o que importa é escolher a ferramenta certa – código aberto ou fechado – para o trabalho em questão. As entidades comerciais que apoiam os modelos de linguagem de código fechado exercem influência indiscutível. Mas a paixão e os princípios das comunidades de ciência aberta continuarão desempenhando um papel crucial no impulsionamento do progresso da IA.












