Modelos e plataformas de IA
O Primeiro Aniversário do ChatGPT: Redefinindo o Futuro da Interação com a IA
Refletindo sobre o primeiro ano do ChatGPT, é claro que essa ferramenta mudou significativamente a cena de IA. Lançado no final de 2022, o ChatGPT se destacou por seu estilo conversacional e amigável, que tornou a interação com a IA mais parecida com uma conversa com uma pessoa do que com uma máquina. Essa nova abordagem rapidamente chamou a atenção do público. Em apenas cinco dias após seu lançamento, o ChatGPT já havia atraído um milhão de usuários. No início de 2023, esse número saltou para cerca de 100 milhões de usuários mensais, e em outubro, a plataforma estava atraindo cerca de 1,7 bilhão de visitas em todo o mundo. Esses números falam muito sobre sua popularidade e utilidade.
Ao longo do último ano, os usuários encontraram todas as espécies de maneiras criativas de usar o ChatGPT, desde tarefas simples como escrever e-mails e atualizar currículos até iniciar negócios de sucesso. Mas não é apenas sobre como as pessoas estão usando; a tecnologia em si cresceu e melhorou. Inicialmente, o ChatGPT era um serviço gratuito que oferecia respostas de texto detalhadas. Agora, há o ChatGPT Plus, que inclui o ChatGPT-4. Essa versão atualizada é treinada em mais dados, fornece menos respostas erradas e entende instruções complexas melhor.
Uma das principais atualizações é que o ChatGPT agora pode interagir de várias maneiras – ele pode ouvir, falar e até processar imagens. Isso significa que você pode conversar com ele por meio de seu aplicativo móvel e mostrar-lhe fotos para obter respostas. Essas mudanças abriram novas possibilidades para a IA e mudaram a forma como as pessoas veem e pensam sobre o papel da IA em nossas vidas.
Desde seus primórdios como um demonstrativo de tecnologia até seu status atual como um grande jogador no mundo da tecnologia, a jornada do ChatGPT é bastante impressionante. Inicialmente, ele foi visto como uma maneira de testar e melhorar a tecnologia, obtendo feedback do público. Mas rapidamente se tornou uma parte essencial do cenário de IA. Esse sucesso mostra quão eficaz é afinar grandes modelos de linguagem (LLMs) com aprendizado supervisionado e feedback humano. Como resultado, o ChatGPT pode lidar com uma ampla gama de perguntas e tarefas.
A corrida para desenvolver os sistemas de IA mais capazes e versáteis levou a uma proliferação de modelos tanto de código aberto quanto proprietários, como o ChatGPT. Entender suas capacidades gerais requer benchmarks abrangentes em uma ampla gama de tarefas. Esta seção explora esses benchmarks, lançando luz sobre como diferentes modelos, incluindo o ChatGPT, se comparam entre si.
Avaliando LLMs: Os Benchmarks
- MT-Bench: Este benchmark testa a capacidade de conversação em várias voltas e seguir instruções em oito domínios: escrita, roleplay, extração de informações, raciocínio, matemática, codificação, conhecimento científico e humanidades/ciências sociais. LLMs mais fortes, como o GPT-4, são usados como avaliadores.
- AlpacaEval: Com base no conjunto de avaliação AlpacaFarm, este avaliador automático de LLMs baseado em LLMs avalia modelos contra respostas de LLMs avançados, como o GPT-4 e o Claude, calculando a taxa de vitória dos modelos candidatos.
- Open LLM Leaderboard: Utilizando o Language Model Evaluation Harness, este leaderboard avalia LLMs em sete benchmarks-chave, incluindo desafios de raciocínio e testes de conhecimento geral, em configurações zero-shot e few-shot.
- BIG-bench: Este benchmark colaborativo abrange mais de 200 tarefas de linguagem novas, abrangendo uma ampla gama de tópicos e idiomas. Ele visa sondar LLMs e prever suas capacidades futuras.
- ChatEval: Um quadro de debate de multi-agente que permite que equipes discutam e avaliem autonomamente a qualidade das respostas de diferentes modelos em perguntas abertas e tarefas de geração de linguagem natural tradicionais.
Desempenho Comparativo
Em termos de benchmarks gerais, os LLMs de código aberto mostraram um progresso notável. O Llama-2-70B, por exemplo, alcançou resultados impressionantes, particularmente após ser ajustado com dados de instrução. Sua variante, o Llama-2-chat-70B, se destacou no AlpacaEval com uma taxa de vitória de 92,66%, superando o GPT-3.5-turbo. No entanto, o GPT-4 permanece como o líder, com uma taxa de vitória de 95,28%.
O Zephyr-7B, um modelo menor, demonstrou capacidades comparáveis a LLMs maiores de 70B, especialmente no AlpacaEval e no MT-Bench. Enquanto isso, o WizardLM-70B, ajustado com uma ampla gama de dados de instrução, alcançou a pontuação mais alta entre os LLMs de código aberto no MT-Bench. No entanto, ele ainda ficou atrás do GPT-3.5-turbo e do GPT-4.
Uma entrada interessante, o GodziLLa2-70B, alcançou uma pontuação competitiva no Open LLM Leaderboard, demonstrando o potencial de modelos experimentais que combinam conjuntos de dados diversificados. Da mesma forma, o Yi-34B, desenvolvido do zero, se destacou com pontuações comparáveis ao GPT-3.5-turbo e apenas ligeiramente atrás do GPT-4.
O UltraLlama, com seu ajuste em dados diversificados e de alta qualidade, igualou o GPT-3.5-turbo nos benchmarks propostos e até superou em áreas de conhecimento mundial e profissional.
Escalando: O Surgimento dos Gigantes LLMs
Uma tendência notável no desenvolvimento de LLMs tem sido o aumento do número de parâmetros do modelo. Modelos como o Gopher, o GLaM, o LaMDA, o MT-NLG e o PaLM empurraram os limites, culminando em modelos com até 540 bilhões de parâmetros. Esses modelos mostraram capacidades excepcionais, mas sua natureza de código fechado limitou sua aplicação mais ampla. Isso despertou o interesse no desenvolvimento de LLMs de código aberto, uma tendência que está ganhando momentum.
Em paralelo ao aumento do tamanho dos modelos, os pesquisadores exploraram estratégias alternativas. Em vez de apenas tornar os modelos maiores, eles se concentraram em melhorar o pré-treinamento de modelos menores. Exemplos incluem o Chinchilla e o UL2, que mostraram que mais não é sempre melhor; estratégias mais inteligentes podem produzir resultados eficientes também. Além disso, houve considerável atenção ao ajuste de instrução de modelos de linguagem, com projetos como o FLAN, o T0 e o Flan-T5 fazendo contribuições significativas para essa área.
O Catalyst ChatGPT
A introdução do ChatGPT da OpenAI marcou um ponto de inflexão na pesquisa de NLP. Para competir com a OpenAI, empresas como o Google (GOOGL ) e a Anthropic lançaram seus próprios modelos, o Bard e o Claude, respectivamente. Embora esses modelos mostrem desempenho comparável ao ChatGPT em muitas tarefas, eles ainda ficam atrás do modelo mais recente da OpenAI, o GPT-4. O sucesso desses modelos é primariamente atribuído ao aprendizado de reforço com feedback humano (RLHF), uma técnica que está recebendo foco de pesquisa para melhoria adicional.
Rumores e Especulações em Torno do Q* (Q-Estrela) da OpenAI
Relatórios recentes sugerem que pesquisadores da OpenAI podem ter alcançado um avanço significativo em IA com o desenvolvimento de um novo modelo chamado Q* (pronuncia-se Q-estrela). Alegadamente, o Q* tem a capacidade de realizar matemática de nível escolar, um feito que gerou discussões entre especialistas sobre seu potencial como um marco rumo à inteligência artificial geral (IAG). Embora a OpenAI não tenha comentado sobre esses relatórios, as habilidades rumoradas do Q* geraram considerável entusiasmo e especulação nas mídias sociais e entre entusiastas de IA.
O desenvolvimento do Q* é notável porque os modelos de linguagem existentes, como o ChatGPT e o GPT-4, embora capazes de algumas tarefas matemáticas, não são particularmente habilidosos em lidar com elas de forma confiável. O desafio reside na necessidade de os modelos de IA não apenas reconhecerem padrões, como atualmente fazem por meio do aprendizado profundo e transformadores, mas também raciocinarem e compreenderem conceitos abstratos. A matemática, sendo um benchmark para o raciocínio, exige que o IA planeje e execute múltiplos passos, demonstrando uma compreensão profunda de conceitos abstratos. Essa capacidade marcaria um salto significativo nas capacidades de IA, potencialmente se estendendo além da matemática para outras tarefas complexas.
No entanto, especialistas advertiram contra o superdimensionamento desse desenvolvimento. Embora um sistema de IA que resolve problemas matemáticos de forma confiável seja um feito impressionante, isso não sinaliza necessariamente o advento de uma superinteligência de IA ou IAG. A pesquisa de IA atual, incluindo esforços da OpenAI, se concentrou em problemas elementares, com graus variados de sucesso em tarefas mais complexas.
As aplicações potenciais de avanços como o Q* são vastas, variando desde tutoriais personalizados até assistência em pesquisas científicas e engenharia. No entanto, é importante gerenciar expectativas e reconhecer as limitações e preocupações de segurança associadas a tais avanços. As preocupações sobre a IA representar riscos existenciais, uma preocupação fundamental da OpenAI, permanecem pertinentes, especialmente à medida que os sistemas de IA começam a se interfacear mais com o mundo real.
O Movimento LLM de Código Aberto
Para impulsionar a pesquisa de LLMs de código aberto, a Meta lançou a série de modelos Llama, desencadeando uma onda de novos desenvolvimentos baseados no Llama. Isso inclui modelos ajustados com dados de instrução, como o Alpaca, o Vicuna, o Lima e o WizardLM. A pesquisa também está se ramificando para melhorar as capacidades de agentes, raciocínio lógico e modelagem de contexto longo dentro do quadro de trabalho do Llama.
Além disso, há uma tendência crescente de desenvolver LLMs poderosos do zero, com projetos como o MPT, o Falcon, o XGen, o Phi, o Baichuan, Mistral, Grok e Yi. Esses esforços refletem um compromisso para democratizar as capacidades dos LLMs de código fechado, tornando ferramentas de IA avançadas mais acessíveis e eficientes.
O Impacto do ChatGPT e dos Modelos de Código Aberto em Saúde
Estamos olhando para um futuro onde os LLMs assistem na tomada de notas clínicas, preenchimento de formulários para reembolsos e apoiam os médicos no planejamento de diagnóstico e tratamento. Isso chamou a atenção de gigantes da tecnologia e instituições de saúde.
As discussões da Microsoft (MSFT ) com a Epic, um provedor de software de registros eletrônicos de saúde líder, sinalizam a integração de LLMs em saúde. Iniciativas já estão em andamento na UC San Diego Health e no Centro Médico da Universidade de Stanford. Da mesma forma, as parcerias do Google com a Clínica Mayo e o lançamento do Amazon (AMZN ) Web Services do HealthScribe, um serviço de documentação clínica de IA, marcam passos significativos nessa direção.
No entanto, esses deploys rápidos levantam preocupações sobre a cessão de controle da medicina a interesses corporativos. A natureza proprietária desses LLMs os torna difíceis de avaliar. Sua possível modificação ou descontinuação por razões de lucratividade poderia comprometer o cuidado ao paciente, a privacidade e a segurança.
A necessidade urgente é por uma abordagem aberta e inclusiva para o desenvolvimento de LLMs em saúde. Instituições de saúde, pesquisadores, clínicos, pacientes e outros atores globais devem colaborar para construir LLMs de código aberto para saúde. Essa abordagem, semelhante à Trillion Parameter Consortium, permitiria a combinação de recursos computacionais, financeiros e de expertise.













