Líderes de pensamento
Quão Bem os LLMs Podem Realmente Raciocinar Através de Problemas Desordenados?
A introdução e evolução da inteligência artificial geradora têm sido tão súbitas e intensas que é realmente difícil apreciar plenamente o quanto essa tecnologia mudou nossas vidas.
Vamos voltar três anos atrás. Sim, a inteligência artificial estava se tornando mais onipresente, pelo menos em teoria. Mais pessoas sabiam algumas coisas que ela podia fazer, embora mesmo com isso houvesse mal-entendidos enormes sobre as capacidades da inteligência artificial. De alguma forma, a tecnologia foi dada simultaneamente muito crédito e pouco crédito pelo que realmente podia alcançar. Ainda assim, a pessoa comum podia apontar pelo menos uma ou duas áreas onde a inteligência artificial estava trabalhando, realizando tarefas altamente especializadas razoavelmente bem, em ambientes altamente controlados. Qualquer coisa além disso estava ou ainda em um laboratório de pesquisa, ou simplesmente não existia.
Compare isso com hoje. Com zero habilidades, além da capacidade de escrever uma frase ou fazer uma pergunta, o mundo está ao nosso alcance. Podemos gerar imagens, música e até filmes que são verdadeiramente únicos e incríveis, e têm a capacidade de disruptar indústrias inteiras. Podemos supercarregar nosso processo de mecanismo de busca, fazendo uma pergunta simples que, se formulada corretamente, pode gerar páginas de conteúdo personalizado bom o suficiente para passar como um acadêmico treinado na universidade … ou um aluno de terceiro ano médio, se especificarmos a perspectiva. Embora tenham se tornado comuns em apenas um ou dois anos, essas capacidades eram consideradas absolutamente impossíveis há apenas alguns anos. O campo da inteligência artificial geradora existia, mas não havia decolado de forma alguma.
Hoje, muitas pessoas experimentaram a inteligência artificial geradora, como ChatGPT, Midjourney ou outras ferramentas. Outras já as incorporaram em suas vidas diárias. A velocidade com que essas evoluíram é impressionante, a ponto de ser quase alarmante. E, considerando os avanços dos últimos seis meses, sem dúvida seremos impressionados, repetidas vezes, nos próximos anos.
Uma ferramenta específica em jogo dentro da inteligência artificial geradora tem sido o desempenho dos sistemas de Geração Aumentada por Recuperação (RAG) e sua capacidade de pensar por meio de consultas especialmente complexas. A introdução do conjunto de dados FRAMES, explicado em detalhes em um artigo sobre como o conjunto de dados de avaliação funciona, mostra tanto onde está o estado da arte agora quanto onde está indo. Mesmo desde a introdução do FRAMES no final de 2024, várias plataformas já quebraram recordes em sua capacidade de raciocinar por meio de consultas difíceis e complexas.
Vamos mergulhar no que o FRAMES é projetado para avaliar e como bem diferentes modelos de inteligência artificial geradora estão se saindo. Podemos ver como tanto a descentralização quanto as plataformas de código aberto não apenas estão segurando seu terreno (notoriamente Sentient Chat), mas também permitem que os usuários obtenham uma visão clara do raciocínio surpreendente que alguns modelos de inteligência artificial são capazes de alcançar.
FRAMES como uma Janela para o Cérebro da GenAI
O conjunto de dados FRAMES e seu processo de avaliação se concentra em 824 perguntas “multi-etapa” projetadas para exigir inferência, lógica, o uso de várias fontes diferentes para recuperar informações-chave e a capacidade de logicamente unir todas elas para responder à pergunta. As perguntas precisam de entre dois e 15 documentos para respondê-las corretamente e também incluem, propositadamente, restrições, cálculos matemáticos e deduções, bem como a capacidade de processar lógica baseada em tempo. Em outras palavras, essas perguntas são extremamente difíceis e, na verdade, representam tarefas de pesquisa do mundo real que um ser humano pode realizar na internet. Lidamos com esses desafios o tempo todo e devemos procurar as peças-chave de informação espalhadas em um mar de fontes da internet, unindo informações com base em diferentes sites, criando novas informações por meio de cálculos e deduções e entendendo como consolidar esses fatos em uma resposta correta para a pergunta.
O que os pesquisadores descobriram quando o conjunto de dados foi lançado e testado é que os principais modelos GenAI eram capazes de ser razoavelmente precisos (cerca de 40%) quando tinham que responder usando métodos de uma etapa, mas podiam alcançar uma precisão de 73% se permitidos que coletassem todos os documentos necessários para responder à pergunta. Sim, 73% pode não parecer uma revolução. Mas se você entende exatamente o que precisa ser respondido, o número se torna muito mais impressionante.
Por exemplo, uma pergunta específica é: “Em que ano o líder do grupo que originalmente performou a música amostrada na música do Kanye West ‘Power’ nasceu?” Como um ser humano iria resolver esse problema? A pessoa poderia ver que precisa reunir vários elementos de informação, como as letras da música do Kanye West chamada “Power”, e então ser capaz de olhar para as letras e identificar o ponto na música que realmente amostra outra música. Nós, seres humanos, provavelmente poderíamos ouvir a música (mesmo se não estivermos familiarizados com ela) e ser capazes de dizer quando uma música diferente é amostrada.
Mas pense sobre isso: o que um GenAI precisaria realizar para detectar uma música diferente da original enquanto “ouvindo” ela? É aqui que uma pergunta básica se torna um excelente teste de inteligência artificial verdadeiramente inteligente. E se conseguíssemos encontrar a música, ouvi-la e identificar as letras amostradas, isso é apenas a Etapa 1. Ainda precisamos descobrir o nome da música, o nome da banda, quem é o líder da banda e, então, em que ano essa pessoa nasceu.
O FRAMES mostra que, para responder a perguntas realistas, é necessário um enorme processamento de pensamento. Dois pontos vêm à mente aqui.
Primeiro, a capacidade dos modelos GenAI descentralizados de não apenas competir, mas potencialmente dominar os resultados, é incrível. Um número crescente de empresas está usando o método descentralizado para dimensionar suas capacidades de processamento, garantindo que uma grande comunidade possua o software, não uma caixa preta centralizada que não compartilha seus avanços. Empresas como Perplexity e Sentient estão liderando essa tendência, cada uma com modelos formidáveis que performam acima dos primeiros registros de precisão quando o FRAMES foi lançado.
O segundo elemento é que um número menor desses modelos de inteligência artificial não apenas é descentralizado, mas também é de código aberto. Por exemplo, o Sentient Chat é ambos, e os primeiros testes mostram como o raciocínio complexo pode ser, graças ao acesso inestimável de código aberto. A pergunta do FRAMES acima é respondida usando o mesmo processo de pensamento que um ser humano usaria, com os detalhes do raciocínio disponíveis para revisão. Talvez ainda mais interessante, sua plataforma é estruturada como uma série de modelos que podem ajustar finamente uma perspectiva e desempenho específicos, mesmo que o processo de ajuste fino em alguns modelos GenAI resulte em precisão diminuída. No caso do Sentient Chat, vários modelos foram desenvolvidos. Por exemplo, um modelo recente chamado “Dobby 8B” é capaz de superar a referência do FRAMES, mas também desenvolver uma atitude distinta pró-criptomoedas e pró-liberdade, que afeta a perspectiva do modelo à medida que processa peças de informação e desenvolve uma resposta.
No Horizonte
A chave para todas essas inovações surpreendentes é a velocidade rápida que nos trouxe até aqui. Temos que reconhecer que, tão rápido quanto essa tecnologia evoluiu, ela só irá evoluir ainda mais rápido no futuro próximo. Seremos capazes de ver, especialmente com modelos GenAI descentralizados e de código aberto, aquele limiar crucial onde a inteligência do sistema começa a superar cada vez mais a nossa própria, e o que isso significa para o futuro.












