AGI e IA do futuro
Inflection-2.5: O Powerhouse LLM Rivalizando GPT-4 e Gemini
Inflection AI tem feito ondas no campo de grandes modelos de linguagem (LLMs) com a recente revelação de Inflection-2.5, um modelo que compete com os principais LLMs do mundo, incluindo o GPT-4 da OpenAI e o Gemini do Google.
A rápida ascensão da Inflection AI foi ainda mais impulsionada por uma massive rodada de financiamento de $1,3 bilhão, liderada por gigantes da indústria, como a Microsoft (MSFT ), a NVIDIA (NVDA ) e investidores renomados, incluindo Reid Hoffman, Bill Gates e Eric Schmidt. Esse investimento significativo eleva o total de financiamento arrecadado pela empresa para $1,525 bilhão.
Em colaboração com os parceiros CoreWeave (CRWV ) e NVIDIA, a Inflection AI está construindo o maior cluster de IA do mundo, composto por um recorde de 22.000 GPUs Tensor Core H100 da NVIDIA. Esse colossal poder de processamento apoiará o treinamento e a implantação de uma nova geração de modelos de IA em grande escala, permitindo que a Inflection AI empurre os limites do que é possível no campo da IA pessoal.
O trabalho inovador da empresa já produziu resultados notáveis, com o cluster da Inflection AI, que atualmente compreende mais de 3.500 GPUs Tensor Core H100 da NVIDIA, alcançando um desempenho de ponta no benchmark de código aberto MLPerf. Em uma submissão conjunta com a CoreWeave e a NVIDIA, o cluster completou a tarefa de treinamento de referência para grandes modelos de linguagem em apenas 11 minutos, solidificando sua posição como o cluster mais rápido nesse benchmark.
Essa conquista segue a revelação do Inflection-1, o modelo de linguagem grande da Inflection AI, que foi saudado como o melhor modelo em sua classe de computação. Superando gigantes da indústria, como o GPT-3.5, o LLaMA, o Chinchilla e o PaLM-540B, em uma ampla gama de benchmarks comumente usados para comparar LLMs, o Inflection-1 permite que os usuários interajam com o Pi, o assistente de IA pessoal da Inflection AI, de uma maneira simples e natural, recebendo informações e conselhos rápidos, relevantes e úteis.
A Inflection AI demonstra seu compromisso com a transparência e a reprodutibilidade com a liberação de um memorando técnico que detalha a avaliação e o desempenho do Inflection-1 em vários benchmarks. O memorando revela que o Inflection-1 supera os modelos da mesma classe de computação, definida como modelos treinados usando no máximo as operações de ponto flutuante (FLOPs) do PaLM-540B.
O sucesso do Inflection-1 e a rápida escalada da infraestrutura de computação da empresa, impulsionada pela substancial rodada de financiamento, destacam o compromisso inabalável da Inflection AI em entregar sua missão de criar uma IA pessoal para todos. Com a integração do Inflection-1 ao Pi, os usuários agora podem experimentar o poder de uma IA pessoal, beneficiando-se de sua personalidade empática, utilidade e padrões de segurança.
Inflection-2.5
Inflection-2.5 agora está disponível para todos os usuários do Pi, o assistente de IA pessoal da Inflection AI, em várias plataformas, incluindo a web (pi.ai), iOS, Android e um novo aplicativo de desktop. Essa integração marca um marco significativo na missão da Inflection AI de criar uma IA pessoal para todos, combinando capacidade bruta com personalidade empática e padrões de segurança.
Um Salto no Desempenho O modelo anterior da Inflection AI, o Inflection-1, utilizou aproximadamente 4% das operações de ponto flutuante (FLOPs) do GPT-4 e exibiu um desempenho médio de cerca de 72% em comparação com o GPT-4 em várias tarefas orientadas à inteligência. Com o Inflection-2.5, a Inflection AI alcançou um aumento substancial nas capacidades intelectuais do Pi, com foco em codificação e matemática.
O desempenho do modelo em benchmarks da indústria demonstra sua habilidade, exibindo mais de 94% do desempenho médio do GPT-4 em várias tarefas, com ênfase especial em excelência em áreas de ciência, tecnologia, engenharia e matemática (STEM). Essa conquista notável é um testemunho do compromisso da Inflection AI em impulsionar a fronteira tecnológica, mantendo um foco inabalável na experiência do usuário e na segurança.
Habilidade em Codificação e Matemática O Inflection-2.5 brilha em codificação e matemática, demonstrando uma melhoria de mais de 10% em relação ao Inflection-1 no BIG-Bench-Hard, um subconjunto de problemas desafiadores para grandes modelos de linguagem. Dois benchmarks de codificação, MBPP+ e HumanEval+, revelam melhorias massivas em relação ao Inflection-1, solidificando a posição do Inflection-2.5 como uma força a ser reconhecida no domínio da codificação.
No benchmark MBPP+, o Inflection-2.5 supera seu antecessor por uma margem significativa, exibindo um nível de desempenho comparável ao do GPT-4, conforme relatado pelo DeepSeek Coder. Da mesma forma, no benchmark HumanEval+, o Inflection-2.5 demonstra um progresso notável, superando o desempenho do Inflection-1 e se aproximando do nível do GPT-4, conforme relatado na leaderboard do EvalPlus.
Domínio dos Benchmarks da Indústria
O Inflection-2.5 se destaca nos benchmarks da indústria, exibindo melhorias substanciais em relação ao Inflection-1 nos benchmarks MMLU e GPQA Diamond, renomados por sua dificuldade de nível de especialista. O desempenho do modelo nesses benchmarks destaca sua capacidade de lidar com uma ampla gama de tarefas, desde problemas de nível de ensino médio até desafios de nível profissional.
Excelência em Exames de STEM A habilidade do modelo se estende a exames de STEM, com um desempenho notável no exame de matemática húngaro e no exame de física GRE. No exame de matemática húngaro, o Inflection-2.5 demonstra sua aptidão matemática, aproveitando o prompt de few-shot e o formato fornecidos, permitindo a facilidade de reprodutibilidade.
No exame de física GRE, um exame de admissão para pós-graduação em física, o Inflection-2.5 atinge o percentil 85 dos participantes humanos em maj@8 (voto majoritário em 8), solidificando sua posição como um concorrente formidável no domínio da resolução de problemas de física. Além disso, o modelo se aproxima do placar máximo em maj@32, exibindo sua capacidade de lidar com problemas de física complexos com precisão notável.
Melhorando a Experiência do Usuário O Inflection-2.5 não apenas mantém a personalidade empática e os padrões de segurança do Pi, mas também eleva seu status como uma IA pessoal versátil e inestimável em uma variedade de tópicos. Desde discutir eventos atuais até buscar recomendações locais, estudar para exames, codificar e até conversas casuais, o Pi, impulsionado pelo Inflection-2.5, promete uma experiência de usuário enriquecida.
Com as capacidades poderosas do Inflection-2.5, os usuários estão interagindo com o Pi em uma gama mais ampla de tópicos do que nunca. A capacidade do modelo de lidar com tarefas complexas, combinada com sua personalidade empática e capacidade de pesquisa na web em tempo real, garante que os usuários recebam informações e orientações de alta qualidade e atualizadas.
Adoção e Engajamento do Usuário O impacto da integração do Inflection-2.5 ao Pi já é evidente nos indicadores de sentimento, engajamento e retenção do usuário. A Inflection AI testemunhou um aceleração significativa no crescimento orgânico de usuários, com um milhão de usuários ativos diários e seis milhões de usuários ativos mensais trocando mais de quatro bilhões de mensagens com o Pi.
Em média, as conversas com o Pi duram 33 minutos, com um em cada dez durando mais de uma hora a cada dia. Além disso, aproximadamente 60% das pessoas que interagem com o Pi em uma semana determinada retornam na semana seguinte, demonstrando uma aderência mensal mais alta do que a dos principais concorrentes no setor.
Detalhes Técnicos e Transparência dos Benchmarks
Em linha com o compromisso da Inflection AI com a transparência e a reprodutibilidade, a empresa forneceu resultados técnicos abrangentes e detalhes sobre o desempenho do Inflection-2.5 em vários benchmarks da indústria.
Por exemplo, na versão corrigida do conjunto de dados MT-Bench, que aborda problemas com soluções de referência incorretas e premissas defeituosas no conjunto de dados original, o Inflection-2.5 demonstra um desempenho compatível com as expectativas com base em outros benchmarks.
A Inflection AI também avaliou o Inflection-2.5 no HellaSwag e no ARC-C, benchmarks de senso comum e ciência relatados por uma ampla gama de modelos, e os resultados mostram um desempenho sólido nesses benchmarks saturados.
É importante notar que, embora as avaliações fornecidas representem o modelo que impulsiona o Pi, a experiência do usuário pode variar ligeiramente devido a fatores como o impacto da recuperação da web (não usada nos benchmarks), a estrutura do prompt de few-shot e outras diferenças de produção.
Conclusão
O Inflection-2.5 representa um salto significativo no campo dos grandes modelos de linguagem, rivalizando as capacidades dos líderes da indústria, como o GPT-4 e o Gemini, enquanto utiliza apenas uma fração dos recursos de computação. Com seu desempenho impressionante em uma ampla gama de benchmarks, particularmente em áreas de STEM, codificação e matemática, o Inflection-2.5 se posicionou como um concorrente formidável no cenário de IA.
A integração do Inflection-2.5 ao Pi, o assistente de IA pessoal da Inflection AI, promete uma experiência de usuário enriquecida, combinando capacidade bruta com personalidade empática e padrões de segurança. À medida que a Inflection AI continua a impulsionar os limites do que é possível com os LLMs, a comunidade de IA aguarda ansiosamente a próxima onda de inovações e avanços dessa empresa pioneira.














