Modelos e plataformas de IA
A Evolução da IA Multimodal com o ChatGPT Ganhando Visão com o GPT-4V
Na tentativa contínua de tornar a IA mais semelhante aos humanos, os modelos GPT da OpenAI têm continuamente empurrado os limites. O GPT-4 agora é capaz de aceitar prompts de texto e imagens.
A multimodalidade na IA gerativa denota a capacidade de um modelo produzir saídas variadas, como texto, imagens ou áudio, com base na entrada. Esses modelos, treinados em dados específicos, aprendem padrões subjacentes para gerar novos dados semelhantes, enriquecendo as aplicações de IA.
Avanços Recentes na IA Multimodal
Um salto notável recente nesse campo é visto com a integração do DALL-E 3 no ChatGPT, uma atualização significativa na tecnologia de texto-para-imagem da OpenAI. Essa combinação permite uma interação mais suave, onde o ChatGPT ajuda a criar prompts precisos para o DALL-E 3, transformando as ideias do usuário em arte gerada por IA vívida. Portanto, enquanto os usuários podem interagir diretamente com o DALL-E 3, ter o ChatGPT no mix torna o processo de criação de arte de IA muito mais amigável ao usuário.
Confira mais sobre o DALL-E 3 e sua integração com o ChatGPT aqui. Essa colaboração não apenas demonstra o avanço na IA multimodal, mas também torna a criação de arte de IA uma brisa para os usuários.
O Google (GOOGL ), por outro lado, introduziu o Med-PaLM M em junho deste ano. É um modelo gerativo multimodal capaz de codificar e interpretar dados biomédicos diversos. Isso foi alcançado por meio do ajuste fino do PaLM-E, um modelo de linguagem, para atender a domínios médicos utilizando um benchmark de código aberto, o MultiMedBench. Esse benchmark consiste em mais de 1 milhão de amostras em 7 tipos de dados biomédicos e 14 tarefas, como resposta a perguntas médicas e geração de relatórios de radiologia.
Vários setores estão adotando ferramentas de IA multimodal inovadoras para impulsionar a expansão dos negócios, otimizar operações e elevar o engajamento do cliente. O progresso nas capacidades de voz, vídeo e texto da IA está impulsionando o crescimento da IA multimodal.
As empresas buscam aplicações de IA multimodal capazes de revolucionar modelos de negócios e processos, abrindo caminhos de crescimento em todo o ecossistema de IA gerativa, desde ferramentas de dados até aplicações de IA emergentes.
Após o lançamento do GPT-4 em março, alguns usuários observaram uma declínio na qualidade de resposta ao longo do tempo, uma preocupação ecoada por desenvolvedores notáveis e nos fóruns da OpenAI. Inicialmente descartada pela OpenAI, um estudo posterior confirmou a questão. Ele revelou uma queda na precisão do GPT-4 de 97,6% para 2,4% entre março e junho, indicando uma declínio na qualidade da resposta com atualizações subsequentes do modelo.
O hype em torno do ChatGPT da OpenAI está de volta agora. Ele agora vem com um recurso de visão GPT-4V, permitindo que os usuários tenham o GPT-4 analisar imagens fornecidas por eles. Este é o recurso mais recente que foi aberto aos usuários.
Adicionar análise de imagens a grandes modelos de linguagem (LLMs) como o GPT-4 é visto por alguns como um grande passo adiante na pesquisa e desenvolvimento de IA. Esse tipo de LLM multimodal abre novas possibilidades, levando os modelos de linguagem além do texto para oferecer novas interfaces e resolver novos tipos de tarefas, criando experiências frescas para os usuários.
O treinamento do GPT-4V foi concluído em 2022, com acesso antecipado lançado em março de 2023. O recurso visual no GPT-4V é impulsionado pela tecnologia do GPT-4. O processo de treinamento permaneceu o mesmo. Inicialmente, o modelo foi treinado para prever a próxima palavra em um texto usando um conjunto de dados maciço de texto e imagens de várias fontes, incluindo a internet.
Posteriormente, foi ajustado com mais dados, empregando um método chamado aprendizado por reforço com feedback humano (RLHF), para gerar saídas que os humanos preferiam.
Mecânica de Visão do GPT-4
As capacidades de visão e linguagem notáveis do GPT-4, embora impressionantes, têm métodos subjacentes que permanecem na superfície.
Para explorar essa hipótese, um novo modelo de visão-linguagem, MiniGPT-4, foi introduzido, utilizando um LLM avançado chamado Vicuna. Esse modelo usa um codificador de visão com componentes pré-treinados para percepção visual, alinhando recursos visuais codificados com o modelo de linguagem Vicuna por meio de uma única camada de projeção. A arquitetura do MiniGPT-4 é simples, mas eficaz, com foco em alinhar recursos visuais e linguísticos para melhorar as capacidades de conversação visual.

A arquitetura do MiniGPT-4 inclui um codificador de visão com ViT e Q-Former pré-treinados, uma camada de projeção linear única e um modelo de linguagem avançado Vicuna.
A tendência de modelos de linguagem autoregressivos em tarefas de visão-linguagem também cresceu, capitalizando a transferência cross-modal para compartilhar conhecimento entre domínios de linguagem e multimodal.
O MiniGPT-4 ponteia os domínios visual e linguístico, alinhando informações visuais de um codificador de visão pré-treinado com um LLM avançado. O modelo utiliza o Vicuna como decodificador de linguagem e segue uma abordagem de treinamento em duas etapas. Inicialmente, é treinado em um grande conjunto de dados de pares de imagem-texto para compreender o conhecimento de visão-linguagem, seguido de um ajuste fino em um conjunto de dados menor e de alta qualidade para melhorar a confiabilidade e usabilidade da geração.
Para melhorar a naturalidade e usabilidade da linguagem gerada no MiniGPT-4, os pesquisadores desenvolveram um processo de alinhamento em duas etapas, abordando a falta de conjuntos de dados de alinhamento de visão-linguagem adequados. Eles criaram um conjunto de dados especializado para esse propósito.
Inicialmente, o modelo gerou descrições detalhadas de imagens de entrada, melhorando o detalhe usando um prompt conversacional alinhado com o formato do modelo de linguagem Vicuna. Essa etapa visava gerar descrições de imagem mais abrangentes.
Prompt de Descrição de Imagem Inicial:
###Humano: <Img><Recursos da Imagem></Img>Descreva essa imagem em detalhes. Forneça tantos detalhes quanto possível. Diga tudo o que vê. ###Assistente:
Para o pós-processamento de dados, quaisquer inconsistências ou erros nas descrições geradas foram corrigidos usando o ChatGPT, seguido de verificação manual para garantir alta qualidade.
Prompt de Ajuste Fino em Segunda Etapa:
###Humano: <Img><Recursos da Imagem></Img><Instrução>###Assistente:
Essa exploração abre uma janela para entender a mecânica da IA gerativa multimodal, como o GPT-4, lançando luz sobre como as modalidades de visão e linguagem podem ser efetivamente integradas para gerar saídas coerentes e ricas em contexto.
Explorando a Visão do GPT-4
Determinando a Origem de Imagens com o ChatGPT
O GPT-4 Vision melhora a capacidade do ChatGPT de analisar imagens e identificar suas origens geográficas. Esse recurso transiciona as interações do usuário de apenas texto para uma mistura de texto e visuais, tornando-se uma ferramenta útil para aqueles curiosos sobre diferentes lugares por meio de dados de imagem.
Conceitos Matemáticos Complexos
O GPT-4 Vision se destaca ao mergulhar em ideias matemáticas complexas, analisando expressões gráficas ou manuscritas. Esse recurso atua como uma ferramenta útil para indivíduos que buscam resolver problemas matemáticos intricados, marcando o GPT-4 Vision como uma ajuda notável nos campos educacional e acadêmico.
Conversão de Entrada Manuscrita para Códigos LaTeX
Uma das capacidades notáveis do GPT-4V é sua habilidade de traduzir entradas manuscritas em códigos LaTeX. Esse recurso é uma bênção para pesquisadores, acadêmicos e estudantes que frequentemente precisam converter expressões matemáticas manuscritas ou outras informações técnicas em um formato digital. A transformação de manuscrito para LaTeX expande o horizonte da digitalização de documentos e simplifica o processo de escrita técnica.
Extração de Detalhes de Tabelas
O GPT-4V demonstra habilidade em extrair detalhes de tabelas e responder a perguntas relacionadas, um ativo vital na análise de dados. Os usuários podem utilizar o GPT-4V para vasculhar tabelas, coletar insights-chave e resolver perguntas, tornando-o uma ferramenta robusta para analistas de dados e outros profissionais.
Compreensão de Apontamento Visual
A capacidade única do GPT-4V de compreender apontamento visual adiciona uma nova dimensão à interação do usuário. Ao entender pistas visuais, o GPT-4V pode responder a perguntas com uma compreensão contextual mais elevada.
Construção de Sites Mock-Up Simples Usando um Desenho
Inspirado por este tweet, tentei criar um mock-up para o site unite.ai.
Embora o resultado não tenha correspondido exatamente à minha visão inicial, aqui está o que consegui.
Limitações e Falhas do GPT-4V
Para analisar o GPT-4V, a equipe da OpenAI realizou avaliações qualitativas e quantitativas. As avaliações qualitativas incluíram testes internos e revisões de especialistas externos, enquanto as quantitativas mediram recusas do modelo e precisão em vários cenários, como identificação de conteúdo prejudicial, reconhecimento demográfico, preocupações de privacidade, geolocalização, cibersegurança e jailbreaks multimodais.
No entanto, o modelo ainda não é perfeito.
O artigo destaca as limitações do GPT-4V, como inferências incorretas e falta de texto ou caracteres em imagens. Ele pode alucinar ou inventar fatos. Em particular, não é adequado para identificar substâncias perigosas em imagens, frequentemente as identificando incorretamente.
Em imagens médicas, o GPT-4V pode fornecer respostas inconsistentes e carece de conhecimento de práticas padrão, levando a possíveis diagnósticos errados.

Desempenho não confiável para fins médicos (Fonte)
Ele também falha em compreender as nuances de certos símbolos de ódio e pode gerar conteúdo inapropriado com base nas entradas visuais. A OpenAI aconselha contra o uso do GPT-4V para interpretações críticas, especialmente em contextos médicos ou sensíveis.
Conclusão

Criado usando Fast Stable Diffusion XL https://huggingface.co/spaces/google/sdxl
A chegada do GPT-4 Vision (GPT-4V) traz consigo um monte de possibilidades legais e novos desafios a serem superados. Antes de lançá-lo, muito esforço foi feito para garantir que os riscos, especialmente quando se trata de imagens de pessoas, sejam bem examinados e reduzidos. É impressionante ver como o GPT-4V deu um passo à frente, mostrando muito potencial em áreas difíceis como medicina e ciência.
Agora, há algumas grandes questões em discussão. Por exemplo, esses modelos devem ser capazes de identificar celebridades a partir de fotos? Devem adivinhar o gênero, raça ou sentimentos de uma pessoa a partir de uma imagem? E devem haver ajustes especiais para ajudar indivíduos com deficiência visual? Essas questões abrem uma caixa de vermes sobre privacidade, justiça e como a IA deve se encaixar em nossas vidas, algo que todos devem ter uma palavra a dizer.




















