Ângulo de Anderson

IA que utiliza imagens no raciocínio em cadeia de pensamento (CoT)

mm
Adicione Unite.AI às suas fontes preferidas no Google
Derived from René Magritte, La condition humaine (The Human Condition), 1933. © Photothèque R. Magritte / ADAGP / DACS Images. Collection: National Gallery of Art, Washington. Extended laterally by GPT Image 2.

Pensamos muito em imagens — bem, a maioria de nós: nos seres humanos, uma capacidade reduzida de imaginação visual foi associada por pesquisas a um desempenho académico inferior. Em termos de memorização — a nossa necessidade de recordar coisas, e não o problema temido da IA —, o considerável poder semântico de imagens fortes ou vívidas é utilizado há milénios como auxílio à aprendizagem:

O “Templo do Tempo” de Emma Willard (1846), uma visualização educativa que transforma a cronologia em espaço físico, organizando períodos e figuras históricas numa perspetiva arquitetónica em profundidade. Willard concebeu estas imagens como recursos mnemónicos visuais, acreditando que as representações gráficas poderiam ajudar os alunos a formar uma imagem mental coerente da história. Fonte – https://publicdomainreview.org/essay/emma-willard-maps-of-time/

O “Templo do Tempo” de Emma Willard (1846), uma visualização educativa que transforma a cronologia em espaço físico, organizando períodos e figuras históricas numa perspetiva arquitetónica em profundidade. Willard concebeu estas imagens como recursos mnemónicos visuais, acreditando que as representações gráficas poderiam ajudar os alunos a formar uma imagem mental coerente da história. Fonte

Contudo, a mnemónica diz respeito à ingestão de dados, e não ao seu processamento ou interpretação, áreas em que as pessoas variam consideravelmente nos “estilos” de pensamento que utilizam.

Pessoalmente, penso em formas e faço-o desde que me lembro de pensar — décadas, anos, ideias e pessoas são representados de alguma maneira por geometria relativa e blocos dinâmicos de volume. Outras pessoas pensam sobretudo em números; outras ainda em cheiros ou sabores.

Para a IA, o leque possível de métodos sinestésicos é mais limitado. Naturalmente, um grande modelo de linguagem (LLM) pode pensar em texto, pois esse é o seu tipo de codificação nativo, acima do nível dos embeddings. Também já se demonstrou que os LLM codificam números como conceitos, em vez de simples valores de variáveis, revelando uma tendência para “pensar em números”.

Mas até que ponto se pode dizer que um LLM “pensa em formas” ou “pensa em imagens” da forma como os seres humanos tendem a fazer?

O facto de um LLM dar respostas diferentes à mesma pergunta apresentada em idiomas diferentes mostra que essas relações podem ser muito específicas e frágeis, e estar rigidamente associadas a um texto específico num domínio linguístico — por exemplo, “espanhol” —, em vez de abordarem um domínio superior que transcende e, ao mesmo tempo, contém a linguagem.*

Assim, um LLM multimodal — isto é, um modelo de visão e linguagem, ou VLM — capaz de gerar imagens exclusivamente para a sua própria cadeia de pensamento interna (Chain of Thought, CoT) poderá ter uma vantagem lógica, ou pelo menos um ponto de vista literalmente alternativo.

Novos pontos de vista

Com isto em mente, uma recente colaboração de investigação alemã apresentou um VLM centrado em imagens chamado ReImaGin, que utiliza a geração de imagens como um mecanismo de raciocínio maleável.

Embora trabalhos anteriores tenham “acoplado” componentes baseados em imagens, essas funções não eram intrínsecas nem essenciais ao fluxo de trabalho principal. Em contrapartida, o novo sistema dos autores foi concebido para explorar as capacidades mais recentes dos VLM e assumir a funcionalidade de ferramentas especializadas e métodos como a perceção de profundidade.

No exemplo abaixo, retirado do novo artigo intitulado Reasoning with Image Generation, a IA precisa de interpretar duas vistas — as imagens mais à esquerda —, nenhuma das quais contém toda a informação necessária para resolver uma tarefa. O modelo consegue então utilizar a informação disponível para interpretar uma imagem mais ampla e completa da cena: o mapa com a legenda “Generated Visualization”, o terceiro a contar da esquerda na imagem abaixo.

Exemplo do novo artigo em que o ReImaGin gera um mapa visto de cima a partir de duas vistas incompletas, dando ao modelo uma representação visual unificada a partir da qual raciocinar. Fonte – https://arxiv.org/pdf/2609.16409

Exemplo do novo artigo em que o ReImaGin gera um mapa visto de cima a partir de duas vistas incompletas, dando ao modelo uma representação visual unificada a partir da qual raciocinar. Fonte

O ReImaGin não está limitado a um tipo específico de transformação visual. O sistema pode completar regiões em falta num puzzle, remover oclusões para contar objetos, desenhar trajetórias para prever colisões, combinar várias vistas em mapas espaciais, converter caminhos tracejados em linhas contínuas para os seguir e gerar mapas de profundidade para raciocínio espacial.

Mais importante ainda, o sistema consegue regular sozinho a utilização deste conjunto interno de ferramentas, em linha com as capacidades emergentes recentes dos VLM para resolver automaticamente desafios específicos com ferramentas adequadas, como a estimativa de profundidade. A maior parte das funções descritas do ReImaGin é acionada por chamadas à ferramenta generate_image, uma função capaz de intervir visualmente quando necessário, sem supervisão ou invocação humana.

Os autores afirmam:

“Como generate_image aceita instruções arbitrárias em linguagem natural, o agente pode realizar uma enorme variedade de transformações. A questão é qual transformação realmente ajuda numa determinada tarefa.”

“A prática [normal] consiste em especificar a transformação através de exemplos contextuais elaborados manualmente que demonstram a estratégia desejada — por exemplo, gerar um mapa de profundidade para raciocinar sobre profundidade. Isto exige esforço manual para cada tarefa e limita a generalização a novas tarefas.”

“[Nós] perguntamos se essas estratégias podem ser descobertas automaticamente. Como a estratégia é transmitida ao agente através do seu prompt, descobrir uma estratégia reduz-se a otimizar o prompt: criamos um ciclo iterativo em que um modelo de propostas gera prompts candidatos, avalia-os num pequeno conjunto de desenvolvimento e os aperfeiçoa com base nos sucessos e fracassos observados.”

Testado em três VLM e seis tarefas de raciocínio visual, o ReImaGin superou, de modo geral, tanto o raciocínio sem assistência como ferramentas especializadas de visão, utilizando apenas uma ferramenta.

A abordagem

O ReImaGin funciona como um ciclo: em cada etapa, o VLM considera a pergunta, as imagens originais e tudo o que já gerou, e decide o que fazer em seguida. Isto pode incluir operações de imagem convencionais, como recortar ou sobrepor, ou uma chamada a generate_image, que cria uma nova imagem destinada especificamente a facilitar o raciocínio sobre o problema:

Ilustração passo a passo de como o ReImaGin raciocina sobre problemas espaciais e puzzles visuais. Em ambos os exemplos, o modelo gera uma nova imagem durante o raciocínio e depois utiliza-a como entrada adicional nas etapas seguintes até chegar à resposta.

Ilustração passo a passo de como o ReImaGin raciocina sobre problemas espaciais e puzzles visuais. Em ambos os exemplos, o modelo gera uma nova imagem durante o raciocínio e depois utiliza-a como entrada adicional nas etapas seguintes até chegar à resposta.

A imagem gerada é então devolvida ao VLM, tornando-se parte do material disponível para a etapa de raciocínio seguinte, e o processo pode repetir-se. Na imagem acima podemos ver estas fases ilustradas para a tarefa espacial: o modelo começa por combinar duas fotografias numa única vista e depois transforma o resultado num mapa visto de cima antes de responder à pergunta.

Para a tarefa do puzzle, gera uma versão alterada que isola a região em falta e depois utiliza a subtração convencional de imagens para identificar a resposta.

Desta forma, a geração de imagens torna-se parte do próprio processo de raciocínio, em vez de ser um produto final para o utilizador. Na verdade, estas imagens intermédias destinam-se exclusivamente aos processos CoT da IA, e não ao consumo direto pelo utilizador final.

Em cada turno, o VLM escolhe a sua próxima ação a partir do contexto acumulado até então. Essa ação pode ser outro passo de raciocínio, uma operação de imagem convencional ou uma instrução em linguagem natural para generate_image. Tudo o que a ferramenta escolhida devolver é acrescentado ao contexto, permitindo ao modelo analisar o resultado e decidir se deve transformá-lo novamente, utilizar outra ferramenta ou avançar para a resposta final.

Ganhar autonomia

Um problema central consiste em decidir que tipo de imagem tornaria realmente uma determinada tarefa mais fácil. O ReImaGin decide-o experimentando diferentes instruções para o agente, testando prompts candidatos em exemplos com respostas conhecidas e utilizando tentativas bem-sucedidas e falhadas para obter prompts melhores. As iterações seguintes deste ciclo acabam por produzir as estratégias com melhor desempenho.

O modelo de raciocínio e o gerador de imagens não são novamente treinados durante este processo. Apenas são otimizadas as instruções que controlam a forma como o agente utiliza as suas ferramentas. Por isso, os investigadores descrevem o processo como uma “descoberta automatizada” de estratégias de raciocínio visual, sem fornecerem eles próprios estratégias específicas para cada tarefa ou exemplos de raciocínio.

Configuração e testes

O ReImaGin foi avaliado em seis tarefas de raciocínio visual: raciocínio de profundidade (Blink — identificar qual de dois pontos está mais perto da câmara); conclusão de puzzles (Mira — selecionar a peça correta para uma região em falta numa imagem); contagem com oclusão (CAPTURe — contar objetos, incluindo os ocultos); previsão de colisões (Spatial457 — prever que objeto um alvo em movimento irá atingir); raciocínio espacial (MMSI — determinar relações entre objetos em vistas diferentes); e seguimento de trajetos, um novo benchmark que exige que os modelos sigam linhas tracejadas que ligam números a letras.

Exemplos marcantes de imagens visuais em processos de cadeia de pensamento, retirados do artigo «MIRA, a Benchmark for Visual Chain-of-Thought». Fonte – https://arxiv.org/pdf/2511.02779

Exemplos marcantes de imagens visuais em processos de cadeia de pensamento, retirados do artigo «MIRA, a Benchmark for Visual Chain-of-Thought». Fonte

Os modelos-base VLM testados foram Gemini-3.1-Pro, GPT-5 e o modelo de pesos abertos Qwen-3.5-27B. A geração de imagens ficou sobretudo a cargo do Nano-Banana-Pro, tendo também sido testados os modelos de pesos abertos FLUX.2 [dev] e Qwen-Image-Edit-2511. O Gemini-3.1-Pro foi utilizado como seletor para o dimensionamento da geração de imagens no momento do teste.

Das duas linhas de base utilizadas para comparação, o VLM convencional, denominado “No Tools” pelos autores do artigo, respondia diretamente a partir da consulta e das imagens, sem ferramentas nem execução de código. Já o Visual Sketchpad, apresentado em 2024, oferecia neste caso um conjunto fixo de ferramentas especializadas de visão e manipulação de imagens, mas não geração de imagens aberta.

Para a tarefa espacial MMSI, ambas as linhas de base receberam uma quantidade de capacidade computacional semelhante à do ReImaGin: foram geradas 20 respostas de cada uma e utilizada a resposta que surgia com maior frequência.

O desempenho foi medido pela precisão em perguntas de escolha múltipla para todas as tarefas, exceto a contagem com oclusão, avaliada através do erro percentual absoluto médio simétrico, comparando o número previsto e real de objetos. Os resultados foram calculados como média de três execuções e o erro padrão também foi indicado.

Resultados dos testes que comparam o ReImaGin com No Tools e Visual Sketchpad em três VLM e seis tarefas de raciocínio visual. Pontuações mais altas são melhores, exceto na contagem com oclusão, em que um erro menor é melhor. O ReImaGin obteve o melhor resultado na maioria das combinações de modelo e tarefa.

Resultados dos testes que comparam o ReImaGin com No Tools e Visual Sketchpad em três VLM e seis tarefas de raciocínio visual. Pontuações mais altas são melhores, exceto na contagem com oclusão, em que um erro menor é melhor. O ReImaGin obteve o melhor resultado na maioria das combinações de modelo e tarefa.

Foram utilizados os mesmos exemplos de estratégias definidos por humanos nos três modelos. O ReImaGin produziu resultados melhores do que ambas as linhas de base na maioria das tarefas, com ganhos especialmente claros na conclusão de puzzles, na contagem com oclusão e no seguimento de trajetos.

Com o GPT-5, por exemplo, a precisão em puzzles aumentou de 29,5% com No Tools e 16,7% com Visual Sketchpad para 44,9% com o ReImaGin. Testes de ablação confirmaram que o componente generativo de imagens é essencial para o desempenho do sistema.

Também foram testados geradores de imagens de pesos abertos em vez do Nano-Banana-Pro. O FLUX.2 [dev] e o Qwen-Image-Edit-2511 produziram resultados comparáveis em algumas tarefas mais simples, sobretudo no inpainting, mas foram menos consistentes em transformações mais exigentes, como a estimativa de profundidade e o seguimento de trajetos. Foram obtidos resultados semelhantes quando o Qwen-3.5-27B foi utilizado como VLM:

Resultados dos testes que comparam geradores de imagens com o Qwen-3.5-27B como VLM. O Nano-Banana-Pro obteve o melhor resultado em cinco das seis tarefas, enquanto o FLUX.2 [dev] e o Qwen-Image-Edit-2511 superaram No Tools em várias tarefas.

Resultados dos testes que comparam geradores de imagens com o Qwen-3.5-27B como VLM. O Nano-Banana-Pro obteve o melhor resultado em cinco das seis tarefas, enquanto o FLUX.2 [dev] e o Qwen-Image-Edit-2511 superaram No Tools em várias tarefas.

Os autores também realizaram testes qualitativos em quatro tarefas:

Exemplos qualitativos em quatro tarefas mostram como o ReImaGin foi utilizado para ampliar o raciocínio do Gemini-3.1-Pro. Em cada caso, representações visuais geradas foram incorporadas no processo de raciocínio para ajudar a resolver a tarefa.

Exemplos qualitativos em quatro tarefas mostram como o ReImaGin foi utilizado para ampliar o raciocínio do Gemini-3.1-Pro. Em cada caso, representações visuais geradas foram incorporadas no processo de raciocínio para ajudar a resolver a tarefa.

O ReImaGin não foi fiável em todos os casos. Em algumas situações, o gerador de imagens produziu uma transformação incorreta, como uma planta com objetos nas posições erradas. Noutras, uma imagem gerada corretamente foi depois mal interpretada pelo VLM.

Numa auditoria manual de 120 imagens geradas, verificou-se que 75% tinham realizado fielmente a transformação solicitada. Quando isso acontecia, a resposta final estava correta em 87% dos casos, contra 43% quando a imagem gerada era imprecisa.

Os autores concluem:

“Os nossos resultados sugerem duas conclusões mais amplas. Primeiro, a geração de imagens pode funcionar como um mecanismo geral de imaginação visual no raciocínio multimodal, reduzindo a necessidade de desenvolver uma ferramenta separada para cada nova transformação.”

“Segundo, a eficácia desta abordagem depende não apenas dos modelos subjacentes, mas também da estratégia de raciocínio utilizada para decidir o que visualizar e como usar o resultado.”

“Os ganhos proporcionados pela descoberta automática de estratégias mostram que os modelos conseguem tirar partido da sua compreensão das transformações visuais para descobrir estratégias relevantes sem estratégias específicas de cada tarefa ou raciocínios escritos por humanos.”

Conclusão

As decisões autónomas sobre a utilização de ferramentas investigadas neste estudo representam um desenvolvimento fascinante, sobretudo porque a evolução dos VLM parece encaminhar-se naturalmente para esta abordagem. Tenho curiosidade em saber se estes VLM de uso geral acabarão por ter um desempenho tão bom como ferramentas e estruturas especializadas, como o ecossistema Segment, e se aqueles que trabalham exclusivamente nestas “tarefas secundárias” poderão acabar por usar uma marreta para partir uma noz.

É bastante difícil acreditar que os VLM consigam desenvolver a disciplina necessária para ultrapassar e manter a liderança sobre soluções especializadas como o ajuste fino local, em que um modelo inteiro é dedicado a uma única tarefa e, no processo, fica muitas vezes inutilizável para qualquer outra. O tempo dirá.

 

* Uma definição discutível do domínio das imagens, que aprendemos muito antes de adquirirmos quaisquer competências linguísticas.

Publicado pela primeira vez na segunda-feira, 28 de setembro de 2026

Escritor em aprendizado de máquina, especialista em síntese de imagens humanas. Ex‑chefe de conteúdo de pesquisa na Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Website: martinanderson.ai
Contato: martin@martinanderson.ai