Ângulo de Anderson

O Código de Vibração Sofre Quando o Papel da IA se Expande

mm
Adicione Unite.AI às suas fontes preferidas no Google
An AI-generated stock-style image depicting a human Caucasian male and a larger glossy humanoid robot attempting to collaborate on a document; but the aggressive robot is causing the annoyed man to be sidelined. GPT-5 Image + Photoshop enhancement.

Um novo estudo descobriu que o código de vibração melhora quando os humanos dão as instruções, mas declina quando a IA o faz, com o melhor setup híbrido mantendo os humanos em primeiro lugar, com a IA como árbitro ou juiz.

 

Pesquisas recentes nos Estados Unidos, examinando o que acontece quando os sistemas de IA são permitidos para direcionar código de vibração, em vez de simplesmente executar instruções humanas, descobriram que quando os Modelos de Linguagem Grande (LLMs) assumem um papel direcional maior, os resultados são quase sempre piores.

Embora os pesquisadores tenham usado o GPT-5 da OpenAI como o framework para seus experimentos de colaboração humano-IA, eles mais tarde confirmaram que tanto o Claude Opus 4.5 da Anthropic quanto o Google Gemini 3 Pro estavam sujeitos à mesma curva de deterioração à medida que as responsabilidades crescem, afirmando que ‘mesmo a participação humana limitada melhora consistentemente o desempenho’:

‘[Os humanos] fornecem orientação de alto nível única e eficaz em todas as iterações, [enquanto] a orientação da IA frequentemente leva a um colapso no desempenho. Além disso, descobrimos que uma alocação cuidadosa de papéis que mantém os humanos no comando da direção, enquanto transfere a avaliação para a IA, pode melhorar o desempenho híbrido.’

Para fornecer um teste consistente que pudesse ser avaliado igualmente por humanos e por IA, um framework experimental controlado foi construído em torno de uma tarefa de codificação iterativa na qual uma imagem de referência – apresentando uma foto de um gato, cachorro, tigre, pássaro, elefante, pinguim, tubarão, zebra, girafa ou panda – teve que ser recriada usando gráficos vetoriais escaláveis (SVG), e essa recriação foi julgada contra a fonte de imagem da qual foi derivada:

Ambos os participantes humanos e da IA foram apresentados a uma imagem de referência fotográfica ao lado de uma reconstrução SVG gerada pela IA, e solicitados a avaliar o quão semelhantes eram as duas em uma escala de sete pontos. Fonte - https://arxiv.org/pdf/2602.10473

Ambos os participantes humanos e da IA foram apresentados a uma imagem de referência fotográfica ao lado de uma reconstrução SVG gerada pela IA, e solicitados a avaliar o quão semelhantes eram as duas em uma escala de sete pontos. Fonte

Em cada rodada, um agente fornecia instruções de linguagem natural de alto nível para guiar um gerador de código, e outro decidia se manter a nova versão ou reverter para a anterior – um loop estruturado que espelha fluxos de trabalho colaborativos reais.

Ao longo de 16 experimentos envolvendo 604 participantes e milhares de chamadas de API, rodadas de teste lideradas totalmente por humanos foram comparadas diretamente com rodadas lideradas totalmente por IA, sob condições idênticas.

Algumas das soluções variadas alcançadas por diferentes combinações de porcentagens e tipos de colaboração humano-IA (retiradas de uma ilustração maior no artigo de origem, ao qual nos referimos).

Algumas das soluções variadas alcançadas por diferentes combinações de porcentagens e tipos de colaboração humano-IA (retiradas de uma ilustração maior no artigo de origem, ao qual nos referimos).

Embora os humanos e a IA tenham apresentado desempenhos semelhantes no início das testes, ao longo do tempo, suas trajetórias divergiram: quando os humanos forneceram as instruções e fizeram as decisões de seleção, as pontuações de similaridade aumentaram ao longo das iterações, com melhoria cumulativa constante; mas quando os sistemas de IA preencheram ambos os papéis, o desempenho não mostrou ganhos consistentes e frequentemente declinou ao longo das rodadas – mesmo quando o mesmo modelo subjacente foi usado para geração de código e a IA teve acesso às mesmas informações que os participantes humanos.

O Efeito da Prolixidade

Os resultados também mostraram que as instruções humanas eram tipicamente curtas e orientadas para a ação, se concentrando no que mudar em seguida na imagem atual; por outro lado, as instruções da IA eram muito mais longas e densamente descritivas (um fator que foi parametrizado para o GPT-5), detalhando atributos visuais em vez de priorizar a correção incremental.

Mas, como visto no gráfico abaixo, impor limites estritos de palavra nas instruções da IA não reverteu o padrão; mesmo quando limitadas a 10, 20 ou 30 palavras, as cadeias lideradas pela IA ainda falharam em melhorar ao longo do tempo:

Avaliações de similaridade ao longo das iterações para cadeias lideradas por humanos em comparação com cadeias totalmente lideradas por IA e cadeias lideradas por IA limitadas a 10, 20 ou 30 palavras, mostrando que encurtar os prompts da IA não impede o declínio no desempenho observado quando a IA direciona tanto a instrução quanto a seleção.

Avaliações de similaridade ao longo das iterações para rodadas lideradas por humanos em comparação com rodadas lideradas por IA limitadas a 10, 20 ou 30 palavras. Evidentemente, encurtar os prompts da IA não impede o declínio no desempenho observado quando a IA direciona tanto a instrução quanto a seleção.

Experimentos híbridos tornaram o padrão mais claro, mostrando que adicionar um pouco de participação humana melhorou os resultados, em comparação com configurações totalmente lideradas por IA; no entanto, o desempenho geralmente declinou à medida que a participação da IA aumentava.

Quando os papéis foram separados, a avaliação e a seleção puderam ser transferidas para a IA com perda de qualidade relativamente pequena; mas substituir a instrução de alto nível humana por orientação da IA levou a quedas notáveis no desempenho, sugerindo que o que mais importava não era quem gerou o código, mas quem estabeleceu e manteve a direção ao longo das iterações.

Os autores concluem:

‘Em múltiplos experimentos, a codificação liderada por humanos melhorou consistentemente ao longo das iterações, enquanto a codificação liderada por IA frequentemente colapsou, apesar de ter acesso às mesmas informações e capacidades de execução semelhantes.

‘Isso aponta para as principais lutas dos sistemas de IA atuais em manter uma direção de alto nível coerente ao longo de interações repetidas, do tipo necessário para uma codificação de vibração bem-sucedida’

O novo artigo é intitulado Por que a Orientação Humana é Importante na Codificação de Vibração Colaborativa, e vem de sete pesquisadores de Cornell University, Princeton University, Massachusetts Institute of Technology e New York University.

Método

Para os experimentos, um instrutor humano olhou para uma foto de referência animal gerada pelo GPT-5, juntamente com a última tentativa de imitação SVG associada. Em seguida, ele escreveu instruções de linguagem natural para guiar o gerador de código em direção a uma correspondência mais próxima.

Assim, o gerador produziria um novo SVG a cada rodada, fornecendo um loop iterativo para testar como o efeito da orientação se acumula ao longo do tempo. Os alvos eram dez imagens de animais geradas pelo GPT-5, cobrindo uma variedade de formas e texturas para que as melhorias ou erros fossem fáceis de detectar:

Esquema para o fluxo de trabalho de codificação de vibração usado no estudo. Em A), um instrutor humano vê uma imagem de referência fotográfica juntamente com o melhor SVG produzido até o momento e escreve instruções de linguagem natural para o gerador de código seguir quando produzir o próximo SVG; em B), um seletor humano compara o novo SVG com o anterior e escolhe qual versão melhor corresponde à imagem de referência, antes de passar o SVG selecionado para a próxima rodada de instrução. Em C), avaliadores humanos independentes avaliam o quão semelhante cada SVG gerado é à sua imagem de referência, fornecendo as pontuações usadas para avaliar o desempenho geral.

Esquema para o fluxo de trabalho de codificação de vibração usado no estudo. Em A), um instrutor humano vê uma imagem de referência fotográfica juntamente com o melhor SVG produzido até o momento e escreve instruções de linguagem natural para o gerador de código seguir quando produzir o próximo SVG; em B), um seletor humano compara o novo SVG com o anterior e escolhe qual versão melhor corresponde à imagem de referência, antes de passar o SVG selecionado para a próxima rodada de instrução; e em C), avaliadores humanos independentes avaliam o quão semelhante cada SVG gerado é à sua imagem de referência, fornecendo as pontuações usadas para avaliar o desempenho geral.

Um seletor humano comparou cada novo SVG gerado com o anterior e aceitou ou rejeitou, o que manteve o processo alinhado com a imagem de referência ao longo das rodadas. Nesse setup de baseline, o mesmo humano desempenhou ambos os papéis.

Para medir a qualidade, avaliadores humanos independentes avaliaram o quão semelhante cada SVG gerado era à sua imagem de referência. Ao longo de dezesseis experimentos, 120 pessoas produziram 4.800 avaliações. Todos os experimentos foram executados no framework PsyNet, um portal projetado para acomodar interações estruturadas entre humanos e sistemas de IA.

O estudo recrutou 604 falantes nativos de inglês, em testes que consumiriam 4.800 chamadas de API para geração de código e 5.327 chamadas de API para instrução. Embora o GPT-5 tenha sido o modelo principal usado, lotes de comparação menores foram feitos com o Claude Opus 4.5 e o Gemini 3 Pro, que cada um lidou com 280 consultas.

Resultados

Trinta rodadas de codificação de vibração foram executadas, cada uma compreendendo quinze edições das dez imagens de referência principais. Para essas, 45 participantes humanos foram escolhidos, cada um servindo como seletor e instrutor ao longo de dez iterações, nas rodadas “lideradas por humanos”.

Dentro de cada turno, o mesmo participante primeiro escolheu entre o SVG atual e o anterior, e então escreveu as instruções para a próxima rodada. Uma segunda versão do teste substituiu as decisões humanas por chamadas de API para o GPT 5, mantendo o restante do setup inalterado. Em todos os casos, o instrutor e o seletor forneceram ao gerador de código com linguagem natural.

Um exemplo representativo de codificação de vibração de múltiplas rodadas mostra como o processo diverge ao longo do tempo; quando os humanos atuaram como seletor e instrutor, a saída SVG melhorou constantemente ao longo das iterações, aproximando-se da imagem de referência a cada rodada:

Exemplo de progressões para uma imagem de referência sob codificação de vibração liderada por humanos (topo) e liderada por IA (inferior), mostrando melhoria constante ao longo das iterações com humanos em ambos os papéis, e estagnação ou deriva quando ambos os papéis são lidados pela IA.

Exemplo de progressões para uma imagem de referência sob codificação de vibração liderada por humanos (topo) e liderada por IA (inferior), mostrando melhoria constante ao longo das iterações com humanos em ambos os papéis, e estagnação ou deriva quando ambos os papéis são lidados pela IA.

Ao contrário, na versão liderada por IA, as rodadas iniciais às vezes capturaram recursos visuais importantes, mas as tentativas posteriores falharam em construir sobre esses ganhos e, em alguns casos, se afastaram do alvo:

Saídas finais da iteração final, comparando rodadas lideradas por humanos (linha superior) com cadeias lideradas por IA (linha inferior), ao longo do mesmo conjunto de imagens de referência. Os resultados liderados por humanos correspondem mais de perto aos animais originais, e os resultados liderados por IA demonstram distorções visíveis ou perda de recursos importantes.

Saídas finais da iteração final, comparando rodadas lideradas por humanos (linha superior) com cadeias lideradas por IA (linha inferior), ao longo do mesmo conjunto de imagens de referência. Os resultados liderados por humanos correspondem mais de perto aos animais originais, enquanto os resultados liderados por IA demonstram distorções visíveis ou perda de recursos importantes.

Para medir as tendências emergentes quantitativamente, as imagens finais foram mostradas a avaliadores humanos independentes e avaliadas por similaridade às imagens de referência. No início das rodadas, as rodadas lideradas por humanos e lideradas por IA pontuaram mais ou menos da mesma forma; mas na décima quinta rodada, a diferença estava clara, com as imagens escolhidas pelos humanos avaliadas como muito mais próximas dos alvos. Ao longo do tempo, as pontuações humanas subiram constantemente, com o maior ganho relativo sobre a IA atingindo 27,1%.

Pontuações de similaridade média ao longo das iterações para codificação de vibração liderada por humanos e liderada por IA, mostrando ganhos constantes quando os humanos atuam como seletor e instrutor, e um declínio gradual quando ambos os papéis são lidados pelo GPT 5.

Pontuações de similaridade média ao longo das iterações para codificação de vibração liderada por humanos e liderada por IA, mostrando ganhos constantes quando os humanos atuam como seletor e instrutor, e um declínio gradual quando ambos os papéis são lidados pelo GPT 5.

Para garantir que as tendências emergentes não se deviam ao poder coletivo de vários participantes humanos simultâneos, os pesquisadores recrutaram dez pessoas adicionais para trabalhar sozinhas, cada uma executando três rodadas por si mesma – e os resultados melhoraram da mesma maneira constante, demonstrando que os ganhos não foram um acaso do esforço coletivo.

A Visão Geral

No entanto, se o GPT-5 julgasse os resultados por si mesmo, admitiria que os resultados humanos eram melhores? As avaliações humanas e da IA geralmente se moveram na mesma direção, então o modelo poderia distinguir entre bom e ruim, mas consistentemente pontuou imagens geradas pela IA mais altas do que os humanos.

‘Especificamente, perguntamos se os agentes da IA reconheceriam que suas próprias saídas são inferiores às produzidas por humanos, ou se mostrariam preferência por suas próprias criações, o que indicaria um possível problema de alinhamento.’

Como se revelou, há de fato um problema de alinhamento*:

‘Os avaliadores da IA atribuíram classificações mais altas às saídas geradas pela IA. Esses resultados sugerem que as diferenças de desempenho observadas podem decorrer de uma desalinhamento nas representações entre humanos e IA.’

Ao examinar como os humanos e a IA frasam sua orientação, discrepâncias se tornaram claras nos testes. Como visto na figura abaixo, tanto o foco quanto o comprimento são assuntos de divergência entre a IA e os humanos:

Uma comparação de como os humanos e a IA deram instruções durante a tarefa de codificação. 'A' mostra que os humanos escrevem instruções curtas e diretas, enquanto a IA escreve descrições longas e detalhadas. 'B' mapeia as instruções, revelando que os prompts humanos se agrupam juntos, enquanto os prompts da IA se separam por animal. 'C' rastreia como limitar o comprimento da instrução da IA não corrige seus maus resultados ao longo do tempo; e 'D' ilustra que os humanos fornecem orientação mais variada e equilibrada do que a IA, mesmo quando limites de palavra são impostos.

Uma comparação de como os humanos e a IA deram instruções durante a tarefa de codificação. ‘A’ mostra que os humanos escrevem instruções curtas e diretas, enquanto a IA escreve descrições longas e detalhadas. ‘B’ mapeia as instruções, revelando que os prompts humanos se agrupam juntos, enquanto os prompts da IA se separam por animal. ‘C’ rastreia como limitar o comprimento da instrução da IA não corrige seus maus resultados ao longo do tempo; e ‘D’ ilustra que os humanos fornecem orientação mais variada e equilibrada do que a IA, mesmo quando limites de palavra são impostos.

As instruções humanas tendiam a ser curtas e objetivas, oferecendo edições claras que poderiam ser aplicadas geralmente em todos os alvos. As instruções da IA, por outro lado, estavam densamente cheias de detalhes descritivos e frequentemente infladas com especificidades sobre sombreamento, texturas, iluminação ou minúcias anatômicas – descrições que podem fazer sentido em isolamento, mas falham em fornecer etapas úteis para o modelo (e que serão familiares para aqueles cientes dos problemas dos LLMs em torno do comprimento do contexto, ou seja, ser capaz de reter ‘a visão geral’ à medida que um projeto se desenvolve e cresce).

Para ver se a redução da verbosidade melhoraria o desempenho, o GPT-5 foi limitado a 10, 20 ou 30 palavras por instrução; mas mesmo essas instruções comprimidas falharam em mostrar qualquer melhoria (veja a parte inferior direita do gráfico acima).

Empreendimentos Conjuntos

Para testar o que acontece quando os humanos e a IA compartilham o controle, os pesquisadores executaram tarefas de codificação com diferentes combinações de entrada humana e da IA, variando de principalmente humano para principalmente IA.

Cada configuração híbrida superou o controle total da IA, de modo que mesmo uma pequena quantidade de orientação humana melhorou os resultados:

Configurações de codificação híbrida com diferentes combinações de humanos e IA. (A) Mostra como os humanos e a IA se alternaram como instrutores e seletor para cada passo de codificação; (B) mostra que mais participação humana levou a resultados de melhor qualidade, enquanto mais entrada da IA reduziu as pontuações; e (C) descreve uma queda constante na qualidade da saída final à medida que a participação humana diminui, confirmando que direção humana mais consistente produziu melhores resultados.

Configurações de codificação híbrida com diferentes combinações de humanos e IA. (A) Mostra como os humanos e a IA se alternaram como instrutores e seletor para cada passo de codificação; (B) mostra que mais participação humana levou a resultados de melhor qualidade, enquanto mais entrada da IA reduziu as pontuações; e (C) descreve uma queda constante na qualidade da saída final à medida que a participação humana diminui, confirmando que direção humana mais consistente produziu melhores resultados.

À medida que a IA assumia mais do processo, o desempenho caía, com os melhores resultados vistos quando os humanos lideravam a maioria das rodadas e os mais fracos quando a IA liderava a maioria das rodadas. Nenhuma dessas configurações híbridas conseguiu continuar melhorando com cada nova rodada, sugerindo que a direção humana funciona melhor quando é constante e consistente, em vez de ocasional.

Reversão de Papel

O estudo também explorou se importa quem faz o quê nesse tipo de tarefa e testou para isso. A tarefa revisada envolvia duas tarefas: um participante ditaria como mudar a imagem e outro escolheria uma versão preferível.

Quando ambos os trabalhos foram feitos por pessoas, a qualidade foi mantida; mas quando um humano deu as instruções e ninguém escolheu entre as versões, a qualidade piorou:

Testes para divisão de papéis na codificação de vibração: em (A), remover o papel do seletor levou a um desempenho pior, mesmo quando um humano forneceu instruções; em (B), substituir o seletor humano por uma IA reduziu a qualidade ligeiramente, mas não tão severamente quanto pular a seleção inteiramente.

Testes para divisão de papéis na codificação de vibração: em (A), remover o papel do seletor levou a um desempenho pior, mesmo quando um humano forneceu instruções; em (B), substituir o seletor humano por uma IA reduziu a qualidade ligeiramente, mas não tão severamente quanto pular a seleção inteiramente.

Quando a IA estava no comando, pular a etapa de escolha não importava, desde que suas saídas permanecessem consistentes de qualquer forma; mas quando os humanos deram as instruções e a IA escolheu entre os resultados, a qualidade permaneceu próxima do setup totalmente humano.

O oposto não funcionou: ter a IA dar direções enquanto os humanos escolhiam as saídas levou a resultados mais fracos, sugerindo que a orientação criativa humana permanece essencial, enquanto o trabalho de escolher entre opções pode ser transferido para a IA sem muita perda.

O artigo conclui:

‘[Geração de ideias de alto nível] e instrução são as contribuições humanas críticas, enquanto a avaliação e a seleção podem ser frequentemente delegadas à IA sem perda de desempenho.

‘Isso sugere um princípio de design prático para sistemas híbridos: os humanos devem estabelecer a direção, enquanto a IA pode apoiar a avaliação e a execução.’

Conclusão

Ainda está para ser visto até que ponto janelas de contexto melhoradas e/ou aumentadas afetarão o desempenho dos LLMs em tarefas desse tipo. O dia em que a ‘amnésia do LLM’ deixar de ser um problema diário da colaboração humano-IA pode ser uma causa tanto para celebração quanto para alarme, desde que o problema que a IA está tentando resolver, argumentavelmente, é pessoas.

No entanto, o trabalho dos autores também deixa claro que existem desacordos inatos e críticos entre a IA e os humanos com relação à qualidade, que podem ainda ser determinados pelos consumidores como um conceito irremediavelmente humano.

 

* Minha conversão das citações em linha dos autores para links.

Publicado pela primeira vez na sexta-feira, 13 de fevereiro de 2026

Escritor em aprendizado de máquina, especialista em síntese de imagens humanas. Ex‑chefe de conteúdo de pesquisa na Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Website: martinanderson.ai
Contato: martin@martinanderson.ai