Ângulo de Anderson

Código Humano de 2020 Supera Agentes Codificados por Vibração em Testes de Agência

mm
Adicione Unite.AI às suas fontes preferidas no Google
AI-generated image: a Victorian coach and horses winning formula 1 against modern race car competitors. gpt-image-1.

O ChatGPT e outras ferramentas de codificação por vibração foram testados em quase 40.000 partidas – e perderam para o código escrito por um estudante de pós-graduação antes da invenção dos Grandes Modelos de Linguagem.

 

Em um novo estudo do Reino Unido, os pesquisadores colocaram agentes codificados por humanos contra agentes codificados por vibração desenvolvidos com os últimos Grandes Modelos de Linguagem (LLMs), como ChatGPT-5 e Claude, e descobriram que os agentes criados sem a ajuda da IA superaram facilmente as versões facilitadas pela IA.

Os dois conjuntos de agentes foram criados por diferentes gerações de estudantes do Laboratório de Inteligência Artificial do Instituto Federal de Tecnologia da Suíça. Os agentes não IA foram desenvolvidos como parte de um curso em 2020, dois anos antes do início do ChatGPT e do início da revolução dos LLMs, enquanto os novos agentes foram criados por estudantes atuais, auxiliados pelos LLMs mais recentes e melhores disponíveis.

Even com um jogo manipulado, as soluções codificadas por vibração não puderam vencer, e os cinco primeiros lugares foram consistentemente ocupados por ‘agentes brutos’, com a maioria dos agentes LLM (33 de 40) sendo facilmente derrotados por ‘agentes básicos muito simples’, em 38.304 desafios em um torneio, em uma ampla variedade de variáveis e circunstâncias.

O artigo afirma:

‘Nosso trabalho demonstra que, embora os LLMs de ponta possam gerar código que execute (ou seja, livre de erros de sintaxe), a solução gerada não é competitiva com as soluções projetadas por humanos em dimensões como planejamento estratégico, otimização ou competição multiagente.

‘Portanto, este trabalho traz à tona esta nova fronteira na geração de código e visa facilitar o desenvolvimento de benchmarks, conjuntos de dados e linhas de base de código aberto que enfatizam a síntese de código impulsionada por raciocínio.’

O desafio projetado foi para participar criativamente de leilões, em uma variedade de estratégias, e organizar a logística de entrega de itens vencidos para os vencedores.

Os autores observam que vários vantagens foram dadas aos LLMs, como intervenir em seu código para melhorar seu desempenho – um benefício não permitido ao código de 2020; No entanto, mesmo quando fornecido com código corretivo que definitivamente melhoraria seus resultados, os LLMs não puderam aceitá-lo ou usá-lo:

‘[Em] nosso benchmark, mesmo quando expomos uma boa solução no contexto, o LLM ainda não consegue utilizá-la.

‘Este resultado também levanta questões de pesquisa interessantes sobre os limites do aprendizado no contexto e da resolução de problemas aumentada em cenários complexos.’

Os LLMs usados no teste foram GPT-5 Thinking, Gemini 2.5 Pro, Claude Opus 4.1, e DeepSeek R1*.

O novo artigo é intitulado Os Códigos de Vibração Podem Superar os Estudantes de Pós-Graduação em Ciência da Computação? Um Torneio de LLM vs. Código Humano em Planejamento Estratégico Orientado por Mercado, e vem de um autor da Universidade de Southampton e outro da Universidade de Oxford e do Instituto Alan Turing. O benchmark, os autores afirmam, será lançado em breve.

Método

Os autores observam que os testes tradicionais nessa esfera se concentram em desafios com soluções binárias claramente definidas (correto ou incorreto), verificados por meio de testes unitários. Alegando que isso não é o ideal para explorar as limitações do código auxiliado por LLM, os autores projetaram um cenário de desafio mais complexo, com múltiplos benchmarks internos e marcos, no qual a vitória é possível, mas longe de simples:

Comparação de abordagens baseadas em testes unitários padrão (acima) e o cenário de desafio mais aberto projetado pelos autores (em azul, abaixo). Fonte [ https://arxiv.org/pdf/2511.20613 ]

Comparação de abordagens baseadas em testes unitários padrão (acima) e o cenário de desafio mais aberto projetado pelos autores (em azul, abaixo). Fonte

O Problema de Leilão, Coleta e Entrega (APDP) usado para o estudo dos autores foi parcialmente auto-selecionado, devido à disponibilidade de um corpus de trabalho de estudantes de 2020 da universidade suíça; trabalho que buscava criar agentes automatizados para a tarefa APDP, antes de qualquer capacidade de fortalecer o desenvolvimento por meio da IA. Portanto, foi relativamente fácil atribuir a tarefa moderna aos estudantes com o mesmo briefing, mas disponibilizar-lhes as ferramentas atuais.

Os autores buscaram evitar quadros de teste populares, como HumanEval, BigCodeBench e WebDev Arena (entre muitos outros), pois essa classe de procedimentos de teste tende a sofrer de contaminação de dados (ou seja, instâncias em que o sistema pode ter treinado em dados de teste em vez de respeitar uma divisão).

O APDP é um problema logístico de duas etapas baseado em leilões reversos e rota de veículo. Na primeira etapa, os agentes competem para ganhar tarefas de entrega, submetendo lances para quanto devem ser pagos para completar cada uma delas. Lances muito altos significam perder a tarefa; lances muito baixos podem significar perder dinheiro.

Na segunda etapa, cada agente deve criar um plano eficiente para cumprir apenas as tarefas que ganharam, atribuindo-as a veículos com diferentes capacidades e custos, sob restrições de tempo e recursos:

No APDP, as empresas licitam em leilões reversos para tarefas de entrega, então otimizam as rotas de veículo para cumprir apenas as tarefas que ganharam, visando maximizar o lucro.

No APDP, as empresas licitam em leilões reversos para tarefas de entrega, então otimizam as rotas de veículo para cumprir apenas as tarefas que ganharam, visando maximizar o lucro.

O objetivo não é simplesmente concluir as tarefas, mas maximizar o lucro geral, antecipando quais conjuntos de tarefas funcionarão melhor juntos e prevendo as estratégias dos concorrentes que estão tentando fazer o mesmo.

O benchmark APDP aumenta a dificuldade das tarefas de geração de código, introduzindo planejamento estratégico em uma sequência de leilões interdependentes, com cada lance redefinindo o cenário de escolhas futuras; e, portanto, exige que os agentes raciocinem não apenas sobre custos imediatos, mas sobre posicionamento, tempo e consequências de longo prazo.

O problema de entrega central é NP-difícil, ou seja, nenhum algoritmo pode encontrar a melhor solução em tempo razoável à medida que o número de tarefas cresce. Isso torna a força bruta uma abordagem inviável e força os agentes a trocar precisão por velocidade.

A Corrida Está On

A avaliação dos autores comparou 40 agentes codificados por LLM contra 17 agentes codificados por humanos em uma série de torneios de confronto direto. Cada um dos 12 torneios usou uma combinação diferente de quatro topologias de rede de estrada e consistiu em todos contra todos emparelhamentos, com os agentes enfrentando cada oponente duas vezes: uma vez controlando cada uma das duas empresas, com especificações de veículo diferentes.

Esse cenário produziu 3.192 partidas por torneio, totalizando 38.304 partidas. Em cada partida, 50 tarefas de entrega foram leiloadas, definidas por seus pontos de coleta e entrega e peso, e sorteada aleatoriamente em layouts de estrada modelados na Suíça, França, Grã-Bretanha e Países Baixos:

Redes de estrada simplificadas usadas no torneio: Grã-Bretanha (topo esquerdo), Suíça (topo direito), Países Baixos (fundo esquerdo) e França (fundo direito). Quadrados azuis e vermelhos marcam tarefas de coleta e entrega. Triângulos coloridos mostram as posições atuais dos veículos dos agentes.

Redes de estrada simplificadas usadas no torneio: Grã-Bretanha (topo esquerdo), Suíça (topo direito), Países Baixos (fundo esquerdo) e França (fundo direito). Quadrados azuis e vermelhos marcam tarefas de coleta e entrega. Triângulos coloridos mostram as posições atuais dos veículos dos agentes.

Os agentes estudantis foram retirados de um torneio de curso de 2020. Oito vieram dos principais desempenhos em uma final de eliminação única e quatro mais foram escolhidos por um desempenho forte contra os agentes de baseline em partidas de confronto direto.

Os agentes de baseline seguiram heurísticas. Naive calculou a distância total e licitou de acordo, usando apenas um veículo e ignorando o lote; ExpCostFixedBid simulou 10 tarefas aleatórias e licitou o custo marginal médio; Honest computou o custo marginal real de inserir a tarefa no cronograma; ModelOpponent fez o mesmo, mas adicionou uma estimativa do custo do oponente, licitando o máximo; e RiskSeeking combinou um prior decrescente com base no tempo com uma estimativa de custo ao vivo e modelagem do oponente – novamente licitando o mais alto dos dois.

A avaliação incluiu 40 agentes codificados por LLM construídos usando o (mencionado anteriormente) GPT-5 Thinking, Claude Opus 4.1, Gemini 2.5 Pro e DeepSeek R1. Cada modelo foi solicitado com cinco estratégias distintas, aplicadas duas vezes por modelo.

Duas estratégias usaram prompts estáticos escritos por diferentes autores, enquanto uma terceira pediu ao modelo que se auto-refletisse e revisasse sua própria saída; outra envolveu crítica e revisão por um LLM separado. A estratégia final usou o GPT-4 para sintetizar um novo prompt revisando as quatro abordagens anteriores.

O prompt base refletia a tarefa original do estudante, descrevendo o ambiente de entrega e instruindo o modelo a licitar e planejar para maximizar o lucro, sem confiar em métodos de alta complexidade.

Todos os agentes LLM foram testados em ambientes de autojogo e torneio até que todos os bugs observáveis fossem corrigidos. A correção de bugs foi tratada autonomamente pelos LLMs, solicitados com as informações de erro.

Falhas comuns de LLM, o artigo observa, incluíam violações de limites de tempo, falha em coletar ou entregar tarefas atribuídas e violações de restrições de capacidade de veículo – erros que frequentemente surgiam do descumprimento de instruções explícitas ou de lógica de replanejamento defeituosa†:

‘Outro problema comum que encontramos (principalmente com Gemini, Claude e DeepSeek, e não tanto com GPT) é que, quite frequentemente, o LLM consistentemente falhava em resolver um bug.

‘Por exemplo, um agente consistentemente expirava, apesar de múltiplos (por exemplo, 5 – 15) ciclos de solicitação do LLM com o erro e recebendo a versão atualizada do código.

‘A única solução que encontramos para tais situações (em que o LLM repetidamente falha em resolver o mesmo bug) é reiniciar do zero. No geral, observamos a necessidade de esforço manual significativo para alcançar o código livre de bugs. Tivemos que gerar substancialmente mais agentes para obter os 40 agentes livres de bugs que avaliamos.’

Os resultados mostrados abaixo resumem os resultados de 12 torneios de rodada dupla, abrangendo quatro topologias de rede e três torneios por topologia, produzindo quase 40.000 partidas:

Agente Avg #Vitórias / Torneio SD #Vitórias / Torneio Avg #Derrotas / Torneio SD #Derrotas / Torneio Vitórias Totais Derrotas Totais Taxa de Vitória
Estudante 1 108.167 1.193 3.833 1.193 1298 46 0.9658
Estudante 2 104.917 2.539 7.083 2.539 1259 85 0.9368
Estudante 3 103.917 2.466 8.083 2.466 1247 97 0.9278
Estudante 4 103.25 1.815 8.75 1.815 1239 105 0.9219
Estudante 5 96.5 2.908 15.5 2.908 1158 186 0.8616
LLM(O, IR, 1) 95.417 2.314 16.583 2.314 1145 199 0.8519
LLM(O, A2, 1) 94.583 2.314 17.417 2.314 1135 209 0.8445
Estudante 6 93.167 1.899 18.833 1.899 1118 226 0.8318
Estudante 7 93.167 3.563 18.833 3.563 1118 226 0.8318
LLM(O, A1, 1) 86.083 3.029 25.917 3.029 1033 311 0.7686
LLM(O, GEN, 2) 84.083 6.947 27.917 6.947 1009 335 0.7507
LLM(O, CR, 2) 83.5 4.442 28.5 4.442 1002 342 0.7455
Estudante 8 83.417 4.122 28.583 4.122 1001 343 0.7448
RiskSeeking 82.417 3.343 29.583 3.343 989 355 0.7359
LLM(O, GEN, 1) 80.667 4.355 31.25 4.372 968 375 0.7208
ModelOpponent 80.583 3.26 31.417 3.26 967 377 0.7195
LLM(D, A1, 1) 79.417 3.965 32.583 3.965 953 391 0.7091
ExpCostFixedBid 77.167 4.951 34.833 4.951 926 418 0.689
LLM(O, IR, 2) 73.917 3.502 38 3.618 887 456 0.6605
LLM(O, A1, 2) 72.417 2.193 39.583 2.193 869 475 0.6466
LLM(G, A1, 2) 68.5 3.555 43.5 3.555 822 522 0.6116
LLM(A, GEN, 2) 67.917 2.968 44.083 2.968 815 529 0.6064
LLM(G, IR, 2) 65.917 2.314 46.083 2.314 791 553 0.5885
Estudante 9 64.167 11.044 47.833 11.044 770 574 0.5729
LLM(G, A1, 1) 64 4.243 47.917 4.316 768 575 0.5719
LLM(G, IR, 1) 60.333 3.725 51.667 3.725 724 620 0.5387
LLM(O, A2, 2) 59.333 4.499 52.667 4.499 712 632 0.5298
LLM(D, CR, 1) 55.083 6.694 56.833 6.59 661 682 0.4922
LLM(G, GEN, 2) 53.167 3.664 58.833 3.664 638 706 0.4747
LLM(D, GEN, 2) 52.083 9.06 59.917 9.06 625 719 0.465
Honest 50.583 3.848 61.417 3.848 607 737 0.4516
Estudante 10 48.833 2.98 63.167 2.98 586 758 0.436
LLM(D, IR, 1) 48.583 10.211 63.417 10.211 583 761 0.4338
LLM(A, A1, 1) 48 4.69 64 4.69 576 768 0.4286
LLM(G, A2, 1) 47.25 3.864 64.75 3.864 567 777 0.4219
LLM(A, CR, 1) 43.833 4.609 68.167 4.609 526 818 0.3914
LLM(A, A1, 2) 43.75 2.05 68.25 2.05 525 819 0.3906
Estudante 11 42.083 5.664 69.917 5.664 505 839 0.3757
LLM(A, IR, 1) 39.5 2.541 72.5 2.541 474 870 0.3527
Naive 36.75 1.712 75.25 1.712 441 903 0.3281
Estudante 12 36.333 1.775 75.667 1.775 436 908 0.3244
LLM(D, A2, 1) 33.917 2.193 78.083 2.193 407 937 0.3028
LLM(A, GEN, 1) 30.167 1.749 81.833 1.749 362 982 0.2693
LLM(D, A2, 2) 29.833 2.038 82.167 2.038 358 986 0.2664
LLM(G, A2, 2) 27 2.256 85 2.256 324 1020 0.2411
LLM(A, A2, 1) 26.333 0.985 85.667 0.985 316 1028 0.2351
LLM(O, CR, 1) 25 3.411 87 3.411 300 1044 0.2232
LLM(A, IR, 2) 24.333 8.542 87.667 8.542 292 1052 0.2173
LLM(A, A2, 2) 24 1.809 88 1.809 288 1056 0.2143
LLM(A, CR, 2) 23.333 1.557 88.667 1.557 280 1064 0.2083
LLM(D, GEN, 1) 22.5 1.784 89.5 1.784 270 1074 0.2009
LLM(D, A1, 2) 13.333 1.826 98.667 1.826 160 1184 0.119
LLM(G, CR, 1) 9.5 1.087 102.5 1.087 114 1230 0.0848
LLM(G, GEN, 1) 9.167 0.937 102.833 0.937 110 1234 0.0818
LLM(D, IR, 2) 7.75 0.622 104.25 0.622 93 1251 0.0692
LLM(G, CR, 2) 7.25 1.422 104.75 1.422 87 1257 0.0647
LLM(D, CR, 2) 5.667 0.985 106.333 0.985 68 1276 0.0506

Para contexto, cada agente jogou 112 partidas por torneio, então a média máxima possível para vitórias ou derrotas por agente é 112. Desvio padrão (SD) reflete variabilidade entre torneios. Agentes codificados por humanos aparecem em negrito. Agentes codificados por LLM são rotulados por modelo (O = GPT-5 Thinking, G = Gemini 2.5 Pro, A = Claude Opus 4.1, D = DeepSeek R1), seguido por um código de estratégia de dois letras e um dígito indicando se o agente é o primeiro ou segundo gerado com esse prompt. Fonte

Em relação aos resultados mostrados acima, os autores afirmam†:

‘LLMs não geraram código esperado/competitivo, mesmo em variantes mais simples do problema APDP (apesar do código ser largamente livre de bugs de sintaxe). Isso destaca a importância de benchmarks de avaliação de código impulsionados por raciocínio que vão além do auto-completar e identificam novas fraquezas dos LLMs.’

‘Nossos resultados demonstram uma clara superioridade dos agentes codificados por humanos: (i) Os cinco primeiros lugares são consistentemente ocupados por agentes estudantis, e (ii) a maioria dos agentes LLM (33 de 40) é derrotada por agentes básicos muito simples (como o licitante de custo fixo esperado).

‘Importante notar que não depuramos o código do estudante (enquanto depuramos/testamos o código LLM, tanto em autojogo quanto em torneio [configurações]). Todas as vezes que um agente estudantil travou, automaticamente demos a vitória ao LLM. Um grande número desses travamentos seria fácil de consertar (por exemplo, agentes expiraram), então os agentes estudantis poderiam potencialmente classificar ainda mais alto.’

Como um experimento adicional, o GPT-5 Thinking foi solicitado a melhorar o código do agente de desempenho superior, Estudante 1; mas o agente agora modificado pelo LLM subsequentemente caiu para o décimo lugar, agora o pior de todos os escores humanos. Em vez de melhorar a solução, as alterações do LLM a degradaram em quase 20%.

Os autores concluem:

‘[Nossos] resultados destacam limitações importantes da geração de código LLM, mais notavelmente suas capacidades limitadas de raciocínio e planejamento ao gerar [código]. LLMs modernos podem fornecer código livre de bugs de sintaxe que executa, mas isso não é o benchmark que devemos usar para medir o progresso em direção à IA geral avançada.’

Conclusão

Os autores observam que a codificação por vibração permitiu que pessoas de todos os níveis técnicos criassem códigos, e caracterizam a prática de forma positiva, como uma força niveladora. No entanto, também implicam que, porque a codificação por vibração chegou recentemente, seus limites não são conhecidos e podem ser considerados realistas.

Eles concluem seu artigo chamando para uma mudança de objetivo ‘de código que compila para código que compete’.

Uma pergunta que o leitor casual deste artigo interessante pode ter é se os autores estão lutando acima ou abaixo, pois a tarefa agente em questão é consideravelmente mais complexa e envolvida do que criar scripts do PowerShell e outras formas de funcionalidade e reparos menores para os quais a codificação por vibração é bem adequada.

 

* Por favor, note que o artigo se refere continuamente a ‘DeepThink R1′, que parece ser inexistente, surgindo apenas um punhado de referências na internet (presumivelmente de outros autores que escreveram incorretamente ‘DeepSeek R1)’. Se este for meu erro, por favor, entre em contato comigo por meio dos meus detalhes de perfil e eu farei as alterações necessárias.

† Ênfase dos autores, não minha.

Publicado pela primeira vez na quarta-feira, 26 de novembro de 2025. Alterado às 17h35 para formatação.

Escritor em aprendizado de máquina, especialista em síntese de imagens humanas. Ex‑chefe de conteúdo de pesquisa na Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Website: martinanderson.ai
Contato: martin@martinanderson.ai