Ãngulo de Anderson
CÃģdigo Humano de 2020 Supera Agentes Codificados por VibraçÃĢo em Testes de AgÊncia

O ChatGPT e outras ferramentas de codificaçÃĢo por vibraçÃĢo foram testados em quase 40.000 partidas â e perderam para o cÃģdigo escrito por um estudante de pÃģs-graduaçÃĢo antes da invençÃĢo dos Grandes Modelos de Linguagem.
Â
Em um novo estudo do Reino Unido, os pesquisadores colocaram agentes codificados por humanos contra agentes codificados por vibraçÃĢo desenvolvidos com os Últimos Grandes Modelos de Linguagem (LLMs), como ChatGPT-5 e Claude, e descobriram que os agentes criados sem a ajuda da IA superaram facilmente as versÃĩes facilitadas pela IA.
Os dois conjuntos de agentes foram criados por diferentes geraçÃĩes de estudantes do LaboratÃģrio de InteligÊncia Artificial do Instituto Federal de Tecnologia da SuÃça. Os agentes nÃĢo IA foram desenvolvidos como parte de um curso em 2020, dois anos antes do inÃcio do ChatGPT e do inÃcio da revoluçÃĢo dos LLMs, enquanto os novos agentes foram criados por estudantes atuais, auxiliados pelos LLMs mais recentes e melhores disponÃveis.
Even com um jogo manipulado, as soluçÃĩes codificadas por vibraçÃĢo nÃĢo puderam vencer, e os cinco primeiros lugares foram consistentemente ocupados por âagentes brutosâ, com a maioria dos agentes LLM (33 de 40) sendo facilmente derrotados por âagentes bÃĄsicos muito simplesâ, em 38.304 desafios em um torneio, em uma ampla variedade de variÃĄveis e circunstÃĒncias.
O artigo afirma:
âNosso trabalho demonstra que, embora os LLMs de ponta possam gerar cÃģdigo que execute (ou seja, livre de erros de sintaxe), a soluçÃĢo gerada nÃĢo ÃĐ competitiva com as soluçÃĩes projetadas por humanos em dimensÃĩes como planejamento estratÃĐgico, otimizaçÃĢo ou competiçÃĢo multiagente.
âPortanto, este trabalho traz à tona esta nova fronteira na geraçÃĢo de cÃģdigo e visa facilitar o desenvolvimento de benchmarks, conjuntos de dados e linhas de base de cÃģdigo aberto que enfatizam a sÃntese de cÃģdigo impulsionada por raciocÃnio.â
O desafio projetado foi para participar criativamente de leilÃĩes, em uma variedade de estratÃĐgias, e organizar a logÃstica de entrega de itens vencidos para os vencedores.
Os autores observam que vÃĄrios vantagens foram dadas aos LLMs, como intervenir em seu cÃģdigo para melhorar seu desempenho â um benefÃcio nÃĢo permitido ao cÃģdigo de 2020; No entanto, mesmo quando fornecido com cÃģdigo corretivo que definitivamente melhoraria seus resultados, os LLMs nÃĢo puderam aceitÃĄ-lo ou usÃĄ-lo:
â[Em] nosso benchmark, mesmo quando expomos uma boa soluçÃĢo no contexto, o LLM ainda nÃĢo consegue utilizÃĄ-la.
âEste resultado tambÃĐm levanta questÃĩes de pesquisa interessantes sobre os limites do aprendizado no contexto e da resoluçÃĢo de problemas aumentada em cenÃĄrios complexos.â
Os LLMs usados no teste foram GPT-5 Thinking, Gemini 2.5 Pro, Claude Opus 4.1, e DeepSeek R1*.
O novo artigo ÃĐ intitulado Os CÃģdigos de VibraçÃĢo Podem Superar os Estudantes de PÃģs-GraduaçÃĢo em CiÊncia da ComputaçÃĢo? Um Torneio de LLM vs. CÃģdigo Humano em Planejamento EstratÃĐgico Orientado por Mercado, e vem de um autor da Universidade de Southampton e outro da Universidade de Oxford e do Instituto Alan Turing. O benchmark, os autores afirmam, serÃĄ lançado em breve.
MÃĐtodo
Os autores observam que os testes tradicionais nessa esfera se concentram em desafios com soluçÃĩes binÃĄrias claramente definidas (correto ou incorreto), verificados por meio de testes unitÃĄrios. Alegando que isso nÃĢo ÃĐ o ideal para explorar as limitaçÃĩes do cÃģdigo auxiliado por LLM, os autores projetaram um cenÃĄrio de desafio mais complexo, com mÚltiplos benchmarks internos e marcos, no qual a vitÃģria ÃĐ possÃvel, mas longe de simples:
![ComparaçÃĢo de abordagens baseadas em testes unitÃĄrios padrÃĢo (acima) e o cenÃĄrio de desafio mais aberto projetado pelos autores (em azul, abaixo). Fonte [ https://arxiv.org/pdf/2511.20613 ]](https://www.unite.ai/wp-content/uploads/2025/11/figure-1-2.jpg)
ComparaçÃĢo de abordagens baseadas em testes unitÃĄrios padrÃĢo (acima) e o cenÃĄrio de desafio mais aberto projetado pelos autores (em azul, abaixo). Fonte
O Problema de LeilÃĢo, Coleta e Entrega (APDP) usado para o estudo dos autores foi parcialmente auto-selecionado, devido à disponibilidade de um corpus de trabalho de estudantes de 2020 da universidade suÃça; trabalho que buscava criar agentes automatizados para a tarefa APDP, antes de qualquer capacidade de fortalecer o desenvolvimento por meio da IA. Portanto, foi relativamente fÃĄcil atribuir a tarefa moderna aos estudantes com o mesmo briefing, mas disponibilizar-lhes as ferramentas atuais.
Os autores buscaram evitar quadros de teste populares, como HumanEval, BigCodeBench e WebDev Arena (entre muitos outros), pois essa classe de procedimentos de teste tende a sofrer de contaminaçÃĢo de dados (ou seja, instÃĒncias em que o sistema pode ter treinado em dados de teste em vez de respeitar uma divisÃĢo).
O APDP ÃĐ um problema logÃstico de duas etapas baseado em leilÃĩes reversos e rota de veÃculo. Na primeira etapa, os agentes competem para ganhar tarefas de entrega, submetendo lances para quanto devem ser pagos para completar cada uma delas. Lances muito altos significam perder a tarefa; lances muito baixos podem significar perder dinheiro.
Na segunda etapa, cada agente deve criar um plano eficiente para cumprir apenas as tarefas que ganharam, atribuindo-as a veÃculos com diferentes capacidades e custos, sob restriçÃĩes de tempo e recursos:

No APDP, as empresas licitam em leilÃĩes reversos para tarefas de entrega, entÃĢo otimizam as rotas de veÃculo para cumprir apenas as tarefas que ganharam, visando maximizar o lucro.
O objetivo nÃĢo ÃĐ simplesmente concluir as tarefas, mas maximizar o lucro geral, antecipando quais conjuntos de tarefas funcionarÃĢo melhor juntos e prevendo as estratÃĐgias dos concorrentes que estÃĢo tentando fazer o mesmo.
O benchmark APDP aumenta a dificuldade das tarefas de geraçÃĢo de cÃģdigo, introduzindo planejamento estratÃĐgico em uma sequÊncia de leilÃĩes interdependentes, com cada lance redefinindo o cenÃĄrio de escolhas futuras; e, portanto, exige que os agentes raciocinem nÃĢo apenas sobre custos imediatos, mas sobre posicionamento, tempo e consequÊncias de longo prazo.
O problema de entrega central ÃĐ NP-difÃcil, ou seja, nenhum algoritmo pode encontrar a melhor soluçÃĢo em tempo razoÃĄvel à medida que o nÚmero de tarefas cresce. Isso torna a força bruta uma abordagem inviÃĄvel e força os agentes a trocar precisÃĢo por velocidade.
A Corrida EstÃĄ On
A avaliaçÃĢo dos autores comparou 40 agentes codificados por LLM contra 17 agentes codificados por humanos em uma sÃĐrie de torneios de confronto direto. Cada um dos 12 torneios usou uma combinaçÃĢo diferente de quatro topologias de rede de estrada e consistiu em todos contra todos emparelhamentos, com os agentes enfrentando cada oponente duas vezes: uma vez controlando cada uma das duas empresas, com especificaçÃĩes de veÃculo diferentes.
Esse cenÃĄrio produziu 3.192 partidas por torneio, totalizando 38.304 partidas. Em cada partida, 50 tarefas de entrega foram leiloadas, definidas por seus pontos de coleta e entrega e peso, e sorteada aleatoriamente em layouts de estrada modelados na SuÃça, França, GrÃĢ-Bretanha e PaÃses Baixos:

Redes de estrada simplificadas usadas no torneio: GrÃĢ-Bretanha (topo esquerdo), SuÃça (topo direito), PaÃses Baixos (fundo esquerdo) e França (fundo direito). Quadrados azuis e vermelhos marcam tarefas de coleta e entrega. TriÃĒngulos coloridos mostram as posiçÃĩes atuais dos veÃculos dos agentes.
Os agentes estudantis foram retirados de um torneio de curso de 2020. Oito vieram dos principais desempenhos em uma final de eliminaçÃĢo Única e quatro mais foram escolhidos por um desempenho forte contra os agentes de baseline em partidas de confronto direto.
Os agentes de baseline seguiram heurÃsticas. Naive calculou a distÃĒncia total e licitou de acordo, usando apenas um veÃculo e ignorando o lote; ExpCostFixedBid simulou 10 tarefas aleatÃģrias e licitou o custo marginal mÃĐdio; Honest computou o custo marginal real de inserir a tarefa no cronograma; ModelOpponent fez o mesmo, mas adicionou uma estimativa do custo do oponente, licitando o mÃĄximo; e RiskSeeking combinou um prior decrescente com base no tempo com uma estimativa de custo ao vivo e modelagem do oponente â novamente licitando o mais alto dos dois.
A avaliaçÃĢo incluiu 40 agentes codificados por LLM construÃdos usando o (mencionado anteriormente) GPT-5 Thinking, Claude Opus 4.1, Gemini 2.5 Pro e DeepSeek R1. Cada modelo foi solicitado com cinco estratÃĐgias distintas, aplicadas duas vezes por modelo.
Duas estratÃĐgias usaram prompts estÃĄticos escritos por diferentes autores, enquanto uma terceira pediu ao modelo que se auto-refletisse e revisasse sua prÃģpria saÃda; outra envolveu crÃtica e revisÃĢo por um LLM separado. A estratÃĐgia final usou o GPT-4 para sintetizar um novo prompt revisando as quatro abordagens anteriores.
O prompt base refletia a tarefa original do estudante, descrevendo o ambiente de entrega e instruindo o modelo a licitar e planejar para maximizar o lucro, sem confiar em mÃĐtodos de alta complexidade.
Todos os agentes LLM foram testados em ambientes de autojogo e torneio atÃĐ que todos os bugs observÃĄveis fossem corrigidos. A correçÃĢo de bugs foi tratada autonomamente pelos LLMs, solicitados com as informaçÃĩes de erro.
Falhas comuns de LLM, o artigo observa, incluÃam violaçÃĩes de limites de tempo, falha em coletar ou entregar tarefas atribuÃdas e violaçÃĩes de restriçÃĩes de capacidade de veÃculo â erros que frequentemente surgiam do descumprimento de instruçÃĩes explÃcitas ou de lÃģgica de replanejamento defeituosaâ :
âOutro problema comum que encontramos (principalmente com Gemini, Claude e DeepSeek, e nÃĢo tanto com GPT) ÃĐ que, quite frequentemente, o LLM consistentemente falhava em resolver um bug.
âPor exemplo, um agente consistentemente expirava, apesar de mÚltiplos (por exemplo, 5 â 15) ciclos de solicitaçÃĢo do LLM com o erro e recebendo a versÃĢo atualizada do cÃģdigo.
âA Única soluçÃĢo que encontramos para tais situaçÃĩes (em que o LLM repetidamente falha em resolver o mesmo bug) ÃĐ reiniciar do zero. No geral, observamos a necessidade de esforço manual significativo para alcançar o cÃģdigo livre de bugs. Tivemos que gerar substancialmente mais agentes para obter os 40 agentes livres de bugs que avaliamos.â
Os resultados mostrados abaixo resumem os resultados de 12 torneios de rodada dupla, abrangendo quatro topologias de rede e trÊs torneios por topologia, produzindo quase 40.000 partidas:
| Agente | Avg #VitÃģrias / Torneio | SD #VitÃģrias / Torneio | Avg #Derrotas / Torneio | SD #Derrotas / Torneio | VitÃģrias Totais | Derrotas Totais | Taxa de VitÃģria |
|---|---|---|---|---|---|---|---|
| Estudante 1 | 108.167 | 1.193 | 3.833 | 1.193 | 1298 | 46 | 0.9658 |
| Estudante 2 | 104.917 | 2.539 | 7.083 | 2.539 | 1259 | 85 | 0.9368 |
| Estudante 3 | 103.917 | 2.466 | 8.083 | 2.466 | 1247 | 97 | 0.9278 |
| Estudante 4 | 103.25 | 1.815 | 8.75 | 1.815 | 1239 | 105 | 0.9219 |
| Estudante 5 | 96.5 | 2.908 | 15.5 | 2.908 | 1158 | 186 | 0.8616 |
| LLM(O, IR, 1) | 95.417 | 2.314 | 16.583 | 2.314 | 1145 | 199 | 0.8519 |
| LLM(O, A2, 1) | 94.583 | 2.314 | 17.417 | 2.314 | 1135 | 209 | 0.8445 |
| Estudante 6 | 93.167 | 1.899 | 18.833 | 1.899 | 1118 | 226 | 0.8318 |
| Estudante 7 | 93.167 | 3.563 | 18.833 | 3.563 | 1118 | 226 | 0.8318 |
| LLM(O, A1, 1) | 86.083 | 3.029 | 25.917 | 3.029 | 1033 | 311 | 0.7686 |
| LLM(O, GEN, 2) | 84.083 | 6.947 | 27.917 | 6.947 | 1009 | 335 | 0.7507 |
| LLM(O, CR, 2) | 83.5 | 4.442 | 28.5 | 4.442 | 1002 | 342 | 0.7455 |
| Estudante 8 | 83.417 | 4.122 | 28.583 | 4.122 | 1001 | 343 | 0.7448 |
| RiskSeeking | 82.417 | 3.343 | 29.583 | 3.343 | 989 | 355 | 0.7359 |
| LLM(O, GEN, 1) | 80.667 | 4.355 | 31.25 | 4.372 | 968 | 375 | 0.7208 |
| ModelOpponent | 80.583 | 3.26 | 31.417 | 3.26 | 967 | 377 | 0.7195 |
| LLM(D, A1, 1) | 79.417 | 3.965 | 32.583 | 3.965 | 953 | 391 | 0.7091 |
| ExpCostFixedBid | 77.167 | 4.951 | 34.833 | 4.951 | 926 | 418 | 0.689 |
| LLM(O, IR, 2) | 73.917 | 3.502 | 38 | 3.618 | 887 | 456 | 0.6605 |
| LLM(O, A1, 2) | 72.417 | 2.193 | 39.583 | 2.193 | 869 | 475 | 0.6466 |
| LLM(G, A1, 2) | 68.5 | 3.555 | 43.5 | 3.555 | 822 | 522 | 0.6116 |
| LLM(A, GEN, 2) | 67.917 | 2.968 | 44.083 | 2.968 | 815 | 529 | 0.6064 |
| LLM(G, IR, 2) | 65.917 | 2.314 | 46.083 | 2.314 | 791 | 553 | 0.5885 |
| Estudante 9 | 64.167 | 11.044 | 47.833 | 11.044 | 770 | 574 | 0.5729 |
| LLM(G, A1, 1) | 64 | 4.243 | 47.917 | 4.316 | 768 | 575 | 0.5719 |
| LLM(G, IR, 1) | 60.333 | 3.725 | 51.667 | 3.725 | 724 | 620 | 0.5387 |
| LLM(O, A2, 2) | 59.333 | 4.499 | 52.667 | 4.499 | 712 | 632 | 0.5298 |
| LLM(D, CR, 1) | 55.083 | 6.694 | 56.833 | 6.59 | 661 | 682 | 0.4922 |
| LLM(G, GEN, 2) | 53.167 | 3.664 | 58.833 | 3.664 | 638 | 706 | 0.4747 |
| LLM(D, GEN, 2) | 52.083 | 9.06 | 59.917 | 9.06 | 625 | 719 | 0.465 |
| Honest | 50.583 | 3.848 | 61.417 | 3.848 | 607 | 737 | 0.4516 |
| Estudante 10 | 48.833 | 2.98 | 63.167 | 2.98 | 586 | 758 | 0.436 |
| LLM(D, IR, 1) | 48.583 | 10.211 | 63.417 | 10.211 | 583 | 761 | 0.4338 |
| LLM(A, A1, 1) | 48 | 4.69 | 64 | 4.69 | 576 | 768 | 0.4286 |
| LLM(G, A2, 1) | 47.25 | 3.864 | 64.75 | 3.864 | 567 | 777 | 0.4219 |
| LLM(A, CR, 1) | 43.833 | 4.609 | 68.167 | 4.609 | 526 | 818 | 0.3914 |
| LLM(A, A1, 2) | 43.75 | 2.05 | 68.25 | 2.05 | 525 | 819 | 0.3906 |
| Estudante 11 | 42.083 | 5.664 | 69.917 | 5.664 | 505 | 839 | 0.3757 |
| LLM(A, IR, 1) | 39.5 | 2.541 | 72.5 | 2.541 | 474 | 870 | 0.3527 |
| Naive | 36.75 | 1.712 | 75.25 | 1.712 | 441 | 903 | 0.3281 |
| Estudante 12 | 36.333 | 1.775 | 75.667 | 1.775 | 436 | 908 | 0.3244 |
| LLM(D, A2, 1) | 33.917 | 2.193 | 78.083 | 2.193 | 407 | 937 | 0.3028 |
| LLM(A, GEN, 1) | 30.167 | 1.749 | 81.833 | 1.749 | 362 | 982 | 0.2693 |
| LLM(D, A2, 2) | 29.833 | 2.038 | 82.167 | 2.038 | 358 | 986 | 0.2664 |
| LLM(G, A2, 2) | 27 | 2.256 | 85 | 2.256 | 324 | 1020 | 0.2411 |
| LLM(A, A2, 1) | 26.333 | 0.985 | 85.667 | 0.985 | 316 | 1028 | 0.2351 |
| LLM(O, CR, 1) | 25 | 3.411 | 87 | 3.411 | 300 | 1044 | 0.2232 |
| LLM(A, IR, 2) | 24.333 | 8.542 | 87.667 | 8.542 | 292 | 1052 | 0.2173 |
| LLM(A, A2, 2) | 24 | 1.809 | 88 | 1.809 | 288 | 1056 | 0.2143 |
| LLM(A, CR, 2) | 23.333 | 1.557 | 88.667 | 1.557 | 280 | 1064 | 0.2083 |
| LLM(D, GEN, 1) | 22.5 | 1.784 | 89.5 | 1.784 | 270 | 1074 | 0.2009 |
| LLM(D, A1, 2) | 13.333 | 1.826 | 98.667 | 1.826 | 160 | 1184 | 0.119 |
| LLM(G, CR, 1) | 9.5 | 1.087 | 102.5 | 1.087 | 114 | 1230 | 0.0848 |
| LLM(G, GEN, 1) | 9.167 | 0.937 | 102.833 | 0.937 | 110 | 1234 | 0.0818 |
| LLM(D, IR, 2) | 7.75 | 0.622 | 104.25 | 0.622 | 93 | 1251 | 0.0692 |
| LLM(G, CR, 2) | 7.25 | 1.422 | 104.75 | 1.422 | 87 | 1257 | 0.0647 |
| LLM(D, CR, 2) | 5.667 | 0.985 | 106.333 | 0.985 | 68 | 1276 | 0.0506 |
Para contexto, cada agente jogou 112 partidas por torneio, entÃĢo a mÃĐdia mÃĄxima possÃvel para vitÃģrias ou derrotas por agente ÃĐ 112. Desvio padrÃĢo (SD) reflete variabilidade entre torneios. Agentes codificados por humanos aparecem em negrito. Agentes codificados por LLM sÃĢo rotulados por modelo (O = GPT-5 Thinking, G = Gemini 2.5 Pro, A = Claude Opus 4.1, D = DeepSeek R1), seguido por um cÃģdigo de estratÃĐgia de dois letras e um dÃgito indicando se o agente ÃĐ o primeiro ou segundo gerado com esse prompt. Fonte
Em relaçÃĢo aos resultados mostrados acima, os autores afirmamâ :
âLLMs nÃĢo geraram cÃģdigo esperado/competitivo, mesmo em variantes mais simples do problema APDP (apesar do cÃģdigo ser largamente livre de bugs de sintaxe). Isso destaca a importÃĒncia de benchmarks de avaliaçÃĢo de cÃģdigo impulsionados por raciocÃnio que vÃĢo alÃĐm do auto-completar e identificam novas fraquezas dos LLMs.â
âNossos resultados demonstram uma clara superioridade dos agentes codificados por humanos: (i) Os cinco primeiros lugares sÃĢo consistentemente ocupados por agentes estudantis, e (ii) a maioria dos agentes LLM (33 de 40) ÃĐ derrotada por agentes bÃĄsicos muito simples (como o licitante de custo fixo esperado).
âImportante notar que nÃĢo depuramos o cÃģdigo do estudante (enquanto depuramos/testamos o cÃģdigo LLM, tanto em autojogo quanto em torneio [configuraçÃĩes]). Todas as vezes que um agente estudantil travou, automaticamente demos a vitÃģria ao LLM. Um grande nÚmero desses travamentos seria fÃĄcil de consertar (por exemplo, agentes expiraram), entÃĢo os agentes estudantis poderiam potencialmente classificar ainda mais alto.â
Como um experimento adicional, o GPT-5 Thinking foi solicitado a melhorar o cÃģdigo do agente de desempenho superior, Estudante 1; mas o agente agora modificado pelo LLM subsequentemente caiu para o dÃĐcimo lugar, agora o pior de todos os escores humanos. Em vez de melhorar a soluçÃĢo, as alteraçÃĩes do LLM a degradaram em quase 20%.
Os autores concluem:
â[Nossos] resultados destacam limitaçÃĩes importantes da geraçÃĢo de cÃģdigo LLM, mais notavelmente suas capacidades limitadas de raciocÃnio e planejamento ao gerar [cÃģdigo]. LLMs modernos podem fornecer cÃģdigo livre de bugs de sintaxe que executa, mas isso nÃĢo ÃĐ o benchmark que devemos usar para medir o progresso em direçÃĢo à IA geral avançada.â
ConclusÃĢo
Os autores observam que a codificaçÃĢo por vibraçÃĢo permitiu que pessoas de todos os nÃveis tÃĐcnicos criassem cÃģdigos, e caracterizam a prÃĄtica de forma positiva, como uma força niveladora. No entanto, tambÃĐm implicam que, porque a codificaçÃĢo por vibraçÃĢo chegou recentemente, seus limites nÃĢo sÃĢo conhecidos e podem ser considerados realistas.
Eles concluem seu artigo chamando para uma mudança de objetivo âde cÃģdigo que compila para cÃģdigo que competeâ.
Uma pergunta que o leitor casual deste artigo interessante pode ter ÃĐ se os autores estÃĢo lutando acima ou abaixo, pois a tarefa agente em questÃĢo ÃĐ consideravelmente mais complexa e envolvida do que criar scripts do PowerShell e outras formas de funcionalidade e reparos menores para os quais a codificaçÃĢo por vibraçÃĢo ÃĐ bem adequada.
Â
* Por favor, note que o artigo se refere continuamente a âDeepThink R1âē, que parece ser inexistente, surgindo apenas um punhado de referÊncias na internet (presumivelmente de outros autores que escreveram incorretamente âDeepSeek R1)â. Se este for meu erro, por favor, entre em contato comigo por meio dos meus detalhes de perfil e eu farei as alteraçÃĩes necessÃĄrias.
â Ãnfase dos autores, nÃĢo minha.
Publicado pela primeira vez na quarta-feira, 26 de novembro de 2025. Alterado à s 17h35 para formataçÃĢo.












