Ângulo de Anderson

CÃģdigo Humano de 2020 Supera Agentes Codificados por VibraçÃĢo em Testes de AgÊncia

mm
Adicione Unite.AI às suas fontes preferidas no Google
AI-generated image: a Victorian coach and horses winning formula 1 against modern race car competitors. gpt-image-1.

O ChatGPT e outras ferramentas de codificaçÃĢo por vibraçÃĢo foram testados em quase 40.000 partidas – e perderam para o cÃģdigo escrito por um estudante de pÃģs-graduaçÃĢo antes da invençÃĢo dos Grandes Modelos de Linguagem.

 

Em um novo estudo do Reino Unido, os pesquisadores colocaram agentes codificados por humanos contra agentes codificados por vibraçÃĢo desenvolvidos com os Últimos Grandes Modelos de Linguagem (LLMs), como ChatGPT-5 e Claude, e descobriram que os agentes criados sem a ajuda da IA superaram facilmente as versÃĩes facilitadas pela IA.

Os dois conjuntos de agentes foram criados por diferentes geraçÃĩes de estudantes do LaboratÃģrio de InteligÊncia Artificial do Instituto Federal de Tecnologia da Suíça. Os agentes nÃĢo IA foram desenvolvidos como parte de um curso em 2020, dois anos antes do início do ChatGPT e do início da revoluçÃĢo dos LLMs, enquanto os novos agentes foram criados por estudantes atuais, auxiliados pelos LLMs mais recentes e melhores disponíveis.

Even com um jogo manipulado, as soluçÃĩes codificadas por vibraçÃĢo nÃĢo puderam vencer, e os cinco primeiros lugares foram consistentemente ocupados por ‘agentes brutos’, com a maioria dos agentes LLM (33 de 40) sendo facilmente derrotados por ‘agentes bÃĄsicos muito simples’, em 38.304 desafios em um torneio, em uma ampla variedade de variÃĄveis e circunstÃĒncias.

O artigo afirma:

‘Nosso trabalho demonstra que, embora os LLMs de ponta possam gerar cÃģdigo que execute (ou seja, livre de erros de sintaxe), a soluçÃĢo gerada nÃĢo ÃĐ competitiva com as soluçÃĩes projetadas por humanos em dimensÃĩes como planejamento estratÃĐgico, otimizaçÃĢo ou competiçÃĢo multiagente.

‘Portanto, este trabalho traz à tona esta nova fronteira na geraçÃĢo de cÃģdigo e visa facilitar o desenvolvimento de benchmarks, conjuntos de dados e linhas de base de cÃģdigo aberto que enfatizam a síntese de cÃģdigo impulsionada por raciocínio.’

O desafio projetado foi para participar criativamente de leilÃĩes, em uma variedade de estratÃĐgias, e organizar a logística de entrega de itens vencidos para os vencedores.

Os autores observam que vÃĄrios vantagens foram dadas aos LLMs, como intervenir em seu cÃģdigo para melhorar seu desempenho – um benefício nÃĢo permitido ao cÃģdigo de 2020; No entanto, mesmo quando fornecido com cÃģdigo corretivo que definitivamente melhoraria seus resultados, os LLMs nÃĢo puderam aceitÃĄ-lo ou usÃĄ-lo:

‘[Em] nosso benchmark, mesmo quando expomos uma boa soluçÃĢo no contexto, o LLM ainda nÃĢo consegue utilizÃĄ-la.

‘Este resultado tambÃĐm levanta questÃĩes de pesquisa interessantes sobre os limites do aprendizado no contexto e da resoluçÃĢo de problemas aumentada em cenÃĄrios complexos.’

Os LLMs usados no teste foram GPT-5 Thinking, Gemini 2.5 Pro, Claude Opus 4.1, e DeepSeek R1*.

O novo artigo ÃĐ intitulado Os CÃģdigos de VibraçÃĢo Podem Superar os Estudantes de PÃģs-GraduaçÃĢo em CiÊncia da ComputaçÃĢo? Um Torneio de LLM vs. CÃģdigo Humano em Planejamento EstratÃĐgico Orientado por Mercado, e vem de um autor da Universidade de Southampton e outro da Universidade de Oxford e do Instituto Alan Turing. O benchmark, os autores afirmam, serÃĄ lançado em breve.

MÃĐtodo

Os autores observam que os testes tradicionais nessa esfera se concentram em desafios com soluçÃĩes binÃĄrias claramente definidas (correto ou incorreto), verificados por meio de testes unitÃĄrios. Alegando que isso nÃĢo ÃĐ o ideal para explorar as limitaçÃĩes do cÃģdigo auxiliado por LLM, os autores projetaram um cenÃĄrio de desafio mais complexo, com mÚltiplos benchmarks internos e marcos, no qual a vitÃģria ÃĐ possível, mas longe de simples:

ComparaçÃĢo de abordagens baseadas em testes unitÃĄrios padrÃĢo (acima) e o cenÃĄrio de desafio mais aberto projetado pelos autores (em azul, abaixo). Fonte [ https://arxiv.org/pdf/2511.20613 ]

ComparaçÃĢo de abordagens baseadas em testes unitÃĄrios padrÃĢo (acima) e o cenÃĄrio de desafio mais aberto projetado pelos autores (em azul, abaixo). Fonte

O Problema de LeilÃĢo, Coleta e Entrega (APDP) usado para o estudo dos autores foi parcialmente auto-selecionado, devido à disponibilidade de um corpus de trabalho de estudantes de 2020 da universidade suíça; trabalho que buscava criar agentes automatizados para a tarefa APDP, antes de qualquer capacidade de fortalecer o desenvolvimento por meio da IA. Portanto, foi relativamente fÃĄcil atribuir a tarefa moderna aos estudantes com o mesmo briefing, mas disponibilizar-lhes as ferramentas atuais.

Os autores buscaram evitar quadros de teste populares, como HumanEval, BigCodeBench e WebDev Arena (entre muitos outros), pois essa classe de procedimentos de teste tende a sofrer de contaminaçÃĢo de dados (ou seja, instÃĒncias em que o sistema pode ter treinado em dados de teste em vez de respeitar uma divisÃĢo).

O APDP ÃĐ um problema logístico de duas etapas baseado em leilÃĩes reversos e rota de veículo. Na primeira etapa, os agentes competem para ganhar tarefas de entrega, submetendo lances para quanto devem ser pagos para completar cada uma delas. Lances muito altos significam perder a tarefa; lances muito baixos podem significar perder dinheiro.

Na segunda etapa, cada agente deve criar um plano eficiente para cumprir apenas as tarefas que ganharam, atribuindo-as a veículos com diferentes capacidades e custos, sob restriçÃĩes de tempo e recursos:

No APDP, as empresas licitam em leilÃĩes reversos para tarefas de entrega, entÃĢo otimizam as rotas de veículo para cumprir apenas as tarefas que ganharam, visando maximizar o lucro.

No APDP, as empresas licitam em leilÃĩes reversos para tarefas de entrega, entÃĢo otimizam as rotas de veículo para cumprir apenas as tarefas que ganharam, visando maximizar o lucro.

O objetivo nÃĢo ÃĐ simplesmente concluir as tarefas, mas maximizar o lucro geral, antecipando quais conjuntos de tarefas funcionarÃĢo melhor juntos e prevendo as estratÃĐgias dos concorrentes que estÃĢo tentando fazer o mesmo.

O benchmark APDP aumenta a dificuldade das tarefas de geraçÃĢo de cÃģdigo, introduzindo planejamento estratÃĐgico em uma sequÊncia de leilÃĩes interdependentes, com cada lance redefinindo o cenÃĄrio de escolhas futuras; e, portanto, exige que os agentes raciocinem nÃĢo apenas sobre custos imediatos, mas sobre posicionamento, tempo e consequÊncias de longo prazo.

O problema de entrega central ÃĐ NP-difícil, ou seja, nenhum algoritmo pode encontrar a melhor soluçÃĢo em tempo razoÃĄvel à medida que o nÚmero de tarefas cresce. Isso torna a força bruta uma abordagem inviÃĄvel e força os agentes a trocar precisÃĢo por velocidade.

A Corrida EstÃĄ On

A avaliaçÃĢo dos autores comparou 40 agentes codificados por LLM contra 17 agentes codificados por humanos em uma sÃĐrie de torneios de confronto direto. Cada um dos 12 torneios usou uma combinaçÃĢo diferente de quatro topologias de rede de estrada e consistiu em todos contra todos emparelhamentos, com os agentes enfrentando cada oponente duas vezes: uma vez controlando cada uma das duas empresas, com especificaçÃĩes de veículo diferentes.

Esse cenÃĄrio produziu 3.192 partidas por torneio, totalizando 38.304 partidas. Em cada partida, 50 tarefas de entrega foram leiloadas, definidas por seus pontos de coleta e entrega e peso, e sorteada aleatoriamente em layouts de estrada modelados na Suíça, França, GrÃĢ-Bretanha e Países Baixos:

Redes de estrada simplificadas usadas no torneio: GrÃĢ-Bretanha (topo esquerdo), Suíça (topo direito), Países Baixos (fundo esquerdo) e França (fundo direito). Quadrados azuis e vermelhos marcam tarefas de coleta e entrega. TriÃĒngulos coloridos mostram as posiçÃĩes atuais dos veículos dos agentes.

Redes de estrada simplificadas usadas no torneio: GrÃĢ-Bretanha (topo esquerdo), Suíça (topo direito), Países Baixos (fundo esquerdo) e França (fundo direito). Quadrados azuis e vermelhos marcam tarefas de coleta e entrega. TriÃĒngulos coloridos mostram as posiçÃĩes atuais dos veículos dos agentes.

Os agentes estudantis foram retirados de um torneio de curso de 2020. Oito vieram dos principais desempenhos em uma final de eliminaçÃĢo Única e quatro mais foram escolhidos por um desempenho forte contra os agentes de baseline em partidas de confronto direto.

Os agentes de baseline seguiram heurísticas. Naive calculou a distÃĒncia total e licitou de acordo, usando apenas um veículo e ignorando o lote; ExpCostFixedBid simulou 10 tarefas aleatÃģrias e licitou o custo marginal mÃĐdio; Honest computou o custo marginal real de inserir a tarefa no cronograma; ModelOpponent fez o mesmo, mas adicionou uma estimativa do custo do oponente, licitando o mÃĄximo; e RiskSeeking combinou um prior decrescente com base no tempo com uma estimativa de custo ao vivo e modelagem do oponente – novamente licitando o mais alto dos dois.

A avaliaçÃĢo incluiu 40 agentes codificados por LLM construídos usando o (mencionado anteriormente) GPT-5 Thinking, Claude Opus 4.1, Gemini 2.5 Pro e DeepSeek R1. Cada modelo foi solicitado com cinco estratÃĐgias distintas, aplicadas duas vezes por modelo.

Duas estratÃĐgias usaram prompts estÃĄticos escritos por diferentes autores, enquanto uma terceira pediu ao modelo que se auto-refletisse e revisasse sua prÃģpria saída; outra envolveu crítica e revisÃĢo por um LLM separado. A estratÃĐgia final usou o GPT-4 para sintetizar um novo prompt revisando as quatro abordagens anteriores.

O prompt base refletia a tarefa original do estudante, descrevendo o ambiente de entrega e instruindo o modelo a licitar e planejar para maximizar o lucro, sem confiar em mÃĐtodos de alta complexidade.

Todos os agentes LLM foram testados em ambientes de autojogo e torneio atÃĐ que todos os bugs observÃĄveis fossem corrigidos. A correçÃĢo de bugs foi tratada autonomamente pelos LLMs, solicitados com as informaçÃĩes de erro.

Falhas comuns de LLM, o artigo observa, incluíam violaçÃĩes de limites de tempo, falha em coletar ou entregar tarefas atribuídas e violaçÃĩes de restriçÃĩes de capacidade de veículo – erros que frequentemente surgiam do descumprimento de instruçÃĩes explícitas ou de lÃģgica de replanejamento defeituosa†:

‘Outro problema comum que encontramos (principalmente com Gemini, Claude e DeepSeek, e nÃĢo tanto com GPT) ÃĐ que, quite frequentemente, o LLM consistentemente falhava em resolver um bug.

‘Por exemplo, um agente consistentemente expirava, apesar de mÚltiplos (por exemplo, 5 – 15) ciclos de solicitaçÃĢo do LLM com o erro e recebendo a versÃĢo atualizada do cÃģdigo.

‘A Única soluçÃĢo que encontramos para tais situaçÃĩes (em que o LLM repetidamente falha em resolver o mesmo bug) ÃĐ reiniciar do zero. No geral, observamos a necessidade de esforço manual significativo para alcançar o cÃģdigo livre de bugs. Tivemos que gerar substancialmente mais agentes para obter os 40 agentes livres de bugs que avaliamos.’

Os resultados mostrados abaixo resumem os resultados de 12 torneios de rodada dupla, abrangendo quatro topologias de rede e trÊs torneios por topologia, produzindo quase 40.000 partidas:

Agente Avg #VitÃģrias / Torneio SD #VitÃģrias / Torneio Avg #Derrotas / Torneio SD #Derrotas / Torneio VitÃģrias Totais Derrotas Totais Taxa de VitÃģria
Estudante 1 108.167 1.193 3.833 1.193 1298 46 0.9658
Estudante 2 104.917 2.539 7.083 2.539 1259 85 0.9368
Estudante 3 103.917 2.466 8.083 2.466 1247 97 0.9278
Estudante 4 103.25 1.815 8.75 1.815 1239 105 0.9219
Estudante 5 96.5 2.908 15.5 2.908 1158 186 0.8616
LLM(O, IR, 1) 95.417 2.314 16.583 2.314 1145 199 0.8519
LLM(O, A2, 1) 94.583 2.314 17.417 2.314 1135 209 0.8445
Estudante 6 93.167 1.899 18.833 1.899 1118 226 0.8318
Estudante 7 93.167 3.563 18.833 3.563 1118 226 0.8318
LLM(O, A1, 1) 86.083 3.029 25.917 3.029 1033 311 0.7686
LLM(O, GEN, 2) 84.083 6.947 27.917 6.947 1009 335 0.7507
LLM(O, CR, 2) 83.5 4.442 28.5 4.442 1002 342 0.7455
Estudante 8 83.417 4.122 28.583 4.122 1001 343 0.7448
RiskSeeking 82.417 3.343 29.583 3.343 989 355 0.7359
LLM(O, GEN, 1) 80.667 4.355 31.25 4.372 968 375 0.7208
ModelOpponent 80.583 3.26 31.417 3.26 967 377 0.7195
LLM(D, A1, 1) 79.417 3.965 32.583 3.965 953 391 0.7091
ExpCostFixedBid 77.167 4.951 34.833 4.951 926 418 0.689
LLM(O, IR, 2) 73.917 3.502 38 3.618 887 456 0.6605
LLM(O, A1, 2) 72.417 2.193 39.583 2.193 869 475 0.6466
LLM(G, A1, 2) 68.5 3.555 43.5 3.555 822 522 0.6116
LLM(A, GEN, 2) 67.917 2.968 44.083 2.968 815 529 0.6064
LLM(G, IR, 2) 65.917 2.314 46.083 2.314 791 553 0.5885
Estudante 9 64.167 11.044 47.833 11.044 770 574 0.5729
LLM(G, A1, 1) 64 4.243 47.917 4.316 768 575 0.5719
LLM(G, IR, 1) 60.333 3.725 51.667 3.725 724 620 0.5387
LLM(O, A2, 2) 59.333 4.499 52.667 4.499 712 632 0.5298
LLM(D, CR, 1) 55.083 6.694 56.833 6.59 661 682 0.4922
LLM(G, GEN, 2) 53.167 3.664 58.833 3.664 638 706 0.4747
LLM(D, GEN, 2) 52.083 9.06 59.917 9.06 625 719 0.465
Honest 50.583 3.848 61.417 3.848 607 737 0.4516
Estudante 10 48.833 2.98 63.167 2.98 586 758 0.436
LLM(D, IR, 1) 48.583 10.211 63.417 10.211 583 761 0.4338
LLM(A, A1, 1) 48 4.69 64 4.69 576 768 0.4286
LLM(G, A2, 1) 47.25 3.864 64.75 3.864 567 777 0.4219
LLM(A, CR, 1) 43.833 4.609 68.167 4.609 526 818 0.3914
LLM(A, A1, 2) 43.75 2.05 68.25 2.05 525 819 0.3906
Estudante 11 42.083 5.664 69.917 5.664 505 839 0.3757
LLM(A, IR, 1) 39.5 2.541 72.5 2.541 474 870 0.3527
Naive 36.75 1.712 75.25 1.712 441 903 0.3281
Estudante 12 36.333 1.775 75.667 1.775 436 908 0.3244
LLM(D, A2, 1) 33.917 2.193 78.083 2.193 407 937 0.3028
LLM(A, GEN, 1) 30.167 1.749 81.833 1.749 362 982 0.2693
LLM(D, A2, 2) 29.833 2.038 82.167 2.038 358 986 0.2664
LLM(G, A2, 2) 27 2.256 85 2.256 324 1020 0.2411
LLM(A, A2, 1) 26.333 0.985 85.667 0.985 316 1028 0.2351
LLM(O, CR, 1) 25 3.411 87 3.411 300 1044 0.2232
LLM(A, IR, 2) 24.333 8.542 87.667 8.542 292 1052 0.2173
LLM(A, A2, 2) 24 1.809 88 1.809 288 1056 0.2143
LLM(A, CR, 2) 23.333 1.557 88.667 1.557 280 1064 0.2083
LLM(D, GEN, 1) 22.5 1.784 89.5 1.784 270 1074 0.2009
LLM(D, A1, 2) 13.333 1.826 98.667 1.826 160 1184 0.119
LLM(G, CR, 1) 9.5 1.087 102.5 1.087 114 1230 0.0848
LLM(G, GEN, 1) 9.167 0.937 102.833 0.937 110 1234 0.0818
LLM(D, IR, 2) 7.75 0.622 104.25 0.622 93 1251 0.0692
LLM(G, CR, 2) 7.25 1.422 104.75 1.422 87 1257 0.0647
LLM(D, CR, 2) 5.667 0.985 106.333 0.985 68 1276 0.0506

Para contexto, cada agente jogou 112 partidas por torneio, entÃĢo a mÃĐdia mÃĄxima possível para vitÃģrias ou derrotas por agente ÃĐ 112. Desvio padrÃĢo (SD) reflete variabilidade entre torneios. Agentes codificados por humanos aparecem em negrito. Agentes codificados por LLM sÃĢo rotulados por modelo (O = GPT-5 Thinking, G = Gemini 2.5 Pro, A = Claude Opus 4.1, D = DeepSeek R1), seguido por um cÃģdigo de estratÃĐgia de dois letras e um dígito indicando se o agente ÃĐ o primeiro ou segundo gerado com esse prompt. Fonte

Em relaçÃĢo aos resultados mostrados acima, os autores afirmam†:

‘LLMs nÃĢo geraram cÃģdigo esperado/competitivo, mesmo em variantes mais simples do problema APDP (apesar do cÃģdigo ser largamente livre de bugs de sintaxe). Isso destaca a importÃĒncia de benchmarks de avaliaçÃĢo de cÃģdigo impulsionados por raciocínio que vÃĢo alÃĐm do auto-completar e identificam novas fraquezas dos LLMs.’

‘Nossos resultados demonstram uma clara superioridade dos agentes codificados por humanos: (i) Os cinco primeiros lugares sÃĢo consistentemente ocupados por agentes estudantis, e (ii) a maioria dos agentes LLM (33 de 40) ÃĐ derrotada por agentes bÃĄsicos muito simples (como o licitante de custo fixo esperado).

‘Importante notar que nÃĢo depuramos o cÃģdigo do estudante (enquanto depuramos/testamos o cÃģdigo LLM, tanto em autojogo quanto em torneio [configuraçÃĩes]). Todas as vezes que um agente estudantil travou, automaticamente demos a vitÃģria ao LLM. Um grande nÚmero desses travamentos seria fÃĄcil de consertar (por exemplo, agentes expiraram), entÃĢo os agentes estudantis poderiam potencialmente classificar ainda mais alto.’

Como um experimento adicional, o GPT-5 Thinking foi solicitado a melhorar o cÃģdigo do agente de desempenho superior, Estudante 1; mas o agente agora modificado pelo LLM subsequentemente caiu para o dÃĐcimo lugar, agora o pior de todos os escores humanos. Em vez de melhorar a soluçÃĢo, as alteraçÃĩes do LLM a degradaram em quase 20%.

Os autores concluem:

‘[Nossos] resultados destacam limitaçÃĩes importantes da geraçÃĢo de cÃģdigo LLM, mais notavelmente suas capacidades limitadas de raciocínio e planejamento ao gerar [cÃģdigo]. LLMs modernos podem fornecer cÃģdigo livre de bugs de sintaxe que executa, mas isso nÃĢo ÃĐ o benchmark que devemos usar para medir o progresso em direçÃĢo à IA geral avançada.’

ConclusÃĢo

Os autores observam que a codificaçÃĢo por vibraçÃĢo permitiu que pessoas de todos os níveis tÃĐcnicos criassem cÃģdigos, e caracterizam a prÃĄtica de forma positiva, como uma força niveladora. No entanto, tambÃĐm implicam que, porque a codificaçÃĢo por vibraçÃĢo chegou recentemente, seus limites nÃĢo sÃĢo conhecidos e podem ser considerados realistas.

Eles concluem seu artigo chamando para uma mudança de objetivo ‘de cÃģdigo que compila para cÃģdigo que compete’.

Uma pergunta que o leitor casual deste artigo interessante pode ter ÃĐ se os autores estÃĢo lutando acima ou abaixo, pois a tarefa agente em questÃĢo ÃĐ consideravelmente mais complexa e envolvida do que criar scripts do PowerShell e outras formas de funcionalidade e reparos menores para os quais a codificaçÃĢo por vibraçÃĢo ÃĐ bem adequada.

 

* Por favor, note que o artigo se refere continuamente a ‘DeepThink R1â€ē, que parece ser inexistente, surgindo apenas um punhado de referÊncias na internet (presumivelmente de outros autores que escreveram incorretamente ‘DeepSeek R1)’. Se este for meu erro, por favor, entre em contato comigo por meio dos meus detalhes de perfil e eu farei as alteraçÃĩes necessÃĄrias.

† Ênfase dos autores, nÃĢo minha.

Publicado pela primeira vez na quarta-feira, 26 de novembro de 2025. Alterado às 17h35 para formataçÃĢo.

Escritor sobre aprendizado de mÃĄquina, especialista em síntese de imagem humana. Anteriormente, chefe de conteÚdo de pesquisa da Metaphysic.ai, atÃĐ sua dissoluçÃĢo na Brahma.ai da DNEG.
Portfolio site: martinanderson.ai
Contato: [email protected]