KÄ t Andersona
Kod Ludzki z 2020 roku pokonaÅ agentÃģw kodowanych wibacyjnie w testach agenckich

NarzÄdzia do kodowania wibacyjnego, takie jak ChatGPT, zostaÅy poddane testom w prawie 40 000 meczach â i przegraÅy z kodem napisanym przez studentÃģw przed wynalezieniem duÅžych modeli jÄzykowych.
Â
W nowym badaniu przeprowadzonym w Wielkiej Brytanii, badacze skonfrontowali agentÃģw kodowanych przez ludzi z agentami kodowanymi wibacyjnie, opracowanymi przy uÅžyciu najnowszych duÅžych modeli jÄzykowych (LLM), takich jak ChatGPT-5 i Claude, i stwierdzili, Åže agenci stworzeni bez pomocy AI Åatwo pokonali wersje uÅatwione przez AI.
Oba zestawy agentÃģw zostaÅy stworzone przez rÃģÅžne pokolenia studentÃģw z Laboratorium Sztucznej Inteligencji na Federalnej Szwajcarskiej Uczelni Technicznej w Lozannie. Agenci niezaleÅžni od AI zostaÅy opracowane w ramach kursu w 2020 roku, dwa lata przed powstaniem ChatGPT i rozpoczÄciem rewolucji LLM, podczas gdy nowi agenci zostali stworzeni przez obecnych studentÃģw, wspomaganych przez najnowsze i najlepsze LLM dostÄpne.
Nawet przy sfaÅszowanym meczu, rozwiÄ zania kodowane wibacyjnie nie mogÅy wygraÄ, a piÄÄ pierwszych miejsc byÅo stale zajmowanych przez âsuroweâ agenty, a wiÄkszoÅÄ agentÃģw LLM (33 z 40) zostaÅa Åatwo pokonana przez âbardzo prosteâ agenty bazowe, w 38 304 meczach w turnieju, na szerokim zakresie zmiennych i okolicznoÅci.
W artykule stwierdza siÄ:
âNasza praca pokazuje, Åže chociaÅž najnowsze LLM mogÄ generowaÄ kod, ktÃģry dziaÅa (tj. wolny od bÅÄdÃģw skÅadni), wygenerowany rozwiÄ zanie nie jest konkurencyjne wobec rozwiÄ zaÅ zaprojektowanych przez ludzi w wymiarach takich jak planowanie strategiczne, optymalizacja lub wspÃģÅzawodnictwo wielu agentÃģw.
âDlatego ta praca przybliÅža nowÄ granicÄ w generowaniu kodu i ma na celu uÅatwienie rozwoju benchmarkÃģw, zbiorÃģw danych i otwartych baz, ktÃģre podkreÅlajÄ syntezÄ kodu napÄdzanÄ rozumowaniem.â
Zaplanowany wyzwanie polegaÅo na kreatywnym udziale w aukcjach, w rÃģÅžnych strategiach, oraz na zorganizowaniu logistyki dostarczania wygranych przedmiotÃģw do zwyciÄzcÃģw.
Autorzy zauwaÅžajÄ , Åže wiele zalet zostaÅo przyznanych LLM, takich jak ingerowanie w ich kod w celu poprawy ich wynikÃģw â co nie byÅo dozwolone dla kodu z 2020 roku. Mimo to, nawet gdy dostarczono poprawiony kod, ktÃģry zdecydowanie poprawiÅby ich wyniki, LLM nie byÅy w stanie go wykorzystaÄ:
â[W] naszym teÅcie, nawet gdy eksponujemy dobre rozwiÄ zanie w kontekÅcie, LLM nadal nie jest w stanie je wykorzystaÄ.
âTo wynik rÃģwnieÅž podnosi interesujÄ ce pytania dotyczÄ ce granic uczenia siÄ w kontekÅcie i rozwiÄ zywania problemÃģw z uzupeÅnieniem w zÅoÅžonych scenariuszach.â
LLM uÅžyte w teÅcie to GPT-5 Thinking, Gemini 2.5 Pro, Claude Opus 4.1 oraz DeepSeek R1*.
Nowy artykuÅ pt. Czy kodowanie wibacyjne moÅže pokonaÄ studentÃģw studiÃģw magisterskich? Turniej LLM vs. kodowanie ludzkie w strategicznym planowaniu rynkowym, pochodzi od jednego autora z Uniwersytetu w Southampton i innego z Uniwersytetu w Oksfordzie i Instytutu Alana Turinga. Benchmark, jak stwierdzajÄ autorzy, zostanie opublikowany wkrÃģtce.
Metoda
Autorzy zauwaÅžajÄ , Åže tradycyjne testy w tej dziedzinie koncentrujÄ siÄ na wyzwaniach z wyraÅšnie zdefiniowanymi binarnymi rozwiÄ zaniami (poprawne lub niepoprawne), zweryfikowanymi za pomocÄ testÃģw jednostkowych. TwierdzÄ c, Åže nie jest to idealny sposÃģb na zbadanie ograniczeÅ kodowania LLM, autorzy opracowali bardziej zÅoÅžony scenariusz wyzwania, z wieloma wewnÄtrznymi benchmarkami i kamieniami milowymi, w ktÃģrym zwyciÄstwo jest moÅžliwe, ale dalekie od prostej:âĶ












