Kąt Andersona

Kod Ludzki z 2020 roku pokonał agentÃģw kodowanych wibacyjnie w testach agenckich

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google
AI-generated image: a Victorian coach and horses winning formula 1 against modern race car competitors. gpt-image-1.

Narzędzia do kodowania wibacyjnego, takie jak ChatGPT, zostały poddane testom w prawie 40 000 meczach – i przegrały z kodem napisanym przez studentÃģw przed wynalezieniem duÅžych modeli językowych.

 

W nowym badaniu przeprowadzonym w Wielkiej Brytanii, badacze skonfrontowali agentÃģw kodowanych przez ludzi z agentami kodowanymi wibacyjnie, opracowanymi przy uÅžyciu najnowszych duÅžych modeli językowych (LLM), takich jak ChatGPT-5 i Claude, i stwierdzili, Åže agenci stworzeni bez pomocy AI łatwo pokonali wersje ułatwione przez AI.

Oba zestawy agentÃģw zostały stworzone przez rÃģÅžne pokolenia studentÃģw z Laboratorium Sztucznej Inteligencji na Federalnej Szwajcarskiej Uczelni Technicznej w Lozannie. Agenci niezaleÅžni od AI zostały opracowane w ramach kursu w 2020 roku, dwa lata przed powstaniem ChatGPT i rozpoczęciem rewolucji LLM, podczas gdy nowi agenci zostali stworzeni przez obecnych studentÃģw, wspomaganych przez najnowsze i najlepsze LLM dostępne.

Nawet przy sfałszowanym meczu, rozwiązania kodowane wibacyjnie nie mogły wygrać, a pięć pierwszych miejsc było stale zajmowanych przez “surowe” agenty, a większość agentÃģw LLM (33 z 40) została łatwo pokonana przez “bardzo proste” agenty bazowe, w 38 304 meczach w turnieju, na szerokim zakresie zmiennych i okoliczności.

W artykule stwierdza się:

‘Nasza praca pokazuje, Åže chociaÅž najnowsze LLM mogą generować kod, ktÃģry działa (tj. wolny od błędÃģw składni), wygenerowany rozwiązanie nie jest konkurencyjne wobec rozwiązań zaprojektowanych przez ludzi w wymiarach takich jak planowanie strategiczne, optymalizacja lub wspÃģłzawodnictwo wielu agentÃģw.

‘Dlatego ta praca przybliÅža nową granicę w generowaniu kodu i ma na celu ułatwienie rozwoju benchmarkÃģw, zbiorÃģw danych i otwartych baz, ktÃģre podkreślają syntezę kodu napędzaną rozumowaniem.’

Zaplanowany wyzwanie polegało na kreatywnym udziale w aukcjach, w rÃģÅžnych strategiach, oraz na zorganizowaniu logistyki dostarczania wygranych przedmiotÃģw do zwycięzcÃģw.

Autorzy zauwaÅžają, Åže wiele zalet zostało przyznanych LLM, takich jak ingerowanie w ich kod w celu poprawy ich wynikÃģw – co nie było dozwolone dla kodu z 2020 roku. Mimo to, nawet gdy dostarczono poprawiony kod, ktÃģry zdecydowanie poprawiłby ich wyniki, LLM nie były w stanie go wykorzystać:

‘[W] naszym teście, nawet gdy eksponujemy dobre rozwiązanie w kontekście, LLM nadal nie jest w stanie je wykorzystać.

‘To wynik rÃģwnieÅž podnosi interesujące pytania dotyczące granic uczenia się w kontekście i rozwiązywania problemÃģw z uzupełnieniem w złoÅžonych scenariuszach.’

LLM uÅžyte w teście to GPT-5 Thinking, Gemini 2.5 Pro, Claude Opus 4.1 oraz DeepSeek R1*.

Nowy artykuł pt. Czy kodowanie wibacyjne moÅže pokonać studentÃģw studiÃģw magisterskich? Turniej LLM vs. kodowanie ludzkie w strategicznym planowaniu rynkowym, pochodzi od jednego autora z Uniwersytetu w Southampton i innego z Uniwersytetu w Oksfordzie i Instytutu Alana Turinga. Benchmark, jak stwierdzają autorzy, zostanie opublikowany wkrÃģtce.

Metoda

Autorzy zauwaÅžają, Åže tradycyjne testy w tej dziedzinie koncentrują się na wyzwaniach z wyraÅšnie zdefiniowanymi binarnymi rozwiązaniami (poprawne lub niepoprawne), zweryfikowanymi za pomocą testÃģw jednostkowych. Twierdząc, Åže nie jest to idealny sposÃģb na zbadanie ograniczeń kodowania LLM, autorzy opracowali bardziej złoÅžony scenariusz wyzwania, z wieloma wewnętrznymi benchmarkami i kamieniami milowymi, w ktÃģrym zwycięstwo jest moÅžliwe, ale dalekie od prostej:â€Ķ

Pisarz na temat uczenia maszynowego, specjalista w dziedzinie syntezy obrazu ludzkiego. Były kierownik treści badawczych w Metaphysic.ai, do czasu jego rozwiązania w DNEG's Brahma.ai.
Strona portfelowo: martinanderson.ai
Kontakt: [email protected]