Погляд Anderson

Людський код 2020 року переміг агентів, створених за допомогою Vibe-Coding, у тестах агентських можливостей

mm
Додайте Unite.AI до бажаних джерел у Google
AI-generated image: a Victorian coach and horses winning formula 1 against modern race car competitors. gpt-image-1.

Інструменти Vibe-Coding, такі як ChatGPT, були протестовані у майже 40 000 матчах – і програли коду, написаному аспірантами до появи великих мовних моделей.

 

У новому дослідженні британські дослідники протиставили агентів, створених людьми, агентам, створеним за допомогою Vibe-Coding, розробленим за допомогою останніх великих мовних моделей (LLM), таких як ChatGPT-5 і Claude, і виявили, що агенти, створені без допомоги штучного інтелекту, легко перемогли версії, створені за допомогою штучного інтелекту.

Обидва набори агентів були створені різними поколіннями студентів з лабораторії штучного інтелекту Швейцарського федерального технологічного інституту в Лозанні. Нештучні агенти були розроблені як частина курсової роботи в 2020 році, за два роки до появи ChatGPT і початку революції LLM, тоді як нові агенти були створені поточними студентами, які використовували останні і найкращі LLM, доступні на той час.

Навіть з фальшивою грою, рішення, створені за допомогою Vibe-Coding, не могли перемогти, і перші п’ять місць займали “чисті” агенти, а більшість агентів LLM (33 з 40) легко перемагали “дуже прості” базові агенти в 38 304 матчах турніру, у широкому спектрі змінних і обставин.

У роботі зазначено:

‘Наша робота демонструє, що хоча сучасні LLM можуть генерувати код, який виконується (тобто, без синтаксичних помилок), створене рішення не є конкурентоспроможним для людських рішень з точки зору стратегічного планування, оптимізації або багатокритеріальної конкуренції.

‘Таким чином, ця робота підкреслює новий напрямок у генерації коду, і має на меті сприяти розвитку бенчмарків, наборів даних і відкритих базових рішень, які підкреслюють синтез коду, керований розумінням.’

Виклик, який був розроблений, полягав у тому, щоб творчо брати участь в аукціонах, у різних стратегіях, і організовувати логістику доставки виграних товарів переможцям.

Автори зазначають, що кілька переваг були надані LLM, таких як втручання в їхній код для покращення їхньої продуктивності – перевага, яка не була дозволена коду 2020 року. Незважаючи на це, навіть коли їм була надана виправлена версія коду, яка б безумовно покращила їхні результати, LLM не могли її прийняти або використовувати:

‘[У] нашому бенчмарку навіть коли ми надаємо хороше рішення в контексті, LLM все одно не може його використовувати.

‘Цей результат також піднімає цікаві майбутні дослідження про обмеження контекстного навчання і розв’язання проблем, посиленого пошуком, у складних сценаріях.’

LLM, які були використані у тесті, були GPT-5 Thinking, Gemini 2.5 Pro, Claude Opus 4.1, І DeepSeek R1*.

Нова робота стаття називається Чи може Vibe-Coding перемогти агентів, створених аспірантами? Турнір LLM проти людських агентів у стратегічному плануванні ринку, і надходить від одного автора з Університету Саутгемптона, і іншого з Університету Оксфорда і Інституту Алана Тюрінга. Бенчмарк, зазначають автори, буде опублікований скоро.

Метод

Автори зазначають, що традиційні тести в цій сфері зосереджені на викликах з чітко визначеними бінарними рішеннями (правильно або не правильно), перевірених за допомогою юніт-тестів. Стверджуючи, що це не ідеальний спосіб вивчення обмежень коду LLM, автори замість цього розробили більш складний сценарій виклику, з多 внутрішніми бенчмарками і етапами, у яких перемога є можливою, але далеко не простою:… (переклад продовжується)

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai