Погляд Anderson
Людський код 2020 року переміг агентів, створених за допомогою Vibe-Coding, у тестах агентських можливостей

Інструменти Vibe-Coding, такі як ChatGPT, були протестовані у майже 40 000 матчах – і програли коду, написаному аспірантами до появи великих мовних моделей.
У новому дослідженні британські дослідники протиставили агентів, створених людьми, агентам, створеним за допомогою Vibe-Coding, розробленим за допомогою останніх великих мовних моделей (LLM), таких як ChatGPT-5 і Claude, і виявили, що агенти, створені без допомоги штучного інтелекту, легко перемогли версії, створені за допомогою штучного інтелекту.
Обидва набори агентів були створені різними поколіннями студентів з лабораторії штучного інтелекту Швейцарського федерального технологічного інституту в Лозанні. Нештучні агенти були розроблені як частина курсової роботи в 2020 році, за два роки до появи ChatGPT і початку революції LLM, тоді як нові агенти були створені поточними студентами, які використовували останні і найкращі LLM, доступні на той час.
Навіть з фальшивою грою, рішення, створені за допомогою Vibe-Coding, не могли перемогти, і перші п’ять місць займали “чисті” агенти, а більшість агентів LLM (33 з 40) легко перемагали “дуже прості” базові агенти в 38 304 матчах турніру, у широкому спектрі змінних і обставин.
У роботі зазначено:
‘Наша робота демонструє, що хоча сучасні LLM можуть генерувати код, який виконується (тобто, без синтаксичних помилок), створене рішення не є конкурентоспроможним для людських рішень з точки зору стратегічного планування, оптимізації або багатокритеріальної конкуренції.
‘Таким чином, ця робота підкреслює новий напрямок у генерації коду, і має на меті сприяти розвитку бенчмарків, наборів даних і відкритих базових рішень, які підкреслюють синтез коду, керований розумінням.’
Виклик, який був розроблений, полягав у тому, щоб творчо брати участь в аукціонах, у різних стратегіях, і організовувати логістику доставки виграних товарів переможцям.
Автори зазначають, що кілька переваг були надані LLM, таких як втручання в їхній код для покращення їхньої продуктивності – перевага, яка не була дозволена коду 2020 року. Незважаючи на це, навіть коли їм була надана виправлена версія коду, яка б безумовно покращила їхні результати, LLM не могли її прийняти або використовувати:
‘[У] нашому бенчмарку навіть коли ми надаємо хороше рішення в контексті, LLM все одно не може його використовувати.
‘Цей результат також піднімає цікаві майбутні дослідження про обмеження контекстного навчання і розв’язання проблем, посиленого пошуком, у складних сценаріях.’
LLM, які були використані у тесті, були GPT-5 Thinking, Gemini 2.5 Pro, Claude Opus 4.1, І DeepSeek R1*.
Нова робота стаття називається Чи може Vibe-Coding перемогти агентів, створених аспірантами? Турнір LLM проти людських агентів у стратегічному плануванні ринку, і надходить від одного автора з Університету Саутгемптона, і іншого з Університету Оксфорда і Інституту Алана Тюрінга. Бенчмарк, зазначають автори, буде опублікований скоро.
Метод
Автори зазначають, що традиційні тести в цій сфері зосереджені на викликах з чітко визначеними бінарними рішеннями (правильно або не правильно), перевірених за допомогою юніт-тестів. Стверджуючи, що це не ідеальний спосіб вивчення обмежень коду LLM, автори замість цього розробили більш складний сценарій виклику, з多 внутрішніми бенчмарками і етапами, у яких перемога є можливою, але далеко не простою:… (переклад продовжується)












