Anderson का एंगल
2020 से मानव कोड ने वाइब-कोडेड एजेंटों को एजेंटिक परीक्षण में हराया

चैटजीपीटी और अन्य वाइब-कोडिंग टूल्स को लगभग 40,000 मैचों में परीक्षण के लिए रखा गया था – और लार्ज लैंग्वेज मॉडल्स के आविष्कार से पहले लिखे गए ग्रेजुएट छात्र कोड से हार गए।
यूके से एक नए अध्ययन में, शोधकर्ताओं ने मानव-कोडेड एजेंटों को वाइब-कोडेड एजेंटों के खिलाफ पिटा, जो नवीनतम लार्ज लैंग्वेज मॉडल्स (एलएलएम) के साथ विकसित किए गए थे, जैसे कि चैटजीपीटी-5 और क्लाउड, और पाया कि बिना एआई की मदद से बनाए गए एजेंट आसानी से एआई-सहायता प्राप्त संस्करणों को हरा देते हैं।
दोनों सेट के एजेंट स्विस फेडरल टेक्नोलॉजी इंस्टीट्यूट ऑफ लॉज़ेन के आर्टिफिशियल इंटेलिजेंस लेबोरेटरी से अलग-अलग पीढ़ियों के छात्रों द्वारा बनाए गए थे। गैर-एआई एजेंट 2020 में कोर्सवर्क के हिस्से के रूप में विकसित किए गए थे, जो चैटजीपीटी और एलएलएम क्रांति की शुरुआत से दो साल पहले था, जबकि नए एजेंट वर्तमान छात्रों द्वारा बनाए गए थे, जो नवीनतम और सर्वश्रेष्ठ एलएलएम का उपयोग करके सहायता प्राप्त थे।
यहां तक कि जब खेल को तैयार किया गया था, तो वाइब-कोडेड समाधान जीत नहीं सकते थे, और शीर्ष पांच स्थान लगातार ‘कच्चे’ एजेंटों द्वारा आयोजित किए गए थे, जिसमें अधिकांश एलएलएम एजेंट (33 में से 40) को आसानी से ‘बहुत सरल’ बेसलाइन एजेंटों द्वारा हराया गया था, 38,304 चुनौतियों में एक टूर्नामेंट में, विभिन्न चर और परिस्थितियों में।
लेख में कहा गया है:
‘हमारा काम यह दिखाता है कि जबकि राज्य-ऑफ-द-आर्ट एलएलएम सिंटैक्स त्रुटियों से मुक्त कोड उत्पन्न कर सकते हैं, उत्पन्न समाधान रणनीतिक योजना, अनुकूलन, या बहु-एजेंट प्रतिस्पर्धा जैसे आयामों पर मानव-डिज़ाइन किए गए समाधानों के लिए प्रतिस्पर्धी नहीं है।
‘इस प्रकार, यह काम एक नए मोर्चे को आगे बढ़ाता है, और बेंचमार्क, डेटासेट, और ओपन-सोर्स बेसलाइन के विकास को सुविधाजनक बनाने का उद्देश्य रखता है जो तर्क-संचालित कोड सिंथेसिस पर जोर देते हैं। ‘
चुनौती को रचनात्मक रूप से नीलामी में भाग लेने और जीते गए आइटमों को विजेताओं को वितरित करने के लिए लॉजिस्टिक व्यवस्था करने के लिए डिज़ाइन किया गया था।
लेखकों का उल्लेख है कि एलएलएम को कई फायदे दिए गए थे, जैसे कि उनके कोड में हस्तक्षेप करना और उनके प्रदर्शन में सुधार करना – एक लाभ जो 2020 के युग के कोड को नहीं दिया गया था। इसके बावजूद, जब उन्हें सुधार के लिए कोड प्रदान किया गया, तो एलएलएम उन्हें स्वीकार नहीं कर सके या उनका उपयोग नहीं कर सके:
‘[हमारे] बेंचमार्क में, जब हम एक अच्छा समाधान प्रदान करते हैं, तो एलएलएम अभी भी इसका उपयोग करने में असमर्थ है।
‘यह परिणाम भी जटिल परिदृश्यों में संदर्भ-शिक्षा और पुनर्प्राप्ति-संचालित समस्या-समाधान में संदर्भ-शिक्षा की सीमाओं के बारे में रोचक भविष्य के शोध प्रश्न उठाता है। ‘
परीक्षण में उपयोग किए गए एलएलएम जीपीटी-5 थिंकिंग, जेमिनी 2.5 प्रो, क्लाउड ओपस 4.1, और डीपसीक आर1* थे।
नई पेपर यहाँ है, जिसका शीर्षक क्या वाइब कोडिंग ग्रेजुएट सीएस छात्रों को हरा सकती है? एक एलएलएम बनाम मानव कोडिंग टूर्नामेंट बाजार-चालित रणनीतिक योजना पर है, और यह यूनिवर्सिटी ऑफ साउथेम्प्टन और यूनिवर्सिटी ऑफ ऑक्सफोर्ड और एलन ट्यूरिंग इंस्टीट्यूट से एक लेखक द्वारा आया है। बेंचमार्क, लेखकों का कहना है, जल्द ही जारी किया जाएगा।
विधि
लेखकों का उल्लेख है कि पारंपरिक परीक्षण इस क्षेत्र में स्पष्ट रूप से परिभाषित द्विआधारी समाधानों (सही या गलत) पर केंद्रित होते हैं, जो यूनिट परीक्षण के माध्यम से सत्यापित किए जाते हैं। एलएलएम-सहायता प्राप्त कोड की सीमाओं का अन्वेषण करने के लिए यह आदर्श तरीका नहीं होने का दावा करते हुए, लेखकों ने एक अधिक जटिल चुनौती परिदृश्य का आविष्कार किया, जिसमें कई आंतरिक बेंचमार्क और मील के पत्थर हैं, जिसमें जीत संभव है, लेकिन दूर से नहीं है:
[कैप्शन id=”attachment_226365″ align=”alignnone” width=”672″]![मानक, यूनिट-परीक्षण-आधारित दृष्टिकोण (ऊपर), और लेखकों द्वारा आविष्कृत अधिक खुले चुनौती परिदृश्य (नीचे नीले रंग में) की तुलना। स्रोत [ https://arxiv.org/pdf/2511.20613 ]](https://www.unite.ai/wp-content/uploads/2025/11/figure-1-2.jpg)
लेखकों ने लोकप्रिय परीक्षण फ्रेमवर्क जैसे ह्यूमनइवल, बिगकोडबेंच और वेबडेव एरेना (अन्य कई लोगों के बीच) से बचने का प्रयास किया, क्योंकि इस वर्ग के परीक्षण प्रक्रियाओं में अक्सर डेटा दूषण (अर्थात, ऐसे उदाहरण जहां प्रणाली परीक्षण डेटा पर प्रशिक्षित हो सकती है) का सामना करना पड़ता है इसके बजाय एक विभाजन का सम्मान करने के लिए)।
दौड़ शुरू हो गई है
लेखकों का मूल्यांकन 40 एलएलएम-कोडेड एजेंटों की तुलना 17 मानव-कोडेड एजेंटों से एक श्रृंखला में की गई थी। प्रत्येक टूर्नामेंट में चार सड़क नेटवर्क टोपोलॉजी के विभिन्न संयोजनों का उपयोग किया गया था, और इसमें सभी-खेल-सभी जोड़ी शामिल थी, जिसमें एजेंटों ने प्रत्येक विरोधी का सामना दो बार किया था: एक बार दो कंपनियों में से प्रत्येक को नियंत्रित करते हुए, विभिन्न वाहन विशिष्टताओं के साथ।
यह सेटअप प्रति टूर्नामेंट 3,192 मैचों का उत्पादन करता है, कुल 38,304 मैचों के लिए। प्रत्येक मैच में, 50 डिलीवरी कार्य नीलामी के द्वारा निर्धारित किए गए थे, जो उनके पिकअप और ड्रॉप-ऑफ बिंदुओं और वजन द्वारा परिभाषित किए गए थे, और स्विट्जरलैंड, फ्रांस, ग्रेट ब्रिटेन और नीदरलैंड्स पर आधारित सड़क लेआउट में यादृच्छिक रूप से आकर्षित किए गए थे:
[कैप्शन id=”attachment_226367″ align=”alignnone” width=”859″]
छात्र एजेंट 2020 के पाठ्यक्रम टूर्नामेंट से लिए गए थे। आठ एकल-निर्मूलन फाइनल में शीर्ष प्रदर्शन करने वालों से आए थे, और चार और बेसलाइन एजेंटों के खिलाफ हेड-टू-हेड मैचों में मजबूत प्रदर्शन के लिए चुने गए थे।
बेसलाइन एजेंट ने निर्धारित ह्यूरिस्टिक्स का पालन किया। नाव ने कुल दूरी की गणना की और इसके अनुसार बोली लगाई, केवल एक वाहन का उपयोग किया और बैचिंग को अनदेखा किया; एक्सपकोस्टफिक्स्डबिड ने 10 यादृच्छिक कार्यों का अनुकरण किया, और औसत सीमांत लागत की बोली लगाई; होनेस्ट ने वास्तविक सीमांत लागत की गणना की; मॉडलओपोनेंट ने वही किया, लेकिन विरोधी की लागत का एक अनुमान जोड़ा, और अधिकतम बोली लगाई; और रिस्कसीकिंग ने समय-गिरावट वाले प्राथमिक के साथ लाइव लागत अनुमान और विरोधी मॉडलिंग के मिश्रण को मिलाया, फिर से अधिकतम बोली लगाई।
मूल्यांकन में 40 एलएलएम-कोडेड एजेंट शामिल थे जो (उपरोक्त) जीपीटी-5 थिंकिंग, क्लाउड ओपस 4.1, जेमिनी 2.5 प्रो, और डीपसीक आर1 का उपयोग करके बनाए गए थे। प्रत्येक मॉडल को पांच अलग-अलग रणनीतियों के साथ प्रेरित किया गया था, प्रति मॉडल दो बार लागू किया गया था।
दो रणनीतियों ने अलग-अलग लेखकों द्वारा लिखे गए स्थिर प्रोम्प्ट का उपयोग किया, जबकि एक तीसरे ने मॉडल को अपने स्वयं के आउटपुट को संशोधित और संशोधित करने के लिए कहा; एक और ने एक अलग एलएलएम द्वारा आलोचना और संशोधन शामिल किया। अंतिम रणनीति ने जीपीटी-4 का उपयोग सभी चार पिछले दृष्टिकोणों की समीक्षा करने और एक नया प्रोम्प्ट संश्लेषित करने के लिए किया।
बेस प्रोम्प्ट मूल छात्र असाइनमेंट को दर्शाता था, जिसमें डिलीवरी वातावरण का वर्णन किया गया था और मॉडल को लाभ को अधिकतम करने के लिए बोली लगाने और योजना बनाने का निर्देश दिया गया था, उच्च-जटिलता वाली विधियों पर निर्भर किए बिना।
सभी एलएलएम एजेंटों का परीक्षण स्व-खेल और टूर्नामेंट सेटिंग में किया गया था, जब तक कि सभी दिखाई देने वाले बग ठीक नहीं हो जाते। बग-फिक्सिंग एलएलएम द्वारा स्वयं स्वचालित रूप से की गई थी, जो त्रुटि जानकारी के साथ प्रेरित थी।
सामान्य एलएलएम विफलताओं में शामिल हैं:
‘एक और सामान्य समस्या जिसे हमने पाया (ज्यादातर जेमिनी, क्लाउड, और डीपसीक के साथ, और जीपीटी के साथ नहीं) यह है कि एलएलएम अक्सर लगातार एक बग को हल करने में विफल रहता है।
‘उदाहरण के लिए, एक एजेंट लगातार समय समाप्त हो जाएगा, त्रुटि के साथ एलएलएम को प्रेरित करने और अपडेटेड संस्करण प्राप्त करने के बाद भी (जैसे 5 – 15) चक्र।
‘ऐसी स्थितियों (जहां एलएलएम बार-बार एक ही बग को हल करने में विफल रहता है) के लिए हमने जो एकमात्र समाधान पाया है वह है शुरू से फिर से शुरू करना. कुल मिलाकर, हमने देखा कि बग-मुक्त कोड प्राप्त करने के लिए महत्वपूर्ण मैनुअल प्रयास की आवश्यकता है। हमें मूल्यांकन के लिए 40 बग-मुक्त एजेंट प्राप्त करने के लिए काफी अधिक एजेंट उत्पन्न करने की आवश्यकता थी। ‘
नीचे दिखाए गए परिणाम 12 डबल राउंड-रोबिन टूर्नामेंट से परिणामों का सारांश देते हैं, जो चार नेटवर्क टोपोलॉजी और प्रति टोपोलॉजी तीन टूर्नामेंट को कवर करते हैं, जो लगभग 40,000 मैचों का उत्पादन करते हैं:
| एजेंट | एवरेज #जीत / टूर | एसडी #जीत / टूर | एवरेज #हार / टूर | एसडी #हार / टूर | कुल जीत | कुल हार | जीत दर |
|---|---|---|---|---|---|---|---|
| छात्र 1 | 108.167 | 1.193 | 3.833 | 1.193 | 1298 | 46 | 0.9658 |
| छात्र 2 | 104.917 | 2.539 | 7.083 | 2.539 | 1259 | 85 | 0.9368 |
| छात्र 3 | 103.917 | 2.466 | 8.083 | 2.466 | 1247 | 97 | 0.9278 |
| छात्र 4 | 103.25 | 1.815 | 8.75 | 1.815 | 1239 | 105 | 0.9219 |
| छात्र 5 | 96.5 | 2.908 | 15.5 | 2.908 | 1158 | 186 | 0.8616 |
| एलएलएम(ओ, आईआर, 1) | 95.417 | 2.314 | 16.583 | 2.314 | 1145 | 199 | 0.8519 |
| एलएलएम(ओ, ए2, 1) | 94.583 | 2.314 | 17.417 | 2.314 | 1135 | 209 | 0.8445 |
| छात्र 6 | 93.167 | 1.899 | 18.833 | 1.899 | 1118 | 226 | 0.8318 |
| छात्र 7 | 93.167 | 3.563 | 18.833 | 3.563 | 1118 | 226 | 0.8318 |
| एलएलएम(ओ, ए1, 1) | 86.083 | 3.029 | 25.917 | 3.029 | 1033 | 311 | 0.7686 |
| एलएलएम(ओ, जेन, 2) | 84.083 | 6.947 | 27.917 | 6.947 | 1009 | 335 | 0.7507 |
| एलएलएम(ओ, सीआर, 2) | 83.5 | 4.442 | 28.5 | 4.442 | 1002 | 342 | 0.7455 |
| छात्र 8 | 83.417 | 4.122 | 28.583 | 4.122 | 1001 | 343 | 0.7448 |
| रिस्कसीकिंग | 82.417 | 3.343 | 29.583 | 3.343 | 989 | 355 | 0.7359 |
| एलएलएम(ओ, जेन, 1) | 80.667 | 4.355 | 31.25 | 4.372 | 968 | 375 | 0.7208 |
| मॉडलओपोनेंट | 80.583 | 3.26 | 31.417 | 3.26 | 967 | 377 | 0.7195 |
| एलएलएम(डी, ए1, 1) | 79.417 | 3.965 | 32.583 | 3.965 | 953 | 391 | 0.7091 |
| एक्सपकोस्टफिक्स्डबिड | 77.167 | 4.951 | 34.833 | 4.951 | 926 | 418 | 0.689 |
| एलएलएम(ओ, आईआर, 2) | 73.917 | 3.502 | 38 | 3.618 | 887 | 456 | 0.6605 |
| एलएलएम(ओ, ए1, 2) | 72.417 | 2.193 | 39.583 | 2.193 | 869 | 475 | 0.6466 |
| एलएलएम(जी, ए1, 2) | 68.5 | 3.555 | 43.5 | 3.555 | 822 | 522 | 0.6116 |
| एलएलएम(ए, जेन, 2) | 67.917 | 2.968 | 44.083 | 2.968 | 815 | 529 | 0.6064 |
| एलएलएम(जी, आईआर, 2) | 65.917 | 2.314 | 46.083 | 2.314 | 791 | 553 | 0.5885 |
| छात्र 9 | 64.167 | 11.044 | 47.833 | 11.044 | 770 | 574 | 0.5729 |
| एलएलएम(जी, ए1, 1) | 64 | 4.243 | 47.917 | 4.316 | 768 | 575 | 0.5719 |
| एलएलएम(जी, आईआर, 1) | 60.333 | 3.725 | 51.667 | 3.725 | 724 | 620 | 0.5387 |
| एलएलएम(ओ, ए2, 2) | 59.333 | 4.499 | 52.667 | 4.499 | 712 | 632 | 0.5298 |
| एलएलएम(डी, सीआर, 1) | 55.083 | 6.694 | 56.833 | 6.59 | 661 | 682 | 0.4922 |
| एलएलएम(जी, जेन, 2) | 53.167 | 3.664 | 58.833 | 3.664 | 638 | 706 | 0.4747 |
| एलएलएम(डी, जेन, 2) | 52.083 | 9.06 | 59.917 | 9.06 | 625 | 719 | 0.465 |
| होनेस्ट | 50.583 | 3.848 | 61.417 | 3.848 | 607 | 737 | 0.4516 |
| छात्र 10 | 48.833 | 2.98 | 63.167 | 2.98 | 586 | 758 | 0.436 |
| एलएलएम(डी, आईआर, 1) | 48.583 | 10.211 | 63.417 | 10.211 | 583 | 761 | 0.4338 |
| एलएलएम(ए, ए1, 1) | 48 | 4.69 | 64 | 4.69 | 576 | 768 | 0.4286 |
| एलएलएम(जी, ए2, 1) | 47.25 | 3.864 | 64.75 | 3.864 | 567 | 777 | 0.4219 |
| एलएलएम(ए, सीआर, 1) | 43.833 | 4.609 | 68.167 | 4.609 | 526 | 818 | 0.3914 |
| एलएलएम(ए, ए1, 2) | 43.75 | 2.05 | 68.25 | 2.05 | 525 | 819 | 0.3906 |
| छात्र 11 | 42.083 | 5.664 | 69.917 | 5.664 | 505 | 839 | 0.3757 |
| एलएलएम(ए, आईआर, 1) | 39.5 | 2.541 | 72.5 | 2.541 | 474 | 870 | 0.3527 |
| नाव | 36.75 | 1.712 | 75.25 | 1.712 | 441 | 903 | 0.3281 |
| छात्र 12 | 36.333 | 1.775 | 75.667 | 1.775 | 436 | 908 | 0.3244 |
| एलएलएम(डी, ए2, 1) | 33.917 | 2.193 | 78.083 | 2.193 | 407 | 937 | 0.3028 |
| एलएलएम(ए, जेन, 1) | 30.167 | 1.749 | 81.833 | 1.749 | 362 | 982 | 0.2693 |
| एलएलएम(डी, ए2, 2) | 29.833 | 2.038 | 82.167 | 2.038 | 358 | 986 | 0.2664 |
| एलएलएम(जी, ए2, 2) | 27 | 2.256 | 85 | 2.256 | 324 | 1020 | 0.2411 |
| एलएलएम(ए, ए2, 1) | 26.333 | 0.985 | 85.667 | 0.985 | 316 | 1028 | 0.2351 |
| एलएलएम(ओ, सीआर, 1) | 25 | 3.411 | 87 | 3.411 | 300 | 1044 | 0.2232 |
| एलएलएम(ए, आईआर, 2) | 24.333 | 8.542 | 87.667 | 8.542 | 292 | 1052 | 0.2173 |
| एलएलएम(ए, ए2, 2) | 24 | 1.809 | 88 | 1.809 | 288 | 1056 | 0.2143 |
| एलएलएम(ए, सीआर, 2) | 23.333 | 1.557 | 88.667 | 1.557 | 280 | 1064 | 0.2083 |
| एलएलएम(डी, जेन, 1) | 22.5 | 1.784 | 89.5 | 1.784 | 270 | 1074 | 0.2009 |
| एलएलएम(डी, ए1, 2) | 13.333 | 1.826 | 98.667 | 1.826 | 160 | 1184 | 0.119 |
| एलएलएम(जी, सीआर, 1) | 9.5 | 1.087 | 102.5 | 1.087 | 114 | 1230 | 0.0848 |
| एलएलएम(जी, जेन, 1) | 9.167 | 0.937 | 102.833 | 0.937 | 110 | 1234 | 0.0818 |
| एलएलएम(डी, आईआर, 2) | 7.75 | 0.622 | 104.25 | 0.622 | 93 | 1251 | 0.0692 |
| एलएलएम(जी, सीआर, 2) | 7.25 | 1.422 | 104.75 | 1.422 | 87 | 1257 | 0.0647 |
| एलएलएम(डी, सीआर, 2) | 5.667 | 0.985 | 106.333 | 0.985 | 68 | 1276 | 0.0506 |
संदर्भ के लिए, प्रत्येक एजेंट ने प्रति टूर्नामेंट 112 मैच खेले, इसलिए प्रति एजेंट जीत या हार का औसत संभावित अधिकतम 112 है। मानक विचलन (एसडी) टूर्नामेंट में परिवर्तनशीलता को दर्शाता है। मानव-कोडेड एजेंट बोल्ड में हैं। एलएलएम-कोडेड एजेंट मॉडल (ओ = जीपीटी-5 थिंकिंग, जी = जेमिनी 2.5 प्रो, ए = क्लाउड ओपस 4.1, डी = डीपसीक आर1), इसके बाद एक दो-अक्षर प्रोम्प्ट रणनीति कोड और एक अंक जो दर्शाता है कि एजेंट को पहले या दूसरे प्रोम्प्ट के साथ उत्पन्न किया गया है या नहीं। स्रोत
उपरोक्त परिणामों के संबंध में, लेखकों का कहना है:
‘एलएलएम ने अपेक्षित/प्रतिस्पर्धी कोड उत्पन्न नहीं किया, यहां तक कि एपीडीपी समस्या के सरल रूपांतरों में भी (हालांकि कोड बड़े पैमाने पर सिंटैक्स-त्रुटि मुक्त था)। यह एलएलएम की नई कमजोरियों की पहचान करने और ऑटो-पूर्ण और बेंचमार्क के बाहर जाने के लिए तर्क-संचालित कोड मूल्यांकन बेंचमार्क के महत्व को रेखांकित करता है। ‘
‘हमारे परिणाम मानव-कोडेड एजेंटों की स्पष्ट श्रेष्ठता को प्रदर्शित करते हैं: (i) शीर्ष 5 स्थान लगातार छात्र एजेंटों द्वारा आयोजित किए जाते हैं, और (ii) अधिकांश एलएलएम एजेंट (33 में से 40) बहुत सरल बेसलाइन एजेंटों (जैसे अपेक्षित लागत निर्धारित बोली) द्वारा हराए जाते हैं। ‘
‘महत्वपूर्ण बात यह है कि हमने छात्र कोड को डीबग नहीं किया (जबकि हमने एलएलएम कोड का स्वयं-खेल और टूर्नामेंट सेटिंग में परीक्षण और डीबगिंग किया था)। हर बार जब एक छात्र एजेंट क्रैश होता था, तो हम स्वचालित रूप से एलएलएम को जीत देते थे। इनमें से कई क्रैश आसानी से ठीक किए जा सकते थे (जैसे एजेंट समय समाप्त हो गए), इसलिए छात्र एजेंट संभावित रूप से अधिक उच्च रैंक कर सकते थे। ‘
एक और प्रयोग के रूप में, जीपीटी-5 थिंकिंग को शीर्ष प्रदर्शन करने वाले मानव एजेंट, छात्र 1 के कोड में सुधार करने के लिए प्रेरित किया गया था; लेकिन एलएलएम-संशोधित एजेंट बाद में दसवें स्थान पर गिर गया, अब सभी मानव स्कोर में से सबसे खराब है। एलएलएम के बदलाव ने समाधान को लगभग 20% तक खराब कर दिया, इसे बेहतर बनाने के बजाय।
लेखकों का निष्कर्ष है:
‘[हमारे] परिणाम एलएलएम कोड जनरेशन की महत्वपूर्ण सीमाओं को उजागर करते हैं, सबसे उल्लेखनीय रूप से उनकी सीमित तर्क और योजना क्षमताएं। आधुनिक एलएलएम सिंटैक्स-त्रुटि मुक्त कोड प्रदान कर सकते हैं जो चलता है, लेकिन यह वह बेंचमार्क नहीं है जिसका उपयोग हमें उन्नत सामान्य एआई की ओर प्रगति को मापने के लिए करना चाहिए। ‘
निष्कर्ष
लेखक खुद पेपर के अंत में यह देखकर观察 करते हैं कि वाइब-कोडिंग ने सभी तकनीकी पृष्ठभूमि के लोगों को सशक्त बनाया है, और इसका वर्णन एक सकारात्मक प्रकाश में किया है, इसे एक स्तर के रूप में वर्णित किया है। हालांकि, वे यह भी इंगित करते हैं कि क्योंकि वाइब-कोडिंग अभी तक mới है, इसकी सीमाएं अज्ञात हैं, और वास्तविक अपेक्षाओं की तुलना में अधिक हो सकती हैं।
वे अपने प्रस्ताव को ‘कोड जो संकलित होता है से कोड जो प्रतिस्पर्धा करता है‘ की ओर लक्ष्य बदलने के लिए कहते हैं।
इस नए पेपर के एक आकस्मिक पाठक के पास जो प्रश्न हो सकता है वह यह है कि क्या लेखक ऊपर या नीचे मुक्का मार रहे हैं, क्योंकि प्रश्न में एजेंटिक कार्य काफी जटिल और शामिल है, पावरशेल स्क्रिप्ट और अन्य प्रकार के मामूली कार्यों और सुधारों के लिए वाइब-कोडिंग के लिए उपयुक्त है।
* कृपया ध्यान दें कि पेपर लगातार ‘डीपथिंक आर1′ का उल्लेख करता है, जो अस्तित्व में नहीं लगता है, केवल कुछ संदर्भों को इंटरनेट पर दिखा रहा है (संभवतः अन्य लेखकों द्वारा ‘डीपसीक आर1’ को गलत लिखा गया है)। यदि यह मेरी त्रुटि है, तो कृपया मेरे प्रोफाइल विवरण के माध्यम से मुझसे संपर्क करें, और मैं इसे संशोधित करूंगा।
† लेखकों का जोर, मेरा नहीं.
पहली बार बुधवार, 26 नवंबर, 2025 को प्रकाशित। 17:35 पूर्वी मानक समय के लिए प्रारूपण के लिए संशोधित।












