Anderson का एंगल

2020 से मानव कोड ने वाइब-कोडेड एजेंटों को एजेंटिक परीक्षण में हराया

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें
AI-generated image: a Victorian coach and horses winning formula 1 against modern race car competitors. gpt-image-1.

गया था – और लार्ज लैंग्वेज मॉडल्स के आविष्कार से पहले लिखे गए ग्रेजुएट छात्र कोड से हार गए। यूके से एक नए अध्ययन में, शोधकर्ताओं ने मानव-कोडेड एजेंटों को वाइब-कोडेड

 

चैटजीपीटी और अन्य वाइब-कोडिंग टूल्स को लगभग 40,000 मैचों में परीक्षण के लिए रखा एजेंटों के खिलाफ पिटा, जो नवीनतम लार्ज लैंग्वेज मॉडल्स (एलएलएम)केसाथ विकसित किए गए थे, जैसे कि चैटजीपीटी-5 और क्लाउड, और पाया कि बिना एआई की मदद से बनाए गए एजेंट आसानी से एआई-सहायता प्राप्त संस्करणों को हरा देते हैं। दोनों सेट के एजेंट स्विस फेडरल टेक्नोलॉजी इंस्टीट्यूट ऑफ लॉज़ेन के आर्टिफिशियल इंटेलिजेंस लेबोरेटरी से अलग-अलग पीढ़ियों के छात्रों द्वारा बनाए गए थे। गैर-एआई एजेंट 2020 में कोर्सवर्क के हिस्से के रूप में विकसित किए गए थे, जो चैटजीपीटी और एलएलएम क्रांति की शुरुआत से दो साल पहले था, जबकि नए एजेंट वर्तमान छात्रों द्वारा बनाए गए थे, जो नवीनतम और सर्वश्रेष्ठ एलएलएम का उपयोग करके सहायता प्राप्त थे। यहां तक कि जब खेल को तैयार किया गया था, तो वाइब-कोडेड समाधान जीत नहीं सकते थे, और शीर्ष पांच स्थान लगातार ‘कच्चे’ एजेंटों द्वारा आयोजित किए गए थे, जिसमें अधिकांश एलएलएम एजेंट (33 में से 40) को आसानी से ‘बहुत सरल’ बेसलाइन एजेंटों द्वारा हराया गया था, 38,304 चुनौतियों में एक टूर्नामेंट में, विभिन्न चर और

परिस्थितियों में। लेख में कहा गया है: ‘हमारा काम यह दिखाता है कि जबकि राज्य-ऑफ-द-आर्ट एलएलएम सिंटैक्स त्रुटियों से मुक्त कोड उत्पन्न कर सकते हैं, उत्पन्न समाधान रणनीतिक योजना, अनुकूलन, या बहु-एजेंट प्रतिस्पर्धा जैसे आयामों पर मानव-डिज़ाइन किए गए समाधानों के लिए प्रतिस्पर्धी नहीं

उपयोग नहीं कर सके: ‘इस प्रकार, यह काम एक नए मोर्चे को आगे बढ़ाता है, और बेंचमार्क, डेटासेट, और ओपन-सोर्स बेसलाइन के विकास को सुविधाजनक बनाने का उद्देश्य रखता है जो तर्क-संचालित कोड सिंथेसिस

है। चुनौती को रचनात्मक रूप से नीलामी में भाग लेने और जीते गए आइटमों को विजेताओं को वितरित करने के लिए लॉजिस्टिक व्यवस्था करने के लिए डिज़ाइन किया गया था। लेखकों का उल्लेख है कि एलएलएम को कई फायदे दिए गए थे, जैसे कि उनके कोड में हस्तक्षेप करना और उनके प्रदर्शन में सुधार करना – एक लाभ जो 2020 के युग के कोड को नहीं दिया गया था। इसके बावजूद, जब उन्हें सुधार के लिए कोड प्रदान किया गया, तो एलएलएम उन्हें स्वीकार नहीं कर सके या उनका

पर जोर देते हैं। ‘ ‘(हमारे) बेंचमार्क में, जब हम एक अच्छा समाधान प्रदान करते हैं, तो एलएलएम अभी भी

उपयोग किए गए एलएलएम जीपीटी-5 थिंकिंग, जेमिनी 2.5 प्रो, क्लाउड ओपस 4.1, और डीपसीक आर1* थे। नई पेपर ‘यह परिणाम भी जटिल परिदृश्यों में

इसका उपयोग करने में असमर्थ है। परीक्षण में संदर्भ-शिक्षा और पुनर्प्राप्ति-संचालितसमस्या-समाधान में संदर्भ-शिक्षा की सीमाओंके बारे में रोचक भविष्यके शोध प्रश्न उठाताहै। ‘ यहाँ है, जिसका ग्रेजुएट सीएस छात्रों को हरा सकती है? एक एलएलएम बनाम मानव कोडिंग टूर्नामेंट बाजार-चालित रणनीतिक योजना पर जल्द हीशीर्षक है, और यह यूनिवर्सिटी ऑफ साउथेम्प्टन और यूनिवर्सिटी ऑफ ऑक्सफोर्ड और एलन ट्यूरिंग इंस्टीट्यूट से एक लेखक द्वारा आया है। बेंचमार्क, लेखकों का कहना है, क्या वाइब कोडिंग जारी कियाजाएगा।

विधि

लेखकों का उल्लेख है कि पारंपरिक परीक्षण क्षेत्रइस में स्पष्ट रूप से परिभाषित द्विआधारी समाधानों ( या सही ) पर केंद्रित होते हैं,

मानक, यूनिट-परीक्षण-आधारित दृष्टिकोण (ऊपर), और लेखकों द्वारा आविष्कृत अधिक खुले चुनौती परिदृश्य (नीचे नीले रंग में) की तुलना। स्रोत ( https://arxiv.org/pdf/2511.20613 ) जो गलत यूनिट परीक्षण के माध्यम से सत्यापित किएजाते हैं। एलएलएम-सहायता प्राप्त कोड की सीमाओं का अन्वेषण करने के लिए यह आदर्श तरीका नहीं होने का दावा करते हुए, लेखकों ने एक अधिक जटिल चुनौती परिदृश्य का आविष्कार किया, जिसमें कई आंतरिक बेंचमार्क और मील के पत्थर हैं, जिसमें जीत संभव है,लेकिन दूर से नहीं है:(कैप्शन id=”attachment_226365″ align=”alignnone” width=”672″) मानक, यूनिट-परीक्षण-आधारित दृष्टिकोण (ऊपर), और लेखकों द्वारा आविष्कृत अधिक खुले चुनौती परिदृश्य (नीचे नीले रंग में) की तुलना। स्रोत स्रोत (/कैप्शन) लेखकों

टूर्नामेंट में उपयोग किए गए सरलीकृत सड़क नेटवर्क: ग्रेट ब्रिटेन (ऊपर बाएं), स्विट्जरलैंड (ऊपर दाएं), नीदरलैंड (नीचे बाएं), और फ्रांस (नीचे दाएं)। नीले और लाल वर्ग पिक-अप और डिलीवरी कार्यों को चिह्नित करते हैं। रंगीन त्रिकोण एजेंटों के वाहनों की वर्तमान स्थिति दर्शाते हैं। ने लोकप्रिय परीक्षण फ्रेमवर्क जैसे ह्यूमनइवल , बिगकोडबेंच और वेबडेव

एरेना (अन्य कई लोगों के बीच) से बचने का प्रयास किया, क्योंकि इस वर्ग के परीक्षण प्रक्रियाओं में अक्सर डेटा दूषण (अर्थात, ऐसे उदाहरण जहां प्रणाली परीक्षण डेटा पर प्रशिक्षित हो सकती है) का सामना करना पड़ता है इसके बजाय एक विभाजन का सम्मान करने के लिए)।

दौड़ शुरू हो गई है

लेखकों का मूल्यांकन 40 एलएलएम-कोडेड एजेंटों की तुलना 17 मानव-कोडेड एजेंटों से एक श्रृंखला में की गई थी। प्रत्येक टूर्नामेंट में चार सड़क नेटवर्क टोपोलॉजी के विभिन्न संयोजनों का उपयोग किया गया था, और इसमें सभी-खेल-सभी जोड़ी शामिल थी, जिसमें एजेंटों ने प्रत्येक विरोधी का सामना दो बार किया था: एक बार दो कंपनियों में से प्रत्येक को नियंत्रित करते हुए, विभिन्न वाहन विशिष्टताओं के साथ। यह सेटअप प्रति टूर्नामेंट 3,192 मैचों का उत्पादन करता है, कुल 38,304 मैचों के लिए। प्रत्येक मैच में, 50 डिलीवरी कार्य नीलामी के द्वारा निर्धारित किए गए थे,

टूर्नामेंट में उपयोग किए गए सरलीकृत सड़क नेटवर्क: ग्रेट ब्रिटेन (ऊपर बाएं), स्विट्जरलैंड (ऊपर दाएं), नीदरलैंड्स (नीचे बाएं), और फ्रांस (नीचे दाएं)। नीले और लाल वर्ग नीलामी कार्यों के पिकअप और डिलीवरी बिंदुओं को दर्शाते हैं। रंगीन त्रिभुज एजेंटों के वाहनों की वर्तमान स्थिति को दर्शाते हैं। जो उनके पिकअप और ड्रॉप-ऑफ बिंदुओं और वजन द्वारा परिभाषित किए गए थे, और स्विट्जरलैंड, फ्रांस, ग्रेट ब्रिटेन और नीदरलैंड्स पर आधारित सड़क लेआउट में यादृच्छिक रूप से आकर्षित किए गए थे: (कैप्शन id=”attachment_226367″ align=”alignnone” width=”859″)

टूर्नामेंट में उपयोग किए गए सरलीकृत सड़क नेटवर्क: ग्रेट ब्रिटेन (ऊपर बाएं), स्विट्जरलैंड (ऊपर दाएं), नीदरलैंड्स (नीचे बाएं), और फ्रांस (नीचे दाएं)। नीले और लाल वर्ग नीलामी कार्यों के पिकअप और डिलीवरी बिंदुओं को दर्शाते हैं। रंगीन त्रिभुज एजेंटोंके के वाहनों की वर्तमान स्थिति को दर्शाते हैं। स्रोत (/कैप्शन) छात्र एजेंट 2020 पाठ्यक्रम टूर्नामेंट से लिए गए थे। आठ एकल-निर्मूलन फाइनल बेसलाइन में शीर्ष प्रदर्शन करने वालों से आए थे, और चार और एजेंटों के खिलाफ हेड-टू-हेड मैचों में मजबूत प्रदर्शन के लिए चुने गए थे। बेसलाइन एजेंट का ने निर्धारित ह्यूरिस्टिक्स का पालन किया। ने कुल दूरी की गणना की और इसके अनुसार बोली लगाई, केवल एक वाहन का उपयोग किया और बैचिंग को अनदेखा किया; नाव ने 10 यादृच्छिक कार्यों का अनुकरण किया, और औसत सीमांत लागत की बोली लगाई; एक्सपकोस्टफिक्स्डबिड ने वास्तविक सीमांत लागत की गणना की; होनेस्ट ने वही किया, लेकिन विरोधी की लागत का एक अनुमान जोड़ा, और अधिकतम बोली लगाई; और मॉडलओपोनेंट ने समय-गिरावट वाले प्राथमिक के साथ लाइव लागत अनुमान और विरोधी मॉडलिंग के मिश्रण को मिलाया, फिर से अधिकतम बोली लगाई। रिस्कसीकिंग मूल्यांकन में 40 एलएलएम-कोडेड एजेंट शामिल थे जो (उपरोक्त) जीपीटी-5 थिंकिंग, क्लाउड ओपस 4.1, जेमिनी 2.5 प्रो, और डीपसीक आर1 का उपयोग करके बनाए गए थे। प्रत्येक मॉडल को पांच अलग-अलग रणनीतियों के साथ प्रेरित किया गया था, प्रति मॉडल दो बार लागू किया गया था। दो रणनीतियों ने अलग-अलग लेखकों द्वारा लिखे गए स्थिर प्रोम्प्ट का उपयोग किया, जबकि एक तीसरे ने मॉडल को अपने स्वयं के आउटपुट को संशोधित और संशोधित करने के लिए कहा; एक और ने एक अलग एलएलएम द्वारा आलोचना और संशोधन शामिल किया। अंतिम रणनीति ने जीपीटी-4उपयोगसभी

चार पिछले दृष्टिकोणों की समीक्षा करने और एक नया प्रोम्प्ट संश्लेषित करने के लिए किया। बेस प्रोम्प्ट मूल छात्र असाइनमेंट को दर्शाता था, जिसमें डिलीवरी वातावरण का

वर्णन किया गया था और मॉडल को लाभ को अधिकतम करने के लिए बोली लगाने और योजना बनाने का निर्देश दिया गया था, उच्च-जटिलता वाली विधियों पर

एलएलएम द्वारा स्वयं स्वचालित रूप से की गई थी, जो त्रुटि जानकारी के साथ प्रेरित थी। सामान्य एलएलएम विफलताओं हो जाते। बग-फिक्सिंगजिसे हमने पाया (ज्यादातर जेमिनी, क्लाउड, में शामिल हैं: ‘एक और सामान्य समस्याऔर डीपसीक के साथ, और जीपीटी के साथ नहीं) यह है कि एलएलएम अक्सर

निर्भर किए बिना। सभी एलएलएम एजेंटों का परीक्षण स्व-खेल और टूर्नामेंट सेटिंग में किया गया था, जब तक कि सभी दिखाई देने वाले बग ठीक नहीं

लगातार एक बग को हल करने में विफल रहता है। ‘उदाहरण के लिए, एक एजेंट लगातार
समय समाप्त हो जाएगा, त्रुटि के साथ एलएलएम को प्रेरित करने और अपडेटेड
संस्करण प्राप्त करने के बाद भी (जैसे 5 – 15) चक्र। नीचे दिखाए
गए परिणाम 12 डबल राउंड-रोबिन टूर्नामेंट से परिणामों का सारांश देते हैं,
जो चार नेटवर्क टोपोलॉजी और प्रति टोपोलॉजी तीन टूर्नामेंट को कवर करते हैं,
जो लगभग 40,000 मैचों का उत्पादन करते हैं: शुरू से फिर से
शुरू करना ‘ऐसी स्थितियों (जहां एलएलएम बार-बार एक ही बग को हल करने में विफल
रहता है) के लिए हमने जो एकमात्र समाधान पाया है वह है महत्वपूर्ण मैनुअल
प्रयास . कुल मिलाकर, हमने देखा कि बग-मुक्त कोड प्राप्त करने के लिए
की आवश्यकता है। हमें मूल्यांकन के लिए 40 बग-मुक्त एजेंट प्राप्त करने
के लिए काफी अधिक एजेंट उत्पन्न करने की आवश्यकता थी। ‘ एजेंट एवरेज #जीत /
टूर एसडी #जीत / टूर एवरेज #हार / टूर एसडी #हार / टूर कुल
जीत कुल हार जीत दर छात्र 1 108.167 1.193 3.833 1.193 1298 46 0.9658
छात्र 2 104.917 2.539 7.083 2.539 1259 85 0.9368 छात्र 3 103.917 2.466
8.083 2.466 1247 97 0.9278 छात्र 4 103.25 1.815 8.75 1.815 1239
105 0.9219 छात्र 5 96.5 2.908 15.5 2.908 1158 186 0.8616 एलएलएम(ओ, आईआर, 1)
95.417 2.314 16.583 2.314 1145 199 0.8519 एलएलएम(ओ, ए2, 1) 94.583 2.314
17.417 2.314 1135 209 0.8445 छात्र 6 93.167 1.899 18.833 1.899 1118 226 0.8318
छात्र 7 93.167 3.563 18.833 3.563 1118 226 0.8318 एलएलएम(ओ, ए1, 1)
86.083 3.029 25.917 3.029 1033 311 0.7686 एलएलएम(ओ, जेन, 2) 84.083 6.947 27.917
6.947 1009 335 0.7507 एलएलएम(ओ, सीआर, 2) 83.5 4.442 28.5 4.442 1002 342 0.7455 छात्र
8 83.417 4.122 28.583 4.122 1001 343 0.7448 रिस्कसीकिंग 82.417 3.343 29.583 3.343 989
355 0.7359 एलएलएम(ओ, जेन, 1) 80.667 4.355 31.25 4.372 968 375 0.7208 मॉडलओपोनेंट 80.583 3.26
31.417 3.26 967 377 0.7195 एलएलएम(डी, ए1, 1) 79.417 3.965 32.583 3.965 953 391
0.7091 एक्सपकोस्टफिक्स्डबिड 77.167 4.951 34.833 4.951 926 418 0.689 एलएलएम(ओ, आईआर, 2) 73.917
3.502 38 3.618 887 456 0.6605 एलएलएम(ओ, ए1, 2) 72.417 2.193 39.583 2.193
869 475 0.6466 एलएलएम(जी, ए1, 2) 68.5 3.555 43.5 3.555 822 522 0.6116 एलएलएम(ए,
जेन, 2) 67.917 2.968 44.083 2.968 815 529 0.6064 एलएलएम(जी, आईआर, 2) 65.917 2.314 46.083
2.314 791 553 0.5885 छात्र 9 64.167 11.044 47.833 11.044 770 574 0.5729 एलएलएम(जी,
ए1, 1) 64 4.243 47.917 4.316 768 575 0.5719 एलएलएम(जी, आईआर, 1) 60.333 3.725 51.667
3.725 724 620 0.5387 एलएलएम(ओ, ए2, 2) 59.333 4.499 52.667 4.499 712 632 0.5298
एलएलएम(डी, सीआर, 1) 55.083 6.694 56.833 6.59 661 682 0.4922 एलएलएम(जी, जेन,
2) 53.167 3.664 58.833 3.664 638 706 0.4747 एलएलएम(डी, जेन, 2) 52.083
9.06 59.917 9.06 625 719 0.465 होनेस्ट 50.583 3.848 61.417 3.848 607 737 0.4516 छात्र
10 48.833 2.98 63.167 2.98 586 758 0.436 एलएलएम(डी, आईआर, 1) 48.583
10.211 63.417 10.211 583 761 0.4338 एलएलएम(ए, ए1, 1) 48 4.69 64 4.69 576 768
0.4286 एलएलएम(जी, ए2, 1) 47.25 3.864 64.75 3.864 567 777 0.4219 एलएलएम(ए, सीआर, 1)
43.833 4.609 68.167 4.609 526 818 0.3914 एलएलएम(ए, ए1, 2) 43.75 2.05 68.25 2.05
525 819 0.3906 छात्र 11 42.083 5.664 69.917 5.664 505 839 0.3757 एलएलएम(ए,
आईआर, 1) 39.5 2.541 72.5 2.541 474 870 0.3527 नाव 36.75 1.712 75.25 1.712
441 903 0.3281 छात्र 12 36.333 1.775 75.667 1.775 436 908 0.3244
एलएलएम(डी, ए2, 1) 33.917 2.193 78.083 2.193 407 937 0.3028 एलएलएम(ए, जेन, 1)
30.167 1.749 81.833 1.749 362 982 0.2693 एलएलएम(डी, ए2, 2) 29.833 2.038 82.167 2.038
358 986 0.2664 एलएलएम(जी, ए2, 2) 27 2.256 85 2.256 324 1020 0.2411 एलएलएम(ए,
ए2, 1) 26.333 0.985 85.667 0.985 316 1028 0.2351 एलएलएम(ओ, सीआर, 1) 25 3.411 87
3.411 300 1044 0.2232 एलएलएम(ए, आईआर, 2) 24.333 8.542 87.667 8.542 292
1052 0.2173 एलएलएम(ए, ए2, 2) 24 1.809 88 1.809 288 1056 0.2143 एलएलएम(ए, सीआर, 2)
23.333 1.557 88.667 1.557 280 1064 0.2083 एलएलएम(डी, जेन, 1) 22.5 1.784
89.5 1.784 270 1074 0.2009 एलएलएम(डी, ए1, 2) 13.333 1.826 98.667 1.826 160 1184 0.119
एलएलएम(जी, सीआर, 1) 9.5 1.087 102.5 1.087 114 1230 0.0848 एलएलएम(जी, जेन,
1) 9.167 0.937 102.833 0.937 110 1234 0.0818 एलएलएम(डी, आईआर, 2) 7.75 0.622 104.25 0.622
93 1251 0.0692 एलएलएम(जी, सीआर, 2) 7.25 1.422 104.75 1.422 87 1257 0.0647 एलएलएम(डी,
सीआर, 2) 5.667 0.985 106.333 0.985 68 1276 0.0506 संदर्भ के लिए, प्रत्येक एजेंट ने
प्रति टूर्नामेंट 112 मैच खेले, इसलिए प्रति एजेंट जीत या हार का औसत संभावित
अधिकतम 112 है। मानक विचलन (एसडी) टूर्नामेंट में परिवर्तनशीलता को दर्शाता है। मानव-कोडेड एजेंट
बोल्ड में हैं। एलएलएम-कोडेड एजेंट मॉडल (ओ = जीपीटी-5 थिंकिंग, जी = जेमिनी 2.5 प्रो,
ए = क्लाउड ओपस 4.1, डी = डीपसीक आर1), इसके बाद एक दो-अक्षर प्रोम्प्ट
रणनीति कोड और एक अंक जो दर्शाता है कि एजेंट को पहले या दूसरे प्रोम्प्ट

के साथ उत्पन्न किया गया है या नहीं। उपरोक्त परिणामों के संबंध में, लेखकों का कहना है: स्रोत ‘एलएलएम ने अपेक्षित/प्रतिस्पर्धी कोड उत्पन्न नहीं किया, यहां तक कि एपीडीपी समस्या के सरल रूपांतरों में भी (हालांकि कोड बड़े पैमाने पर सिंटैक्स-त्रुटि मुक्त था)। यह एलएलएम की नई कमजोरियों की पहचान करने और ऑटो-पूर्ण और बेंचमार्क के बाहर जाने के लिए तर्क-संचालित कोड मूल्यांकन बेंचमार्क के महत्व को रेखांकित करता है। ‘ ‘हमारे परिणाम मानव-कोडेड शीर्ष

एजेंटों की स्पष्ट श्रेष्ठता को प्रदर्शित करते हैं: (i)5स्थान

लगातार छात्र एजेंटों द्वारा आयोजित किए जाते हैं, और (ii) अधिकांश एलएलएम एजेंट (33 में से 40) बहुत सरल बेसलाइन एजेंटों (जैसे अपेक्षित लागत निर्धारित बोली) द्वारा हराए जाते हैं। ‘ एक और प्रयोग के रूप में, जीपीटी-5 थिंकिंग

को शीर्ष प्रदर्शन करने वाले मानव एजेंट, अधिक उच्च ‘महत्वपूर्ण बात कि हमने छात्र कोड को डीबग नहीं कियायह है और टूर्नामेंट सेटिंग में परीक्षण और डीबगिंग किया था)। हर बार जब एक छात्र एजेंट (जबकि हमने एलएलएम कोड का स्वयं-खेल

किए जा सकते थे (जैसे एजेंट समय समाप्त हो गए), इसलिए छात्र एजेंट संभावित रूप से रैंक कर सकते थे। ‘ के कोड में सुधार करने के लिए प्रेरित किया गया था; लेकिन एलएलएम-संशोधित एजेंट बाद में दसवें स्थान पर गिर गया, अब सभी मानव स्कोर में से सबसे खराब है। एलएलएम आसानी से ठीकके

क्रैश होता था, तो हम स्वचालित रूप से एलएलएम को जीत देते थे। इनमें से कई क्रैश करते हैं,बदलाव ने समाधान को लगभग 20% तक खराब कर दिया, इसे बेहतर बनाने के बजाय। लेखकों का निष्कर्ष है: छात्र 1 ‘(हमारे) परिणाम एलएलएम कोड जनरेशन की महत्वपूर्ण सीमाओं को उजागर

सबसे उल्लेखनीय रूप से उनकी सीमित तर्क और योजना क्षमताएं। आधुनिक एलएलएम सिंटैक्स-त्रुटि मुक्त कोड प्रदान कर सकते हैं जो चलता है, लेकिन यह वह बेंचमार्क नहीं है जिसका उपयोग हमें उन्नत सामान्य एआई की ओर प्रगति को मापने के लिए करना चाहिए। ‘

निष्कर्ष

लेखक खुद पेपर का अंत यह बताते हुए करते हैं कि वाइब-कोडिंग ने सभी टेक्निकल बैकग्राउंड के लोगों को मज़बूत बनाया है और इसे एक लेवलिंग-अप बताते हुए इसे पॉज़िटिव तरीके से बताते हैं। हालांकि, वे यह भी बताते हैं कि क्योंकि वाइब-कोडिंग अभी भी काफ़ी नई है, इसलिए इसकी लिमिटेशन पता नहीं हैं और उम्मीद से ज़्यादा हो सकती हैं। वे अपने लक्ष्य को ” ‘ की ओर ले जाने का सुझाव देते हैं।के लिए उपयुक्त है। * कृपया ध्यान दें किकोड जो संकलित होता है से कोड जो प्रतिस्पर्धा करता है इस नए पेपर के एक आकस्मिक पाठक के पास जो प्रश्न हो सकता है वह यह है कि क्या लेखक ऊपर या नीचे मुक्का मार रहे हैं, क्योंकि प्रश्न में एजेंटिक कार्य काफी जटिल और शामिल है, पावरशेल स्क्रिप्ट और अन्य प्रकार के मामूली कार्यों और सुधारों के लिए वाइब-कोडिंग पेपर लगातार ‘डीप आर1’ का उल्लेख करता है, जो अस्तित्व मेंमेरा नहीं लगता है, केवल कुछ संदर्भों को इंटरनेट पर दिखा रहा है (संभवतः अन्य लेखकों द्वारा ‘डीपसीक आर1’ को गलत लिखा गया है)। यदि यह मेरी त्रुटि है, तो कृपया मेरे प्रोफाइल विवरण के माध्यम से मुझसे संपर्क करें, और मैं इसे संशोधित करूंगा। थिंक † लेखकों का जोर,

नहीं. पहली बार बुधवार, 26

नवंबर, 2025 को प्रकाशित। 17:35 पूर्वी मानक समय के लिए प्रारूपण के लिए संशोधित।

मशीन लर्निंग पर लेखक, मानव छवि संश्लेषण में डोमेन विशेषज्ञ। Metaphysic.ai में शोध सामग्री के पूर्व प्रमुख, जब तक यह DNEG की Brahma.ai में विलीन नहीं हो गया।
वेबसाइट: martinanderson.ai
संपर्क: martin@martinanderson.ai