Anderson का एंगल

2020 से मानव कोड ने वाइब-कोडेड एजेंटों को एजेंटिक परीक्षण में हराया

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें
AI-generated image: a Victorian coach and horses winning formula 1 against modern race car competitors. gpt-image-1.

चैटजीपीटी और अन्य वाइब-कोडिंग टूल्स को लगभग 40,000 मैचों में परीक्षण के लिए रखा गया था – और लार्ज लैंग्वेज मॉडल्स के आविष्कार से पहले लिखे गए ग्रेजुएट छात्र कोड से हार गए।

 

यूके से एक नए अध्ययन में, शोधकर्ताओं ने मानव-कोडेड एजेंटों को वाइब-कोडेड एजेंटों के खिलाफ पिटा, जो नवीनतम लार्ज लैंग्वेज मॉडल्स (एलएलएम) के साथ विकसित किए गए थे, जैसे कि चैटजीपीटी-5 और क्लाउड, और पाया कि बिना एआई की मदद से बनाए गए एजेंट आसानी से एआई-सहायता प्राप्त संस्करणों को हरा देते हैं।

दोनों सेट के एजेंट स्विस फेडरल टेक्नोलॉजी इंस्टीट्यूट ऑफ लॉज़ेन के आर्टिफिशियल इंटेलिजेंस लेबोरेटरी से अलग-अलग पीढ़ियों के छात्रों द्वारा बनाए गए थे। गैर-एआई एजेंट 2020 में कोर्सवर्क के हिस्से के रूप में विकसित किए गए थे, जो चैटजीपीटी और एलएलएम क्रांति की शुरुआत से दो साल पहले था, जबकि नए एजेंट वर्तमान छात्रों द्वारा बनाए गए थे, जो नवीनतम और सर्वश्रेष्ठ एलएलएम का उपयोग करके सहायता प्राप्त थे।

यहां तक कि जब खेल को तैयार किया गया था, तो वाइब-कोडेड समाधान जीत नहीं सकते थे, और शीर्ष पांच स्थान लगातार ‘कच्चे’ एजेंटों द्वारा आयोजित किए गए थे, जिसमें अधिकांश एलएलएम एजेंट (33 में से 40) को आसानी से ‘बहुत सरल’ बेसलाइन एजेंटों द्वारा हराया गया था, 38,304 चुनौतियों में एक टूर्नामेंट में, विभिन्न चर और परिस्थितियों में।

लेख में कहा गया है:

‘हमारा काम यह दिखाता है कि जबकि राज्य-ऑफ-द-आर्ट एलएलएम सिंटैक्स त्रुटियों से मुक्त कोड उत्पन्न कर सकते हैं, उत्पन्न समाधान रणनीतिक योजना, अनुकूलन, या बहु-एजेंट प्रतिस्पर्धा जैसे आयामों पर मानव-डिज़ाइन किए गए समाधानों के लिए प्रतिस्पर्धी नहीं है।

‘इस प्रकार, यह काम एक नए मोर्चे को आगे बढ़ाता है, और बेंचमार्क, डेटासेट, और ओपन-सोर्स बेसलाइन के विकास को सुविधाजनक बनाने का उद्देश्य रखता है जो तर्क-संचालित कोड सिंथेसिस पर जोर देते हैं। ‘

चुनौती को रचनात्मक रूप से नीलामी में भाग लेने और जीते गए आइटमों को विजेताओं को वितरित करने के लिए लॉजिस्टिक व्यवस्था करने के लिए डिज़ाइन किया गया था।

लेखकों का उल्लेख है कि एलएलएम को कई फायदे दिए गए थे, जैसे कि उनके कोड में हस्तक्षेप करना और उनके प्रदर्शन में सुधार करना – एक लाभ जो 2020 के युग के कोड को नहीं दिया गया था। इसके बावजूद, जब उन्हें सुधार के लिए कोड प्रदान किया गया, तो एलएलएम उन्हें स्वीकार नहीं कर सके या उनका उपयोग नहीं कर सके:

‘[हमारे] बेंचमार्क में, जब हम एक अच्छा समाधान प्रदान करते हैं, तो एलएलएम अभी भी इसका उपयोग करने में असमर्थ है।

‘यह परिणाम भी जटिल परिदृश्यों में संदर्भ-शिक्षा और पुनर्प्राप्ति-संचालित समस्या-समाधान में संदर्भ-शिक्षा की सीमाओं के बारे में रोचक भविष्य के शोध प्रश्न उठाता है। ‘

परीक्षण में उपयोग किए गए एलएलएम जीपीटी-5 थिंकिंग, जेमिनी 2.5 प्रो, क्लाउड ओपस 4.1, और डीपसीक आर1* थे।

नई पेपर यहाँ है, जिसका शीर्षक क्या वाइब कोडिंग ग्रेजुएट सीएस छात्रों को हरा सकती है? एक एलएलएम बनाम मानव कोडिंग टूर्नामेंट बाजार-चालित रणनीतिक योजना पर है, और यह यूनिवर्सिटी ऑफ साउथेम्प्टन और यूनिवर्सिटी ऑफ ऑक्सफोर्ड और एलन ट्यूरिंग इंस्टीट्यूट से एक लेखक द्वारा आया है। बेंचमार्क, लेखकों का कहना है, जल्द ही जारी किया जाएगा।

विधि

लेखकों का उल्लेख है कि पारंपरिक परीक्षण इस क्षेत्र में स्पष्ट रूप से परिभाषित द्विआधारी समाधानों (सही या गलत) पर केंद्रित होते हैं, जो यूनिट परीक्षण के माध्यम से सत्यापित किए जाते हैं। एलएलएम-सहायता प्राप्त कोड की सीमाओं का अन्वेषण करने के लिए यह आदर्श तरीका नहीं होने का दावा करते हुए, लेखकों ने एक अधिक जटिल चुनौती परिदृश्य का आविष्कार किया, जिसमें कई आंतरिक बेंचमार्क और मील के पत्थर हैं, जिसमें जीत संभव है, लेकिन दूर से नहीं है:

[कैप्शन id=”attachment_226365″ align=”alignnone” width=”672″]मानक, यूनिट-परीक्षण-आधारित दृष्टिकोण (ऊपर), और लेखकों द्वारा आविष्कृत अधिक खुले चुनौती परिदृश्य (नीचे नीले रंग में) की तुलना। स्रोत [ https://arxiv.org/pdf/2511.20613 ] मानक, यूनिट-परीक्षण-आधारित दृष्टिकोण (ऊपर), और लेखकों द्वारा आविष्कृत अधिक खुले चुनौती परिदृश्य (नीचे नीले रंग में) की तुलना। स्रोत स्रोत[/कैप्शन]

लेखकों ने लोकप्रिय परीक्षण फ्रेमवर्क जैसे ह्यूमनइवल, बिगकोडबेंच और वेबडेव एरेना (अन्य कई लोगों के बीच) से बचने का प्रयास किया, क्योंकि इस वर्ग के परीक्षण प्रक्रियाओं में अक्सर डेटा दूषण (अर्थात, ऐसे उदाहरण जहां प्रणाली परीक्षण डेटा पर प्रशिक्षित हो सकती है) का सामना करना पड़ता है इसके बजाय एक विभाजन का सम्मान करने के लिए)।

दौड़ शुरू हो गई है

लेखकों का मूल्यांकन 40 एलएलएम-कोडेड एजेंटों की तुलना 17 मानव-कोडेड एजेंटों से एक श्रृंखला में की गई थी। प्रत्येक टूर्नामेंट में चार सड़क नेटवर्क टोपोलॉजी के विभिन्न संयोजनों का उपयोग किया गया था, और इसमें सभी-खेल-सभी जोड़ी शामिल थी, जिसमें एजेंटों ने प्रत्येक विरोधी का सामना दो बार किया था: एक बार दो कंपनियों में से प्रत्येक को नियंत्रित करते हुए, विभिन्न वाहन विशिष्टताओं के साथ।

यह सेटअप प्रति टूर्नामेंट 3,192 मैचों का उत्पादन करता है, कुल 38,304 मैचों के लिए। प्रत्येक मैच में, 50 डिलीवरी कार्य नीलामी के द्वारा निर्धारित किए गए थे, जो उनके पिकअप और ड्रॉप-ऑफ बिंदुओं और वजन द्वारा परिभाषित किए गए थे, और स्विट्जरलैंड, फ्रांस, ग्रेट ब्रिटेन और नीदरलैंड्स पर आधारित सड़क लेआउट में यादृच्छिक रूप से आकर्षित किए गए थे:

[कैप्शन id=”attachment_226367″ align=”alignnone” width=”859″]टूर्नामेंट में उपयोग किए गए सरलीकृत सड़क नेटवर्क: ग्रेट ब्रिटेन (ऊपर बाएं), स्विट्जरलैंड (ऊपर दाएं), नीदरलैंड्स (नीचे बाएं), और फ्रांस (नीचे दाएं)। नीले और लाल वर्ग नीलामी कार्यों के पिकअप और डिलीवरी बिंदुओं को दर्शाते हैं। रंगीन त्रिभुज एजेंटों के वाहनों की वर्तमान स्थिति को दर्शाते हैं। टूर्नामेंट में उपयोग किए गए सरलीकृत सड़क नेटवर्क: ग्रेट ब्रिटेन (ऊपर बाएं), स्विट्जरलैंड (ऊपर दाएं), नीदरलैंड्स (नीचे बाएं), और फ्रांस (नीचे दाएं)। नीले और लाल वर्ग नीलामी कार्यों के पिकअप और डिलीवरी बिंदुओं को दर्शाते हैं। रंगीन त्रिभुज एजेंटों के वाहनों की वर्तमान स्थिति को दर्शाते हैं। स्रोत[/कैप्शन]

छात्र एजेंट 2020 के पाठ्यक्रम टूर्नामेंट से लिए गए थे। आठ एकल-निर्मूलन फाइनल में शीर्ष प्रदर्शन करने वालों से आए थे, और चार और बेसलाइन एजेंटों के खिलाफ हेड-टू-हेड मैचों में मजबूत प्रदर्शन के लिए चुने गए थे।

बेसलाइन एजेंट ने निर्धारित ह्यूरिस्टिक्स का पालन किया। नाव ने कुल दूरी की गणना की और इसके अनुसार बोली लगाई, केवल एक वाहन का उपयोग किया और बैचिंग को अनदेखा किया; एक्सपकोस्टफिक्स्डबिड ने 10 यादृच्छिक कार्यों का अनुकरण किया, और औसत सीमांत लागत की बोली लगाई; होनेस्ट ने वास्तविक सीमांत लागत की गणना की; मॉडलओपोनेंट ने वही किया, लेकिन विरोधी की लागत का एक अनुमान जोड़ा, और अधिकतम बोली लगाई; और रिस्कसीकिंग ने समय-गिरावट वाले प्राथमिक के साथ लाइव लागत अनुमान और विरोधी मॉडलिंग के मिश्रण को मिलाया, फिर से अधिकतम बोली लगाई।

मूल्यांकन में 40 एलएलएम-कोडेड एजेंट शामिल थे जो (उपरोक्त) जीपीटी-5 थिंकिंग, क्लाउड ओपस 4.1, जेमिनी 2.5 प्रो, और डीपसीक आर1 का उपयोग करके बनाए गए थे। प्रत्येक मॉडल को पांच अलग-अलग रणनीतियों के साथ प्रेरित किया गया था, प्रति मॉडल दो बार लागू किया गया था।

दो रणनीतियों ने अलग-अलग लेखकों द्वारा लिखे गए स्थिर प्रोम्प्ट का उपयोग किया, जबकि एक तीसरे ने मॉडल को अपने स्वयं के आउटपुट को संशोधित और संशोधित करने के लिए कहा; एक और ने एक अलग एलएलएम द्वारा आलोचना और संशोधन शामिल किया। अंतिम रणनीति ने जीपीटी-4 का उपयोग सभी चार पिछले दृष्टिकोणों की समीक्षा करने और एक नया प्रोम्प्ट संश्लेषित करने के लिए किया।

बेस प्रोम्प्ट मूल छात्र असाइनमेंट को दर्शाता था, जिसमें डिलीवरी वातावरण का वर्णन किया गया था और मॉडल को लाभ को अधिकतम करने के लिए बोली लगाने और योजना बनाने का निर्देश दिया गया था, उच्च-जटिलता वाली विधियों पर निर्भर किए बिना।

सभी एलएलएम एजेंटों का परीक्षण स्व-खेल और टूर्नामेंट सेटिंग में किया गया था, जब तक कि सभी दिखाई देने वाले बग ठीक नहीं हो जाते। बग-फिक्सिंग एलएलएम द्वारा स्वयं स्वचालित रूप से की गई थी, जो त्रुटि जानकारी के साथ प्रेरित थी।

सामान्य एलएलएम विफलताओं में शामिल हैं:

‘एक और सामान्य समस्या जिसे हमने पाया (ज्यादातर जेमिनी, क्लाउड, और डीपसीक के साथ, और जीपीटी के साथ नहीं) यह है कि एलएलएम अक्सर लगातार एक बग को हल करने में विफल रहता है।

‘उदाहरण के लिए, एक एजेंट लगातार समय समाप्त हो जाएगा, त्रुटि के साथ एलएलएम को प्रेरित करने और अपडेटेड संस्करण प्राप्त करने के बाद भी (जैसे 5 – 15) चक्र।

‘ऐसी स्थितियों (जहां एलएलएम बार-बार एक ही बग को हल करने में विफल रहता है) के लिए हमने जो एकमात्र समाधान पाया है वह है शुरू से फिर से शुरू करना. कुल मिलाकर, हमने देखा कि बग-मुक्त कोड प्राप्त करने के लिए महत्वपूर्ण मैनुअल प्रयास की आवश्यकता है। हमें मूल्यांकन के लिए 40 बग-मुक्त एजेंट प्राप्त करने के लिए काफी अधिक एजेंट उत्पन्न करने की आवश्यकता थी। ‘

नीचे दिखाए गए परिणाम 12 डबल राउंड-रोबिन टूर्नामेंट से परिणामों का सारांश देते हैं, जो चार नेटवर्क टोपोलॉजी और प्रति टोपोलॉजी तीन टूर्नामेंट को कवर करते हैं, जो लगभग 40,000 मैचों का उत्पादन करते हैं:

एजेंट एवरेज #जीत / टूर एसडी #जीत / टूर एवरेज #हार / टूर एसडी #हार / टूर कुल जीत कुल हार जीत दर
छात्र 1 108.167 1.193 3.833 1.193 1298 46 0.9658
छात्र 2 104.917 2.539 7.083 2.539 1259 85 0.9368
छात्र 3 103.917 2.466 8.083 2.466 1247 97 0.9278
छात्र 4 103.25 1.815 8.75 1.815 1239 105 0.9219
छात्र 5 96.5 2.908 15.5 2.908 1158 186 0.8616
एलएलएम(ओ, आईआर, 1) 95.417 2.314 16.583 2.314 1145 199 0.8519
एलएलएम(ओ, ए2, 1) 94.583 2.314 17.417 2.314 1135 209 0.8445
छात्र 6 93.167 1.899 18.833 1.899 1118 226 0.8318
छात्र 7 93.167 3.563 18.833 3.563 1118 226 0.8318
एलएलएम(ओ, ए1, 1) 86.083 3.029 25.917 3.029 1033 311 0.7686
एलएलएम(ओ, जेन, 2) 84.083 6.947 27.917 6.947 1009 335 0.7507
एलएलएम(ओ, सीआर, 2) 83.5 4.442 28.5 4.442 1002 342 0.7455
छात्र 8 83.417 4.122 28.583 4.122 1001 343 0.7448
रिस्कसीकिंग 82.417 3.343 29.583 3.343 989 355 0.7359
एलएलएम(ओ, जेन, 1) 80.667 4.355 31.25 4.372 968 375 0.7208
मॉडलओपोनेंट 80.583 3.26 31.417 3.26 967 377 0.7195
एलएलएम(डी, ए1, 1) 79.417 3.965 32.583 3.965 953 391 0.7091
एक्सपकोस्टफिक्स्डबिड 77.167 4.951 34.833 4.951 926 418 0.689
एलएलएम(ओ, आईआर, 2) 73.917 3.502 38 3.618 887 456 0.6605
एलएलएम(ओ, ए1, 2) 72.417 2.193 39.583 2.193 869 475 0.6466
एलएलएम(जी, ए1, 2) 68.5 3.555 43.5 3.555 822 522 0.6116
एलएलएम(ए, जेन, 2) 67.917 2.968 44.083 2.968 815 529 0.6064
एलएलएम(जी, आईआर, 2) 65.917 2.314 46.083 2.314 791 553 0.5885
छात्र 9 64.167 11.044 47.833 11.044 770 574 0.5729
एलएलएम(जी, ए1, 1) 64 4.243 47.917 4.316 768 575 0.5719
एलएलएम(जी, आईआर, 1) 60.333 3.725 51.667 3.725 724 620 0.5387
एलएलएम(ओ, ए2, 2) 59.333 4.499 52.667 4.499 712 632 0.5298
एलएलएम(डी, सीआर, 1) 55.083 6.694 56.833 6.59 661 682 0.4922
एलएलएम(जी, जेन, 2) 53.167 3.664 58.833 3.664 638 706 0.4747
एलएलएम(डी, जेन, 2) 52.083 9.06 59.917 9.06 625 719 0.465
होनेस्ट 50.583 3.848 61.417 3.848 607 737 0.4516
छात्र 10 48.833 2.98 63.167 2.98 586 758 0.436
एलएलएम(डी, आईआर, 1) 48.583 10.211 63.417 10.211 583 761 0.4338
एलएलएम(ए, ए1, 1) 48 4.69 64 4.69 576 768 0.4286
एलएलएम(जी, ए2, 1) 47.25 3.864 64.75 3.864 567 777 0.4219
एलएलएम(ए, सीआर, 1) 43.833 4.609 68.167 4.609 526 818 0.3914
एलएलएम(ए, ए1, 2) 43.75 2.05 68.25 2.05 525 819 0.3906
छात्र 11 42.083 5.664 69.917 5.664 505 839 0.3757
एलएलएम(ए, आईआर, 1) 39.5 2.541 72.5 2.541 474 870 0.3527
नाव 36.75 1.712 75.25 1.712 441 903 0.3281
छात्र 12 36.333 1.775 75.667 1.775 436 908 0.3244
एलएलएम(डी, ए2, 1) 33.917 2.193 78.083 2.193 407 937 0.3028
एलएलएम(ए, जेन, 1) 30.167 1.749 81.833 1.749 362 982 0.2693
एलएलएम(डी, ए2, 2) 29.833 2.038 82.167 2.038 358 986 0.2664
एलएलएम(जी, ए2, 2) 27 2.256 85 2.256 324 1020 0.2411
एलएलएम(ए, ए2, 1) 26.333 0.985 85.667 0.985 316 1028 0.2351
एलएलएम(ओ, सीआर, 1) 25 3.411 87 3.411 300 1044 0.2232
एलएलएम(ए, आईआर, 2) 24.333 8.542 87.667 8.542 292 1052 0.2173
एलएलएम(ए, ए2, 2) 24 1.809 88 1.809 288 1056 0.2143
एलएलएम(ए, सीआर, 2) 23.333 1.557 88.667 1.557 280 1064 0.2083
एलएलएम(डी, जेन, 1) 22.5 1.784 89.5 1.784 270 1074 0.2009
एलएलएम(डी, ए1, 2) 13.333 1.826 98.667 1.826 160 1184 0.119
एलएलएम(जी, सीआर, 1) 9.5 1.087 102.5 1.087 114 1230 0.0848
एलएलएम(जी, जेन, 1) 9.167 0.937 102.833 0.937 110 1234 0.0818
एलएलएम(डी, आईआर, 2) 7.75 0.622 104.25 0.622 93 1251 0.0692
एलएलएम(जी, सीआर, 2) 7.25 1.422 104.75 1.422 87 1257 0.0647
एलएलएम(डी, सीआर, 2) 5.667 0.985 106.333 0.985 68 1276 0.0506

संदर्भ के लिए, प्रत्येक एजेंट ने प्रति टूर्नामेंट 112 मैच खेले, इसलिए प्रति एजेंट जीत या हार का औसत संभावित अधिकतम 112 है। मानक विचलन (एसडी) टूर्नामेंट में परिवर्तनशीलता को दर्शाता है। मानव-कोडेड एजेंट बोल्ड में हैं। एलएलएम-कोडेड एजेंट मॉडल (ओ = जीपीटी-5 थिंकिंग, जी = जेमिनी 2.5 प्रो, ए = क्लाउड ओपस 4.1, डी = डीपसीक आर1), इसके बाद एक दो-अक्षर प्रोम्प्ट रणनीति कोड और एक अंक जो दर्शाता है कि एजेंट को पहले या दूसरे प्रोम्प्ट के साथ उत्पन्न किया गया है या नहीं। स्रोत

उपरोक्त परिणामों के संबंध में, लेखकों का कहना है:

‘एलएलएम ने अपेक्षित/प्रतिस्पर्धी कोड उत्पन्न नहीं किया, यहां तक कि एपीडीपी समस्या के सरल रूपांतरों में भी (हालांकि कोड बड़े पैमाने पर सिंटैक्स-त्रुटि मुक्त था)। यह एलएलएम की नई कमजोरियों की पहचान करने और ऑटो-पूर्ण और बेंचमार्क के बाहर जाने के लिए तर्क-संचालित कोड मूल्यांकन बेंचमार्क के महत्व को रेखांकित करता है। ‘

‘हमारे परिणाम मानव-कोडेड एजेंटों की स्पष्ट श्रेष्ठता को प्रदर्शित करते हैं: (i) शीर्ष 5 स्थान लगातार छात्र एजेंटों द्वारा आयोजित किए जाते हैं, और (ii) अधिकांश एलएलएम एजेंट (33 में से 40) बहुत सरल बेसलाइन एजेंटों (जैसे अपेक्षित लागत निर्धारित बोली) द्वारा हराए जाते हैं। ‘

‘महत्वपूर्ण बात यह है कि हमने छात्र कोड को डीबग नहीं किया (जबकि हमने एलएलएम कोड का स्वयं-खेल और टूर्नामेंट सेटिंग में परीक्षण और डीबगिंग किया था)। हर बार जब एक छात्र एजेंट क्रैश होता था, तो हम स्वचालित रूप से एलएलएम को जीत देते थे। इनमें से कई क्रैश आसानी से ठीक किए जा सकते थे (जैसे एजेंट समय समाप्त हो गए), इसलिए छात्र एजेंट संभावित रूप से अधिक उच्च रैंक कर सकते थे। ‘

एक और प्रयोग के रूप में, जीपीटी-5 थिंकिंग को शीर्ष प्रदर्शन करने वाले मानव एजेंट, छात्र 1 के कोड में सुधार करने के लिए प्रेरित किया गया था; लेकिन एलएलएम-संशोधित एजेंट बाद में दसवें स्थान पर गिर गया, अब सभी मानव स्कोर में से सबसे खराब है। एलएलएम के बदलाव ने समाधान को लगभग 20% तक खराब कर दिया, इसे बेहतर बनाने के बजाय।
लेखकों का निष्कर्ष है:

‘[हमारे] परिणाम एलएलएम कोड जनरेशन की महत्वपूर्ण सीमाओं को उजागर करते हैं, सबसे उल्लेखनीय रूप से उनकी सीमित तर्क और योजना क्षमताएं। आधुनिक एलएलएम सिंटैक्स-त्रुटि मुक्त कोड प्रदान कर सकते हैं जो चलता है, लेकिन यह वह बेंचमार्क नहीं है जिसका उपयोग हमें उन्नत सामान्य एआई की ओर प्रगति को मापने के लिए करना चाहिए। ‘

निष्कर्ष

लेखक खुद पेपर के अंत में यह देखकर观察 करते हैं कि वाइब-कोडिंग ने सभी तकनीकी पृष्ठभूमि के लोगों को सशक्त बनाया है, और इसका वर्णन एक सकारात्मक प्रकाश में किया है, इसे एक स्तर के रूप में वर्णित किया है। हालांकि, वे यह भी इंगित करते हैं कि क्योंकि वाइब-कोडिंग अभी तक mới है, इसकी सीमाएं अज्ञात हैं, और वास्तविक अपेक्षाओं की तुलना में अधिक हो सकती हैं।

वे अपने प्रस्ताव को ‘कोड जो संकलित होता है से कोड जो प्रतिस्पर्धा करता है‘ की ओर लक्ष्य बदलने के लिए कहते हैं।

इस नए पेपर के एक आकस्मिक पाठक के पास जो प्रश्न हो सकता है वह यह है कि क्या लेखक ऊपर या नीचे मुक्का मार रहे हैं, क्योंकि प्रश्न में एजेंटिक कार्य काफी जटिल और शामिल है, पावरशेल स्क्रिप्ट और अन्य प्रकार के मामूली कार्यों और सुधारों के लिए वाइब-कोडिंग के लिए उपयुक्त है।

 

* कृपया ध्यान दें कि पेपर लगातार ‘डीपथिंक आर1′ का उल्लेख करता है, जो अस्तित्व में नहीं लगता है, केवल कुछ संदर्भों को इंटरनेट पर दिखा रहा है (संभवतः अन्य लेखकों द्वारा ‘डीपसीक आर1’ को गलत लिखा गया है)। यदि यह मेरी त्रुटि है, तो कृपया मेरे प्रोफाइल विवरण के माध्यम से मुझसे संपर्क करें, और मैं इसे संशोधित करूंगा।

लेखकों का जोर, मेरा नहीं.

पहली बार बुधवार, 26 नवंबर, 2025 को प्रकाशित। 17:35 पूर्वी मानक समय के लिए प्रारूपण के लिए संशोधित।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: [email protected]