Instrumente IA 101
Dincolo de ChatGPT; Agentul AI: O lume nouă de lucrători

Cu progresele în învățarea profundă, prelucrarea limbajului natural (NLP) și inteligența artificială (AI), ne aflăm într-o perioadă în care agenții AI ar putea forma o parte semnificativă a forței de muncă globale. Acești agenți AI, care depășesc chatbot-urile și asistenții vocali, sunt modelatori ai unui nou paradigme atât pentru industrii, cât și pentru viețile noastre de zi cu zi. Dar ce înseamnă cu adevărat să trăiești într-o lume îmbunătățită de acești “lucrători”? Acest articol explorează în profunzime acest peisaj în evoluție, evaluând implicațiile, potențialul și provocările care se află înainte.
O scurtă recapitulare: Evoluția lucrătorilor AI
Înainte de a înțelege revoluția iminentă, este crucial să recunoaștem evoluția condusă de AI care a avut loc deja.
- Sisteme de calcul tradiționale: De la algoritmii de calcul de bază, călătoria a început. Aceste sisteme puteau rezolva sarcini predefinite folosind un set fix de reguli.
- Chatbot-uri și asistenți vocali timpurii: Pe măsură ce tehnologia a evoluat, au evoluat și interfețele noastre. Unelte precum Siri, Cortana și chatbot-urile timpurii au simplificat interacțiunea utilizator-AI, dar aveau o înțelegere și o capacitate limitate.
- Rețele neuronale și învățare profundă: Rețelele neuronale au marcat un punct de cotitură, imitând funcțiile creierului uman și evoluând prin experiență. Tehnicile de învățare profundă au îmbunătățit și mai mult acest lucru, permițând recunoașterea sofisticată a imaginilor și a vorbirii.
- Arhitecturi de transformatori și modele NLP avansate: Introducerea arhitecturilor de transformatori a revoluționat peisajul NLP. Sisteme precum ChatGPT de la OpenAI, BERT și T5 au permis progrese în comunicarea uman-AI. Cu o înțelegere profundă a limbajului și a contextului, aceste modele pot purta conversații semnificative, pot scrie conținut și pot răspunde la întrebări complexe cu o acuratețe fără precedent.
Intră Agentul AI: Mai mult decât o conversație
Peisajul actual al AI sugerează ceva mai vast decât uneltele de conversație. Agenții AI, dincolo de funcțiile de chat, pot acum efectua sarcini, învăța din mediul lor, lua decizii și chiar poate arăta creativitate. Ei nu mai răspund doar la întrebări; ei rezolvă probleme.
Modelele de software tradiționale funcționau pe o cale clară. Stakeholderii și-au exprimat un obiectiv către managerii de software, care au proiectat apoi un plan specific. Inginerii au executat acest plan prin linii de cod. Acest “paradigm moștenit” al funcționalității software a fost clar, implicând o mulțime de intervenții umane.
Agenții AI, însă, operează diferit. Un agent:
- Are obiective pe care le urmărește.
- Poate interacționa cu mediul său.
- Elaborează un plan bazat pe aceste observații pentru a-și atinge obiectivul.
- Întreprinde acțiuni necesare, ajustându-și abordarea în funcție de starea în schimbare a mediului.
Ceea ce distinge cu adevărat agenții AI de modelele tradiționale este capacitatea lor de a crea autonom un plan pas cu pas pentru a-și atinge obiectivele. În esență, în timp ce mai devreme programatorul furniza planul, agenții AI de astăzi își croiesc drumul.
Să considerăm un exemplu de zi cu zi. În proiectarea software-ului tradițional, un program ar notifica utilizatorii despre sarcini întârziate pe baza unor condiții predefinite. Dezvoltatorii ar stabili aceste condiții pe baza specificațiilor furnizate de managerul de produs.
În paradigma agentului AI, agentul însuși determină când și cum să notifice utilizatorul. El evaluează mediul (obiceiurile utilizatorului, starea aplicației) și decide cea mai bună cursă de acțiune. Procesul devine astfel mai dinamic, mai în momentul respectiv.
ChatGPT a marcat o plecare de la utilizarea sa tradițională prin integrarea de plugin-uri, permițându-i să utilizeze unelte externe pentru a efectua multiple solicitări. A devenit o manifestare timpurie a conceptului de agent. Dacă considerăm un exemplu simplu: un utilizator care solicită informații despre vremea din New York, ChatGPT, folosind plugin-uri, poate interacționa cu un API de vreme extern, interpreta datele și chiar corecta cursul în funcție de răspunsurile primite.
Agenții AI, incluzând Auto-GPT, AgentGPT și BabyAGI, anunță o nouă eră în universul vast al AI. În timp ce ChatGPT a popularizat AI-ul generativ prin necesitatea inputului uman, viziunea din spatele agenților AI este de a permite AI-urilor să funcționeze independent, îndreptându-se spre obiective cu minimă sau deloc intervenție umană. Acest potențial transformator a fost subliniat de ascensiunea meteorică a Auto-GPT, care a obținut peste 107.000 de stele pe GitHub în doar șase săptămâni de la lansare, o creștere fără precedent comparativ cu proiecte stabilite precum pachetul de știință a datelor “pandas”.
Agenții AI vs. ChatGPT
Mulți agenți AI avansați, precum Auto-GPT și BabyAGI, utilizează arhitectura GPT. Obiectivul lor principal este de a minimiza nevoia de intervenție umană în finalizarea sarcinilor AI. Termeni descriptivi precum “GPT pe buclă” caracterizează funcționarea modelelor precum AgentGPT și BabyAGI. Ei operează în cicluri iterative pentru a înțelege mai bine solicitările utilizatorilor și a-și rafina ieșirile. Între timp, Auto-GPT împinge limitele și mai departe, prin incorporarea accesului la internet și a capacităților de executare a codului, extinzându-și semnificativ domeniul de rezolvare a problemelor.
Inovații în agenții AI
- Memorie pe termen lung: Modelele LLM tradiționale au o memorie limitată, reținând doar segmentele recente ale interacțiunilor. Pentru sarcini comprehensive, reamintirea întregii conversații sau chiar a conversațiilor anterioare devine crucială. Pentru a depăși această limitare, agenții AI au adoptat fluxuri de lucru de încorporare, convertind conversații textuale în matrice numerice, oferind o soluție pentru constrângerile de memorie.
- Capacități de navigare pe web: Pentru a rămâne la curent cu evenimentele recente, Auto-GPT a fost dotat cu capacități de navigare pe web, utilizând API-ul de căutare Google. Acest lucru a generat dezbateri în cadrul comunității AI cu privire la sfera cunoștințelor unui AI.
- Executarea codului: Dincolo de generarea codului, Auto-GPT poate executa atât cod shell, cât și cod Python. Această capacitate fără precedent îi permite să interacționeze cu alte software, extinzându-și astfel domeniul de operare.
Diagrama ilustrează arhitectura unui sistem AI alimentat de un model de limbaj mare și agenți.
- Intrări: Sistemul primește date din surse diverse: comenzi directe ale utilizatorilor, baze de date structurate, conținut web și senzori de mediu în timp real.
- LLM & Agenți: La nucleu, LLM-ul procesează aceste intrări, colaborând cu agenți specializați precum
Auto-GPTpentru lanțuri de gândire,AgentGPTpentru sarcini web-specifice,BabyAGIpentru acțiuni specifice sarcinilor șiHuggingGPTpentru procesare în echipă. - Ieșiri: Odată procesate, informațiile sunt transformate într-un format prietenos pentru utilizator și apoi transmise dispozitivelor care pot acționa asupra sau influența mediul extern.
- Componente de memorie: Sistemul reține informații, atât pe termen scurt, cât și pe termen lung, prin cache-uri temporare și baze de date permanente.
- Mediu: Acesta este domeniul extern, care afectează senzorii și este impactat de acțiunile sistemului.
Agenți AI avansați: Auto-GPT, BabyAGI și mai mult
AutoGPT și AgentGPT
AutoGPT, lansat pe GitHub în martie 2023, este o aplicație ingenioasă bazată pe Python care valorifică puterea modelului generativ GPT de la OpenAI. Ceea ce distinge Auto-GPT de predecesorii săi este autonomia sa – este proiectat să efectueze sarcini cu o ghidare umană minimă și are capacitatea unică de a iniția prompturi singur. Utilizatorii trebuie doar să definească un obiectiv general, și Auto-GPT creează prompturile necesare pentru a atinge acel obiectiv, făcându-l un salt potențial revoluționar către o adevărată inteligență artificială generală (AGI).
Cu funcții care se întind de la conectivitatea la internet, gestionarea memoriei și capacitățile de stocare a fișierelor folosind GPT-3.5, acest instrument este capabil să gestioneze o gamă largă de sarcini, de la sarcini convenționale precum redactarea de e-mailuri la sarcini complexe care ar necesita o implicare umană mult mai mare.
Pe de altă parte, AgentGPT, construit și el pe framework-ul GPT, este o interfață centrată pe utilizator care nu necesită o experiență extinsă în codare pentru a fi configurat și utilizat. AgentGPT permite utilizatorilor să definească obiective AI, pe care le divizează apoi în sarcini gestionabile.
În plus, AgentGPT se remarcă prin versatilitate. Nu este limitat la crearea de chatbot-uri. Platforma își extinde capacitățile pentru a crea aplicații diverse, precum bot-uri Discord, și se integrează perfect cu Auto-GPT. Această abordare asigură că chiar și cei fără o experiență extinsă în codare pot efectua sarcini precum codarea complet autonomă, generarea de text, traducerea limbajelor și rezolvarea de probleme.
LangChain este un framework care conectează modelele de limbaj mare (LLM) cu diverse unelte și utilizează agenți, adesea percepuți ca “bot-uri”, pentru a determina și executa sarcini specifice prin alegerea uneltei potrivite. Acești agenți se integrează perfect cu resurse externe, în timp ce o bază de date vectorială în LangChain stochează date nestructurate, facilitând o recuperare rapidă a informațiilor pentru LLM.
BabyAGI
Există și BabyAGI, un agent simplu dar puternic. Pentru a înțelege capacitățile BabyAGI, imaginați-vă un manager de proiect digital care creează, organizează și execută sarcini cu un focus puternic pe obiectivele date. În timp ce majoritatea platformelor AI sunt limitate de cunoștințele lor pre-antrenate, BabyAGI se remarcă prin capacitatea sa de a se adapta și de a învăța din experiențe. El are o capacitate profundă de a discerne feedback-ul și, la fel ca oamenii, ia decizii pe baza încercărilor și erorilor.
În mod deosebit, puterea subiacentă a BabyAGI nu constă doar în adaptabilitatea sa, ci și în capacitatea sa de a rula cod pentru obiective specifice. El strălucește în domenii complexe, precum tranzacționarea cu criptomonede, robotică și conducere autonomă, făcându-l un instrument versatil în multe aplicații.

https://yoheinakajima.com/task-driven-autonomous-agent-utilizing-gpt-4-pinecone-and-langchain-for-diverse-applications/
Procesul poate fi categorisit în trei agenți:
- Agent de execuție: Inima sistemului, acest agent utilizează API-ul OpenAI pentru procesarea sarcinilor. Dat un obiectiv și o sarcină, el trimite prompturi către API-ul OpenAI și recuperează rezultatele sarcinii.
- Agent de creare a sarcinilor: Această funcție creează sarcini noi pe baza rezultatelor anterioare și a obiectivelor curente. Un prompt este trimis către API-ul OpenAI, care returnează sarcini potențiale, organizate sub formă de liste de dicționare.
- Agent de prioritizare a sarcinilor: Faza finală implică ordonarea sarcinilor în funcție de prioritate. Acest agent utilizează API-ul OpenAI pentru a reordona sarcinile, asigurând că cele mai importante sunt executate primul.
În colaborare cu modelul de limbaj OpenAI, BabyAGI utilizează capacitățile Pinecone pentru stocarea și recuperarea rezultatelor sarcinilor în funcție de context.
Mai jos este o demonstrație a BabyAGI folosind acest link.
Pentru a începe, veți avea nevoie de o cheie OpenAPI valabilă. Pentru a facilita accesul, interfața are o secțiune de setări unde cheia OpenAPI poate fi introdusă. De asemenea, dacă doriți să gestionați costurile, este important să setați o limită pentru numărul de iterații.
Îndată ce am configurat aplicația, am efectuat un mic experiment. Am postat un prompt către BabyAGI: “Creează un fir de tweet concis care se concentrează pe călătoria de creștere personală, atingând puncte de reper, provocări și puterea transformatoare a învățării continue”.
BabyAGI a răspuns cu un plan bine gândit. Nu a fost doar un șablon generic, ci o hartă cuprinzătoare care a indicat că AI-ul subiacent a înțeles cu adevărat nuanțele solicitării.
Deepnote AI Copilot
Deepnote AI Copilot reconfigurează dinamica explorării datelor în caiete. Dar ce îl diferențiază?
În esență, Deepnote AI își propune să îmbunătățească fluxul de lucru al oamenilor de știință din domeniul datelor. În momentul în care oferiți o instrucțiune rudimentară, AI-ul intră în acțiune, concepând strategii, executând interogări SQL, vizualizând date folosind Python și prezentând descoperirile sale într-o manieră articulată.
Una dintre puterile Deepnote AI este înțelegerea cuprinzătoare a spațiului de lucru. Prin înțelegerea schemelor de integrare și a sistemelor de fișiere, el aliniază planurile sale de execuție perfect cu contextul organizațional, asigurând că insight-urile sale sunt întotdeauna relevante.
Integrarea AI-ului cu mediul de caiet creează un buclă de feedback unic. El evaluează activ ieșirile codului, făcându-l priceput la autocorectare și asigurându-se că rezultatele sunt consecvente cu obiectivele stabilite.
Deepnote AI se remarcă prin operațiunile sale transparente, oferind perspective clare asupra proceselor sale. Împletirea codului și a ieșirilor sale asigură că acțiunile sale sunt întotdeauna responsabile și reproductibile.
CAMEL
CAMEL este un framework care își propune să promoveze colaborarea între agenții AI, urmărind finalizarea eficientă a sarcinilor cu o supraveghere umană minimă.
El își divide operațiunile în două tipuri principale de agenți:
- Agenții Utilizator AI stabilesc instrucțiuni.
- Agenții Asistenți AI execută sarcini pe baza directivelor furnizate.
Una dintre aspirațiile CAMEL este de a dezvălui complexitățile proceselor de gândire AI, urmărind optimizarea sinergiilor între multiple agenți. Cu funcții precum jocul de roluri și promptarea de inițiere, el asigură că sarcinile AI se aliniază perfect cu obiectivele umane.
Simularea Westworld: Viață în AI
Derivat din inspirații precum software-ul Unity și adaptat în Python, simularea Westworld este un salt în simularea și optimizarea mediilor în care interacționează mulți agenți AI, aproape ca o societate digitală.
Acești agenți nu sunt doar entități digitale. Ei simulează comportamente umane credibile, de la rutine zilnice la interacțiuni sociale complexe. Arhitectura lor extinde un model de limbaj mare pentru a stoca experiențe, a reflecta asupra lor și a le utiliza pentru planificarea comportamentului dinamic.
Mediul de simulare Westworld, asemănător cu The Sims, aduce la viață un oraș populat de agenți generativi. Aici, utilizatorii pot interacționa, observa și ghida acești agenți pe parcursul zilei lor, observând comportamente emergente și dinamici sociale complexe.
Simularea Westworld exemplifică fuziunea armonioasă a puterii de calcul și a nuanțelor umane. Prin îmbinarea modelelor de limbaj mari cu simulările de agenți dinamici, ea deschide calea către crearea de experiențe AI care sunt remarcabil de nedistingibile de realitate.
Concluzie
Agenții AI pot fi incredibil de versatili și sunt modelatori ai industriilor, modificatori ai fluxurilor de lucru și facilitatori ai realizării de fapte care altădată păreau imposibile. Dar, ca și toate inovațiile revoluționare, ei nu sunt lipsiți de imperfecțiuni.
În timp ce au puterea de a rescrie însăși esența existenței noastre digitale, acești agenți se confruntă și cu anumite provocări, unele dintre ele inerent umane, precum înțelegerea contextului în scenarii nuanțate sau abordarea problemelor care se află în afara seturilor lor de date antrenate.
În articolul următor, vom explora mai în profunzime AutoGPT și GPT Engineer, examinând cum să le configurați și să le utilizați. De asemenea, vom explora motivele pentru care acești agenți AI uneori eşuează, precum a cădea în bucle, printre alte probleme. Așa că rămâneți tune!


















