Інструменти ШІ 101

За межами ChatGPT: AI-агент – новий світ працівників

mm
Додайте Unite.AI до бажаних джерел у Google

З появою глибокого навчання, обробки природної мови (NLP) та штучного інтелекту ми перебуваємо в період, коли AI-агенти можуть становити значну частину глобальної робочої сили. Ці AI-агенти, що перевершують чат-ботів та голосові помічники, формують новий парадигму для галузей та нашого повсякденного життя. Але що це означає жити у світі, доповненому цими “працівниками”? Ця стаття глибоко вивчає цю еволюціонуючу ландшафт, оцінюючи наслідки, потенціал та виклики, що лежать попереду.

Короткий огляд: Еволюція AI-працівників

Перед тим, як зрозуміти майбутню революцію, важливо визнати AI-драйвену еволюцію, яка вже відбулася.

  • Традиційні системи обчислення: Від базових алгоритмів обчислення почалася ця подорож. Ці системи могли вирішувати попередньо визначені завдання за допомогою фіксованого набору правил.
  • Чат-боти та ранні голосові помічники: З розвитком технологій змінилися наші інтерфейси. Інструменти, такі як Siri, Cortana та ранні чат-боти, спрощували взаємодію користувача з AI, але мали обмежене розуміння та можливості.
  • Нейронні мережі та глибоке навчання: Нейронні мережі стали поворотним моментом, імітуючи функції людського мозку та еволюціонуючи через досвід. Техніки глибокого навчання ще більше покращили це, дозволяючи здійснювати складну обробку зображень та мовлення.
  • Трансформери та моделі NLP: Введення архітектури трансформерів революціонізувало ландшафт NLP. Системи, такі як ChatGPT від OpenAI, BERT та T5, дозволили здійснити прориви у взаємодії людини з AI. З їхнім глибоким розумінням мови та контексту ці моделі можуть вести значимі розмови, створювати контент та відповідати на складні питання з безпрецедентною точністю.

Вхід AI-агента: більше, ніж просто розмова

Сучасний AI-ландшафт натякає на щось більш розширене, ніж інструменти розмови. AI-агенти, за межами простих чат-функцій, можуть зараз виконувати завдання, навчатися у своєму середовищі, приймати рішення та навіть демонструвати креативність. Вони не просто відповідають на питання; вони розв’язують проблеми.

Традиційні моделі програмного забезпечення працювали на чіткому шляху. Зацікавлені сторони виражали мету програмним менеджерам, які потім розробляли конкретний план. Інженери виконували цей план через рядки коду. Ця “застаріла парадигма” програмної функціональності була чітко визначена, включаючи безліч людських втручань.

AI-агенти, однак, працюють інакше. Агент:

  1. Має мети, яких він намагається досягти.
  2. Може взаємодіяти зі своїм середовищем.
  3. Розробляє план на основі цих спостережень для досягнення своєї мети.
  4. Приймає необхідні дії, коригуючи свій підхід на основі змінного стану середовища.

Що справді відрізняє AI-агентів від традиційних моделей, це їхня здатність автономно створювати крок за кроком план для реалізації мети. По суті, тоді як раніше програміст надавав план, сьогодні AI-агенти вибирають свій шлях.

Розгляньте повсякденний приклад. У традиційному проектуванні програмного забезпечення програма повідомляла б користувачів про просрочені завдання на основі попередньо визначених умов. Розробники встановлювали ці умови на основі специфікацій, наданих менеджером продукту.

У парадигмі AI-агента агент сам визначає, коли та як повідомити користувача. Він оцінює середовище (навички користувача, стан програми) та приймає рішення про найкращий курс дій. Процес таким чином стає більш динамічним, більш у моменті.

ChatGPT позначив відхід від свого традиційного використання завдяки інтеграції плагінів, що дозволило йому використовувати зовнішні інструменти для виконання декількох запитів. Він став раннім проявом концепції агента. Якщо ми розглянемо простий приклад: користувач запитує про погоду в Нью-Йорку, ChatGPT, використовуючи плагіни, міг взаємодіяти з зовнішнім API погоди, інтерпретувати дані та навіть коригувати свій підхід на основі отриманих відповідей.

Поточний ландшафт AI-агентів

Поточний ландшафт AI-агентів

AI-агенти, включаючи Auto-GPT, AgentGPT та BabyAGI, оголошують про нову еру в розширеному AI-універсі. Хоча ChatGPT популяризував генеративний AI за допомогою людського вводу, бачення за AI-агентами полягає в тому, щоб дозволити AI працювати незалежно, рухаючись до цілей з мінімальним людським втручанням. Цей трансформаційний потенціал був підкреслений метеоритним зростанням Auto-GPT, яке зібрало понад 107 000 зірок на GitHub всього за шість тижнів після свого створення, що є безпрецедентним зростанням порівняно з встановленими проектами, такими як пакет даних науки “pandas”.

AI-агенти проти ChatGPT

Багато просунутих AI-агентів, таких як Auto-GPT та BabyAGI, використовують архітектуру GPT. Їх основна увага зосереджена на мінімізації потреби людського втручання у виконанні завдань AI. Описові терміни, такі як “GPT на циклі”, характеризують роботу моделей, таких як AgentGPT та BabyAGI. Вони працюють в ітеративних циклах для кращого розуміння запитів користувача та уточнення своїх виходів. Тим часом Auto-GPT розширює межі далі, включно з доступом до Інтернету та можливістю виконання коду, що суттєво розширює його можливості розв’язування проблем.

Інновації в AI-агентах

  1. Довготривала пам’ять: Традиційні LLM мають обмежену пам’ять, зберігаючи лише недавні сегменти взаємодій. Для комплексних завдань відображення всієї розмови або навіть попередніх розмов стає важливим. Для подолання цього AI-агенти прийняли робочий процес вкладення, перетворюючи текстові розмови в числові масиви, пропонуючи рішення обмежень пам’яті.
  2. Веб-перегляд: Для того, щоб бути в курсі останніх подій, Auto-GPT був озброєний можливістю перегляду веб-сторінок, використовуючи API Google Search. Це викликало дискусії в AI-спільноті щодо обсягу знань AI.
  3. Виконання коду: Окрім генерації коду, Auto-GPT може виконувати як shell-, так і Python-код. Ця безпрецедентна можливість дозволяє йому взаємодіяти з іншими програмами, розширюючи його операційний діапазон.

АРХІТЕКТУРА AI-СИСТЕМИ AUTOGPT, AGENTGPT, LLM, ПАМ'ЯТЬ І ТА ІНШЕ

Діаграма візуалізує архітектуру AI-системи, що працює на основі великої мови та агентів.

  • Вхідні дані: Система приймає дані з різних джерел: прямої команди користувача, структурованих баз даних, веб-контенту та реального часу датчиків середовища.
  • LLM та агенти: У центрі система обробляє ці вхідні дані, співпрацюючи зі спеціалізованими агентами, такими як Auto-GPT для ланцюжків думок, AgentGPT для веб-специфічних завдань, BabyAGI для завдань, орієнтованих на завдання, та HuggingGPT для командної обробки.
  • Вихідні дані: Після обробки інформація перетворюється у формат, зручний для користувача, та потім передується пристроям, які можуть діяти або впливати на зовнішнє середовище.
  • Компоненти пам’яті: Система зберігає інформацію як тимчасово, так і постійно, через короткочасні кеші та довготривалі бази даних.
  • Середовище: Це зовнішнє середовище, яке впливає на датчики та впливається на дії системи.

Розширені AI-агенти: Auto-GPT, BabyAGI та інші

AutoGPT та AgentGPT

Auto-GPT, дитя, випущене на GitHub у березні 2023 року, є генійним Python-застосуванням, яке використовує силу GPT, трансформаційної генеративної моделі OpenAI. Що відрізняє Auto-GPT від його попередників, це його автономність – воно призначене для виконання завдань з мінімальним людським керівництвом і має унікальну можливість самозапуску промптів. Користувачеві просто потрібно визначити загальну мету, і Auto-GPT створює необхідні промпти для досягнення цієї мети, роблячи його потенційно революційним кроком до справжнього штучного загального інтелекту (AGI).

З функціями, що охоплюють Інтернет-з’єднання, управління пам’яттю та можливості зберігання файлів за допомогою GPT-3.5, цей інструмент підходить для виконання широкого спектра завдань, від звичайних, таких як складання електронної пошти, до складних завдань, які зазвичай потребують значно більше людського втручання.

З іншого боку, AgentGPT, також побудований на основі GPT-фреймворку, є користувацьким інтерфейсом, який не вимагає глибоких знань кодування для налаштування та використання. AgentGPT дозволяє користувачам визначати цілі AI, які потім розбиваються на керованих завдання.

AgentGPT AI-агент

AgentGPT UI

Крім того, AgentGPT виділяється своєю універсальністю. Він не обмежується створенням чат-ботів. Платформа розширює свої можливості для створення різних застосунків, таких як боти Discord, та безшовно інтегрується з Auto-GPT. Цей підхід забезпечує те, що навіть ті, хто не має глибоких знань кодування, можуть виконувати завдання, такі як повністю автономне кодування, генерація тексту, переклад мови та розв’язання проблем.

LangChain – це фреймворк, який поєднує великі мови моделей (LLM) з різними інструментами та використовує агентів, часто сприймаються як “боти”, для визначення та виконання конкретних завдань шляхом вибору відповідного інструменту. Ці агенти безшовно інтегруються з зовнішніми ресурсами, тоді як векторна база даних у LangChain зберігає неструктуровані дані, забезпечуючи швидкий доступ до інформації для LLM.

BabyAGI

Тоді є BabyAGI, спрощений, але потужний агент. Щоб зрозуміти можливості BabyAGI, уявіть цифрового менеджера проекту, який автономно створює, організовує та виконує завдання з чітким фокусом на даних цілях. Хоча більшість AI-драйвених платформ обмежені своєю попередньо натренованою знаннями, BabyAGI виділяється своєю здатністю адаптуватися та навчатися з досвіду. Він володіє глибокою можливістю розрізняти відгуки та, як люди, приймати рішення на основі спроб і помилок.

Відзначимо, що основна сила BabyAGI полягає не тільки в його адаптивності, але й у його здатності виконувати код для конкретних цілей. Він сягає в складних галузях, таких як торгівля криптовалютами, робототехніка та автономне водіння, роблячи його універсальним інструментом у багатьох застосуваннях.

BabyAGI завдання-орієнтований автономний агент

https://yoheinakajima.com/task-driven-autonomous-agent-utilizing-gpt-4-pinecone-and-langchain-for-diverse-applications/

Процес можна розділити на три агенти:

  1. Виконавчий агент: Серце системи, цей агент використовує API OpenAI для обробки завдань. За заданою метою та завданням він надсилає промпт до API OpenAI та повертає результати завдань.
  2. Створений агент завдань: Ця функція створює нові завдання на основі попередніх результатів та поточних цілей. Промпт надсилається до API OpenAI, яке повертає потенційні завдання, організовані у вигляді списку словників.
  3. Агент пріоритезації завдань: Останнім етапом є послідовність завдань за пріоритетом. Цей агент використовує API OpenAI для переупорядкування завдань, забезпечуючи те, що найбільш важливі завдання виконуються першими.

У співпраці з мовною моделлю OpenAI BabyAGI використовує можливості Pinecone для контекстно-орієнтованого зберігання та отримання результатів завдань.

Нижче наведено демонстрацію BabyAGI за допомогою цього посилання.

Щоб розпочати, вам потрібно буде дійсний ключ OpenAPI. Для зручності інтерфейс має розділ налаштувань, де можна ввести ключ OpenAPI. Крім того, якщо ви хочете керувати витратами, пам’ятайте, що потрібно встановити обмеження на кількість ітерацій.

Як тільки я налаштував додаток, я зробив маленький експеримент. Я надіслав промпт до BabyAGI: “Створіть лаконічний твіт-ланцюжок, що фокусується на шляху особистісного зростання, торкаючисься етапів, викликів та трансформаційної сили постійного навчання”.

BabyAGI відповів добре продуманим планом. Це не був просто загальний шаблон, а повний план, який свідчив про те, що підлеглий AI справді зрозумів нюанси запиту.

BabyAGI завдання-орієнтований автономний агент

Deepnote AI Copilot

Deepnote AI Copilot змінює динаміку дослідження даних у блокнотах. Але що відрізняє його?

У своєму ядрі Deepnote AI спрямований на підвищення ефективності роботи вчених-даних. Як тільки ви надаєте базову інструкцію, AI розпочинає дію, розробляючи стратегії, виконуючи запити SQL, візуалізуючи дані за допомогою Python та представляючи свої висновки у виразній формі.

Однією з сильних сторін Deepnote AI є його глибоке розуміння вашого робочого простору. Розуміючи схеми інтеграції та файлові системи, він ідеально синхронізує плани виконання з організаційним контекстом, забезпечуючи, щоб його висновки завжди були актуальними.

Deepnote AI виділяється своєю прозорою операцією, забезпечуючи чітке розуміння своїх процесів. Сплетіння коду та виходів забезпечує, щоб його дії завжди були відповідальними та відтворюваними.

CAMEL

CAMEL – це фреймворк, який спрямований на сприяння співпраці між AI-агентами, спрямованої на ефективне виконання завдань з мінімальним людським наглядом.

CAMEL AI-агент

https://github.com/camel-ai/camel

Він розділяє свої операції на два основних типи агентів:

  • AI-агент користувача розкладає інструкції.
  • AI-помічник агента виконує завдання на основі наданих директив.

Однією з амбіцій CAMEL є розгортання складностей думок AI, спрямованих на оптимізацію синергій між декількома агентами. З функціями, такими як рольова гра та інсайтинг-промптінг, він забезпечує, щоб завдання AI ідеально синхронізувалися з людськими цілями.

Симуляція Westworld: життя в AI

Використовуючи натхнення, такі як програмне забезпечення Unity, та адаптовані в Python, симуляція Westworld – це стрибок у симуляції та оптимізації середовищ, де взаємодіють декілька AI-агентів, майже як цифрове суспільство.

Генеративні агенти

Генеративні агенти

Ці агенти не просто цифрові сутності. Вони симулюють правдоподібну поведінку людини, від щоденних рутин до складних соціальних взаємодій. Їх архітектура розширює велику мовну модель для зберігання досвіду, роздумів про нього та застосування його для динамічного планування поведінки.

Симуляційна sandbox-середовище Westworld, що нагадує The Sims, оживляє місто, населене генеративними агентами. Тут користувачі можуть взаємодіяти, спостерігати та спрямовувати цих агентів протягом дня, спостерігаючи за виникненням поведінки та складними соціальними динаміками.

Симуляція Westworld демонструє гармонійне поєднання обчислювальної потужності та людських нюансів. Об’єднуючи великі мовні моделі з динамічними агентськими симуляціями, вона прокладає шлях до створення AI-досвідів, які майже непомітні від реальності.

Висновок

AI-агенти можуть бути надзвичайно універсальними та формують галузі, змінюють робочі процеси та дозволяють досягнення, які раніше здавалися неможливими. Але, як і всі революційні інновації, вони не позбавлені недоліків.

Хоча вони мають силу змінити саму тканину нашого цифрового існування, ці агенти все ще стикаються з певними викликами, деякі з яких є вроджено людськими, такими як розуміння контексту в нюансированих сценаріях або розв’язання проблем, що лежать поза їх навченими наборами даних.

У наступній статті ми глибше вивчимо AutoGPT та GPT-інженерію, розглянувши, як налаштувати та використовувати їх. Крім того, ми дослідимо причини, через які ці AI-агенти іноді зазнають невдач, такі як потрапляння в цикли, серед інших проблем. Тому залишаємось на зв’язку!

Я провів останні п'ять років, занурючись у захопливий світ машинного навчання та глибокого навчання. Моя пристрасть та експертиза привели мене до внеску у понад 50 різних проектів програмної інженерії, з особливим акцентом на AI/ML. Моя тривала цікавість також привела мене до природної обробки мови, галузі, яку я бажаю дослідити далі.