AI 도구 101

차트 밖의 세계: AI 에이전트, 새로운 노동자들의 세계

mm
Unite.AI를 Google의 선호 소스에 추가

딥 러닝, 자연어 처리(NLP), AI의 발전으로 인해 우리는 AI 에이전트가 글로벌 노동력의 중요한 부분을 구성할 수 있는 시대에 살고 있습니다. 이러한 AI 에이전트는 채팅봇과 음성 조작을 넘어서 산업과 우리의 일상生活에 새로운 패러다임을 형성하고 있습니다. 그러나 이러한 “노동자”와 함께 생활하는 것이真正로 의미하는 바는 무엇일까요? 이 기사는 이러한 발전하는 풍경을 깊이 조사하여 앞으로 다가올 함의, 가능성, 그리고 도전을 평가합니다.

AI 노동자의 발전: 간단한 요약

임박한 혁신을 이해하기 전에 이미 발생한 AI 주도적인 발전을 인식하는 것이 중요합니다.

  • 전통적인 컴퓨팅 시스템: 기본적인 컴퓨팅 알고리즘에서 시작된 이 여정은 고정된 규칙 집합을 사용하여 미리 정의된 작업을 해결할 수 있는 시스템이었습니다.
  • 채팅봇 및 초기 음성 조작: 기술이 발전함에 따라 우리의 인터페이스도 발전했습니다. Siri, Cortana, 초기 채팅봇과 같은 도구는 사용자-AI 상호작용을 단순화했지만 이해력과 능력이 제한적이었습니다.
  • 신경망 및 딥 러닝: 신경망은 인간의 뇌 기능을 모방하고 경험을 통해 발전하는 중요한 전환점을 표시했습니다. 딥 러닝 기술은 복잡한 이미지 및 음성 인식을 가능하게 하여 이러한 기능을 더욱 강화했습니다.
  • 트랜스포머 및 고급 NLP 모델: 트랜스포머 아키텍처의 도입은 NLP 풍경을 혁신적으로 변화시켰습니다. OpenAI의 ChatGPT, BERT, T5와 같은 시스템은 인간-AI 통신에서 획기적인 발전을 가능하게 했습니다. 이러한 모델은 언어와 contexto를 깊이 이해할 수 있으며 의미 있는 대화를 나눌 수 있고, 내용을 작성하고, 복잡한 질문에 정확하게 답변할 수 있습니다.

AI 에이전트登場: 대화 이상의 것

오늘날의 AI 풍경은 대화 도구를 넘어서는 무언가에 대한 힌트를 주고 있습니다. AI 에이전트는 채팅 기능 이상의 작업을 수행할 수 있으며 환경에서 학습하고, 결정하고, 창의성을 발휘할 수 있습니다. 그들은 단순히 질문에 답변하는 것이 아니라 문제를 해결합니다.

전통적인 소프트웨어 모델은 명확한 경로를 따랐습니다. 이해 관계자들은 소프트웨어 관리자에게 목표를 표현하고, 관리자는 특정 계획을 설계했습니다. 엔지니어는 이 계획을 코드 라인으로 실행했습니다. 이 ‘레거시 패러다임’은 소프트웨어 기능에 대한 명확한 이해를 제공했으며, 인간의 개입이 많았습니다.

AI 에이전트는 다르게 작동합니다. 에이전트는:

  1. 달성하고자 하는 목표를 가지고 있습니다.
  2. 그의 환경상호작용할 수 있습니다.
  3. 관찰에 기반하여 계획을 수립하여 목표를 달성합니다.
  4. 필요한 작업을 수행하며, 환경의 상태가 변경됨에 따라 그의 접근 방식을 조정합니다.

AI 에이전트를 전통적인 모델과 구분하는真正한 특징은 목표를 달성하기 위한 단계별 계획을 자율적으로 생성할 수 있는 능력입니다. 본질적으로, 이전에는 프로그래머가 계획을 제공했지만, 오늘날의 AI 에이전트는 자신의 경로를 차트합니다.

일상적인 예를 들어 보겠습니다. 전통적인 소프트웨어 설계에서, 프로그램은 미리 정의된 조건에 따라 사용자에게 연체 작업에 대한 알림을 제공했습니다. 개발자들은 제품 관리자가 제공한 사양에 따라 이러한 조건을 설정했습니다.

AI 에이전트 패러다임에서, 에이전트 자체가 사용자에게 알림을 언제 그리고 어떻게 제공할지 결정합니다. 사용자의 습관, 애플리케이션 상태와 같은 환경을 측정하고, 최선의 조치를 결정합니다. 이 프로세스는 더 동적이며, 순간에 더 적합합니다.

ChatGPT는 플러그인을 통합함으로써 전통적인 사용에서 벗어나, 외부 도구를 사용하여 여러 요청을 수행할 수 있게 되었습니다. 이것은 에이전트 개념의 초기 прояв입니다. 간단한 예를 들어, 사용자가 뉴욕의 날씨에 대해 물어본다면, ChatGPT는 플러그인을 사용하여 외부 날씨 API와 상호작용하여 데이터를 해석하고, 받은 응답에 따라 코스를 수정할 수 있습니다.

현재 AI 에이전트 풍경

현재 AI 에이전트 풍경

AI 에이전트,包括 Auto-GPT, AgentGPT, 및 BabyAGI,는 광범위한 AI 우주에서 새로운 시대를 예고하고 있습니다. ChatGPT는 인간의 입력을 요구하는 생성적 AI를 대중화했지만, AI 에이전트의 비전은 인간의 간섭 없이 AI가 독립적으로 작동하도록 하는 것입니다. 이러한 변革적 가능성은 Auto-GPT의 급속한 성장에 의해 강조되었으며, 6주 만에 GitHub에서 107,000개의 별을 받았습니다.

AI 에이전트 vs. ChatGPT

많은 고급 AI 에이전트,例如 Auto-GPT 및 BabyAGI,는 GPT 아키텍처를 사용합니다. 그들의 주요 초점은 AI 작업 완성을 위한 인간의 간섭을 최소화하는 것입니다. “GPT 루프”와 같은 용어는 AgentGPT 및 BabyAGI와 같은 모델의 작동을 특징짓습니다. 그들은 반복적인 주기에서 작업하여 사용자 요청을 더 잘 이해하고 출력을 개선합니다. 한편, Auto-GPT는 인터넷 접근 및 코드 실행 기능을 통합하여 문제 해결 범위를 크게 확장합니다.

AI 에이전트의 혁신

  1. 장기 기억: 전통적인 LLM은 최근 상호작용 세그먼트만 기억합니다. 포괄적인 작업을 위해 전체 대화 또는 이전 대화를 회상하는 것이 중요합니다. 이를 극복하기 위해 AI 에이전트는 임베딩 워크플로우를 채택하여 텍스트 대화를 숫자 배열로 변환하여 메모리 제약을 해결했습니다.
  2. 웹 브라우징 능력: 최근 이벤트를 최신 상태로 유지하기 위해 Auto-GPT는 Google Search API를 사용하여 브라우징 기능을 갖추었습니다. 이것은 AI의 지식 범위에 대한 논쟁을 AI 커뮤니티 내에서 불러일으켰습니다.
  3. 코드 실행: 코드 생성을 넘어서, Auto-GPT는 쉘 및 Python 코드를 실행할 수 있습니다. 이것은 다른 소프트웨어와 인터페이스를 할 수 있게 해주어, 그의 작동 범위를 넓히는 것입니다.

AI 에이전트 아키텍처: Auto-GPT, AgentGPT, LLM, 메모리 등

이 다이어그램은 대형 언어 모델과 에이전트를 사용하는 AI 시스템의 아키텍처를 시각화합니다.

  • 입력: 시스템은 다양한 소스에서 데이터를 받습니다: 직접 사용자 명령, 구조화된 데이터베이스, 웹 콘텐츠, 실시간 환경 센서.
  • LLM & 에이전트: 핵심에서, LLM은 이러한 입력을 처리하며, Auto-GPT와 같은 특수 에이전트와 협력하여 사고 체인을 생성하고, AgentGPT와 같은 웹 관련 작업을 수행하며, BabyAGI와 같은 작업 특정 동작을 수행합니다.
  • 출력: 처리된 정보는 사용자 친화적인 형식으로 변환되어 외부 환경에 영향을 미칠 수 있는 장치에 전달됩니다.
  • 메모리 구성 요소: 시스템은 정보를 일시적으로 및 영구적으로 유지합니다. 이는 단기 캐시와 장기 데이터베이스를 통해 이루어집니다.
  • 환경: 이것은 외부 영역으로, 센서에 영향을 미치고 시스템의 동작에 의해 영향을 받습니다.

고급 AI 에이전트: Auto-GPT, BabyAGI 및 기타

Auto-GPT 및 AgentGPT

Auto-GPT는 2023년 3월에 GitHub에서 공개된 파이썬 기반 응용 프로그램으로, GPT의 힘을 활용합니다. Auto-GPT를 구별하는 것은 그의 자율성입니다. 사용자는 오버아치링 목표만 정의하면, Auto-GPT는 목표를 달성하기 위한 필요한 프롬프트를 생성합니다. 이것은真正한 인공지능 일반 지능(AGI)로의 혁신적인 도약입니다.

인터넷 연결, 메모리 관리, 파일 저장 기능을 포함하여 다양한 작업을 처리할 수 있는 도구입니다. 사용자는 오버아치링 목표만 정의하면, Auto-GPT는 필요한 프롬프트를 생성하여 목표를 달성합니다.

한편, AgentGPT는 사용자 중심의 인터페이스로, 광범위한 코딩 전문 지식 없이 설정하고 사용할 수 있습니다. AgentGPT는 사용자가 AI 목표를 정의할 수 있으며, 이를 작업으로 분해합니다.

AgentGPT AI 에이전트

AgentGPT UI

さらに, AgentGPT는 다양한 응용 프로그램을 생성할 수 있는 능력으로 특징지어집니다. 이것은 디스코드 봇을 생성하고, Auto-GPT와 무리없이 통합할 수 있습니다. 이것은 광범위한 코딩 배경이 없는 사용자도 완전한 자율 코딩, 텍스트 생성, 언어 번역, 문제 해결과 같은 작업을 수행할 수 있게 해줍니다.

LangChain은 대형 언어 모델(LLM)과 다양한 도구를 연결하는 프레임워크로, 에이전트를 사용하여 특정 작업을 결정하고 실행합니다. 이러한 에이전트는 외부 자원과 무리없이 통합되며, LangChain의 벡터 데이터베이스는 비정형 데이터를 저장하여 LLM에 대한 빠른 정보 검색을 가능하게 합니다.

BabyAGI

그런 다음, BabyAGI가 있습니다. BabyAGI의 능력을 이해하기 위해, 디지털 프로젝트 관리자를 상상해 보십시오. 이것은 작업을 자율적으로 생성하고, 조직하고, 실행하며, 주어진 목표에 집중합니다. 대부분의 AI 기반 플랫폼은 사전 훈련된 지식으로 제한되지만, BabyAGI는 경험에서 학습하고, 결정에 대한 피드백을 반영하는 능력으로 특징지어집니다.

특히, BabyAGI의 기본 강점은 그의 적응성과 코드 실행 능력입니다. 이것은 암호화폐 거래, 로봇공학, 자율 주행과 같은 복잡한 도메인에서 탁월한 도구입니다.

BabyAGI 작업 주도 자율 에이전트

https://yoheinakajima.com/task-driven-autonomous-agent-utilizing-gpt-4-pinecone-and-langchain-for-diverse-applications/

이 프로세스는 세 가지 에이전트로 분류될 수 있습니다:

  1. 실행 에이전트: 시스템의 핵심입니다. 이것은 OpenAI의 API를 사용하여 작업을 처리합니다. 목표와 작업이 주어지면, 이것은 OpenAI의 API에 프롬프트를 보내고, 작업 결과를 받습니다.
  2. 작업 생성 에이전트: 이것은 이전 결과와 현재 목표를 기반으로 새로운 작업을 생성합니다. 프롬프트는 OpenAI의 API에 보내지고, 작업 목록으로 구성된 사전을 반환합니다.
  3. 작업 우선순위 에이전트: 마지막 단계는 작업을 우선순위에 따라 순서대로 합니다. 이것은 OpenAI의 API를 사용하여 작업을 재정렬하여 가장 중요한 작업이 먼저 실행되도록 합니다.

BabyAGI는 OpenAI의 언어 모델과 협력하여 Pinecone의 컨텍스트 중심 작업 결과 저장 및 검색을 활용합니다.

아래는 BabyAGI를 사용하는 예시입니다: 이 링크.

시작하기 위해, 유효한 OpenAPI 키가 필요합니다. UI에는 설정 섹션이 있으며, OpenAPI 키를 입력할 수 있습니다. 또한, 비용을 관리하려면 반복 횟수에 대한 제한을 설정하는 것을 기억하세요.

한번에 작은 실험을 해보았습니다. BabyAGI에게 프롬프트를 보냈습니다: “개인 성장의 여정을 강조하는 간결한 트윗 스레드를 작성하세요. 里程碑, 도전, 그리고 지속적인 학습의 변革력에 대해触れてください.”

BabyAGI는 잘 생각된 계획으로 응답했습니다. 이것은 일반적인 템플릿이 아니라, 요청의细節를真正로 이해한 것으로 보이는 포괄적인 로드맵이었습니다.

BabyAGI 작업 주도 자율 에이전트

Deepnote AI Copilot

Deepnote AI Copilot는 노트북에서 데이터 탐색의 역학을 재정의합니다. 하지만, 무엇이 그것을 구별하는가?

그것의 핵심에서, Deepnote AI는 데이터 과학자의 워크플로우를 보완합니다. 사용자가 기본적인 지침을 제공하면, AI는 전략을 수립하고, SQL 쿼리를 실행하고, 데이터를 시각화하며, 그의 발견을 명료하게 제시합니다.

Deepnote AI의 강점 중 하나는 작업 공간에 대한 그의 포괄적인 이해입니다. 통합 스키마와 파일 시스템을 이해함으로써, 그것은 그의 실행 계획을 조직적.context와 완벽하게 일치시킵니다. 이는 그의 통찰력이 항상 관련성이 있음을 보장합니다.

AI의 노트북 매체와의 통합은 유니크한 피드백 루프를 생성합니다. 이것은 코드 출력을 능동적으로 평가하여, 결과가 일관된다는 것을 보장합니다.

Deepnote AI는 그의 프로세스에 대한 투명성을 제공하여, 그의 동작을 명료하게 이해할 수 있습니다. 코드와 출력의 결합은 그의 행동이 항상 책임감 있게 유지됨을 보장합니다.

CAMEL

CAMEL은 AI 에이전트 간의 협력을 촉진하는 프레임워크로, 인간의 간섭을 최소화하여 작업을 효율적으로 완수하는 것을 목표로 합니다.

CAMEL AI 에이전트

https://github.com/camel-ai/camel

이것은 두 가지 주요 에이전트 유형으로 나뉩니다:

  • AI 사용자 에이전트는 지침을 제공합니다.
  • AI 어시스턴트 에이전트는 지침에 따라 작업을 실행합니다.

CAMEL의 하나의 목표는 AI의 사고 과정의 복잡성을 풀어내기 위해, 여러 에이전트 간의 시너지를 최적화하는 것입니다. 롤 플레잉과 인셉션 프롬프팅과 같은 기능을 통해, 이것은 AI 작업이 인간의 목표와 무리없이 일치하도록 합니다.

Westworld Simulation: Life into AI

Unity 소프트웨어에서 영감을 받고 Python으로 적응된 Westworld 시뮬레이션은 다중 AI 에이전트가 상호작용하는 환경을 시뮬레이션하고 최적화하는 것입니다. 이것은 거의 디지털 사회와 같습니다.

제너레이티브 에이전트

제너레이티브 에이전트

이 에이전트들은 단순한 디지털 엔티티가 아닙니다. 그들은 일상적인 루틴에서부터 복잡한 사회적 상호작용까지, 인간의 행동을 시뮬레이션합니다. 그들의 아키텍처는 대형 언어 모델을 확장하여 경험을 저장하고, 반영하고, 동적 행동 계획을 위해 사용합니다.

Westworld의 상호작용 샌드박스 환경은 The Sims를 연상시키며, 사용자와 상호작용할 수 있는 마을을 제너레이티브 에이전트로 채웁니다. 여기서, 사용자는 에이전트를 관찰하고, 그들을 통해 일일生活을 안내하며, 복잡한 사회적 역동성을 관찰할 수 있습니다.

Westworld 시뮬레이션은 계산 능력과 인간적인複雑さ의 조화를 보여줍니다. 대형 언어 모델과 제너레이티브 에이전트 시뮬레이션을 결합하여, 현실과 거의 구별할 수 없는 AI 경험을 만들기 위한 길을 열어줍니다.

결론

AI 에이전트는 매우 다재다능하며, 산업을 형성하고, 워크플로우를 변경하며, 불가능하다고 생각했던 업적을 가능하게 합니다. 그러나, 이러한 혁신적인 발명품은 완벽하지 않습니다.

그들은 디지털 존재의 본질을 재정의할 수 있는 힘을 가지고 있지만, 여전히 인간적인 도전을 겪습니다. 예를 들어, 미묘한 상황에서 컨텍스트를 이해하거나, 훈련 데이터セット 밖의 문제를 해결하는 것과 같은 도전입니다.

다음 기사에서는 Auto-GPT와 GPT 엔지니어에 대해 더 깊이 있게 다룰 것입니다. 우리는 어떻게 설정하고 사용하는지 살펴보고, 이러한 AI 에이전트가 कभ때로 왜 실패하는지, 예를 들어 루프에 갇히는 것과 같은 문제를 조사할 것입니다. 그래서 기다려주세요!

지난 5년 동안私は Machine Learning과 Deep Learning의 매혹적인 세계에 몰두해 왔습니다.私の熱情と専門知識は私を50以上의多様한 소프트웨어 엔지니어링 프로젝트에 기여하게 했으며, 특히 AI/ML에 중점을 두었습니다.私の継続的な 호기심은 또한私를自然어 처리로 끌어들였습니다.私は이 분야를さらに 탐구하기를熱望합니다.