AGI 및 미래 AI
메타GPT: 현재 사용 가능한 최고의 AI 에이전트에 대한 완벽한 가이드
대형 언어 모델(Large Language Models, LLM)을 사용하는 오픈AI는 기업과 사용자 채택이 증가하고 있으며, 현재 월간 수익은 약 8,000만 달러에 달하고 있다. 최근 The Information의 보고서에 따르면, 샌프란시스코 기반의 이 회사는 연간 수익 10억 달러를 달성할 것으로 예상된다.
이전에는 AutoGPT와 GPT-엔지니어링에 대해 살펴보았다. 이들은 복잡한 작업을 자동화하기 위한 초기 오픈 소스 LLM 기반 AI 에이전트이다. 그러나 이러한 시스템은 일관되지 않은 결과, 성능 병목 현상 및 다면적인 요구를 처리하는 데 한계가 있었다. 코드 생성에는 능숙하지만, 그들의 능력은 종종 그곳에서 끝난다. 그들은 PRD 생성, 기술 설계 생성 및 API 인터페이스 프로토 타이핑과 같은 중요한 프로젝트 관리 기능이 없다.
메타GPT는 큰 언어 모델을 사용하는 다중 에이전트 시스템이다. Sirui Hong이 만든 메타GPT는 표준 운영 절차(Standardized Operating Procedures, SOP)를 큰 언어 모델 기반 다중 에이전트 시스템과 결합한다. 이는 복잡한 실제 응용 프로그램에서 효과적인 협력과 작업 분해를 촉진하는 기존 큰 언어 모델의 제한을 깨는 새로운 패러다임이다.
메타GPT의 아키텍처는 두 개의 계층으로 나뉜다: 기초 구성 요소 계층과 협력 계층.
기초 구성 요소 계층은 개별 에이전트 작업에 중점을 두고 시스템 전체 정보 교환을 촉진한다. 이는 핵심 빌딩 블록을 도입한다: 환경, 메모리, 역할, 작업 및 도구. 환경은 공유 작업 공간과 통신 경로를 설정한다. 메모리는 역사적 데이터 아카이브로 작용한다. 역할은 도메인별 전문 지식을 캡슐화한다. 작업은 모듈식 작업을 실행한다. 도구는 공통 서비스를 제공한다. 이 계층은 본质적으로 에이전트의 운영 체제로 작용한다.
협력 계층은 기초 구성 요소 위에 구축되며 개별 에이전트의 협력 노력을 관리하고 간소화한다. 두 가지 메커니즘을 도입한다: 지식 공유 및 워크플로우 캡슐화.
지식 공유는 에이전트를 결합하는 협력적인 글루로 작용한다. 에이전트는 다양한 수준에서 정보를 저장,检索 및 공유할 수 있으므로 중복성을 줄이고 운영 효율성을 향상시킨다.
워크플로우 캡슐화는 표준 운영 절차(SOP)가 발挥作用하는 곳이다. SOP는 작업을 관리 가능한 구성 요소로 분해하는 청사진으로 작용한다. 에이전트는 이러한 하위 작업에 할당되며, 그들의 성과는 표준화된 출력과 일치한다.
메타GPT는 또한 “역할 정의”를 사용하여 다양한 전문 에이전트(예: 제품 관리자, 아키텍트 등)를 시작한다. 이러한 역할은 이름, 프로필, 목표, 제약 조건 및 설명과 같은 주요 속성으로 특징 지어진다.
앵커 에이전트는 이러한 에이전트에게 역할별 지침을 제공한다. 예를 들어, 제품 관리자의 역할은 “효율적으로 성공적인 제품을 생성”이라는 제약 조건으로 초기화될 수 있다. 앵커 에이전트는 에이전트의 행동이 전체적인 목표와 일치하도록 보장하여 성능을 최적화한다.
메타GPT 에이전트는 관찰, 생각, 반성 및 행동할 수 있다. 그들은 특정 행동 함수를 통해 작동한다: _think(), _observe(), _publish_message() 등. 이러한 인지 모델링은 에이전트가 적응하고 진화할 수 있는 능동적인 학습자가 되도록 한다.
메타GPT 에이전트는 다음과 같은 인지 프로세스를 통해 작동한다:
관찰: 에이전트는 환경을 스캔하고 주요 데이터를 메모리에 통합한다.
思考 및 반성: _think() 함수를 통해 역할은 행동을 취하기 전에 의사 결정을 내린다.
방송 메시지: 에이전트는 _publish_message()를 사용하여 현재 작업 상태와 관련된 작업 기록을 공유한다.
지식 침전 및 행동: 에이전트는 수신된 메시지를 평가하고 내부 저장소를 업데이트한 후 다음 조치를 결정한다.
상태 관리: 작업 잠금 및 상태 업데이트와 같은 기능을 통해 역할은 순차적으로 여러 작업을 처리할 수 있으며, 이는 실제 인간 협력의 모방이다.
메타GPT는 코드 검토 메커니즘을 지원한다. 이는 소프트웨어 개발 수명 주기에서 중요한 구성 요소이나, 여러 인기 있는 프레임워크에서 누락되었다. 메타GPT와 에이전트버스(AgentVerse) 모두 코드 검토 기능을 지원하지만, 메타GPT는 사전 컴파일 실행도 통합한다. 이는 초기 오류 감지에 도움이 되며, 결과적으로 코드 품질을 향상시킨다.
수량적 실험은 메타GPT가 거의 모든 시나리오에서 다른 프레임워크를 능가한다는 것을 보여주었다. Pass@1은 프레임워크가 단일 반복에서 정확한 코드를 생성하는 능력의 척도이다. 이 메트릭은 실제 설정에서 프레임워크의 유용성을 더 현실적으로 반영한다. 더 높은 Pass@1 비율은 디버깅이 적고 효율성이 더 높다는 것을 의미하며, 이는 개발 주기와 비용에 직접적인 영향을 미친다. CodeX, CodeT 및 GPT-4와 같은 고급 코드 생성 도구와 비교했을 때, 메타GPT는 모두 능가한다. 프레임워크는 HumanEval 및 MBPP 벤치마크에서 81.7%에서 82.3%의 Pass@1 비율을 달성한다.
메타GPT는 다음과 같은 명령을 사용하여 로컬 시스템에 설치할 수 있다:
NPM 및 Python 설치:
1. NPM 설치 확인: 터미널에서 npm –version을 실행하여 NPM이 설치되어 있는지 확인한다.
2. mermaid-js 설치: 메타GPT의 종속성인 mermaid-js를 설치한다.
3. Python 버전 확인: Python 3.9 이상이 설치되어 있는지 확인한다.
4. 메타GPT 저장소 클론: 메타GPT 깃허브 저장소를 클론한다.
5. 디렉토리 내비게이션: 메타GPT 디렉토리로 이동한다.
6. 설치: Python 설정 스크립트를 실행하여 메타GPT를 설치한다.
도커 설치:
1. 도커 이미지 가져오기: 메타GPT 공식 이미지를 가져온다.
2. 구성 파일 생성: 구성 파일을 생성한다.
3. 컨테이너 실행: 메타GPT 컨테이너를 실행한다.
OpenAI API 키 구성:
1. OpenAI 키 찾기 또는 생성: OpenAI 대시보드에서 API 키를 찾거나 생성한다.
2. API 키 설정: 구성 파일에 API 키를 설정한다.
메타GPT는 다음과 같은 사용 사례를 보여준다:
메타GPT에게 CLI 기반의 가위바위보 게임을 개발하라는 목표를 주었고, 메타GPT는 성공적으로 작업을 수행했다.
메타GPT는 시스템 설계 문서를 마크다운 형식으로 제공했으며, UML 다이어그램을 포함하여 아키텍처 청사진을 제공했다. 또한 API 사양을 포함하여 HTTP 메서드, 엔드포인트, 요청/응답 개체 및 상태 코드를 포함했다.
메타GPT는 다음과 같은 주요 사항을 제공한다:
메타 프로그래밍의 힘: 메타 프로그래밍을 사용하여 메타GPT는 민첩하고 적응 가능한 소프트웨어 프레임워크를 제공한다.
2층 아키텍처: 메타GPT의 기초 및 협력 계층은 에이전트가 협력하여 작동할 수 있는 시너지적인 생태계를 생성한다.
최적화된 코드 검토: 메타GPT는 코드 생성 외에도 사전 컴파일 실행 기능을 제공하여 코드 품질을 향상시킨다.
인지 에이전트: 메타GPT의 지능형 에이전트는 _observe(), _think(), _publish_message()와 같은 인지 기능을 통해 적응하고 진화한다.
설치 및 배포: 메타GPT는 로컬 설치 또는 도커 컨테이너를 통해 쉽게 설치 및 배포할 수 있다.












