사상 리더

그들이 에이전트를 약속했지만 우리가 얻은 것은 정적 체인뿐이었다

mm
Unite.AI를 Google의 선호 소스에 추가

2023년 봄, 세계는 LLM 기반 에이전트의 등장에 흥奮했다. 강력한 데모인 AutoGPTBabyAGI는 LLM이 루프에서 실행되고 다음 동작을 선택하고 결과를 관찰하고 다음 동작을 선택하는 잠재력을 보여주었다(이것은 ReACT 프레임워크로 알려져 있다). 이 새로운 방법은 다중 단계 작업을 자율적으로 수행하는 에이전트를 구동할 것으로 예상되었다. 목표와 도구 세트를 주면 나머지는 처리할 것이다. 2024년 말까지, 풍경은 에이전트와 에이전트 구축 프레임워크로 가득 찰 것이다. 하지만 그들이 약속한 것에 비해 어떻게 측정되는가?

나이브한 ReACT 프레임워크를 사용하는 에이전트가 심각한 제한을uffers한다고 말하는 것이 안전하다. 몇 단계 이상의 작업을 수행하거나 몇 가지 도구 이상을 사용해야 하는 작업을 주면 비참하게 실패할 것이다. 명백한 지연 문제 외에도 작업을 잃어버리거나 지시를 따르지 못하거나 너무 일찍 또는 너무 늦게 중지하거나 각 시도마다 매우 다른 결과를 생성할 것이다. 그리고 놀라운 일이 아니다. ReACT 프레임워크는 예측할 수 없는 LLM의 제한을 단계 수로 합성한다. 그러나 에이전트 구축자들은 실제 사용 사례를 해결하려고 한다. 특히 기업에서 그러한 수준의 성능으로는 할 수 없다. 그들은 복잡한 다중 단계 워크플로우에 대해 신뢰할 수 있고 예측 가능하며 설명 가능한 결과가 필요하다. 그리고 그들은 LLM의 예측할 수 없는 성질을 악화시키지 않고 완화하는 AI 시스템이 필요하다.

那么, 오늘날 기업에서 에이전트는 어떻게 구축되는가? 몇 가지 도구와 몇 단계 이상이 필요한 사용 사례(예: 대화형 RAG)에 대해, 에이전트 구축자는 ReACT의 동적이고 자율적인 약속을 위해 정적 체인 구축에 크게 의존한다. 정적 체인은 특정 사용 사례를 해결하도록 설계된 사전 정의된 체인이다. 이 접근 방식은 전통적인 소프트웨어 공학과 ReACT의 에이전트 약속과遠い 것이다. 그것은 더 높은 수준의 제어와 신뢰성을 달성하지만 자율성과 유연성이 부족하다. 따라서 솔루션은 개발 집중적이고 응용 프로그램이 狭く 환경과 입력 공간의 높은 수준의 변동성을 처리하기에는 너무剛性がある다.

정적 체인 관행은 얼마나 “정적”인지를 다를 수 있다. 일부 체인은 원자 단계를 수행하기 위해 LLM을 사용한다(예: 정보를 추출하거나 텍스트를 요약하거나 메시지를 작성한다). 다른 일부 체인은 런타임에 동적으로 일부 결정도 한다(예: 체인에서 대체 흐름으로 라우팅하거나 단계의 결과를 확인하여 다시 실행해야 하는지 여부를 결정한다). 어느 경우에나, LLM이 솔루션에서 동적 결정에 책임이 있는 경우, 우리는 신뢰성과 자율성 사이의 트레이드오프에 빠지게 된다. 솔루션이 정적일수록 더 신뢰할 수 있고 예측 가능하지만 또한 더 狭く 개발 집중적이다. 솔루션이 동적이고 자율적일수록 더 일반적이고 구축하기 쉽지만 또한 더 신뢰할 수 없고 예측할 수 없다.

이 트레이드오프는 다음 그래픽으로 나타낼 수 있다:

 

이것은 우리에게 다음과 같은 질문을 제기한다. 왜 아직도 상단 우측 사분면에 있는 에이전트 프레임워크를 보지 못하고 있는가? 신뢰성과 자율성을 트레이드오프해야 하는가? ReACT 에이전트의 단순한 인터페이스(목표와 도구 세트를 주고 처리하도록 함) 없이 신뢰성을 희생하지 않고 프레임워크를 얻을 수 없는가?

그答案은 – 우리는 그렇게 할 수 있고, 우리는 그렇게 할 것이다! 그러나 그것을 위해서, 우리는 우리가 모든 것을 잘못하고 있다는 것을 깨달아야 한다. 모든 현재 에이전트 구축 프레임워크는 공통의 결함을 공유한다: LLM을 동적이고 자율적인 구성 요소로 의존한다. 그러나 우리가 놓친 중요한 요소는 – 우리가 자율적이고 신뢰할 수 있는 에이전트를 생성하기 위해 필요한 것은 – 계획 기술이다. 그리고 LLM은 훌륭한 계획자이다.

그러나 먼저, “계획”이란 무엇인가? “계획”이란 원하는 결과를 얻기 위한 대체 동작을 명시적으로 모델링하고 이러한 대체 동작을 예산 제약 하에서 효율적으로 탐색하고 활용하는 능력을 말한다. 계획은 거시적이고 미시적으로 수행되어야 한다. 거시 계획은 작업을 의존적이고 독립적인 단계로 나눈다. 종종 간과되는 것은 원하는 결과를 얻기 위한 단계 수준에서 원하는 결과를 보장하기 위한 미시 계획의 필요성이다. 단일 단계 수준에서 신뢰성을 높이고 보장을 얻기 위해 추론 시간 컴퓨팅을 사용하여 더 많은 요구 사항을 충족하는 결과를 얻을 수 있다. 예를 들어, 의미 검색 쿼리를 여러 번 다시 작성할 수 있다. 주어진 쿼리에 대해 더 많은 컨텍스트를 검색할 수 있다. 더 큰 모델을 사용할 수 있다. LLM에서 더 많은 추론을 얻을 수 있다. 모두 더好的 결과를 선택할 수 있다. 좋은 미시 계획자는 컴퓨팅 및 지연 예산 하에서 추론 시간 컴퓨팅을 효율적으로 사용하여 최상의 결과를 얻을 수 있다. 특정 작업에 필요한 리소스 투자를 조정한다. 그렇게 하면 계획적인 AI 시스템은 LLM의 확률적 성질을 완화하여 단계 수준에서 보장을 얻을 수 있다. 그러한 보장이 없으면, 우리는 심지어 최상의 거시 수준 계획도 훼손할 수 있는 누적 오류 문제로 돌아간다.

그러나 LLM이 계획자로 사용될 수 없는 이유는 무엇인가? 결국, 그들은 높은 수준의 지시를 합리적인 사고 체인 또는 자연어 또는 코드로 정의된 계획으로 번역할 수 있다. 이유는 계획이 그것보다 더 많은 것을 필요로 하기 때문이다. 계획은 원하는 결과를 얻을 수 있는 대체 동작을 모델링할 수 있어야 하며 각 대체 동작의 예상된 유틸리티와 예상된 비용(컴퓨팅 및/또는 지연)을 모델링할 수 있어야 한다. LLM은 사용 가능한 동작의 표현을 생성할 수 있지만 해당 동작의 예상된 유틸리티와 비용을 예측할 수 없다. 예를 들어, 특정 컨텍스트에서 모델 X를 사용하여 답변을 생성하는 것과 모델 Y를 사용하여 답변을 생성하는 것의 예상된 유틸리티와 비용은 무엇인가? 특정 정보를 색인된 문서 코퍼스에서 검색하는 것과 CRM에 대한 API 호출의 예상된 유틸리티는 무엇인가? LLM은 전혀 모른다. 그리고 좋은 이유가 있다 – 이러한 확률적 특성의 역사적 흔적은 야생에서 거의 발견되지 않으며 LLM 훈련 데이터에 포함되지 않는다. 또한 이러한 특성은 일반적인 지식을 얻을 수 있는 LLM과 달리 AI 시스템이 작동할 도구와 데이터 환경에 특정하다. 그리고就算 LLM이 예상된 유틸리티와 비용을 예측할 수 있다 하더라도, 가장 효과적인 동작을 선택하기 위해 그것에 대해推論하는 것은 LLM의 다음 토큰 예측에 의해 신뢰할 수 있게 수행될 수 없다.

그러면 AI 계획 기술에 필요한 누락된 요소는 무엇인가? 우리는 특정 작업과 도구 및 데이터 환경에서 대체 동작과 해당 유틸리티 및 비용 확률을 명시적으로 모델링할 수 있는 계획자 모델이 필요하다. 우리는 이러한 동작과 확률에 대해 모델링하고 推論할 수 있는 계획 정의 언어(PDL)가 필요하다. 우리는 PDL에서 정의된 계획을 결정적으로 효율적으로 실행할 수 있는 실행 엔진이 필요하다.

일부 사람들은 이미 이 약속을 실현하기 위해 열심히 일하고 있다. 그때까지 정적 체인을 계속 구축하라. 그러나 그것을 “에이전트”라고 부르지 마라.

아몬은 2017년에 AI21에 입사하여 다양한 제품 리더십 역할을 수행했습니다. AI21에 입사하기 전에 그는 이스라엘 지역 이니셔티브 NGO의 국제 활동 관리자로 일했습니다. 아몬은 텔아비브 대학교(Lautman 인터디스플린러리 프로그램 для Outstanding Students)에서 법학, 경제학, 역사, 철학을 공부했습니다. 그는 이스라엘 신호 지능 국립 단위(8200)의 섹션 司令官으로 근무했으며 텔아비브 대학교와 하버드 로스쿨에서 두 개의 법학 석사(Law Master) 학위를 가지고 있습니다.