AI 모델 및 플랫폼
의도에서 실행까지: 마이크로소프트가 대규모 언어 모델을 행동 지향형 AI로 변환하는 방법
대규모 언어 모델(Large Language Models, LLM)은 자연어 처리를 다루는 방식을 바꾸었다.它们는 질문에 대답하고, 코드를 작성하고, 대화를 할 수 있다. 그러나 실제 작업에 관해서는 부족하다. 예를 들어, LLM은 자켓을 구매하는 방법을 안내할 수 있지만 직접 주문할 수는 없다. 생각과 행동 사이의 이 간격은 주요한 제한이다. 사람들은 정보만이 아니라 결과를 원한다.
이 간격을 메우기 위해 마이크로소프트는 LLM을 행동 지향형 AI 에이전트로 변환하고 있다. 이를 통해 실제 작업을 효과적으로 관리할 수 있다. 이 변환은 LLM이 할 수 있는 것을 재정의할 수 있으며, 복잡한 워크플로를 자동화하고 일상적인 작업을 단순화하는 도구로 만들 수 있다. 이를 가능하게 하는데 필요한 것과 마이크로소프트가 이 문제를 접근하는 방법을 살펴보자.
LLM이 행동을 취하기 위해 필요한 것
LLM이 실제 작업을 수행하기 위해서는 텍스트를 이해하는 것을 넘어서야 한다. 디지털 및 물리적 환경과 서로 작용하며不断变化하는 조건에 적응해야 한다. 필요한 능력은 다음과 같다:
-
사용자 의도 이해
효과적으로 행동하기 위해 LLM은 사용자 요청을 이해해야 한다. 텍스트 또는 음성 명령과 같은 입력은 종종 모호하거나 불완전하다. 시스템은 지식과 요청의 contexto를 사용하여 빈칸을 채워야 한다. 다단계 대화는 의도를 정제하는 데 도움이 되며, 행동을 취하기 전에 AI가 이해하는 것을 보장한다.
-
의도를 행동으로 전환
작업을 이해한 후, LLM은 이를 행동할 수 있는 단계로 전환해야 한다. 이는 버튼을 클릭하거나 API를 호출하거나 물리적 장치를 제어하는 것을 포함할 수 있다. LLM은 작업에 따라 행동을 수정해야 하며, 환경에 적응하고 문제가 발생할 때 해결해야 한다.
-
변화에 적응
실제 작업은 항상 계획대로 진행되지 않는다. LLM은 문제를 예상하고, 단계를 조정하고, 문제가 발생할 때 대안을 찾아야 한다. 예를 들어, 필요한 자원이 사용할 수 없으면 시스템은 작업을 완료하는 다른 방법을 찾아야 한다. 이 유연성은 프로세스가 변경으로 인해 중단되지 않도록 보장한다.
-
특정 작업에 전문화
LLM은 일반적으로 사용되지만, 특정 작업에 전문화하면 더 효율적이다. 특정 작업에 집중함으로써 이러한 시스템은 더 나은 결과를 더 적은 자원으로 제공할 수 있다. 이는 컴퓨팅 파워가 제한된 장치(예: 스마트폰 또는 임베디드 시스템)에서 특히 중요하다. (MSFT )
이러한 능력을 개발함으로써 LLM은 단순히 정보를 처리하는 것을 넘어서 의미 있는 행동을 취할 수 있다. 이는 AI가 일상적인 워크플로에无缝하게 통합되는 길을 열어준다.
마이크로소프트가 LLM을 변환하는 방법
마이크로소프트의 행동 지향형 AI 생성 접근법은 구조화된 프로세스를 따른다. 주요 목표는 LLM이 명령을 이해하고, 효과적으로 계획하고, 행동을 취하는 것을 가능하게 하는 것이다. 다음과 같이 진행된다:
단계 1: 데이터 수집 및 준비
첫 번째 단계에서는 특정 사용 사례(아래의 UFO 에이전트에 설명됨)와 관련된 데이터를 수집한다. 이 데이터에는 사용자 쿼리, 환경 세부 정보 및 작업 특정 동작이 포함된다. 이 단계에서 두 가지 유형의 데이터가 수집된다. 첫째, 작업 계획 데이터는 LLM이 작업을 완료하는 데 필요한 높은 수준의 단계를 개요하는 데 도움이 된다. 예를 들어, “Word에서 ‘중요’라는 단어를 강조显示”라는 작업은 텍스트를 선택하고 툴바 설정을 조정하는 단계를 포함할 수 있다. 둘째, 작업 동작 데이터는 LLM이 이러한 단계를 구체적인 명령으로 번역하는 것을 가능하게 한다. 예를 들어, 특정 버튼을 클릭하거나 키보드 단축키를 사용하는 것과 같다.
이 조합은 모델에 큰 그림과 자세한 지침이 모두 제공된다.
단계 2: 모델 훈련
데이터가 수집되면 LLM은 여러 훈련 세션을 통해 개선된다. 첫 번째 단계에서는 작업 계획을 위해 LLM을 훈련시킨다. 즉, 사용자 요청을 행동할 수 있는 단계로 분해하는 방법을 가르친다. 전문가가 레이블을 지정한 데이터를 사용하여 이러한 계획을 구체적인 동작으로 번역하는 방법을 가르친다. 문제 해결 능력을 더욱 강화하기 위해 LLM은 자기 강화 탐색 프로세스에 참여하여 해결되지 않은 작업을 해결하고 지속적인 학습을 위한 새로운 예를 생성하는 것을 가능하게 한다. 마지막으로, 강화 학습이 적용되어 성공과 실패에서 피드백을 사용하여 의사 결정 능력을 더욱 개선한다.
단계 3: 오프라인 테스트
훈련 후, 모델은 제어된 환경에서 테스트되어 안정성을 보장한다. 작업 성공률(TSR) 및 단계 성공률(SSR)과 같은 지표가 성능을 측정하는 데 사용된다. 예를 들어, 일정 관리 에이전트를 테스트하는 경우 오류 없이 회의를 예약하고 초대를 보내는 능력을 확인하는 것이 포함된다.
단계 4: 실제 시스템 통합
검증된 모델은 에이전트 프레임워크에 통합된다. 이를 통해 실제 환경과 상호 작용할 수 있다. 예를 들어, 버튼을 클릭하거나 메뉴를 탐색하는 것과 같다. UI 자동화 API와 같은 도구는 시스템이 사용자 인터페이스 요소를 동적으로 식별하고 조작하는 것을 도왔다.
예를 들어, 워드에서 텍스트를 강조显示하는 작업을 수행하는 경우 에이전트는 강조显示 버튼을 식별하고, 텍스트를 선택하고, 서식을 적용한다. 메모리 구성 요소는 LLM이 과거 행동을 추적하는 것을 도와주어 새로운 시나리오에 적응할 수 있다.
단계 5: 실제 테스트
마지막 단계는 온라인 평가이다. 여기서 시스템은 실제 시나리오에서 테스트되어 예상치 못한 변경과 오류를 처리할 수 있는지 확인한다. 예를 들어, 고객 지원 봇이 사용자를 비밀번호 재설정으로 안내하는 동안 잘못된 입력이나 누락된 정보에 대한 적응성을 테스트하는 경우와 같다. 이 테스트는 AI가 강건하고 일상적인 사용에 준비되어 있는지 확인한다.
실제 예: UFO 에이전트
행동 지향형 AI가 어떻게 작동하는지 보여주기 위해 마이크로소프트는 UFO 에이전트를 개발했다. 이 시스템은 윈도우 환경에서 실제 작업을 수행하도록 설계되었으며, 사용자 요청을 완료된 작업으로 전환한다.
UFO 에이전트의 핵심은 LLM을 사용하여 요청을 해석하고 행동을 계획하는 것이다. 예를 들어, 사용자가 “이 문서에서 ‘중요’라는 단어를 강조显示”라고 말하면 에이전트는 워드와 상호 작용하여 작업을 완료한다. 사용자 인터페이스 요소의 위치와 같은 환경 정보를 수집하여 행동을 계획하고 실행한다.
UFO 에이전트는 윈도우 UI 자동화(UIA) API와 같은 도구에 의존한다. 이 API는 응용 프로그램을 제어 요소(예: 버튼 또는 메뉴)로 스캔한다. “문서를 PDF로 저장”과 같은 작업의 경우 에이전트는 “파일” 버튼을 식별하고, “다른 이름으로 저장” 옵션을 찾고, 필요한 단계를 수행한다. 데이터를 일관되게 구조화함으로써 시스템은 훈련에서 실제 적용까지 원활한 작동을 보장한다.
도전 사항 극복
이 진전은 흥미롭지만, 행동 지향형 AI를 생성하는 것은 도전을 수반한다. 확장성은 주요 문제이다. 다양한 작업에 걸쳐 이러한 모델을 훈련하고 배포하는 것은 상당한 자원을 필요로 한다. 안전성과 신뢰성을 보장하는 것도 중요하다. 특히 민감한 환경에서 모델은 의도하지 않은 결과 없이 작업을 수행해야 한다. 또한 이러한 시스템이 개인 데이터와 상호 작용하기 때문에, 개인 정보 보호와 보안에 대한 윤리적 기준을 유지하는 것도 중요하다.
마이크로소프트의 로드맵은 효율성을 개선하고, 사용 사례를 확대하며, 윤리적 기준을 유지하는 데 중점을 두고 있다. 이러한 발전으로 인해 LLM은 세계와 상호 작용하는 방식을 재정의할 수 있으며, 더 실제적이고, 적응 가능하며, 행동 지향형으로 만들 수 있다.
AI의 미래
LLM을 행동 지향형 에이전트로 변환하는 것은 게임 체인저가 될 수 있다. 이러한 시스템은 작업을 자동화하고, 워크플로를 단순화하며, 기술을 더 접근하기 쉽게 만들 수 있다. 마이크로소프트의 행동 지향형 AI와 UFO 에이전트와 같은 도구에 대한 작업은 시작에 불과하다. AI가 계속 진화함에 따라, 더 지능적이고, 능력 있는 시스템을 기대할 수 있다. 이러한 시스템은 단순히 우리와 상호 작용하는 것이 아니라, 작업을 수행한다.












