사상 리더
인공지능이 인간처럼 생각할 때: LLM과 에이전트의 마음을 탐험하다

오늘날, LLM과 에이전트는 학습, 분석, 결정하는 방식으로 인간의 마음과 구분되는 선을 모호하게 만들 수 있다. 그들이 구축된 접근 방식은 이미 우리의 인지 과정을 모방하고, 그들의 훈련 규모는 인간의 경험을 수십 배로 초과한다. 이것은 우리가 인간의 능력을 확장하는 도구를 만들고 있는지, 아니면 아직 예측할 수 없는 결과를 가진 새로운 유형의 마음을 창조하고 있는지에 대한 질문을 제기한다.
모델이 어떻게 생각하는가
LLM과 에이전트의 개념을 구별하는 것이 중요하다. 컴퓨터와의 유사성을 댄다면, LLM은 프로세서와 비교할 수 있다. 그러나 에이전트는 전체 시스템이다. 즉, 메인보드와 같은 것으로, 다양한 모듈이 연결된다. 즉, 메모리, 그래픽 카드, 네트워크와 같은 것들이 연결된 전체 시스템이다. 마찬가지로, 에이전트는 하나 이상의 LLM을 포함하는 복잡한 시스템이다. 결정-making 메커니즘과 외부 환경과 상호작용하는 도구가 포함된다.
단일 LLM의 작업을 고려하면, 모든 것이 패턴 매칭으로 귀결된다. 그러나 에이전트가 여러 LLM을 연결하면, 우리는 그것이 “생각”한다고 말할 수 있다. 그러나 이 과정은 여전히 패턴에 기반한다. 에이전트는 모델 간의 상호작용 논리를 구축한다. 예를 들어, 하나의 LLM이 작업을 분석하고, 에이전트는 다른 LLM이 수행해야 할 작업을 결정한다.
인간의 사고도 비슷하게 작동합니다. 우리는 축적된 지식과 패턴에 의존해 적절한 순간에 선택하고 처리한 뒤 결론을 도출합니다. 이 과정을 추론이라고 합니다.
ChatGPT는 인간과 마찬가지로 두 가지 유형의 기억을 가지고 있다. 즉, 단기 기억과 장기 기억이다. 차이점은 인간의 경우 이러한 기억 수준에 대한 접근이 더 복잡하고 항상 선형적이지 않다는 것이다.
단기 기억은 현재 작업중인 정보이다. 인간의 경우, 5분 전에 말한 것을 기억하거나 잊을 수 있다. 그러나 GPT는 항상 자신의 “컨텍스트 창” 내의 모든 것을 고려한다. 이 데이터를 건너뛰거나 무시할 수 없다.
인간의 장기 기억은 항상 활성화되지 않은 기억으로 구성된다. 이러한 기억은 특정 트리거로 인해서만 표면화된다. 예를 들어, 어린 시절의 기억, 외상, 또는 심리학자와의 작업과 같은 경우이다. GPT도 유사한 논리를 가지고 있다. 즉, 정보를 스스로 “회상”하지 않는다. 그러나 특정 명령으로 인해 활성화될 수 있다. 예를 들어, “이 질문을 다시 묻지 마세요” 또는 “항상 정식으로 나를 칭하세요”와 같은 명령이 있다.
저장된 문서도 장기 기억의 한 예입니다. 마케팅 조사 지침을 GPT에 업로드했다고 가정해 보겠습니다. 모델은 이를 기억에 저장할 수 있지만 질문할 때마다 문서를 참조한다는 뜻은 아닙니다. 질문에 문서 내용과 일치하는 키워드가 들어 있을 때 모델이 이를 ‘회상’할 수 있습니다.
이 메커니즘은 RAG(Retrieval-Augmented Generation)라고 하는 접근 방식을 통해 구현된다. 즉, 모델은 관련된 큐를 통해 저장된 정보에 접근할 수 있다.
따라서 모델이 진정으로 기억을 가지고 있다는 것을 말할 수 있다. 그러나 이는 인간의 기억과는 다른, 더 형식화된 논리를 따른다.
인공지능과의 대화가 때때로 치료적이고, 때때로 냉정하고 기계적인 이유
최신 언어 모델은 매우 커서 막대한 양의 데이터와 지식, 맥락을 저장합니다. 이 정보는 클러스터라고 하는 주제별·의미별 영역으로 구성됩니다. 모델은 소설과 과학 논문, YouTube 댓글 등 여러 출처의 자료로 학습합니다.
인공지능과 상호작용할 때 사용자의 질의, 즉 프롬프트는 모델을 특정 클러스터로 안내합니다.
예를 들어 “당신은 뉴욕에서 20년 경력을 쌓은 부동산 변호사입니다. 아파트 구입을 도와주세요”라고 입력하면 모델은 변호사, 뉴욕, 부동산 등 여러 클러스터를 동시에 활성화합니다. 그 결과 실제 전문가와 상담하는 듯한 현실적인 답변을 받게 됩니다.
만약 쿼리가 더 개인적이거나 철학적인 주제와 관련된 경우, 즉, 자기 개발 또는 감정과 같은 경우, 모델은 다른 클러스터로 전환한다. 즉, 심리학, 철학, 또는 내면 작업과 같은 클러스터이다. 이 경우, 모델의 응답은 놀랍게도 인간적이고 심지어 치료적일 수 있다.
하지만 프롬프트가 너무 일반적이거나 모호하면 모델은 클러스터 구조 안에서 “길을 잃고” 기본 응답을 내놓는다고 볼 수 있습니다. 즉 정형화되고 차갑고 감정적 색채가 없는 답변입니다.
인공지능 응답의 스타일과 깊이는 사용자가 모델을 어느 클러스터로 안내하느냐에 달려 있습니다.
모델 훈련의 철학과 RLHF
인공지능에는 다양한 학습 접근 방식이 있다. 이것은 철학보다는 전략이다.
클래식 옵션은 지도 학습이다. 즉, 모델에 질문과 정답을 제공한다. 모델은 올바른 것이라고 간주되는 것을 관찰하고, 이후에 유사한 솔루션을 재현한다.
다른 접근 방식은 RLHF(Reinforcement Learning from Human Feedback)이다. 즉, 모델이 시도하고, 성공적인 행동에 대한 “보상”을 받고, 행동을 조정한다. 점차적으로, 모델은 효과적인 전략을 개발한다.
RLHF는 원료를 완제품으로 만드는 과정과 비교할 수 있다. 편리하게 사용할 수 있는 모델을 만들기 위해서는 인간의 피드백과 함께 대량의 작업이 필요하다.
예를 들어 제가 물건의 이름을 말하지 않고 보여주면 여러분은 “시가 케이스인가? 카드 지갑인가?”라며 망설일 것입니다. 저는 “더 가까워요”, “더 멀어요”, “60% 맞아요” 같은 단서만 줍니다. 이런 과정을 수백 번 반복한 뒤 여러분은 마침내 “아, 지갑이군요”라고 추측합니다.
LLM은 이러한 방식으로 훈련된다. 즉, 인간, 주석자, 전문가가 평가한다. 즉, 이 응답은 좋다, 이 응답은 나쁘다, 점수를 부여한다. Keymakr과 같은 회사들은 높은 품질의 데이터 주석과 검증에 전문적인 회사이다. 이러한 회사들은 이 과정에서 중요한 역할을 한다. 피드백은 또한 일반 사용자로부터 온다. 즉, 좋아요, 불만, 반응과 같은 피드백이다. 모델은 이러한 신호를 해석하고, 행동 패턴을 형성한다.
모델 훈련의 실제
OpenAI의 실험은 강화 학습을 사용하여 에이전트를 훈련하는 생생한 예이다. 즉, “숨고 숨기” 게임이다.
두 팀이 참여했다. 즉, “추적자”와 “숨는 사람”이다. 규칙은 간단했다. 즉, 추적자가 숨는 사람을 잡으면 점수를 얻고, 그렇지 않으면 점수를 잃는다. 초기에, 에이전트는 기본적인 물리적 능력만 가지고 있었다. 즉, 달리기와 점프와 같은 능력이다. 그러나 전략은 미리 정의되지 않았다.
처음에 술래는 무작위로 행동해 상대를 잡는 일이 우연에 가까웠습니다. 하지만 수백만 번 반복하면서 에이전트의 행동이 진화했습니다. 숨는 쪽은 주변 물체로 문을 막고 장벽을 세웠습니다. 이러한 기술은 직접 프로그래밍하지 않았지만 반복적인 시도와 성공 보상을 통해 나타났습니다.
술래는 처음부터 사용할 수 있었지만 무시해 온 점프 기능을 쓰기 시작했습니다. 여러 차례 실패한 뒤 우연히 사용한 점프가 전술적 가치를 드러냈습니다. 그러자 숨는 쪽은 술래의 시야에서 물체를 치우고 더 튼튼한 은신처를 만드는 등 방어 전략을 더욱 복잡하게 발전시켰습니다.
이 실험은 강화 학습을 통해 복잡한 협력적인 행동이 형성될 수 있음을 보여주었다. 즉, 개발자의 개입 없이, 에이전트는 서로 협력하여 행동했다.
이것이 LLM과 에이전트의 가치이다. 즉, RLHF를 통해, 모델은 단순한 텍스트 라이브러리가 아닌, 대화 파트너가 된다. 즉, 적응하고, 자신을 교정하고, 진화할 수 있다.
다음은 무엇인가?
많은 사람들이 LLM과 에이전트의 발전이 바람직하지 않거나 심지어 위험한 결과를 초래할 수 있는지 궁금해한다.
핵심은 오늘날 우리가 보는 것이 아직 MVP조차 아닌 단순한 프로토타입이라는 점입니다.
진짜 혁신은 미래에 있을 것이다. 즉, 미세한 작업과 일상적인 과정의 자동화이다. 즉, 인간은 진정으로 창의적인, 지적인 작업이나 휴식에만 집중할 수 있다.
진짜 혁신은 에이전트를 중심으로 한다. 즉, 독립적으로 생각하고, 행동하고, 결정할 수 있는 시스템이다. 이것이 오늘날 OpenAI, Google, Meta와 같은 회사들이 집중하는 방향이다.
LLM은 기초에 불과합니다. 진정한 미래는 역동적인 세계에서 활동하며 피드백을 받고 변화에 적응하는 에이전트에 있습니다.












