사상 리더

인공지능이 인간처럼 생각할 때: LLM과 에이전트의 마음을 탐험하다

mm
Unite.AI를 Google의 선호 소스에 추가

오늘날, LLM과 에이전트는 학습, 분석, 결정하는 방식으로 인간의 마음과 구분되는 선을 모호하게 만들 수 있다. 그들이 구축된 접근 방식은 이미 우리의 인지 과정을 모방하고, 그들의 훈련 규모는 인간의 경험을 수십 배로 초과한다. 이것은 우리가 인간의 능력을 확장하는 도구를 만들고 있는지, 아니면 아직 예측할 수 없는 결과를 가진 새로운 유형의 마음을 창조하고 있는지에 대한 질문을 제기한다.

모델이 어떻게 생각하는가

LLM과 에이전트의 개념을 구별하는 것이 중요하다. 컴퓨터와의 유사성을 댄다면, LLM은 프로세서와 비교할 수 있다. 그러나 에이전트는 전체 시스템이다. 즉, 메인보드와 같은 것으로, 다양한 모듈이 연결된다. 즉, 메모리, 그래픽 카드, 네트워크와 같은 것들이 연결된 전체 시스템이다. 마찬가지로, 에이전트는 하나 이상의 LLM을 포함하는 복잡한 시스템이다. 결정-making 메커니즘과 외부 환경과 상호작용하는 도구가 포함된다.

단일 LLM의 작업을 고려하면, 모든 것이 패턴 매칭으로 귀결된다. 그러나 에이전트가 여러 LLM을 연결하면, 우리는 그것이 “생각”한다고 말할 수 있다. 그러나 이 과정은 여전히 패턴에 기반한다. 에이전트는 모델 간의 상호작용 논리를 구축한다. 예를 들어, 하나의 LLM이 작업을 분석하고, 에이전트는 다른 LLM이 수행해야 할 작업을 결정한다.

인간의 생각은 유사한 방식으로 작동한다. 우리는 축적된 지식과 패턴을頼み, 적절한 시점에 선택하고, 처리하고, 결론을 도출한다. 이 과정을 추론이라고 한다.

ChatGPT는 인간과 마찬가지로 두 가지 유형의 기억을 가지고 있다. 즉, 단기 기억과 장기 기억이다. 차이점은 인간의 경우 이러한 기억 수준에 대한 접근이 더 복잡하고 항상 선형적이지 않다는 것이다.

단기 기억은 현재 작업중인 정보이다. 인간의 경우, 5분 전에 말한 것을 기억하거나 잊을 수 있다. 그러나 GPT는 항상 자신의 “컨텍스트 창” 내의 모든 것을 고려한다. 이 데이터를 건너뛰거나 무시할 수 없다.

인간의 장기 기억은 항상 활성화되지 않은 기억으로 구성된다. 이러한 기억은 특정 트리거로 인해만 표면화된다. 예를 들어, 어린 시절의 기억, 외상, 또는 심리학자와의 작업과 같은 경우이다. GPT도 유사한 논리를 가지고 있다. 즉, 정보를 스스로 “회상”하지 않는다. 그러나 특정 명령으로 인해 활성화될 수 있다. 예를 들어, “이 질문을 다시 묻지 마세요” 또는 “항상正式하게 나를称하세요”와 같은 명령이 있다.

또 다른 장기 기억의 예는 저장된 문서이다.假设您将 마케팅 연구 지침을 GPT에 업로드했다. 모델은 이를 기억에 저장할 수 있다. 그러나 이것은 모델이 매 질문마다 이 문서를 참조한다는 것을 의미하지 않는다. 질문이 문서의 텍스트와 일치하는 키워드를 포함하는 경우, 모델은 이를 “회상”할 수 있다.

이 메커니즘은 RAG(Retrieval-Augmented Generation)라고 하는 접근 방식을 통해 구현된다. 즉, 모델은 관련된 큐를 통해 저장된 정보에 접근할 수 있다.

따라서 모델이真正로 기억을 가지고 있다는 것을 말할 수 있다. 그러나 이는 인간의 기억과는 다른, 더 형식화된 논리를 따른다.

인공지능과의 대화가 때때로 치료적이고, 때때로 냉정하고 기계적인 이유

최신 언어 모델은 매우 크다. 즉,大量의 데이터, 지식, 컨텍스트를 저장한다. 이러한 모든 정보는 클러스터라고 하는 주제적 및 의미적 영역으로 구성된다. 모델은 다양한 출처에서 훈련되었다. 즉, 소설, 과학적 文章, 유튜브 댓글과 같은 것들이다.

인공지능과 상호작용할 때,您的 쿼리(프롬프트)는 모델을 특정 클러스터로 направляет.

예를 들어, “뉴욕의 20년 경력의 부동산 변호사입니다. 아파트를 사는 데 도와주세요”라고 작성하면, 모델은 여러 클러스터를 동시에 활성화한다. 즉, 변호사 → 뉴욕 → 부동산과 같은 클러스터이다. 결과적으로,您는 현실적인 응답을 받는다. 즉, 실제 전문가와 상담하는 것과 같은 느낌을 받는다.

만약 쿼리가 더 개인적이거나 철학적인 주제와 관련된 경우, 즉, 자기 개발 또는 감정과 같은 경우, 모델은 다른 클러스터로 전환한다. 즉, 심리학, 철학, 또는 내면 작업과 같은 클러스터이다. 이 경우, 모델의 응답은 놀랍게도 인간적이고 심지어 치료적일 수 있다.

그러나 너무 일반적이거나 모호한 프롬프트의 경우, 모델은 클러스터 구조에서 “길을 잃는다”고 nói할 수 있다. 즉, 기본 응답을 제공한다. 즉, 정형화된, 냉정한, 감정적인 색彩가 없는 응답이다.

인공지능의 응답 스타일과 깊이는您가 모델을 어느 클러스터로 направ하는지에 달려 있다.

모델 훈련의 철학과 RLHF

인공지능에는 다양한 학습 접근 방식이 있다. 이것은 철학보다는 전략이다.

클래식 옵션은 지도 학습이다. 즉, 모델에 질문과 정답을 제공한다. 모델은 올바른 것이라고 간주되는 것을 관찰하고, 이후에 유사한 솔루션을 재현한다.

다른 접근 방식은 RLHF(Reinforcement Learning from Human Feedback)이다. 즉, 모델이 시도하고, 성공적인 행동에 대한 “보상”을 받고, 행동을 조정한다. 점차적으로, 모델은 효과적인 전략을 개발한다.

RLHF는 원료를 완제품으로 만드는 과정과 비교할 수 있다. 편리하게 사용할 수 있는 모델을 만들기 위해서는 인간의 피드백과 함께大量의 작업이 필요하다.

예를 들어, 나는您에게 직접 이름을 명시하지 않고 객체를 보여준다.您는 주저한다. “それは 시가ケース인가? 카드 홀더인가?” 나는 只_hint를 제공한다. “더 가깝게”, “더 멀리”, “60% 예스”와 같은 힌트이다. 수백 번의 이러한 반복之后,您는 추측한다. “아, 그것은 지갑이다”라고.

LLM은 이러한 방식으로 훈련된다. 즉, 인간, 주석자, 전문가가 평가한다. 즉, 이 응답은 좋다, 이 응답은 나쁘다, 점수를 부여한다. Keymakr과 같은 회사들은 높은 품질의 데이터 주석과 검증에 전문적인 회사이다. 이러한 회사들은 이 과정에서 중요한 역할을 한다. 피드백은 또한 일반 사용자로부터 온다. 즉, 좋아요, 불만, 반응과 같은 피드백이다. 모델은 이러한 신호를 해석하고, 행동 패턴을 형성한다.

모델 훈련의 실제

OpenAI의 실험은 강화 학습을 사용하여 에이전트를 훈련하는 생생한 예이다. 즉, “숨고 숨기” 게임이다.

두 팀이 참여했다. 즉, “추적자”와 “숨는 사람”이다. 규칙은 간단했다. 즉, 추적자가 숨는 사람을 잡으면 점수를 얻고, 그렇지 않으면 점수를 잃는다. 초기에, 에이전트는 기본적인 물리적 능력만 가지고 있었다. 즉, 달리기와 점프와 같은 능력이다. 그러나 전략은 미리 정의되지 않았다.

초기에, 추적자는 무작위적으로 행동했다. 즉, 상대방을 잡는 것은 우연이었다. 그러나 수백만 번의 반복之后, 에이전트의 행동이 진화했다. 숨는 사람들은 주변 객체를 사용하여 문을 막고, 장벽을 구축했다. 이러한 기술은 직접 프로그래밍 없이, 반복적인 시도와 성공에 대한 보상으로부터 나타났다.

추적자는 점프를 사용하기 시작했다. 즉, 초기에 उपलब했던 능력이다. 그러나 이전에는 무시되었다. 여러 번의 실패之后, 무작위적인 점프 사용이 그들의 전술적 가치를 보여주었다. 이후, 숨는 사람들은 방어를 더욱 복잡하게 만들었다. 즉, 추적자의 시야에서 객체를 제거하고, 더 강력한 은신처를 구축했다.

이 실험은 강화 학습을 통해 복잡한 협력적인 행동이 형성될 수 있음을 보여주었다. 즉, 개발자의 개입 없이, 에이전트는 서로 협력하여 행동했다.

이것이 LLM과 에이전트의 가치이다. 즉, RLHF를 통해, 모델은 단순한 텍스트 라이브러리가 아닌, 대화 파트너가 된다. 즉, 적응하고, 자신을 교정하고, 진화할 수 있다.

다음은 무엇인가?

많은 사람들이 LLM과 에이전트의 발전이 바람직하지 않거나 심지어 위험한 결과를 초래할 수 있는지 궁금해한다.

중요한 것은 오늘날 우리가 보는 것이 아직 MVP도 아닌, 단순한 프로토タイプ라는 것이다.

진짜 혁신은 미래에 있을 것이다. 즉, 미세한 작업과 일상적인 과정의 자동화이다. 즉, 인간은真正로 창의적인, 지적인 작업이나 휴식에만 집중할 수 있다.

진짜 혁신은 에이전트를 중심으로 한다. 즉, 독립적으로 생각하고, 행동하고, 결정할 수 있는 시스템이다. 이것이 오늘날 OpenAI, Google, Meta와 같은 회사들이 집중하는 방향이다.

LLM은 단순한 기초이다.真正의 미래는 동적인 세계에서 살고, 피드백을 받고, 변화에 적응하는 에이전트에 있다.

마이클 아브라모프는 인트로스펙터(Introspector)의 창립자이자 CEO로, 15년 이상의 소프트웨어 엔지니어링 및 컴퓨터 비전 AI 시스템 경험을 바탕으로 기업급 레이블링 툴을 개발하고 있습니다.

마이클은 소프트웨어 엔지니어 및 연구개발 책임자로 경력을 시작하여 확장 가능한 데이터 시스템을 구축하고 교차기능 엔지니어 팀을 관리했습니다. 2025년까지 그는 데이터 레이블링 서비스 회사인 키마크르(Keymakr)의 CEO로 재직하며 인간-인-루프 워크플로, 고급 QA 시스템, 대규모 컴퓨터 비전 및 자율주행 데이터 요구를 지원하기 위한 맞춤형 툴링을 개척했습니다.

그는 컴퓨터 과학 학사 학위를 가지고 있으며 엔지니어링 및 창의적 예술을 배경으로 어려운 문제를 해결하는 데 다학제적 렌즈를 제공합니다. 마이클은 기술 혁신, 전략적 제품 리더십, 실제 영향의 교차로에서 살며 자율 시스템 및 지능형 자동화의 다음 전선을 앞으로 추진하고 있습니다.