AI 모델 및 플랫폼

LLM이 지능을 재정의하게 만드는 방법

mm
Unite.AI를 Google의 선호 소스에 추가

오래된 속담이 있습니다: 거위처럼 보이고, 거위처럼 헤엄치고, 거위처럼 꽥꽥거린다면, 아마도 그것은 거위일 것입니다. 이 단순한 추론법은 인디애나주의 시인 James Whitcomb Riley와 관련이 있으며 수십 년간 인공지능에 대한 사고를 형성해 왔습니다. 행동만으로 지능을 식별할 수 있다는 생각은 Alan Turing의 유명한 “모방 게임”에 영감을 주었고, 이제는 튜링 테스트라고 합니다.

튜링은 사람이 기계와 다른 인간을 구별할 수 없다면 그 기계를 지능적이라고 볼 수 있다고 말했습니다. 오리 테스트와 튜링 테스트 모두 내부 구조보다 행동이 중요하다고 봅니다. 수십 년 동안 이 관점은 AI 발전을 이끌었지만 LLM이 유창하게 대화하고 인간과 비슷한 방식으로 작업하면서 상황이 달라졌습니다. 이제 질문은 기계가 인간처럼 대화할 수 있느냐가 아니라 그러한 모방이 진정한 지능이냐는 것입니다. 우리처럼 글을 쓰고 추론하고 창작한다면 지능이라고 부를 수 있을까요, 아니면 행동만으로는 부족할까요?

기계 지능의 진화

대규모 언어 모델은 우리가 인공 지능에 대해 생각하는 방식을 바꾸었습니다. 이러한 시스템은 기본적인 텍스트 응답을 생성하는 것에서 시작하여 논리 문제를 해결하고, 컴퓨터 코드를 작성하고, 이야기 초안을 작성하고, 심지어 스크린라이팅과 같은 창의적인 작업을 도울 수 있습니다. 이러한 발전의 핵심은 복잡한 문제를 해결하는 데 필요한 일련의 추론을 수행하는 능력입니다. 이는 사슬 추론이라고 하는 방법입니다. 문제를 작은 부분으로 나누면, LLM은 인간과 유사한 방식으로 복잡한 수학 문제나 논리 퍼즐을 해결할 수 있습니다. 이러한 기능은 MATH나 GSM8K와 같은 고급 벤치마크에서 인간의 성능과 일치하거나 능가하는 성능을 달성할 수 있게 했습니다. 오늘날, LLM은 또한 다중 모달 기능을 갖추고 있습니다. 이미지를 처리하고 의료 스캔을 해석하며 시각 퍼즐과 복잡한 도형을 설명할 수 있습니다. 이제 중요한 질문은 LLM이 인간 행동을 모방할 수 있느냐가 아니라 그 행동이 진정한 이해를 반영하느냐입니다.

인간과 같은 사고의 흔적

LLM의 성공은 우리가 지능을 이해하는 방식을 재정의하고 있습니다. 튜링 테스트에서 제안한 대로, AI의 행동을 인간과 일치시키는 데 초점을 맞추는 대신, LLM이 정보를 처리하는 방식에서 인간과 같은 사고를 반영하는지 탐구하는 데 초점을 맞추고 있습니다. 예를 들어, 최근 연구에서 연구자들은 AI 모델의 내부 작동과 인간 뇌 활동을 비교했습니다. 연구는 70억 개 이상의 매개변수를 갖는 LLM이 인간 수준의 정확도를 달성하고, 인간 뇌 패턴과 일치하는 방식으로 정보를 내부적으로 조직화한다는 것을 발견했습니다.

인간과 AI 모델이 모두 패턴 인식 작업에 참여했을 때, 뇌 스캔은 인간 참가자와 AI 모델의 계산 패턴에서 유사한 활동 패턴을 보여주었습니다. 모델은 추상적인 개념을 내부 계층에서 인간 뇌파 활동과 직접 일치하는 방식으로 클러스터링했습니다. 이것은 성공적인 추론이 생물학적 또는 인공 시스템 모두에서 유사한 조직 구조를 필요로 할 수 있음을 시사합니다.

그러나 연구자들은 이 연구의 한계를 주의합니다. 연구에는 상대적으로 적은 수의 인간 참가자가 참여했으며, 인간과 기계는 작업에 다르게 접근했습니다. 인간은 시각적 패턴을 사용했으며, AI 모델은 텍스트 설명을 처리했습니다. 인간과 기계의 처리 간의 상관관계는 매혹적이지만, 기계가 인간과 같은 방식으로 개념을 이해한다는 것을 증명하지는 않습니다.

분명한 차이도 있습니다. 최고 성능의 AI 모델은 단순한 패턴에서 인간 수준의 정확도에 가까웠지만 가장 복잡한 작업에서는 사람보다 성능이 훨씬 급격히 떨어졌습니다. 구조가 비슷해도 인간과 기계가 어려운 추상 개념을 처리하는 방식에는 근본적 차이가 있을 수 있음을 보여줍니다.

회의적인 관점

이러한 인상적인 결과에도 불구하고 LLM은 매우 능숙한 모방자에 불과하다는 강력한 주장도 있습니다. 이 견해는 철학자 존 설의 “중국어 방” 사고 실험에서 비롯되었습니다. 이 실험은 행동이 이해와 동일하지 않음을 보여줍니다.

시어르는 영어만 nói할 수 있는 사람을 상상하라고 요청합니다. 그 사람은 중국어 기호를 받고 영어 규칙 책을 사용하여 기호를 조작하여 응답을 생성합니다. 방 외부에서 그의 응답은 중국어 사용자와 동일합니다. 그러나 시어르는 그 사람이 중국어를 이해하지 않는다고 주장합니다. 그는 단순히 규칙을 따르는 것입니다.

비평가들은 이 논리를 LLM에 적용합니다. 그들은 이러한 시스템이 “확률적 앵무새”라고 주장합니다. 즉 통계적 패턴에 따라 답을 만드는 것이 아니라 진정한 이해를 바탕으로 응답한다는 뜻입니다. “확률적”은 이들의 확률 기반 특성을, “앵무새”는 모방 행동을 강조합니다.

LLM의 기술적 제한도 이 논리를 뒷받침합니다. LLM은 자주 “환각“을 생성합니다. 즉, 그럴듯하지만 완전히 잘못된 응답을 생성합니다. 이는 통계적으로 가능성이 높은 단어를 선택하여 내부 지식 베이스나 진실과 거짓을 이해하지 않고 응답을 생성하기 때문입니다. 이러한 모델은 또한 인간과 같은 오류와 편향을 재현합니다. 그들은 인간이 쉽게 무시할 수 있는 관련 없는 정보에 혼란을 겪습니다. 또한 그들은 데이터에 포함된 편향을 학습하여 인종적 및 성별에 대한 고정관념을 보여줍니다. 또 다른 중요한 제한은 “위치 편향”입니다. 즉, 긴 문서의 처음 또는 끝에 있는 정보를 과도하게 강조하면서 문서 중간의 내용을 무시하는 것입니다. 이 “중간을 잃어버린” 현상은 이러한 시스템이 정보를 처리하는 방식이 인간과 다르다는 것을 시사합니다.

이러한 제한은 LLM이 언어 패턴을 인식하고 재생산하는 데 탁월하지만, 의미 또는 실제 상황을 진정으로 이해하는 데는 제한이 있음을 강조합니다. 그들은 구문 처리에는 뛰어나지만, 의미론에는 제한이 있습니다.

지능의 정의

논쟁은 결국 지능을 어떻게 정의하느냐에 달려 있습니다. 유창한 언어 생성과 문제 해결, 새로운 상황에 대한 적응이 지능이라면 LLM은 이미 기준을 충족합니다. 그러나 자아 인식과 진정한 이해 또는 주관적 경험이 필요하다면 아직 부족합니다.

이해나 의식 같은 질적 특성을 측정하는 명확하고 객관적인 방법은 없습니다. 인간과 기계 모두 행동을 통해 이런 특성을 추론합니다. 오리 테스트와 튜링 테스트는 한때 훌륭한 답을 제공했지만 LLM 시대에는 충분하지 않을 수 있습니다. 이들의 능력은 지능의 본질을 다시 생각하게 합니다.

결론

LLM은 AI의 지능을 정의하는 방식에 도전합니다. 추론을 모방하고 아이디어를 만들며 한때 인간만 가능하다고 여긴 작업을 수행하지만, 인간다운 사고를 이루는 의식과 현실 세계에 대한 기반은 부족합니다. 이제 우리는 기계가 지능적으로 행동하는지만이 아니라 지능이 실제로 무엇인지 물어야 합니다. 우리처럼 글을 쓰고 추론하고 창작한다면 지능이라고 부를 수 있을까요, 아니면 행동만으로는 부족할까요?

Dr. Tehseen Zia는 COMSATS University Islamabad의 정교수이며, 오스트리아 비엔나 기술대학교에서 인공지능 박사학위를 취득했습니다. 인공지능, 기계학습, 데이터 과학, 컴퓨터 비전을 전문으로 하며, 유명한 과학 저널에 발표된 논문으로 знач적인 기여를 했습니다. Dr. Tehseen은 주요 연구자로서 다양한 산업 프로젝트를 이끌었으며, 인공지능 컨설턴트로도 활동했습니다.