AI 모델 및 플랫폼
LLM이 지능을 재정의하게 만드는 방법
오래된 속담이 있습니다: 거위처럼 보이고, 거위처럼 헤엄치고, 거위처럼 꽥꽥거린다면, 아마도 그것은 거위일 것입니다. 이 간단한 추론 방식은 인디애나 시인 제임스 휘트콤 라일리와 관련이 있으며, 수십 년 동안 인공 지능에 대한 우리의 생각을 형성해 왔습니다. 행동이 지능을 식별하는 데 충분하다는 아이디어는 앨런 튜링의 유명한 “모방 게임”을启發했으며, 이제는 튜링 테스트라고 합니다.
튜링은 인간이 기계와 다른 인간을 구별할 수 없다면, 그 기계는 지능이 있다고 말했습니다. 오리 테스트와 튜링 테스트는 모두 시스템 내부가 아니라 시스템의 행동이 중요하다는 것을 시사합니다. 수십 년 동안 이 테스트는 인공 지능의 발전에指导했습니다. 그러나 대규모 언어 모델(LLM)의 도착으로 상황이 바뀌었습니다. 이러한 시스템은 유창한 텍스트를 생성하고, 대화하고, 인간과 유사한 방식으로 작업을 수행할 수 있습니다. 이제 질문은 기계가 인간과 같은 대화를 할 수 있는지 여부가 아니라, 이러한 모방이真正의 지능인지 여부입니다. 시스템이 우리처럼 글을 쓸 수 있고, 우리처럼 추론할 수 있고, 우리처럼 창의할 수 있다면, 그것을 지능이라고 부를 수 있습니까? 또는 행동만으로 지능을 측정하는 데 충분하지 않은가요?
기계 지능의 진화
대규모 언어 모델은 우리가 인공 지능에 대해 생각하는 방식을 바꾸었습니다. 이러한 시스템은 기본적인 텍스트 응답을 생성하는 것에서 시작하여 논리 문제를 해결하고, 컴퓨터 코드를 작성하고, 이야기 초안을 작성하고, 심지어 스크린라이팅과 같은 창의적인 작업을 도울 수 있습니다. 이러한 발전의 핵심은 복잡한 문제를 해결하는 데 필요한 일련의 추론을 수행하는 능력입니다. 이는 사슬 추론이라고 하는 방법입니다. 문제를 작은 부분으로 나누면, LLM은 인간과 유사한 방식으로 복잡한 수학 문제나 논리 퍼즐을 해결할 수 있습니다. 이러한 기능은 MATH나 GSM8K와 같은 고급 벤치마크에서 인간의 성능과 일치하거나 능가하는 성능을 달성할 수 있게 했습니다. 오늘날, LLM은 또한 다중 모달 기능을 갖추고 있습니다. 이미지와 함께 작동할 수 있고, 의료 스캔을 해석하고, 시각적 퍼즐을 설명하고, 복잡한 도형을 설명할 수 있습니다. 이러한 발전으로 인해, 이제는 LLM이 인간의 행동을 모방할 수 있는지 여부가 아니라, 이러한 행동이真正의 이해를 반영하는지 여부를 묻는 것이 중요합니다.
인간과 같은 사고의 흔적
LLM의 성공은 우리가 지능을 이해하는 방식을 재정의하고 있습니다. 튜링 테스트에서 제안한 대로, AI의 행동을 인간과 일치시키는 데 초점을 맞추는 대신, LLM이 정보를 처리하는 방식에서 인간과 같은 사고를 반영하는지 탐구하는 데 초점을 맞추고 있습니다. 예를 들어, 최근 연구에서 연구자들은 AI 모델의 내부 작동과 인간 뇌 활동을 비교했습니다. 연구는 70억 개 이상의 매개변수를 갖는 LLM이 인간 수준의 정확도를 달성하고, 인간 뇌 패턴과 일치하는 방식으로 정보를 내부적으로 조직화한다는 것을 발견했습니다.
인간과 AI 모델이 모두 패턴 인식 작업에 참여했을 때, 뇌 스캔은 인간 참가자와 AI 모델의 계산 패턴에서 유사한 활동 패턴을 보여주었습니다. 모델은 추상적인 개념을 내부 계층에서 인간 뇌파 활동과 직접 일치하는 방식으로 클러스터링했습니다. 이것은 성공적인 추론이 생물학적 또는 인공 시스템 모두에서 유사한 조직 구조를 필요로 할 수 있음을 시사합니다.
그러나 연구자들은 이 연구의 한계를 주의합니다. 연구에는 상대적으로 적은 수의 인간 참가자가 참여했으며, 인간과 기계는 작업에 다르게 접근했습니다. 인간은 시각적 패턴을 사용했으며, AI 모델은 텍스트 설명을 처리했습니다. 인간과 기계의 처리 간의 상관관계는 매혹적이지만, 기계가 인간과 같은 방식으로 개념을 이해한다는 것을 증명하지는 않습니다.
명확한 차이점도 있습니다. 가장 좋은 AI 모델은 단순한 패턴에서 인간 수준의 정확도에 근접했지만, 가장 복잡한 작업에서 인간 참가자보다 훨씬 더剧적인 성능 저하를 보였습니다. 이것은 유사한 조직 구조에도 불구하고, 인간과 기계가 어려운 추상적인 개념을 처리하는 방식에 근본적인 차이가 있을 수 있음을 시사합니다.
회의적인 관점
이러한 인상적인 발견에도 불구하고, 강한 논증은 LLM이 단순히 매우熟練한 모방꾼이라고 주장합니다. 이 관점은 철학자 존 시어ルの “중국어 방” 사고 실험에서 비롯되었습니다. 이 실험은 행동이 이해와 동일하지 않음을 보여줍니다.
시어르는 영어만 nói할 수 있는 사람을 상상하라고 요청합니다. 그 사람은 중국어 기호를 받고 영어 규칙 책을 사용하여 기호를 조작하여 응답을 생성합니다. 방 외부에서 그의 응답은 중국어 사용자와 동일합니다. 그러나 시어르는 그 사람이 중국어를 이해하지 않는다고 주장합니다. 그는 단순히 규칙을 따르는 것입니다.
비평가들은 이 논리를 LLM에 적용합니다. 그들은 이러한 시스템이 “확률적 앵무새“라고 주장합니다. 즉, 통계적 패턴에 따라 응답을 생성하는 것이 아니라真正의 이해를 기반으로 응답을 생성한다는 것입니다. “확률적”이라는 용어는 그들의 확률적 성질을 강조하며, “앵무새”라는 용어는 그들의 모방 행동을 강조합니다.
LLM의 기술적 제한도 이 논리를 뒷받침합니다. LLM은 자주 “환각“을 생성합니다. 즉, 그럴듯하지만 완전히 잘못된 응답을 생성합니다. 이는 통계적으로 가능성이 높은 단어를 선택하여 내부 지식 베이스나 진실과 거짓을 이해하지 않고 응답을 생성하기 때문입니다. 이러한 모델은 또한 인간과 같은 오류와 편향을 재현합니다. 그들은 인간이 쉽게 무시할 수 있는 관련 없는 정보에 혼란을 겪습니다. 또한 그들은 데이터에 포함된 편향을 학습하여 인종적 및 성별에 대한 고정관념을 보여줍니다. 또 다른 중요한 제한은 “위치 편향”입니다. 즉, 긴 문서의 처음 또는 끝에 있는 정보를 과도하게 강조하면서 문서 중간의 내용을 무시하는 것입니다. 이 “중간을 잃어버린” 현상은 이러한 시스템이 정보를 처리하는 방식이 인간과 다르다는 것을 시사합니다.
이러한 제한은 LLM이 언어 패턴을 인식하고 재생산하는 데 탁월하지만, 의미 또는 실제 상황을真正로 이해하는 데는 제한이 있음을 강조합니다. 그들은 구문 처리에는 뛰어나지만, 의미론에는 제한이 있습니다.
지능의 정의
논쟁은 궁극적으로 지능의 정의에 달려 있습니다. 지능이 유창한 언어를 생성하고, 문제를 해결하고, 새로운 상황에 적응하는 능력이라면, LLM은 이미 이러한 기준을 충족합니다. 그러나 지능이 자아意识,真正의 이해, 또는 주관적인 경험을 필요로 한다면, 이러한 시스템은 여전히 부족합니다.
문제는 이해나 의식과 같은 질적 특성을 측정하는 명확한 또는 객관적인 방법이 없다는 것입니다. 인간과 기계 모두에서 우리는 행동에서 이러한 특성을 추론합니다. 오리 테스트와 튜링 테스트는曾经 제공한 멋진答案이지만, LLM의 시대에는 더 이상 충분하지 않을 수 있습니다. 그들의 능력은 우리가真正로 지능이 무엇인지 재고하도록 강요합니다.
결론
대규모 언어 모델은 우리가 인공 지능의 지능을 정의하는 방식을 도전합니다. 그들은 추론을 모방하고, 아이디어를 생성하고, 인간만이 할 수 있는 것으로 여겨졌던 작업을 수행할 수 있습니다. 그러나真正의 인간과 같은 사고를 형성하는 인식과 기초가 부족합니다. 그들의 부상은 기계가 지능적으로 행동하는지 여부를 묻는 것뿐만 아니라, 지능이真正로 무엇을 의미하는지 묻는 것을 강요합니다. 시스템이 우리처럼 글을 쓸 수 있고, 우리처럼 추론할 수 있고, 우리처럼 창의할 수 있다면, 그것을 지능이라고 부를 수 있습니까? 또는 행동만으로 지능을 측정하는 데 충분하지 않은가요?












