사상 리더

LLM이 실제로 지저분한 문제를 통해 어떻게 추론할 수 있는가?

mm
Unite.AI를 Google의 선호 소스에 추가

생성적 인공지능의 도입과 진화는如此 빠르고 강렬하여 이 기술이 우리의 삶을 얼마나 많이 변화시켰는지 완전히 이해하기가 매우 어렵습니다.

3년 전으로 돌아가보면, AI는 더 많이 퍼지기 시작했지만, 여전히 많은 사람들이 AI의 능력에 대해 오해를 가지고 있었습니다. 기술은同時에 너무 적은 신뢰와 너무 많은 신뢰를 받았습니다. 하지만 평균적인 사람들은 AI가 작동하는 한두 가지 영역을 가리킬 수 있었으며, 높은 수준의 전문적인 작업을 수행했습니다. 그 외의 모든 것은 연구실에 있거나 존재하지 않았습니다.

오늘날에는 글을 쓰거나 질문을 할 수 있는 능력만 있으면 세계가 우리 손가락 끝에 있습니다. 우리는真正로 고유하고 놀라운 이미지, 음악, 영화를 생성할 수 있으며, 전체 산업을 뒤바꿀 수 있는 능력을 가지고 있습니다. 우리는 검색 엔진 프로세스를 강화할 수 있으며, 간단한 질문을 통해 대학에서 교육받은 학자나 평균적인 3학년 학생이 쓸 수 있는 수준의 페이지를 생성할 수 있습니다. 이러한 능력은 1년 또는 2년 전에는 불가능하다고 생각되었지만, 지금은 매우 평범해졌습니다. 생성적 인공지능 분야는 존재했지만, 아직 시작되지 않았습니다.

오늘날, 많은 사람들이 생성적 인공지능을 실험했습니다. 예를 들어, ChatGPT, Midjourney 또는 다른 도구를 사용했습니다. 다른 사람들은 이미 일상生活에 이러한 도구를 통합했습니다. 이러한 도구가 진화하는 속도는 거의 경이로울 정도입니다. 지난 6개월 동안의 발전을 고려하면, 향후 몇 년 동안 우리는 계속해서 놀라움을 경험할 것입니다.

생성적 인공지능 내에서 하나의 특정 도구는 Retrieval-Augmented Generation(RAG) 시스템의 성능과 복잡한 쿼리에 대한 추론 능력입니다. FRAMES 데이터셋의 도입은 현재 상태와 향후 방향을 보여줍니다. 2024년 말에 FRAMES가 도입된 이후, 여러 플랫폼이 이미 어려운 쿼리에서 새로운 기록을 세웠습니다.

FRAMES는 무엇을 평가하는지 그리고 생성적 인공지능 모델이 얼마나 잘 수행하는지 살펴보겠습니다. 우리는 분산형 및 오픈소스 플랫폼이 어떻게 작동하는지 볼 수 있으며, 이러한 플랫폼은 사용자에게 놀라운 추론 능력을 제공합니다.

FRAMES: 생성적 인공지능의 창

FRAMES 데이터셋과 평가 프로세스는 824개의 “다중 홉” 질문으로 구성되어 있으며, 추론, 논리적 연결, 여러 소스를 사용하여 정보를 검색하고, 정보를 논리적으로 결합하여 질문에 답하는 능력이 필요합니다. 이러한 질문은 2개에서 15개까지의 문서가 필요하며, 의도적으로 제약, 수학적 계산 및 추론, 시간 기반 논리를 포함합니다. 즉, 이러한 질문은 매우 어려우며 실제로 인간이 인터넷에서 수행하는 연구 작업을 나타냅니다. 우리는 이러한 도전을 항상 직면하며, 인터넷 소스에서 중요한 정보를 검색하여 정보를 결합하고, 계산하고, 추론하여 질문에 대한 올바른 답을 찾습니다.

연구자들은 FRAMES 데이터셋을 처음发布하고 테스트했을 때, 최상위 생성적 인공지능 모델이 단일 단계 방법을 사용하여 약 40%의 정확도를 달성할 수 있지만, 필요한 모든 문서를 수집하여 질문에 답할 수 있다면 73%의 정확도를 달성할 수 있음을 발견했습니다. 73%는 혁명적인 수준은 아니지만, 정확히 무엇을 대답해야 하는지 이해한다면, 숫자는 훨씬 더 인상적입니다.

예를 들어, 한 가지 질문은 “카니예 웨스트의 노래 파워에서 샘플링된 노래의 밴드 리더는 언제 태어났는가?”입니다. 인간은 어떻게 이 문제를 해결할 수 있을까요? 사람이 정보 요소를 수집해야 하며, 예를 들어 카니예 웨스트의 노래 파워의 가사를 살펴보고, 노래에서 샘플링된 다른 노래를 식별할 수 있어야 합니다. 우리는 노래를 들어보면(아마 익숙하지 않더라도) 다른 노래가 샘플링된 부분을 알 수 있습니다.

하지만 생각해 보십시오. 생성적 인공지능이 다른 노래를 “듣는” 동안 어떻게 다른 노래를 감지할 수 있을까요? 이것은 기본적인 질문이真正로 지능적인 인공지능의 테스트가 되는 곳입니다. 그리고 만약 우리가 노래를 찾고, 듣고, 샘플링된 가사를 식별할 수 있다면, 그것은 단지 1단계입니다. 우리는 아직 노래의 제목, 밴드의 이름, 밴드의 리더의 이름, 그리고 그 사람이 태어난 연도를 알아야 합니다.

FRAMES는 현실적인 질문에 답하기 위해巨大한 생각 처리가 필요하다는 것을 보여줍니다. 여기서 두 가지 사항이 생각납니다.

첫째, 분산형 생성적 인공지능 모델이競爭에서 우세할 뿐만 아니라, 잠재적으로 결과를 지배할 수 있다는 것은 믿을 수 없습니다. 점점 더 많은 회사들이 분산형 방법을 사용하여 처리 능력을 확대하고 있으며, 소프트웨어를 중앙 집중식 블랙 박스에서 공동체가 소유하도록 하고 있습니다. Perplexity와 Sentient와 같은 회사들은 이러한 추세를 주도하며, 각각의 모델은 FRAMES가 처음发布되었을 때의 초기 정확도 기록을 넘어서고 있습니다.

두 번째 요소는 이러한 인공지능 모델 중 일부가 분산형뿐만 아니라 오픈소스라는 것입니다. 예를 들어, Sentient Chat은 분산형과 오픈소스 모두이며, 초기 테스트에서는 놀라운 추론 능력을 보여주었습니다. FRAMES 질문은 인간이 사용하는 것과 동일한 생각 프로세스를 사용하여 답변되며, 그 이유는 오픈소스 액세스 덕분에 검토할 수 있습니다. 또한, 플랫폼은 여러 모델로 구성되어 있으며, 특정 관점과 성능을 미세 조정할 수 있습니다. 예를 들어, 최근 모델인 “Dobby 8B”는 FRAMES 벤치마크를 넘어서고 있으며, 암호화와 자유에 대한 뚜렷한 관점을 가지고 있습니다.

지평선 위에서

이 모든 놀라운 혁신의 핵심은 우리에게까지 왔던 빠른 속도입니다. 우리는이 기술이 얼마나 빠르게 진화했는지 인정해야 하며, 향후에도 더욱 빠르게 진화할 것입니다. 우리는 분산형 및 오픈소스 생성적 인공지능 모델과 함께, 시스템의 지능이 우리의 지능을越えて 가는 임계점을 볼 수 있을 것입니다. 그리고 그것이 미래를 위해 무엇을 의미하는지 알 수 있을 것입니다.

David Balaban은 17년 이상의 악성 코드 분석 및 안티바이러스 소프트웨어 평가 경험을 가진 컴퓨터 보안 연구자입니다. David는 MacSecurity.net Privacy-PC.com 프로젝트를 운영하며, 사회 공학, 악성 코드, 침투 테스트, 위협 인텔리전스, 온라인 개인 정보 보호, 화이트 해트 해킹을 포함한 현대 정보 보안 문제에 대한 전문가 의견을 제공합니다. David는 강력한 악성 코드 문제 해결 배경을 가지고 있으며, 최근에는 랜섬웨어 대책에 중점을 두고 있습니다.