AI 모델 및 플랫폼

ChatGPT의 첫 번째 생일: AI 상호작용의 미래를 재정의하다

mm
Unite.AI를 Google의 선호 소스에 추가

ChatGPT의 첫 번째 해를 되돌아보면, 이 도구가 AI 분야를 크게 변화시켰다는 것이 명확하다. 2022년 말에 출시된 ChatGPT는 사용자 친화적이고 대화형 스타일로 인해 AI와 상호작용하는 것이 기계와 대화하는 것보다 사람과 대화하는 것처럼 느껴졌다. 이 새로운 접근 방식은 빠르게 대중의 관심을 끌었다. 출시 후 5일 만에 ChatGPT는 이미 1백만 명의 사용자를 आकर들였으며, 2023년 초에는 월간 사용자 수가 약 1억 명으로 증가했으며, 10월에는 전 세계에서 약 17억 회의 방문이 이루어졌다. 이러한 숫자는 그 인기와 유용성을 말해준다.

지난 1년 동안 사용자들은 ChatGPT를 사용하여 다양한 창의적인 방법을 찾았다. 이메일 작성과 이력서 업데이트 같은 간단한 작업에서부터 성공적인 비즈니스 시작까지. 그러나 사람들이 그것을 사용하는 방식에 대해서만이 아니라 기술 자체가 성장하고 개선되었다. 처음에 ChatGPT는 자세한 텍스트 응답을 제공하는 무료 서비스였다. 이제는 ChatGPT Plus가 있으며, 이는 ChatGPT-4를 포함한다. 이 업데이트된 버전은 더 많은 데이터에 대한 훈련을 받았으며, 잘못된 답변을 덜 제공하며, 복잡한 명령을 더 잘 이해한다.

가장 큰 업데이트는 ChatGPT가 이제 여러 가지 방식으로 상호작용할 수 있다는 것이다. 그것은 듣고, 말하고, 심지어 이미지를 처리할 수 있다. 이는 모바일 앱을 통해 그것과 대화하고 이미지를 보여주어 응답을 얻을 수 있음을 의미한다. 이러한 변경 사항은 AI의 새로운 가능성을 열어주었고人们이 AI의 역할을 어떻게 생각하는지 변경했다.

기술 데모에서 주요 기술 플레이어로의 여정은 khá 인상적이다. 처음에 그것은 기술을 테스트하고 개선하기 위한 방법으로 공중에서 피드백을 받는 것이었다. 그러나 그것은 빠르게 AI 풍경의 필수적인 부분이 되었다. 이 성공은 대규모 언어 모델(LLM)을 지도 학습과 인간의 피드백으로 미세 조정하는 것이 얼마나 효과적인지를 보여준다. 따라서 ChatGPT는 다양한 질문과 작업을 처리할 수 있다.

AI 시스템 개발 경쟁은 ChatGPT와 같은 오픈 소스 및 사유 모델의 phổ급으로 이어졌다. 이러한 모델의 일반적인 능력을 이해하려면 다양한 작업에 걸친 포괄적인 벤치마크가 필요하다. 이 섹션은 이러한 벤치마크를 탐구하며, ChatGPT를 포함한 다른 모델들이 어떻게 비교되는지에 대한 빛을 비추고 있다.

LLM 평가: 벤치마크

  1. MT-Bench: 이 벤치마크는 8개 도메인(작성, 역할 놀이, 정보 추출, 추론, 수학, 코딩, STEM 지식, 인문학/사회 과학)에서 다중 회신 대화와 명령을 따르는 능력을 테스트한다. 더 강력한 LLM인 GPT-4를 평가자로 사용한다.
  2. AlpacaEval: AlpacaFarm 평가 세트를 기반으로 하는 이 LLM 기반 자동 평가자는 GPT-4와 Claude와 같은 고급 LLM의 응답과 비교하여 모델을 벤치마크하고 후보 모델의 승리율을 계산한다.
  3. 오픈 LLM 리더보드: 언어 모델 평가 하네스를 사용하여 이 리더보드는 LLM을 7개의 주요 벤치마크(추론 과제 및 일반 지식 테스트 포함)에서 평가하며, 제로샷 및 페우샷 설정에서 모두 평가한다.
  4. BIG-bench: 이 협력 벤치마크는 200개 이상의 새로운 언어 작업을 다루며, 다양한 주제와 언어를 다룬다. 이는 LLM의 능력과 미래의 능력을 예측하는 것을 목표로 한다.
  5. ChatEval: 여러 에이전트가 오픈 엔드된 질문과 전통적인 자연어 생성 작업에 대한 다양한 모델의 응답의 질을 평가할 수 있는 다중 에이전트 논쟁 프레임워크이다.

비교 성능

일반적인 벤치마크에서 오픈 소스 LLM은 놀라운 발전을 보였다. Llama-2-70B는 특히 지침 데이터로 미세 조정된 후 인상적인 결과를 보였다. 그 변형인 Llama-2-chat-70B는 AlpacaEval에서 92.66%의 승리율을 기록하며 GPT-3.5-turbo를 능가했다. 그러나 GPT-4는 여전히 95.28%의 승리율로 선두를 지키고 있다.

Zephyr-7B라는 더 작은 모델은 AlpacaEval과 MT-Bench에서 70B LLM과 비교할 수 있는 능력을 보여주었다. 한편, WizardLM-70B는 다양한 지침 데이터로 미세 조정된 후 MT-Bench에서 오픈 소스 LLM 중最高의 점수를 기록했지만, 여전히 GPT-3.5-turbo와 GPT-4에 뒤졌다.

GodziLLa2-70B라는 흥미로운 모델은 오픈 LLM 리더보드에서 경쟁력 있는 점수를 기록하며, 다양한 데이터셋을 결합한 실험 모델의 잠재력을 보여주었다. 유사하게, Yi-34B는 GPT-3.5-turbo와 비교할 수 있는 점수를 기록했으며, GPT-4에 비해わず간 뒤졌다.

UltraLlama는 다양한 고품질 데이터로 미세 조정된 후, 제안된 벤치마크에서 GPT-3.5-turbo와 일치하며, 세계와 전문 지식 분야에서甚至 그것을 능가했다.

규모 확대: 거대한 LLM의 부상

LLM 모델

2020년 이후의 주요 LLM 모델

LLM 개발에서 주목할 만한 추세는 모델 매개변수의 규모를 확대하는 것이다. Gopher, GLaM, LaMDA, MT-NLG, PaLM과 같은 모델은 540억 개의 매개변수까지 모델의 경계를 확대했다. 이러한 모델은 예외적인 능력을 보여주었지만, 그 폐쇄적인 성격으로 인해 더 넓은 적용이 제한되었다. 이 제한은 오픈 소스 LLM 개발에 대한 관심을 불러일으켰으며, 이는 점점 더 많은 추세가 되고 있다.

모델 크기를 확대하는 것과 병렬로, 연구자들은 대체 전략을 탐구했다. 모델을 더 크게 만드는 것보다, 더 작은 모델의 사전 훈련을 개선하는 데 중점을 두었다. Chinchilla와 UL2와 같은 예가 있으며, 더智能한 전략이 효율적인 결과를 산출할 수 있음을 보여주었다. 또한 언어 모델의 지침 튜닝에 대한 상당한 관심이 있으며, FLAN, T0, Flan-T5와 같은 프로젝트가 이 분야에서重大한 기여를 했다.

ChatGPT 카탈리스트

OpenAI의 ChatGPT 도입은 NLP 연구에서 전환점을 맞이했다. OpenAI와 경쟁하기 위해, Google와 Anthropic은 Bard와 Claude와 같은 모델을 출시했다. 이러한 모델은 많은 작업에서 ChatGPT와 비교할 수 있는 성능을 보여주었지만, 여전히 OpenAI의 최신 모델인 GPT-4에 뒤졌다. 이러한 모델의 성공은 주로 인간 피드백에서 강화 학습(RLHF)을 받은 것에 기인한다. 이 기술은 더욱 개선하기 위해 연구의重点이 되고 있다.

OpenAI의 Q\* (Q-Star) 주변의 소문과 추측

최근 보고서는 OpenAI 연구자들이 Q\* (Q-Star)라는 새로운 모델을 개발했으며, 이는 중학교 수준의 수학을 수행할 수 있는 능력을 보유하고 있다고 한다. 이 능력은 전문가들 사이에서 인공 일반 지능(AGI)로의 중요한 里程碑으로 논의를 불러일으켰다. OpenAI는 아직 이 보고서에 대해 논평하지 않았지만, Q\*의 추정 능력은 소셜 미디어와 AI愛好者들 사이에서 상당한 흥奮과 추측을 불러일으켰다.

Q\*의 개발은 주목할 만하다. 기존 언어 모델인 ChatGPT와 GPT-4는 일부 수학 작업을 수행할 수 있지만, 신뢰할 수 있는 성능을 보이지는 않는다. 도전은 패턴을 인식하는 것뿐만 아니라, 추상적인 개념을 이해하고 추론하는 능력이 필요하다는 것이다. 수학은 추론의 벤치마크로, AI가 계획하고 여러 단계를 실행하여 추상적인 개념을 깊이 이해하는 것을 필요로 한다. 이러한 능력은 AI 능력의重大한 발전을 나타내며, 수학을 넘어 다른 복잡한 작업으로 확장될 수 있다.

그러나 전문가들은 이 발전을 과대평가하지 않도록 경고한다. 수학 문제를 신뢰할 수 있게 해결하는 AI 시스템은 인상적인 성과일 수 있지만, 그것은 超지능 AI 또는 AGI의 도래를 의미하지는 않는다. 현재의 AI 연구, OpenAI의 노력 포함,는 초등학교 수준의 문제에 중점을 두고 있으며, 더 복잡한 작업에서는 다양한 정도의 성공을 보이고 있다.

Q\*와 같은 발전의 잠재적인 응용 분야는 개인화된 튜터링에서 과학 연구 및 엔지니어링을 지원하는 것까지 다양하다. 그러나 이러한 발전의 한계와 안전 문제를 관리하는 것이 중요하다. AI가 실세계와 더 많이 상호작용하기 시작함에 따라, AI가 존재적 위험을 초래하는 것에 대한 우려는 여전히 관련이 있다.

오픈 소스 LLM 운동

오픈 소스 LLM 연구를 촉진하기 위해, Meta는 Llama 시리즈 모델을 출시했으며, 이는 Llama를 기반으로 하는 새로운 모델의 물결을 촉발했다. 이것은 지침 데이터로 미세 조정된 모델, 즉 Alpaca, Vicuna, Lima, WizardLM을 포함한다. 연구는 또한 에이전트의 능력, 논리적 추론, 긴 문맥 모델링을 강화하는 데 중점을 두고 있다.

또한, Llama를 기반으로 하지 않는 강력한 LLM을 개발하려는 추세가 있다. MPT, Falcon, XGen, Phi, Baichuan, Mistral, Grok, Yi와 같은 프로젝트가 이러한 노력의 일부이다. 이러한 노력은 폐쇄형 LLM의 능력을 민주화하고, 고급 AI 도구를 더 접근하기 쉽고 효율적으로 만드는 데 대한 헌신을 반영한다.

ChatGPT와 오픈 소스 모델의 헬스케어 영향

우리는 LLM이 임상 기록 작성, 보험 청구 서류 작성, 의사에게 진단 및 치료 계획을 지원하는 데 도움을 줄 미래를 예상할 수 있다. 이것은 기술巨頭와 의료 기관의 관심을 끌었다.

Microsoft의 Epic과의 논의는 헬스케어에서 LLM을 통합하는 신호이다. UC 샌디에고 헬스와 스탠퍼드 대학교 의료 센터에서는 이미 이러한 이니셔티브가 진행 중이다. 유사하게, Google의 Mayo Clinic과의 협력과 Amazon (AMZN ) Web Services의 HealthScribe 출시와 같은 AI 임상 기록 서비스는 이러한 분야에서重大한 발전을 나타낸다.

그러나 이러한 빠른 배치는 의학을 기업의 이익에 넘겨주는 것을 우려한다. 이러한 LLM의 사유적인 성격으로 인해 평가하기가 어렵다. 이익을 위해 수정되거나 중단될 가능성이 있으며, 환자 치료, 개인 정보, 안전을 위협할 수 있다.

헬스케어에서 LLM 개발에 대한 긴급한 필요는 공개적이고 포괄적인 접근 방식이다. 의료 기관, 연구자, 임상 의사, 환자들은 글로벌로 협력하여 헬스케어를 위한 오픈 소스 LLM을 개발해야 한다. Trillion Parameter Consortium과 같은 접근 방식은 컴퓨팅, 재정 자원, 전문 지식을 공유하는 것을 허용할 것이다.

지난 5년 동안私は Machine Learning과 Deep Learning의 매혹적인 세계에 몰두해 왔습니다.私の熱情と専門知識は私を50以上의多様한 소프트웨어 엔지니어링 프로젝트에 기여하게 했으며, 특히 AI/ML에 중점을 두었습니다.私の継続的な 호기심은 또한私를自然어 처리로 끌어들였습니다.私は이 분야를さらに 탐구하기를熱望합니다.