AI 모델 및 플랫폼

Gemma: 구글, 오픈소스 통해 고급 AI 능력 제공

mm
Unite.AI를 Google의 선호 소스에 추가

인공 지능(AI) 분야는 최근 몇 년 동안 엄청난 발전을 이루었으며, 이는 주로 딥 러닝과 자연어 처리(NLP)의 발전에 힘입은 바가 크다. 이러한 발전의 선두에서 있는 것은 대규모 언어 모델(LLM)이다. LLM은大量의 텍스트 데이터로 훈련된 AI 시스템으로, 인간과 같은 텍스트를 생성하고 대화任务를 수행할 수 있다.

구글의 PaLM, Anthropic의 Claude, DeepMind의 Gopher와 같은 LLM은 코딩에서 공통 감각 추론에 이르기까지 다양한 능력을 보여주었다. 그러나 이러한 모델 대부분은 공개되지 않았기 때문에 연구, 개발, 유익한 응용에 대한 접근이 제한적이었다.

이런 상황은 최근 DeepMind의 Gemma가 오픈소스로 공개되면서 바뀌었다. Gemma는 구글의 DeepMind에서 개발한 대규모 언어 모델家族으로, 강력한 독점 모델인 Gemini를 기반으로 한다. 이 글에서는 Gemma의 아키텍처, 훈련 과정, 성능, 책임 있는 공개에 대해 분석한다.

Gemma 개요

2023년 2월, DeepMind는 Gemma 모델을 오픈소스로 공개했다. Gemma 모델은 2가지 크기로 제공되는데, 하나는 20억 매개변수를 갖는 모델로, 기기 내에서 사용하기 위해 최적화되었으며, 다른 하나는 70억 매개변수를 갖는 모델로, GPU/TPU에서 사용하기 위해 설계되었다.

Gemma는 DeepMind의 Gemini 모델과 유사한 트랜스포머 기반 아키텍처와 훈련 방법론을 사용한다. Gemma는 최대 6조 개의 토큰으로 구성된 텍스트 데이터셋에서 훈련되었으며, 이는 웹 문서, 수학, 코드 등 다양한 출처에서 가져온 데이터이다.

DeepMind는 Gemma의 원시 프리트레이닝 체크포인트와 지도 학습 및 인간 피드백을 통해 능력을 향상시킨 버전을 모두 공개했다. 이러한 버전은 대화, 지시 따르기, 코딩 등 다양한 분야에서 능력을 향상시킨 버전이다.

Gemma 시작하기

Gemma의 공개로 개발자, 연구자, 열광자가 고급 AI 능력을 사용할 수 있게 되었다. 여기에서는 Gemma를 시작하는 방법에 대한 간단한 가이드를 제공한다.

플랫폼 독립적 배포

Gemma의 주요 강점 중 하나는 플랫폼 독립적 배포이다. CPU, GPU, TPU에서 모두 실행할 수 있다. CPU의 경우 TensorFlow Lite 또는 HuggingFace Transformers를 사용할 수 있다. GPU/TPU의 경우 TensorFlow를 사용할 수 있다. 구글 클라우드의 Vertex AI와 같은 클라우드 서비스도 무정지 확장을 제공한다.

프리트레이닝 모델 접근

Gemma는 다양한 프리트레이닝 모델을 제공한다. 2B와 7B 모델은 강력한 생성 능력을 제공한다. 사용자 지정 파인튜닝을 위해 2B-FT와 7B-FT 모델을 사용할 수 있다.

흥미로운 애플리케이션 구축

Gemma를 사용하여 다양한 애플리케이션을 구축할 수 있다. 예를 들어, 이야기 생성, 언어 번역, 질문 응답, 창의적 콘텐츠 생성 등이 있다. Gemma의 강점을 활용하기 위해 사용자 지정 데이터셋으로 파인튜닝할 수 있다.

아키텍처

Gemma는 디코더 전용 트랜스포머 아키텍처를 사용한다. 이는 멀티 쿼리 어텐션과 로터리 포지셔널 임베딩과 같은 기술을 사용한다.

  • 트랜스포머: 2017년에 소개된 트랜스포머 아키텍처는 주목받고 있다. Gemma는 트랜스포머의 장점을 이어받아 텍스트의 장거리 의존성을 모델링할 수 있다.
  • 디코더 전용: Gemma는 트랜스포머 디코더 스택만을 사용한다. 이는 BART나 T5와 같은 인코더-디코더 모델과 다르다. 이는 텍스트 생성과 같은 작업에서 강력한 생성 능력을 제공한다.
  • 멀티 쿼리 어텐션: Gemma는 더 큰 모델에서 멀티 쿼리 어텐션을 사용한다. 이는 각 어텐션 헤드가 병렬로 여러 쿼리를 처리할 수 있게 해준다.
  • 로터리 포지셔널 임베딩: Gemma는 로터리 임베딩을 사용하여 위치 정보를 표현한다. 이는 모델 크기를 줄이면서도 위치 정보를 유지할 수 있다.

이러한 기술을 사용하여 Gemma 모델은 성능, 추론 속도, 모델 크기 간의 최적의 균형을 달성할 수 있다.

데이터와 훈련 과정

Gemma는 최대 6조 개의 토큰으로 구성된 텍스트 데이터셋에서 훈련되었다. 이는 주로 영어로 구성되었으며, 웹 문서, 수학, 코드 등 다양한 출처에서 가져온 데이터이다.

DeepMind는 데이터 필터링에 상당한 노력을 기울여 유해하거나 편향된 텍스트를 제거했다. 훈련은 구글의 TPUv5 인프라에서 수행되었으며, 최대 4096개의 TPU를 사용하여 Gemma-7B를 훈련했다.

훈련 과정은 여러 단계로 나누어졌으며, 데이터 분포를 지속적으로 조정하여 높은 품질의 텍스트에 초점을 맞췄다. 최종적인 파인튜닝 단계에서는 인간 생성 및 합성 지시 따르기 예제를 사용하여 능력을 향상시켰다.

모델 성능

DeepMind는 Gemma 모델을 25개 이상의 벤치마크에서 평가했다. 이는 질문 응답, 추론, 수학, 코딩, 공통 감각, 대화 능력 등 다양한 분야를 포함한다.

Gemma는 대부분의 벤치마크에서 유사한 크기의 오픈소스 모델과 비교하여 최첨단 결과를 달성했다. 일부 주요 성과는 다음과 같다.

  • 수학: Gemma는 수학적 추론 테스트에서 Codex와 Anthropic의 Claude를 10점 이상 앞섰다.
  • 코딩: Gemma는 코딩 벤치마크에서 Codex의 성능을 따라갔거나 앞섰다.
  • 대화: Gemma는 인간 선호도 테스트에서 Anthropic의 Mistral-7B를 51.7%의 승률로 앞섰다.
  • 추론: Gemma는 추론 작업에서 다른 7B 모델을 5-10점 앞섰다.

Gemma의 다才적인 능력은 다양한 분야에서 강력한 일반 지능 능력을 보여준다. 인간 수준의 성능에 여전히 격차가 있지만, Gemma는 오픈소스 NLP의 발전에 큰 걸음을 내디딘 것이다.

안전성과 책임

대규모 모델의 오픈소스 공개는 의도적인 오남용과 내재된 모델 편향의 문제를 제기한다. DeepMind는 이러한 위험을 완화하기 위한 조치를 취했다.

  • 데이터 필터링: 유해하거나 편향된 텍스트를 분류기와 휴리스틱을 사용하여 제거했다.
  • 평가: Gemma는 30개 이상의 벤치마크에서 평가되었으며, 이는 안전성, 공정성, 강건성 등을 평가하기 위한 것이다. Gemma는 다른 모델과 비교하여 유사한 또는 더好的 성능을 보였다.
  • 파인튜닝: 모델 파인튜닝은 안전성 능력을 향상시키기 위한 것이었다. 정보 필터링과 적절한 거부/제한 행동과 같은 능력을 향상시켰다.
  • 사용 조건: Gemma 모델의 사용 조건은 공격적, 불법적, 또는 비윤리적인 적용을 금지한다. 그러나 이러한 조건의 집행은 여전히 도전적인 과제이다.
  • 모델 카드: 모델의 능력, 제한, 편향에 대한 정보를 제공하는 모델 카드를 공개하여 투명성을 높였다.

Gemma의 공개는 여전히 위험이 있지만, DeepMind는 Gemma의 안전성 프로파일과 연구를 가능하게 하는 능력으로 인해净 사회적 이익을 제공한다고 판단했다. 그러나 잠재적인 피해를 모니터링하는 것은 중요하다.

AI 혁신의 다음 물결

Gemma를 오픈소스로 공개하는 것은 AI 커뮤니티 전체에 영향을 미친다.

  • 접근성: Gemma는 조직이 최신 NLP를 사용할 수 있게 해주며, 이전에는 높은 컴퓨팅 및 데이터 비용으로 인해 어려웠던 것을 해결했다.
  • 새로운 애플리케이션: 프리트레이닝된 체크포인트와 튜닝된 체크포인트를 공개하여 교육, 과학, 접근성 등 다양한 분야에서 유익한 애플리케이션을 개발하기 쉽게 했다.
  • 사용자 지정: 개발자는 Gemma를 산업 또는 도메인 특정 애플리케이션에 맞게 사용자 지정할 수 있다.
  • 연구: 오픈소스 모델인 Gemma는 현재 NLP 시스템의 투명성과 감사 가능성을 높여주며, 미래 연구 방향을 제시한다.
  • 혁신: 강력한 베이스라인 모델인 Gemma는 편향 완화, 사실성, AI 안전성 등 분야에서 진보를 가속화할 것이다.

Gemma를 오픈소스로 공개함으로써 DeepMind는 책임 있는 AI 개발을 촉진하기를 희망한다.

앞으로의 길

AI의 발전은 인간 지능을 능가하는 모델을 향한 발전이다. 시스템 seperti Gemma는 자기 지도 학습 모델의 발전이 어떻게 점점 더 발전된 인지 능력을解放하는지 보여준다.

그러나 신뢰성, 해석 가능성, 제어 가능성과 같은 분야에서 여전히 작업이 필요하다. 수학과 같은 분야는 이러한 격차를 보여준다. Gemma는 MMLU에서 64%의 점수를 얻었지만, 인간의 추정 성능은 89%이다.

이러한 격차를 메우고, 동시에 AI 시스템의 안전성과 윤리를 보장하는 것이 앞으로의 주요 도전이다. 공개와 주의의 균형을 맞추는 것이 중요하다. DeepMind는 AI의 혜택을 민주화하면서도 새로운 위험을 관리하려고 한다.

AI 안전성 증진을 위한 다양한 이니셔티브는 이러한 필요성을 인식하고 있다. 의미 있는 진행은 연구자, 개발자, 정책 입안자, 그리고 대중 간의 공개적이고 근거 기반의 대화가 필요하다.

책임 있게 관리된다면, Gemma는 AI의 정상이 아니라, 다음 세대의 AI 연구자들이 따라갈 수 있는 기지이다.

결론

DeepMind의 Gemma 모델 공개는 오픈소스 AI의 새로운 시대를 열었다. 이는 협력적인 가치와 경쟁적인 정신이 결합된 결과이다. 이러한 발전은 AI 생태계 전체를 발전시키는 것이다.

Gemma는 책임 있는 오픈소스 공개의 새로운 표준을 설정했다. 기술적이고 윤리적인 주의 깊음으로 인해 Gemma의 혜택이 잠재적인 해를 초과한다는 확신이 있다.

AI의 능력이 더욱 발전하면, 공개와 주의의 균형을 유지하는 것이 중요하다. Gemma는 모든 인류에게 혜택을 제공하는 AI를 향한 한 걸음이다. 그러나 여전히 많은 도전이 남아 있다.

지난 5년 동안私は Machine Learning과 Deep Learning의 매혹적인 세계에 몰두해 왔습니다.私の熱情と専門知識は私を50以上의多様한 소프트웨어 엔지니어링 프로젝트에 기여하게 했으며, 특히 AI/ML에 중점을 두었습니다.私の継続的な 호기심은 또한私를自然어 처리로 끌어들였습니다.私は이 분야를さらに 탐구하기를熱望합니다.