AI 모델 및 플랫폼

메타의 Llama 3.2: 온디바이스 및 멀티모달 기능을 갖춘 오픈소스 생성형 AI의 새로운 정의

mm
Unite.AI를 Google의 선호 소스에 추가

메타의 최근 Llama 3.2 출시, 메타의 Llama 시리즈의 최신 버전은 오픈소스 생성형 AI 생태계의 발전에 있어 중요한 발전이다. 이 업그레이드는 Llama의 두 가지 차원에서 능력을 확장한다. 한편으로, Llama 3.2는 멀티모달 데이터 처리를 허용한다. 즉, 이미지, 텍스트 및 기타 데이터를 통합하여 고급 AI 기능을 더 넓은 관객에게 제공한다. 다른 한편으로, 에지 디바이스에서 배포 потен을 확대하여 실시간 온디바이스 AI 애플리케이션에 대한 흥미로운 기회를 창출한다. 이 기사에서 우리는 이 발전과 그에 따른 AI 배포 미래에 대한 의미를 탐구할 것이다.

Llama의 진화

메타의 Llama와의 여정은 2023년初에 시작되었습니다, 그리고 그 때부터 시리즈는 폭발적인 성장과 채택을 경험했다. Llama 1에서 시작하여 비상업적 사용에만 국한되었고 선택된 연구 기관에만 접근이 가능했다. 시리즈는 2023년에 Llama 2를 출시하면서 오픈소스 영역으로 전환했다. 올해 초에 출시된 Llama 3.1은 발전에 있어 중요한 단계였다. 405억 매개변수를 갖춘 최대의 오픈소스 모델을 도입했으며, 이는 독점적인 경쟁자와 동등하거나 그 이상이었다.最新 버전인 Llama 3.2는 새로운 경량 및 비전 중심 모델을 도입하여 온디바이스 AI 및 멀티모달 기능을 더 쉽게 접근할 수 있게 한다. 메타의 개방성 및 수정 가능성에 대한 헌신은 Llama를 오픈소스 커뮤니티에서 선도적인 모델로 만들었다. 회사는 투명성 및 접근성에 대한 헌신을 통해 AI 혁신을 더 효과적으로 추진할 수 있다고 믿는다. 개발자 및 기업뿐만 아니라 전 세계 모든 사람을 위한 것이다.

Llama 3.2 소개

Llama 3.2는 다양한 요구 사항을 충족하기 위해 설계된 언어 모델의 최신 버전이다.最大 및 중간 크기의 모델은 90억 및 11억 매개변수를 갖추고 있으며, 멀티모달 데이터 처리를 위해 설계되었다. 이러한 모델은 차트, 그래프 및 기타 시각적 데이터를 해석할 수 있으며, 컴퓨터 비전, 문서 분석 및 증강 현실 도구와 같은 분야에서 애플리케이션을 구축하기에 적합하다. 경량 모델은 1억 및 3억 매개변수를 갖추고 있으며, 모바일 디바이스에 최적화되었다. 이러한 텍스트 전용 모델은 다국어 텍스트 생성 및 툴 호출 기능에서 우수하며, 텍스트 생성, 요약 및 에지 디바이스에서 개인화된 에이전트 기반 애플리케이션 생성과 같은 작업에 적합하다.

Llama 3.2의 중요성

Llama 3.2의 출시에는 두 가지 주요 영역에서 발전이 있다.

멀티모달 AI의 새로운 시대

Llama 3.2는 텍스트 및 이미지 처리 기능을 모두 갖춘 최초의 오픈소스 모델이다. 이는 오픈소스 생성형 AI의 발전에 있어 중요한 발전이다. 모델은 시각적 입력과 함께 텍스트 데이터를 분석 및 응답할 수 있다. 예를 들어, 사용자는 이미지를 업로드하고 자연어 프롬프트에 따라詳細한 분석 또는 수정을 받을 수 있다. 마크 저커버그는 출시 당시 이 기능을 강조하며 Llama 3.2가 “시각적 이해가 필요한 다양한 애플리케이션을 가능하게 할 것”이라고 말했다. 이 통합은 멀티모달 정보에 의존하는 산업을 위한 Llama의 범위를 확대한다. 이러한 산업에는 소매, 헬스케어, 교육 및 엔터테인먼트가 포함된다.

접근성을 위한 온디바이스 기능

Llama 3.2의 주요 기능 중 하나는 에지 디바이스, 특히 모바일 환경에서 온디바이스 배포를 최적화한 것이다. 모델의 경량 버전은 1억 및 3억 매개변수를 갖추고 있으며, 퀄컴 및 메디아텍 하드웨어를 갖춘 스마트폰 및 기타 에지 디바이스에서 실행하도록 설계되었다. 이 기능을 통해 개발자는 광범위한 계산 리소스가 없이 애플리케이션을 생성할 수 있다. 또한 이러한 모델 버전은 다국어 텍스트 처리에서 우수하며, 128K 토큰의 더 긴 컨텍스트 길이를 지원하여 사용자가 자신의 모국어로 자연어 처리 애플리케이션을 개발할 수 있다. 또한 이러한 모델은 툴 호출 기능을 제공하여 사용자가 에이전트 애플리케이션을 사용할 수 있다. 예를 들어, 사용자는 캘린더 초대 및 여행 계획과 같은 작업을 직접 디바이스에서 관리할 수 있다.
온디바이스 AI 모델을 배포할 수 있는 기능은 클라우드 컴퓨팅과 관련된 문제를 극복할 수 있다. 이러한 문제에는 지연, 보안 위험, 높은 운영 비용 및 인터넷 연결 의존성이 포함된다. 이 발전은 헬스케어, 교육 및 물류와 같은 산업을 변革할 수 있다. 이러한 산업은 클라우드 인프라 또는 개인 정보 보호 문제 없이 실시간 상황에서 AI를 사용할 수 있다. 또한 이는 인터넷 연결이 제한된 지역에서 AI에 대한 접근을 민주화할 수 있다.

경쟁 우위

메타는 Llama 3.2가 OpenAI 및 Anthropic의 주요 모델과 비교하여 경쟁력 있는 성능을 발휘한다고 보고한다. Llama 3.2는 Claude 3-Haiku 및 GPT-4o-mini와 같은 모델과 비교하여 지시 및 콘텐츠 요약 작업과 같은 다양한 벤치마크에서 우수한 성능을 발휘한다고 주장한다. 이 경쟁 우위는 메타가 빠르게 발전하는 생성형 AI 분야에서 오픈소스 AI를 독점 모델과 동등한 수준으로 유지하기 위해 노력하고 있기 때문에 중요하다.

Llama 스택: AI 배포를 단순화

Llama 3.2 출시의 주요 측면 중 하나는 Llama 스택의 도입이다. 이 도구 세트는 개발자가 다양한 환경에서 Llama 모델을 더 쉽게 작업할 수 있도록 한다. 이러한 환경에는 싱글 노드, 온프레미스, 클라우드 및 온디바이스 설정이 포함된다. Llama 스택에는 RAG 및 툴링 지원이 포함되어 있으며, 생성형 AI 모델을 배포하기 위한 유연하고 포괄적인 프레임워크를 제공한다. 배포 과정을 단순화함으로써 메타는 개발자가 클라우드, 모바일 또는 데스크톱 환경에서 애플리케이션에 Llama 모델을 쉽게 통합할 수 있도록 한다.

결론

메타의 Llama 3.2는 오픈소스 생성형 AI의 발전에 있어 중요한 순간이다. 접근성, 기능 및 다용도성을 새로운 기준으로 설정한다. 온디바이스 기능 및 멀티모달 처리를 통해 모델은 산업 전반에 걸쳐 변혁적인 가능성을 열어준다. 이러한 산업에는 헬스케어, 교육 및 엔터테인먼트가 포함된다. 또한 모델은 개인 정보 보호, 지연 및 인프라 제한과 같은 중요한 문제를 해결한다. 개발자가 온디바이스에서 고급 AI를 효율적으로 배포할 수 있도록 함으로써, Llama 3.2는 AI 애플리케이션의 범위를 확대하고 전 세계적으로 최신 기술에 대한 접근을 민주화한다.

Dr. Tehseen Zia는 COMSATS University Islamabad의 정교수이며, 오스트리아 비엔나 기술대학교에서 인공지능 박사학위를 취득했습니다. 인공지능, 기계학습, 데이터 과학, 컴퓨터 비전을 전문으로 하며, 유명한 과학 저널에 발표된 논문으로 знач적인 기여를 했습니다. Dr. Tehseen은 주요 연구자로서 다양한 산업 프로젝트를 이끌었으며, 인공지능 컨설턴트로도 활동했습니다.