AI 모델 및 플랫폼

Vertex AI 소개

mm
Unite.AI를 Google의 선호 소스에 추가

인공 지능의 빠르게 발전하는 환경에서 기술 리더가 직면하는 가장 큰 장애물 중 하나는 “실험”에서 “기업 준비”로 전환하는 것입니다. 소비자 채팅봇과 상호작용 플랫폼은 공공 상상력을 도와주지만, 기업은 단지 채팅 인터페이스만으로는 성공할 수 없습니다. 경쟁이 이전보다 더 공격적인 시대에, 기업은 강력하고 확장 가능하며 안전한 생태계가 필요하며, 이것이 Google이 Vertex AI와 함께 제공하려고 하는 것입니다.

Vertex AI는 현대 클라우드 인프라와의 제너레이티브 AI 통합을 위한 백본으로 자리 잡으려고 합니다. Vertex AI는 원시 모델과 생산급 애플리케이션 간의 간격을 메우는 포괄적인 기능 세트를 제공합니다. Vertex AI는 대규모 언어 모델(LLM)의 래퍼가 아닙니다. 그것은 제너레이티브 AI를 현대 클라우드 인프라의 1차 시민으로 대우하는 통합 머신 러닝 및 인공 지능(Machine Learning & Artificial Intelligence, ML/AI) 생태계입니다.

Vertex AI의 핵심에는 모델 가든이 있습니다. 모델 가든은 200개 이상의 커리된 기초 모델에 대한 액세스를 제공하는 중앙 마켓플레이스입니다. 여기에는 2백만 토큰 컨텍스트 윈도우를 갖는 멀티모달 파워하우스 Gemini 2.5 Pro가 포함됩니다. 이 기사에서 우리는 Vertex AI의 아키텍처를 분해하고, 모델 가든이 지능의 “앱 스토어”로 어떻게 작용하는지 살펴보고, 이 플랫폼을 다음 세대의 기업 소프트웨어의 백본으로 만드는 기술적인 기둥을 살펴보겠습니다.

核心 아키텍처:統一 플랫폼

Vertex AI는 느슨하게 결합된 도구의 모음이 아닙니다. 그것은 데이터와 AI의 통합 생태계로 설계되었습니다. 이것은 기계 학습에 오늘날까지 존재하는 데이터, 도구 및 팀의 단편화를 메우기 위한 것입니다. 전통적으로, AI 개발은 격리된 환경에서 발생하며, 때때로 데이터는 여러 저장소에 걸쳐 분산되거나 갇혀 있습니다. 예를 들어, 조직은 고객 데이터를 SQL 창고에 저장하는 반면 비정형 문서는 데이터 레이크에 덤프될 수 있습니다. 데이터가 단편화되면, AI는 “부분적인 진실”만 볼 수 있으며, 이는 편향된 결과나 높은 환각률을 유발할 수 있습니다.

Vertex AI는 전체 라이프사이클을 통합하려고 합니다. 이것은 BigQuery와 Cloud Storage에서 원시 데이터摄取에서 생산 監視까지이며, 본질적으로 이러한 단편화 사이의 “연결 조직”으로 작용합니다. Vertex AI는 Cloud Storage와 BigQuery와 네이티브로 통합되어 있습니다. 이것은 AI 모델이 복잡한 추출, 변환 및 로드 파이프라인 없이 데이터를 검색할 수 있도록 합니다.

기초:구글의 AI 하이퍼 컴퓨터

Vertex AI의 GenAI 레이어는 구글의 AI 하이퍼 컴퓨터 아키텍처 위에 위치합니다. 이것은 통합 슈퍼 컴퓨팅 시스템으로 구성되어 있습니다.

TPU v5p & v5e (Tensor Processing Units)

구글의 Tensor Processing Units는 딥 러닝을 정의하는 행렬 곱셈을 위해 특별히 설계된 ASIC(응용 특정 집적 회로)입니다.

  • TPU v5p (성능): 이것은 대규모 훈련을 위한 플래그십 가속기입니다. 각 TPU v5p 포드는 8,960개의 칩이 구글의最高 대역폭 Inter-Chip Interconnect (ICI)를 통해 4,800 Gbps로 확장할 수 있습니다. 기술 리더에게 이것은 이전 세대보다 2.8배 빠른 훈련을 의미하며, 175B 파라미터를 갖는 GPT-3 크기의 모델을 위한 시간을 줄입니다.
  • TPU v5e (효율성): 이것은 “비용 최적화” 성능을 위한 것입니다. v5e는 중규모 훈련과 고 처리량 추론을 위한 작업 마력입니다. 이것은 최대 2.5배의 가격-성능 비율을 제공하며, 24/7 추론을 실행해야 하는 비용을 줄입니다.

NVIDIA H100/A100 GPU를 위한 유연성

TPU는 전문적인 도구이지만, 많은 개발 팀은 NVIDIA CUDA 생태계에 의존합니다. Vertex AI는 NVIDIA의 최신 하드웨어를 위한 1차 지원을 제공합니다:

  • NVIDIA H100 (Hopper): 이것은 가장 큰 오픈 소스 모델(예: Llama 3.1 405B)을 미세 조정하는 데 이상적인 선택입니다.
  • ジュピ터 네트워킹: 구글은 데이터를 노드 사이에서 번개 같은 속도로 이동시키는 ジュピ터 데이터 센터 네트워크 패브릭을 사용합니다. 이것은 RDMA(Remote Direct Memory Access)를 지원하며, CPU 오버헤드를 우회하여 분산 노드에서 거의 로컬 성능을 제공합니다.

동적 오케스트레이션

Vertex AI의 가장 중요한 기술적 변화는 동적 오케스트레이션입니다. 레거시 환경에서, GPU 노드가 3주 훈련 실행 중에 실패하면 전체 작업이 충돌할 수 있습니다.

  • 자동 복원력: Vertex AI는 구글 쿠버네티스 엔진(GKE)을 통해 “자가 치유” 노드를 특징으로 합니다. 하드웨어 결함이 감지되면, 플랫폼은 자동으로 작업을 건강한 노드로 마이그레이션합니다.
  • 동적 워크로드 스케줄러: 이 도구는 팀이 용량을 요청할 수 있도록 허용합니다. 유연한 시작(더 저렴하며, 용량이 사용 가능할 때 시작됨) 또는 임무 임계적인 릴리스를 위한 보장된 용량을 선택할 수 있습니다.
  • 서버리스 훈련: 인프라 관리가 없는 팀을 위한 것입니다. Vertex AI 서버리스 훈련을 통해 코드와 데이터를 제출할 수 있으며, 플랫폼은 클러스터를 제공하고, 작업을 실행하고, 사용된 컴퓨팅 초만 청구합니다.

세 가지 진입점: 발견, 실험, 자동화

데이터 과학자에서 애플리케이션 개발자까지 다양한 기술 전문가를 수용하기 위해, Vertex AI는 세 가지 주요 진입점을 제공합니다:

모델 가든: 발견을 위한 마켓플레이스

구글 클라우드의 Vertex AI 모델 가든은 다양한 비즈니스 요구 사항을 위한 광범위한 제너레이티브 AI 모델을 발견, 테스트, 사용자 정의 및 배포할 수 있는 중앙 플랫폼입니다. 이것은 라이브러리로서 작용하며, 개발자와 비즈니스에게 작업에 적합한 모델(대규모 기초 모델에서 전문 모델까지)을 선택하고, Vertex AI의 도구와의 무결한 통합을 통해 효율적으로 배포할 수 있도록 합니다.

모델 가든은 200개 이상의 모델을 세 가지 티어로 분류합니다. 이것은 아키텍트가 성능, 비용 및 제어를 균형 있게 할 수 있도록 합니다:

  1. 구글 모델: 이것은 Vertex AI에서 사용할 수 있는 멀티모달 모델입니다. 구글은 다양한 크기(복잡한 추론을 위한 Pro, 낮은 지연을 위한 Flash)로 제공하며, 개발자가 모델을 사용 사례에 따라 최적화할 수 있도록 합니다.
  2. 제3자 모델: Vertex AI는 전략적 제휴를 통해 “모델-서비스” 접근 방식을 제공합니다. 이것은 Anthropic(Claude 3.5)와 Mistral AI와 같은 5개의 다른 AI 제공업체에 대한 별도의 청구 및 보안 자격 증명을 관리할 필요 없이, 기존 구글 클라우드 프로젝트를 통해 접근할 수 있도록 합니다.
  3. 오픈 소스 및 오픈 웨이트 모델: 이것은 Meta의 Llama 3.2, Mistral, 구글의 Gemma를 포함합니다. 이것은 데이터를 최대 분리하기 위해 자체 VPC(가상 사설 클라우드) 내에서 모델을 자체적으로 배포하려는 조직에게 이상적입니다.

비統一 환경에서, 오픈 소스 모델(Llama)을 배포하는 것은 PyTorch 환경을 설정하고, CUDA 드라이버를 구성하고, Flask 또는 FastAPI 래퍼를 관리하는 것을 의미합니다.

모델 가든은 統一 관리 엔드포인트를 통해 “Munging” 단계를 제거합니다:

  • 한 번의 클릭으로 배포: 많은 모델에서 “배포”를 클릭하면, 필요한 TPU/GPU 리소스가 자동으로 프로비저닝되고, 모델이 프로덕션 준비 컨테이너에 래핑되고, REST API 엔드포인트가 제공됩니다.
  • 허깅 페이스 허브 통합: Vertex AI는 허깅 페이스 허브에서 모델을 직접 Vertex 엔드포인트로 배포할 수 있도록 허용합니다. 이것은 사용 가능한 지능에 거의 무한한 확장을 제공합니다.
  • 프라이빗 서비스 커넥트(PSC): 높은 규제 산업을 위한 것입니다. 모델은 프라이빗 서비스 커넥트를 사용하여 배포할 수 있으며, 모델 엔드포인트가 공용 인터넷에 노출되지 않도록 합니다.

Vertex AI 스튜디오: 실험을 위한 플레이그라운드

모델 가든은 선택을 위한 것입니다. Vertex AI 스튜디오는 정밀성을 위한 것입니다. Vertex AI 스튜디오는 전통적인 소프트웨어 세계에서 컴파일러와 디버거와 유사합니다. 이것은 원시 모델을 비즈니스 도구로 조각내는 작업 공간입니다. 이것은 프롬프트 엔지니어링, 멀티모달 테스트 및 고급 하이퍼파라미터 조정을 통해 이루어집니다.

멀티모달 프로토タイ핑: 텍스트를 넘어서

스튜디오의 주요 기능 중 하나는 멀티모달리티를 위한 네이티브 지원입니다. 다른 플랫폼에서는 비텍스트 데이터를 처리하기 위해 복잡한 코딩이 필요하지만, Vertex AI 스튜디오에서는 인터페이스에 파일을 직접 드롭하여 Gemini 2.5의 推論 기능을 테스트할 수 있습니다.

  • 비디오 인텔리전스: 45분의 기술 키노트를 업로드하고, 모델에게 “특정 API가 언급될 때마다 식별하고 타임스탬프가 있는 요약을 제공”하도록 요청할 수 있습니다.
  • 문서 분석: 모델은 텍스트를 읽는 것 외에도 1,000페이지의 PDF의 비주얼 레이아웃을 분석할 수 있으며, 차트, 테이블 및 주변 서체 간의 관계를 이해할 수 있습니다.
  • 코드 실행: 스튜디오는 플레이그라운드에서 코드 실행을 지원합니다. 모델이 복잡한 수학 문제를 해결하거나 CSV를 분석하도록 요청하면, 모델은 보안 샌드박스 환경에서 Python 코드를 작성하고 실행하여 검증된 답변을 제공할 수 있습니다.

고급 사용자 정의: 튜닝 경로

프롬프트 엔지니어링(Zero-shot 또는 Few-shot)이 한계에 도달했을 때, Vertex AI 스튜디오는 모델 튜닝을 제공합니다.

  1. 감독 튜닝: 개발자는 “프롬프트/응답” 쌍의 데이터 세트(이상 100개의 예시)를 제공합니다. 이것은 모델이 특정 브랜드 음성, 출력 형식(예: 전문 JSON) 또는 도메인 특정 용어를 채택하도록 가르칩니다.
  2. 컨텍스트 캐싱: 기업이 대규모 정적 데이터 세트(예: 법률 라이브러리 또는 코드베이스)를 다루는 경우, 스튜디오는 컨텍스트 캐싱을 허용합니다. 이것은 모델의 메모리에 1백만 토큰의 데이터를 “프리로드”할 수 있으며, 후속 쿼리에 대한 대기 시간과 비용을 크게 줄입니다.
  3. 증류(교사-학생): 이것은 고수준 아키텍처 이동입니다. 큰 모델(Gemini 2.5 Pro)을 사용하여 더 작은 모델(Gemini 2.0 Flash)을 “가르칠” 수 있습니다. 결과는 “Pro” 수준의 성능을 제공하지만 “Flash” 속도와 비용으로 실행되는 가벼운 모델입니다.

Vertex AI 에이전트 빌더: 자동화를 위한 공장

Vertex AI 에이전트 빌더는 개발자가 기초 모델과 기업 데이터 및 외부 API를 결합하여 이러한 에이전트를 생성할 수 있는 고수준 오케스트레이션 프레임워크입니다.

“진실”의 아키텍처: 그라운드 및 RAG

기업 AI의 주요 기술적 장벽은 환각입니다. 에이전트 빌더는 그라운드 엔진을 통해 이것을 해결합니다.

  • 구글 검색을 통한 그라운드: 실시간 세계 지식을 요구하는 쿼리(예: “뉴욕의 현재 모기지 금리는?”)를 위한 것입니다. 에이전트는 구글 검색을 수행하고, 사실을 추출하고, 출처를 인용할 수 있습니다.
  • Vertex AI 검색 (RAG-서비스): 개발자는 Vertex AI 검색을 사용하여 자체 문서(PDF, HTML, BigQuery)를 색인화할 수 있습니다. 이것은 “chunking”, “embedding” 및 “retrieval” 단계를 자동으로 처리하여 에이전트가 내부 “진실의 출처”에만 답할 수 있도록 합니다.
  • Vertex AI RAG 엔진: 고급 사용자 정의를 위한 것입니다. 이것은 하이브리드 검색(벡터 기반 및 키워드 기반 결과의 조합)을 허용하여 표준 LLM 출력보다 최대 30%의 정확도를 향상시킵니다.

멀티 에이전트 오케스트레이션 (A2A 프로토콜)

고급 기업 워크플로는 종종 여러 전문 에이전트가 협력하여 작동합니다. Vertex AI는 에이전트-에이전트(A2A) 프로토콜을 도입합니다. 이것은 개방형 표준으로 다음을 허용합니다:

  • “여행 에이전트”가 “금융 에이전트”와 통신할 수 있습니다. 이것은 비행기 예약이 기업 예산 내에 있는지 확인하기 위해 필요합니다.
  • 상호 운용성: 개방형 프로토콜을 사용하므로, Vertex에서 구축된 에이전트는 LangChain 또는 CrewAI와 같은 다른 프레임워크에서 구축된 에이전트와 통신할 수 있습니다.

개발자 스택: ADK 및 에이전트 엔진

“tech 플랫폼” 대상에게, 에이전트 빌더는 두 가지 다른 경로를 제공합니다:

  1. 노코드 콘솔: 비즈니스 사용자 구성 및 신속한 프로토 타이핑을 위한 시각적 드래그 앤 드롭 인터페이스입니다.
  2. 에이전트 개발 키트(ADK): 엔지니어를 위한 코드 우선 Python 툴킷입니다. 이것은 “프롬프트-코드”, 버전 제어 통합 및 Vertex AI 에이전트 엔진에 대한 배포를 허용합니다. 에이전트 엔진은 세션 지속성, 확장 및 상태 관리를 자동으로 처리합니다.

결론: “무엇이 가능할까”에서 “무엇이 다음일까”로

AI 데모에서 생산급 기업 애플리케이션으로의 전환은 디지털 변혁 프로젝트에서 오랜 “죽음의 계곡”이었습니다. Vertex AI는 이 간격을 메우기 위해 설계되었습니다. 데이터, 인프라 및 모델 오케스트레이션의 단편화된 실을 통일함으로써, 구글 클라우드는 대규모 언어 모델의 원시力量에서 AI 라이프사이클의 운용 성숙도로 대화를 이동시켰습니다.

전문직으로서의 엔지니어, 마음으로서의 작가입니다. Kunal은 AI와 ML에 대한 깊은 사랑과 이해를 가진 기술 작가로, 이러한 분야의 복잡한 개념을 흥미롭고 정보적인 문서를 통해 단순화하는데 헌신하고 있습니다.