AI 모델 및 플랫폼

Google Cloud Next 2025: AI에 대한 베팅을 두 배로 늘리기 위한 실리콘, 소프트웨어, 및 개방형 에이전트 생태계

mm
Unite.AI를 Google의 선호 소스에 추가

라스베이거스에서 Google Cloud Next 2025 (GOOGL)가 열렸다. 이 행사는 기술 업계의 중대한 시점에 개최됐다. AWS, Microsoft Azure, Google Cloud 사이의 클라우드 AI 군비 경쟁은 빠르게 격화되고 있다. 강력한 기술력과 오랜 AI 연구 기반에도 세 번째 경쟁자로 여겨지곤 했던 Google은 이번 무대에서 기업 AI 시장을 정조준한 포괄적이고 공격적인 전략을 제시했다.

Google Cloud CEO 토머스 쿠리안과 Alphabet (GOOG) CEO 순다르 피차이는 AI 전환을 가능성에서 현실로 옮기는 데 초점을 맞췄다. Google은 지난 1년간 3,000건이 넘는 제품 개선, 이전 행사 이후 Vertex AI 플랫폼 사용량 20배 증가, Gemini 모델군을 활용하는 개발자 400만 명 이상, 그리고 행사에서 소개한 500건 이상의 고객 성공 사례를 근거로 성장세를 강조했다.

하지만 행사는 점진적 업데이트나 지표를 보여 주는 데 그치지 않았다. 추론에 최적화한 맞춤형 실리콘 Ironwood TPU, 실용성에 초점을 둔 Gemini 2.5 Flash, 기업에 개방한 글로벌 네트워크 Cloud WAN, 그리고 AI 에이전트의 개방형 상호운용 생태계를 위한 Agent2Agent 프로토콜을 함께 공개했다. Google은 이를 통해 이른바 에이전트 시대라는 기업 AI의 다음 단계를 주도하려 한다.

Ironwood, Gemini와 네트워크 효과

Google AI 전략의 중심에는 맞춤형 실리콘 투자가 있다. Cloud Next 2025의 주인공인 Ironwood는 7세대 TPU이며, 학습된 모델이 실제 애플리케이션에서 예측이나 출력을 만드는 AI 추론을 위해 명시적으로 설계된 첫 TPU로 소개됐다.

Google은 액체 냉각 칩 9,216개를 단일 포드에 연결한 구성과 42.5엑사플롭스의 연산 성능을 제시했다. 이는 현재 세계에서 가장 강력한 슈퍼컴퓨터로 평가되는 El Capitan보다 포드당 연산력이 24배 이상이라는 주장이다. 다만 비교에는 서로 다른 수치 정밀도가 사용될 수 있어 직접적인 동등 비교는 어렵다. Google은 그럼에도 Ironwood가 이전 고성능 TPU 세대보다 10배 이상 개선됐다고 설명한다.

Ironwood는 Trillium(TPU v6)보다 메모리와 상호 연결성이 크게 발전했다. 에너지 효율도 핵심이다. Google은 와트당 성능이 Trillium의 두 배이고, 2018년 첫 Cloud TPU보다 거의 30배 효율적이라고 주장한다. 이는 AI 데이터센터 확장에서 전력 가용성이 제약으로 부상한 현실에 직접 대응한다.

Google TPU 세대 비교: Ironwood(v7)와 Trillium(v6)

항목 Trillium(TPU v6) Ironwood(TPU v7) 개선 폭
주요 초점 학습 및 추론 추론 특화
칩당 최대 연산량 세대 차이로 직접 비교 어려움 4,614 TFLOPs (FP8 likely) –
칩당 HBM 용량 32 GB (6배 주장에 따른 추정) 192 GB 6x
칩당 HBM 대역폭 ~1.6 Tbps (4.5배 주장에 따른 추정) 7.2 Tbps 4.5x
ICI 대역폭(양방향) ~0.8 Tbps (1.5배 주장에 따른 추정) 1.2 Tbps 1.5x
이전 세대 대비 와트당 성능 비교 기준 2x vs Trillium 2x
TPU v1(2018) 대비 와트당 성능 ~15x (추정) 약 30배 ~2x vs Trillium

참고: 일부 Trillium 수치는 Google이 제시한 Ironwood 개선 배수를 토대로 추정했다. 최대 연산 성능은 세대와 정밀도 차이 때문에 직접 비교하기 어렵다.

Ironwood는 TPU와 Nvidia Blackwell 및 차세대 Vera Rubin GPU, Pathways 분산 머신러닝 런타임, Hyperdisk Exapools와 Managed Lustre 저장장치, 네트워킹을 결합하는 Google의 “AI Hypercomputer” 아키텍처에서 핵심 역할을 한다.

모델 측면에서는 고급형 Gemini 2.5 Pro와 대비되는 Gemini 2.5 Flash를 공개했다. Pro가 복잡한 추론에서 최고의 품질을 겨냥한다면 Flash는 낮은 지연 시간과 비용 효율을 최적화해 고객 서비스나 빠른 요약 같은 대규모 실시간 애플리케이션에 적합하다.

Gemini 2.5 Flash는 질문의 복잡도에 따라 처리량을 조절하는 동적 “사고 예산”을 지원해 속도, 비용, 정확도의 균형을 조정한다. Ironwood와 Gemini Flash를 함께 내놓은 것은 운영 환경에서 모델을 실행하는 비용과 효율이 기업의 핵심 관심사가 된 상황에서 AI의 실질적 운영화를 추진한다는 의미다.

Cloud WAN은 200만 마일이 넘는 광섬유와 200개 이상의 접속 지점으로 42개 지역을 잇는 Google의 내부 글로벌 네트워크를 기업 고객에게 제품으로 제공한다. Google은 공용 인터넷보다 최대 40% 빠르고 자체 관리 WAN보다 총소유비용을 최대 40% 줄이며 99.99%의 신뢰성 SLA를 제공한다고 주장한다.

데이터센터 간 고성능 연결과 지점·캠퍼스 환경을 대상으로 하는 Cloud WAN은 Network Connectivity Center를 포함한 기존 인프라를 활용한다. Nestlé와 Citadel Securities가 초기 도입사로 소개됐다. 이는 내부 운영 자산을 경쟁 우위와 수익원으로 전환해 통신사뿐 아니라 AWS Cloud WAN과 Azure Virtual WAN에도 도전하는 행보다.

출처: Google DeepMind

에이전트 공세: ADK와 A2A로 연결 구축

Google은 인프라와 핵심 모델을 넘어 AI 에이전트와 이를 구축하고 연결하는 도구에 큰 비중을 뒀다. 단순 챗봇을 넘어 자율적으로 추론하고 계획하며 복잡한 다단계 작업을 실행하는 시스템, 그리고 전문 에이전트가 협업하는 다중 에이전트 시스템을 지향한다.

이를 위해 Agent Development Kit(ADK)을 공개했다. 우선 Python으로 제공되는 오픈소스 프레임워크로, 개별 에이전트와 복잡한 다중 에이전트 시스템 개발을 단순화한다. Google은 100줄 미만의 코드로 작동하는 에이전트를 만들 수 있다고 주장한다.

코드 우선 방식, 다중 에이전트 아키텍처 기본 지원, Model Context Protocol(MCP)을 포함한 유연한 도구 통합, 내장 평가, 로컬 컨테이너부터 Vertex AI Agent Engine까지의 배포 옵션이 주요 기능이다. 양방향 오디오와 비디오 스트리밍도 지원하며, Agent Garden은 샘플과 100개 이상의 사전 구축 커넥터를 제공한다.

전략의 핵심은 Agent2Agent(A2A) 프로토콜이다. A2A는 에이전트 상호운용성을 위한 새로운 개방형 표준으로, ADK, LangGraph, CrewAI 등 사용 프레임워크나 공급업체와 관계없이 에이전트가 안전하게 통신하고 정보를 교환하며 행동을 조율하도록 한다. 이는 부서와 업무별 에이전트가 서로 연결되지 않는 기업의 사일로 문제를 직접 겨냥한다.

Google은 폐쇄형 독점 생태계 대신 에이전트 통신의 사실상 표준을 세우려는 큰 승부를 택했다. 단기적인 종속 효과를 일부 포기하는 대신 장기적인 생태계 주도권을 얻고, 복잡한 다중 에이전트 도입을 가로막는 마찰을 줄이려는 전략이다. 개방성을 통해 전체 시장을 키우고 Google Cloud와 도구를 중심 촉진자로 자리매김하려 한다.

A2A의 작동 방식. 출처: Google

클라우드 경쟁의 재조정: Google의 승부수

Google Cloud는 AI 도입에 힘입어 빠르게 성장하지만 시장 점유율에서는 AWS와 Azure에 이어 여전히 3위다. 이번 발표는 고유한 강점을 확대하고 약점으로 인식된 부분을 보완해 경쟁 구도를 다시 짜려는 전략을 보여 준다.

추론 중심 Ironwood TPU로 이어진 장기 맞춤형 실리콘 투자는 AWS Trainium·Inferentia와 Azure Maia와 다른 하드웨어 이야기를 제공한다. AI 전력 수요가 치솟는 상황에서 Google이 강조하는 와트당 성능은 중요한 차별점이 될 수 있다. Cloud WAN은 독보적인 글로벌 네트워크를 기업에 개방해 별도의 네트워크 우위를 만든다.

또한 Google은 DeepMind 연구에서 이어지는 AI·머신러닝 전통과 포괄적인 Vertex AI 플랫폼을 활용해 AI와 데이터 분석의 선도 기업이라는 평가를 강화한다.

동시에 과거의 기업 고객 우려도 해결하려 한다. 행사 직전 발표된 클라우드 보안 회사 Wiz의 320억 달러 인수는 보안 태세와 사용성을 강화해 기업 신뢰를 높이려는 의지를 보여 준다. 산업별 솔루션, 기업 환경 준비도, 전략적 파트너십도 순수 기술 공급자에서 신뢰받는 기업 파트너로 인식을 바꾸는 데 기여한다.

종합하면 모든 서비스에서 AWS와 Azure를 그대로 따라가기보다 AI 연구, 맞춤형 하드웨어, 글로벌 네트워크, 오픈소스 친화성이라는 고유 자산을 활용해 대규모 AI, 특히 효율적인 추론과 정교한 에이전트 시스템이라는 다음 클라우드 물결을 주도하려는 전략이다.

Google AI가 나아갈 길

Google Cloud Next 2025는 야심과 전략적 일관성을 보여 줬다. Google은 추론 시대에 최적화한 Ironwood, 성능과 실용성을 균형 있게 갖춘 Gemini 2.5 Pro와 Flash, 글로벌 Cloud WAN, 그리고 ADK·A2A를 통한 개방형 에이전트 접근에 자원을 집중하고 있다.

행사는 깊은 기술 역량을 AI 시대의 포괄적이고 차별화된 기업 제품으로 전환하려는 회사를 보여 줬다. 하드웨어, 소프트웨어, 네트워크, 개방 표준을 아우르는 통합 전략은 타당하지만 앞으로는 혁신 이상의 것이 필요하다.

가장 큰 과제는 기술보다 기업의 도입 관성을 극복하고 지속적인 신뢰를 쌓는 데 있을 수 있다. 뿌리 깊은 경쟁사를 상대로 발표를 시장 점유율 상승으로 전환하려면 빈틈없는 실행, 분명한 시장 진입 전략, 그리고 대기업에 Google Cloud가 AI 미래에 필수적인 플랫폼임을 꾸준히 설득하는 능력이 필요하다. Google이 그리는 에이전트 미래는 매력적이지만 라스베이거스의 조명이 꺼진 뒤에도 복잡한 시장 역학을 헤쳐 가야 실현될 수 있다.

Alex은 Unite.AI의 AI 기반 뉴스 운영을 이끌며, 저널리즘, 연구, 자동화를 결합해 인공지능에 대한 시기적절하고 확장 가능한 보도를 지원합니다. 그의 작업은 새로운 AI 개발이 효율적으로 부각되도록 돕는 동시에, 출판물의 편집 기준을 유지합니다.