Modelos y plataformas de IA
Introducción a Vertex AI

Dada la rápida evolución del paisaje de la Inteligencia Artificial, uno de los principales obstáculos que los líderes tecnológicos suelen encontrar es la transición de ser “experimentales” a ser “listos para la empresa”. Mientras que los chatbots de consumo y una plataforma interactiva ayudan con la imaginación pública, las empresas no pueden tener éxito con solo una interfaz de chat. En una era en que la competencia es más agresiva que nunca, las empresas necesitan un ecosistema robusto, escalable y seguro, y esto es lo que Google (GOOGL ) intenta ofrecer con Vertex AI, la plataforma unificada de Inteligencia Artificial y Aprendizaje Automático de Google Cloud.
Vertex AI intenta solidificarse como la columna vertebral para la integración de la Inteligencia Generativa con la infraestructura en la nube moderna, ofreciendo una suite integral de características que bridan la brecha entre los modelos de fundamento brutos y las aplicaciones de producción. Vertex AI no es simplemente un envoltorio para los grandes modelos de lenguaje (LLM), sino que es un ecosistema unificado de Aprendizaje Automático e Inteligencia Artificial (ML/AI) que trata a la Inteligencia Generativa como un ciudadano de primera clase de la infraestructura en la nube moderna.
En el corazón de Vertex AI se encuentra el Model Garden, un mercado central que proporciona acceso a más de 200 modelos de fundamento curados, incluyendo el poderoso multimodal Gemini 2.5 Pro, que cuenta con una ventana de contexto de 2 millones de tokens. En este artículo, desglosaremos la arquitectura de Vertex AI, exploraremos cómo Model Garden sirve como la “App Store” de la industria para la inteligencia, y examinaremos los pilares técnicos que hacen que esta plataforma sea la columna vertebral de la próxima generación de software empresarial.
La Arquitectura Central: Una Plataforma Unificada

Vertex AI no es una colección suelta de herramientas, sino un ecosistema unificado de datos y Inteligencia Artificial diseñado para bridar la fragmentación de los datos, las herramientas y los equipos que plagia al aprendizaje automático hasta hoy en día. Tradicionalmente, el desarrollo de la Inteligencia Artificial tiene lugar en entornos aislados, y a veces, los datos están dispersos y atrapados en varios repositorios. Por ejemplo, las organizaciones pueden almacenar los datos de los clientes en almacenes SQL mientras que los documentos no estructurados se descargan en un lago de datos. Cuando los datos están siloeados, la Inteligencia Artificial solo ve una “verdad parcial”, lo que lleva a resultados sesgados o tasas de alucinación altas porque carece del contexto completo de la empresa.
Vertex AI intenta integrar todo el ciclo de vida, desde la ingesta de datos brutos en BigQuery y Cloud Storage hasta el monitoreo de producción, sirviendo esencialmente como un “tejido conectivo” entre estos silos. Vertex AI se integra de forma nativa con Cloud Storage y BigQuery, lo que permite a los modelos de Inteligencia Artificial recuperar los datos sin complejos pipelines de Extracción, Transformación y Carga.
La Fundación: El Hipersupercomputador de Google
La capa GenAI de Vertex AI se encuentra sobre la arquitectura del hipersupercomputador de Google, un sistema de supercomputación integrado que consiste en:
TPU v5p y v5e (Unidades de Procesamiento de Tensor)
Las Unidades de Procesamiento de Tensor de Google son ASIC personalizados (Circuitos Integrados de Aplicación Específica) diseñados específicamente para la multiplicación de matrices que define el aprendizaje profundo.
- TPU v5p (Rendimiento): Este es el acelerador insignia para el entrenamiento a gran escala. Cada pod de TPU v5p puede escalar hasta 8,960 chips interconectados por la Interconexión de Chip de Google de mayor ancho de banda (ICI) a 4,800 Gbps. Para un líder técnico, esto significa un entrenamiento 2,8 veces más rápido para un modelo GPT-3 (175B parámetros) en comparación con la generación anterior, lo que reduce drásticamente el tiempo de comercialización.
- TPU v5e (Eficiencia): Diseñado para un rendimiento “optimizado por costo”, el v5e es el caballo de batalla para el entrenamiento a escala media y la inferencia de alta velocidad. Ofrece hasta 2,5 veces mejor relación precio-rendimiento, lo que lo convierte en la elección ideal para las empresas que necesitan ejecutar inferencia las 24 horas del día sin un presupuesto masivo.
NVIDIA H100/A100 GPUs para Flexibilidad
Mientras que las TPU son especializadas, muchos equipos de desarrollo confían en el ecosistema NVIDIA CUDA. Vertex AI ofrece soporte de primera clase para el hardware más reciente de NVIDIA:
- NVIDIA H100 (Hopper): Ideal para ajustar los modelos de código abierto más grandes (como Llama 3.1 405B) que requieren una gran anchura de banda de memoria.
- Jupiter Networking: Para evitar el “cuello de botella de la red”, Google utiliza su tejido de red de centro de datos Jupiter. Esto garantiza que los datos se muevan entre las GPUs a una velocidad relámpago, lo que admite el acceso directo a la memoria remota (RDMA) para omitir la sobrecarga del CPU y ofrecer un rendimiento casi local en nodos distribuidos.
Orquestación Dinámica
El cambio técnico más crítico en Vertex AI es la Orquestación Dinámica. En un entorno heredado, si un nodo de GPU falla durante una ejecución de entrenamiento de 3 semanas, todo el trabajo puede fallar.
- Resiliencia Automatizada: Vertex AI, a menudo impulsado por Google Kubernetes Engine (GKE) bajo el capó, cuenta con nodos “autocurativos”. Si se detecta una falla de hardware, la plataforma migra automáticamente la carga de trabajo a un nodo saludable.
- Programador de Carga de Trabajo Dinámico: Esta herramienta permite a los equipos solicitar capacidad según la urgencia. Puedes optar por Inicio Flexible (más barato, comienza cuando está disponible) o Capacidad Garantizada para lanzamientos críticos de la misión.
- Entrenamiento sin Servidor: Para los equipos que desean cero gestión de infraestructura, el Entrenamiento sin Servidor de Vertex AI les permite enviar su código y datos; la plataforma proporciona el clúster, ejecuta el trabajo y lo desmonta, cobrando solo por los segundos de cómputo utilizados.
Los Tres Puntos de Entrada: Descubrimiento, Experimentación y Automatización
Para acomodar a diferentes personalidades técnicas, desde científicos de datos hasta desarrolladores de aplicaciones, Vertex AI ofrece tres puntos de entrada principales:
- Model Garden: El Mercado para el Descubrimiento.
- Vertex AI Studio: El Campo de Pruebas para la Experimentación.
- Vertex AI Agent Builder: La Fábrica para la Automatización.
Model Garden: El Mercado para el Descubrimiento
El Model Garden de Google Cloud es una plataforma centralizada dentro de Google Cloud para descubrir, probar, personalizar y desplegar una amplia gama de modelos de Inteligencia Artificial de primera parte, de código abierto y de terceros, incluyendo modelos multimodales (visión, texto, código) para diversas necesidades empresariales, ofreciendo una integración perfecta con las herramientas de Vertex AI para una MLOps fluida. Actúa como una biblioteca integral, ayudando a los desarrolladores y a las empresas a seleccionar el modelo correcto (desde modelos de fundamento grandes hasta modelos especializados) para sus tareas, ya sea para la generación de texto, el análisis de imágenes o la finalización de código, y desplegarlos de manera eficiente dentro de su entorno de Google Cloud.

Model Garden categoriza sus 200+ modelos en tres niveles distintos, lo que permite a los arquitectos equilibrar el rendimiento, el costo y el control:
- Modelos de primera parte (Google): Estos son los modelos multimodales insignia disponibles dentro de Vertex AI, y Google los ofrece en varios tamaños, desde Pro con razonamiento complejo hasta Flash con baja latencia y alto volumen, lo que permite a los desarrolladores optimizar sus modelos según sus casos de uso.
- Modelos de terceros (Propietarios): A través de asociaciones estratégicas, Vertex AI ofrece acceso “Modelo como Servicio” (MaaS) a gigantes como Anthropic (Claude 3.5) y Mistral AI. En lugar de gestionar facturas y credenciales de seguridad separadas para cinco proveedores de Inteligencia Artificial diferentes, un equipo técnico puede acceder a todos ellos a través de su proyecto de Google Cloud existente, utilizando un formato de API unificado.
- Modelos de código abierto y de peso abierto: Este nivel incluye Meta’s Llama 3.2, Mistral y el propio Gemma de Google. Estos son ideales para organizaciones que desean desplegar modelos dentro de su propio VPC (Red Privada Virtual) para garantizar el aislamiento de datos máximo.
En un entorno no unificado, desplegar un modelo de código abierto como Llama requiere configurar un entorno PyTorch, configurar los controladores CUDA y gestionar un envoltorio Flask o FastAPI.
Model Garden elimina esta fase de “amalgamación” a través de Puntos de conexión administrados unificados:
- Implementación en un solo clic: Para muchos modelos, hacer clic en “Implementar” provisiona automáticamente los recursos TPU/GPU necesarios, envuelve el modelo en un contenedor listo para producción y proporciona un punto de conexión de API de REST.
- Integración con Hugging Face: Vertex AI ahora permite a los desarrolladores implementar modelos directamente desde el Hub de Hugging Face en un punto de conexión de Vertex, lo que proporciona una expansión casi infinita de la inteligencia disponible.
- Conexión de Servicio Privado (PSC): Para industrias altamente reguladas, los modelos se pueden implementar utilizando Conexión de Servicio Privado, lo que garantiza que el punto de conexión del modelo nunca se exponga a Internet, manteniendo el tráfico de datos estrictamente dentro de la red corporativa.
Vertex AI Studio: El Campo de Pruebas para la Experimentación
Mientras que el Model Garden se trata de la selección, Vertex AI Studio se trata de precisión.

Prototipado Multimodal: Más allá del Texto
Una de las características destacadas del Studio es su soporte nativo para multimodalidad. Mientras que otras plataformas requieren codificación compleja para manejar datos no textuales, Vertex AI Studio permite cargar archivos directamente en la interfaz para probar las capacidades de razonamiento de Gemini 2.5.
- Inteligencia de Video: Puedes subir una nota técnica de 45 minutos y pedirle al modelo que “identifique cada vez que se menciona una API específica y proporcione un resumen con marca de tiempo”.
- Análisis de Documentos: En lugar de simplemente leer texto, el modelo puede analizar el diseño visual de un PDF de 1.000 páginas, comprendiendo la relación entre gráficos, tablas y prosa circundante.
- Ejecución de Código: El Studio ahora admite la ejecución de código en el campo de pruebas. Si se le pide al modelo que resuelva un problema matemático complejo o analice un CSV, el modelo puede escribir y ejecutar código Python en un entorno de sandbox seguro para proporcionar una respuesta verificada.
Personalización Avanzada: La Vía de Ajuste

Cuando la ingeniería de prompt (Zero-shot o Few-shot) alcanza un límite, Vertex AI Studio proporciona la maquinaria pesada: Ajuste de Modelo.
- Ajuste de Modelo Supervisado (SFT): Los desarrolladores proporcionan un conjunto de datos de “Prompt/Respuesta” (idealmente 100+ ejemplos). Esto enseña al modelo a adoptar una voz de marca específica, formato de salida (como JSON especializado) o jerga de dominio específico.
- Almacenamiento en Caché de Contexto: Para las empresas que lidian con conjuntos de datos estáticos masivos (como una biblioteca jurídica o una base de código), el Studio permite Almacenamiento en Caché de Contexto. Esto permite “pre-cargar” un millón de tokens de datos en la memoria del modelo, lo que reduce drásticamente la latencia y los costos para consultas posteriores.
- Destilación (Maestro-Alumno): Esta es una movida arquitectónica de alto nivel. Puedes usar un modelo masivo (Gemini 2.5 Pro) para “enseñar” a un modelo más pequeño y rápido (Gemini 2.0 Flash). El resultado es un modelo ligero que se desempeña a un nivel “Pro” pero se ejecuta a la velocidad y el costo de “Flash”.
Vertex AI Agent Builder: La Fábrica para la Automatización
Vertex AI Agent Builder es un marco de orquestación de alto nivel que permite a los desarrolladores crear estos agentes combinando modelos de fundamento con datos empresariales y API externas.
La Arquitectura de la “Verdad”: Anclaje y RAG
La principal barrera técnica para la Inteligencia Artificial empresarial es la alucinación. Agent Builder soluciona esto a través de un motor de Anclaje sofisticado.
- Anclaje con Búsqueda de Google: Para las consultas que requieren conocimiento del mundo real en tiempo real (por ejemplo, “¿Cuáles son las tasas de hipoteca actuales en Nueva York?”), el agente puede realizar una búsqueda en Google, extraer los hechos y citar sus fuentes.
- Búsqueda de Vertex AI (RAG como Servicio): En lugar de construir manualmente una base de datos vectorial (Pinecone, Weaviate), los desarrolladores pueden usar Búsqueda de Vertex AI para indexar sus propios documentos (PDF, HTML, BigQuery). Maneja automáticamente los pasos de “troceado”, “incrustación” y “recuperación”, asegurando que el agente solo responda según su “Fuente de Verdad” interna.
- Motor RAG de Vertex AI: Para implementaciones personalizadas a gran escala, este servicio administrado permite la búsqueda híbrida (combinando resultados basados en vectores y basados en palabras clave) para mejorar la precisión hasta un 30% sobre las salidas de LLM estándar.
Orquestación de Multiagente (Protocolo A2A)
Los flujos de trabajo empresariales avanzados a menudo requieren múltiples agentes especializados que trabajen juntos. Vertex AI introduce el Protocolo de Agente a Agente (A2A), un estándar abierto que permite:
- El “Agente de Viajes” puede hablar con el “Agente de Finanzas” para asegurarse de que una reserva de vuelo esté dentro del presupuesto corporativo.
- Interoperabilidad: Dado que utiliza un protocolo abierto, los agentes construidos en Vertex pueden comunicarse con aquellos construidos en otros marcos como LangChain o CrewAI.
La Pila de Desarrollo: ADK y Motor de Agente
Para la audiencia de “plataforma técnica”, el Constructor de Agentes ofrece dos caminos distintos:
- Consola sin Código: Una interfaz de arrastrar y soltar visual para la prototipación rápida y la configuración del usuario comercial.
- Kit de Desarrollo de Agente (ADK): Un kit de herramientas de código de primera clase para ingenieros. Permite “Prompt como Código”, integración de control de versiones y la capacidad de implementar en el Motor de Agente de Vertex AI, un tiempo de ejecución administrado que maneja la persistencia de sesión, escalado y gestión de estado automáticamente.
Conclusión: De “¿Qué pasa si” a “¿Qué sigue?”
La transición de una demostración de Inteligencia Artificial impresionante a una aplicación empresarial de producción ha sido durante mucho tiempo el “valle de la muerte” para los proyectos de transformación digital. Como hemos explorado, Vertex AI está diseñado específicamente para bridar esta brecha. Al unificar los silos fragmentados de datos, infraestructura y orquestación de modelos, Google Cloud ha cambiado la conversación desde el poder bruto de los Grandes Modelos de Lenguaje hacia la madurez operativa del ciclo de vida de la Inteligencia Artificial.












