Líderes de opinión

Mejorando la inferencia de IA: Técnicas avanzadas y mejores prácticas

mm
Añade Unite.AI a tus fuentes preferidas en Google

Cuando se trata de aplicaciones en tiempo real impulsadas por IA, como los coches autónomos o el monitoreo de la salud, incluso un segundo adicional para procesar una entrada podría tener consecuencias graves. Las aplicaciones de IA en tiempo real requieren GPUs y potencia de procesamiento confiables, lo que ha sido muy costoso y prohibitivo para muchas aplicaciones – hasta ahora.

Al adoptar un proceso de inferencia optimizado, las empresas no solo pueden maximizar la eficiencia de la IA, sino que también pueden reducir el consumo de energía y los costos operativos (hasta un 90%); mejorar la privacidad y la seguridad; y incluso mejorar la satisfacción del cliente.

Problemas comunes de inferencia

Algunos de los problemas más comunes que enfrentan las empresas al gestionar la eficiencia de la IA incluyen clústeres de GPU subutilizados, modelos generales por defecto y falta de visibilidad en los costos asociados.

Los equipos a menudo provisionan clústeres de GPU para la carga máxima, pero entre el 70 y el 80 por ciento del tiempo, están subutilizados debido a flujos de trabajo desiguales.

Además, los equipos recurren a modelos generales grandes (GPT-4, Claude) incluso para tareas que podrían ejecutarse en modelos de código abierto más pequeños y económicos. Las razones son la falta de conocimiento y una curva de aprendizaje pronunciada al construir modelos personalizados.

Finalmente, los ingenieros carecen de visibilidad en el costo real por cada solicitud, lo que lleva a facturas cuantiosas. Herramientas como PromptLayer, Helicone pueden ayudar a proporcionar esta visibilidad.

Con la falta de controles sobre la elección del modelo, el batch y la utilización, los costos de inferencia pueden aumentar exponencialmente (hasta 10 veces), desperdiciar recursos, limitar la precisión y disminuir la experiencia del usuario.

Consumo de energía y costos operativos

Ejecutar LLM más grandes como GPT-4, Llama 3 70B o Mixtral-8x7B requiere significativamente más potencia por token. En promedio, el 40 al 50 por ciento de la energía utilizada por un centro de datos alimenta el equipo de cómputo, con un 30 al 40 por ciento adicional dedicado a enfriar el equipo.

Por lo tanto, para una empresa que ejecuta inferencia a escala las 24 horas del día, es más beneficioso considerar un proveedor de infraestructura local en lugar de un proveedor en la nube para evitar pagar un costo premium y consumir más energía.

Privacidad y seguridad

Según el Estudio de referencia de privacidad de datos de Cisco 2025, el 64% de los encuestados se preocupa por compartir involuntariamente información sensible públicamente o con competidores, y casi la mitad admite ingresar datos personales de empleados o no públicos en herramientas de GenAI”. Esto aumenta el riesgo de incumplimiento si los datos no se registran o se almacenan correctamente. Otra oportunidad de riesgo es ejecutar modelos en diferentes organizaciones de clientes en una infraestructura compartida; esto puede provocar violaciones de datos y problemas de rendimiento, y existe un riesgo adicional de que las acciones de un usuario afecten a otros usuarios. Por lo tanto, las empresas generalmente prefieren servicios desplegados en su propia nube.

Satisfacción del cliente

Cuando las respuestas tardan más de unos segundos en aparecer, los usuarios suelen abandonar, lo que respalda el esfuerzo de los ingenieros por optimizar para una latencia cero. Además, las aplicaciones presentan “obstáculos como alucinaciones e inexactitudes que pueden limitar el impacto y la adopción generalizados”, según un comunicado de prensa de Gartner.

Beneficios comerciales de gestionar estos problemas

Optimizar el batch, elegir modelos de tamaño adecuado (por ejemplo, cambiar de Llama 70B o modelos de código cerrado como GPT a Gemma 2B cuando sea posible) y mejorar la utilización de la GPU pueden reducir las facturas de inferencia entre el 60 y el 80 por ciento. Utilizar herramientas como vLLM puede ayudar, al igual que cambiar a un modelo de pago por uso para un flujo de trabajo irregular.

Por ejemplo, Cleanlab. Cleanlab lanzó elModelo de lenguaje confiable (TLM) para agregar una puntuación de confiabilidad a cada respuesta de LLM. Está diseñado para salidas de alta calidad y confiabilidad mejorada, lo cual es fundamental para aplicaciones empresariales para prevenir alucinaciones no controladas. Antes de Inferless, Cleanlabs experimentó un aumento en los costos de la GPU, ya que las GPUs se ejecutaban incluso cuando no se utilizaban activamente. Sus problemas eran típicos de los proveedores de GPU tradicionales en la nube: alta latencia, gestión de costos ineficiente y un entorno complejo para gestionar. Con la inferencia sin servidor, redujeron los costos en un 90 por ciento mientras mantenían los niveles de rendimiento. Más importante aún, se pusieron en vivo en dos semanas sin costos adicionales de sobrecarga de ingeniería.

Optimización de arquitecturas de modelo

Los modelos base como GPT y Claude a menudo se entrenan para la generalidad, no para la eficiencia o tareas específicas. Al no personalizar modelos de código abierto para casos de uso específicos, las empresas desperdician memoria y tiempo de cómputo para tareas que no necesitan esa escala.

Los nuevos chips de GPU como H100 son rápidos y eficientes. Estos son especialmente importantes al ejecutar operaciones a gran escala como la generación de video o tareas relacionadas con la IA. Más núcleos CUDA aumentan la velocidad de procesamiento, superando a las GPUs más pequeñas; los núcleos de tensor de NVIDIA están diseñados para acelerar estas tareas a escala.

La memoria de la GPU también es importante al optimizar las arquitecturas del modelo, ya que los modelos de IA grandes requieren un espacio significativo. Esta memoria adicional permite que la GPU ejecute modelos más grandes sin comprometer la velocidad. Por el contrario, el rendimiento de las GPUs más pequeñas que tienen menos VRAM se ve afectado, ya que mueven los datos a una RAM de sistema más lenta.

Varios beneficios de optimizar la arquitectura del modelo incluyen ahorros de tiempo y dinero. En primer lugar, cambiar de un transformador denso a variantes optimizadas con LoRA o FlashAttention puede ahorrar entre 200 y 400 milisegundos del tiempo de respuesta por consulta, lo cual es crucial en los chatbots y los juegos, por ejemplo. Además, los modelos cuantificados (como 4 bits o 8 bits) necesitan menos VRAM y se ejecutan más rápido en GPUs más baratas.

A largo plazo, optimizar la arquitectura del modelo ahorra dinero en la inferencia, ya que los modelos optimizados pueden ejecutarse en chips más pequeños.

Optimizar la arquitectura del modelo implica los siguientes pasos:

  • Cuantización — reducir la precisión (FP32 → INT4/INT8), ahorrar memoria y acelerar el tiempo de cómputo
  • Poda — eliminar pesos o capas menos útiles (estructurados o no estructurados)
  • Destilación — entrenar un modelo “estudiante” más pequeño para imitar la salida de uno más grande

Comprimir el tamaño del modelo

Modelos más pequeños significan inferencia más rápida y una infraestructura menos costosa. Los modelos grandes (13B+, 70B+) requieren GPUs costosas (A100s, H100s), alta VRAM y más potencia. Comprimirlos permite que se ejecuten en hardware más barato, como A10s o T4s, con mucha menos latencia.

Los modelos comprimidos también son fundamentales para ejecutar la inferencia en el dispositivo (teléfonos, navegadores, IoT), ya que los modelos más pequeños permiten servir más solicitudes concurrentes sin escalar la infraestructura. En un chatbot con más de 1.000 usuarios concurrentes, cambiar de un modelo de 13B a un modelo comprimido de 7B permitió a un equipo servir más del doble de usuarios por GPU sin picos de latencia.

Leveraging hardware especializado

Las CPUs de propósito general no están diseñadas para operaciones de tensor. El hardware especializado como NVIDIA A100s, H100s, Google TPUs o AWS Inferentia puede ofrecer una inferencia más rápida (entre 10 y 100 veces) para LLM con una mejor eficiencia energética. Ahorrar incluso 100 milisegundos por solicitud puede marcar una diferencia cuando se procesan millones de solicitudes diarias.

Consideremos este ejemplo hipotético:

Un equipo está ejecutando LLaMA-13B en GPUs estándar A10 para su sistema RAG interno. La latencia es de aproximadamente 1,9 segundos, y no pueden batchear mucho debido a los límites de VRAM. Entonces cambian a H100 con TensorRT-LLM, habilitan FP8 y el núcleo de atención optimizado, aumentan el tamaño del batch de 8 a 64. El resultado es reducir la latencia a 400 milisegundos con un aumento de cinco veces en el rendimiento.
Como resultado, pueden servir cinco veces más solicitudes con el mismo presupuesto y liberar a los ingenieros de navegar por los cuellos de botella de la infraestructura.

Evaluación de opciones de implementación

Diferentes procesos requieren diferentes infraestructuras; un chatbot con 10 usuarios y un motor de búsqueda que sirve un millón de consultas por día tienen diferentes necesidades. Ir a la nube (por ejemplo, AWS Sagemaker) o servidores GPU DIY sin evaluar las relaciones de rendimiento de costo conduce a un gasto desperdiciado y una mala experiencia del usuario. Tenga en cuenta que si se compromete temprano con un proveedor de nube cerrado, migrar la solución más adelante es doloroso. Sin embargo, evaluar temprano con una estructura de pago por uso ofrece opciones en el camino.

La evaluación abarca los siguientes pasos:

  • Medir la latencia del modelo y el costo en diferentes plataformas: Realizar pruebas A/B en AWS, Azure, clústeres de GPU locales o herramientas sin servidor para replicar.
  • Medir el rendimiento de inicio en frío: Esto es especialmente importante para cargas de trabajo sin servidor o basadas en eventos, porque los modelos se cargan más rápido.
  • Evaluar la observabilidad y los límites de escalabilidad: Evaluar las métricas disponibles e identificar cuál es el máximo de consultas por segundo antes de degradar.
  • Verificar el soporte de cumplimiento: Determinar si se pueden hacer cumplir las reglas de datos geográficos o los registros de auditoría.
  • Estimar el costo total de propiedad. Esto debe incluir horas de GPU, almacenamiento, ancho de banda y sobrecarga para los equipos.

En resumen

La inferencia permite a las empresas optimizar su rendimiento de IA, reducir el consumo de energía y los costos, mantener la privacidad y la seguridad, y mantener a los clientes satisfechos.

Aishwarya Goel es co-fundadora y CEO de Inferless, una plataforma de servidor sin estado que ayuda a los desarrolladores a implementar modelos personalizados y de código abierto con arranques en frío bajos y escalado automático eficiente.