Modelos y plataformas de IA

Fireworks AI pone la API de entrenamiento a disposición general

mm
Añade Unite.AI a tus fuentes preferidas en Google

Fireworks AI, el 31 de agosto de 2026, anunció la disponibilidad general de su API de Entrenamiento y Fireworks Lab, abriendo su infraestructura gestionada de entrenamiento y despliegue a equipos de ML que desean ejecutar bucles de entrenamiento personalizados en modelos abiertos. La API de Entrenamiento conecta el bucle de entrenamiento en Python del cliente con la computación distribuida gestionada por Fireworks, abarcando tanto el entrenador que calcula los gradientes y actualiza el modelo como el despliegue de rollout que genera muestras a partir de él.

Según el acuerdo descrito en el announcement, el cliente orquesta el bucle desde donde prefiera, manteniendo el control sobre la función de pérdida o recompensa, los datos y el entorno. Fireworks gestiona la interacción entre el entrenador y el rollout, incluyendo la sincronización de pesos, la recuperación de intercambios fallidos y la alineación entre entrenamiento y rollout. La empresa presenta la API como respuesta a las limitaciones que, según afirma, los equipos de ML han reportado en los flujos de trabajo de entrenamiento existentes: elección limitada de modelos y métodos, control restringido sobre parámetros y bucles de entrenamiento, computación rígida e infraestructura fragmentada de entrenamiento y despliegue.

Computación sin servidor y dedicada

La API de Entrenamiento ofrece dos opciones de computación. El entrenamiento sin servidor permite a los clientes entrenar adaptadores LoRA en infraestructura compartida con facturación por token, con el muestreo ejecutándose en la misma sesión; Fireworks lo describe como adecuado para iterar experimentos, reducir riesgos en ejecuciones más grandes o ejecutar bucles de aprendizaje por refuerzo que alternan entre rollout y entrenamiento. El entrenamiento dedicado se dirige al entrenamiento de parámetros completos, modelos más allá del pool sin servidor, longitudes de contexto mayores o rangos LoRA, y a un rendimiento sostenido, facturado por hora de GPU en capacidad elástica dimensionada para cada ejecución.

El nivel sin servidor se conecta a un pool compartido siempre activo con una lista seleccionada de modelos populares, capacidad compartida y límites de velocidad por cuenta. El nivel dedicado aprovisiona un entrenador y un despliegue por ejecución, soporta modos LoRA y de parámetros completos hasta los modelos de mezcla de expertos más grandes, y no presenta contención ni límites de velocidad. Los puntos de control prometedores pueden desplegarse a inferencia de producción mediante la UI o la API, y el despliegue multi-LoRA brinda a cada cliente o caso de uso su propio modelo ajustado sin infraestructura separada, según la empresa.

Tres superficies de entrenamiento

La API de Entrenamiento se sitúa junto a otras dos superficies en la Fireworks training platform. Entrenamiento Gestionado, dirigido a ingenieros de ML, ejecuta trabajos incorporados en los que el cliente elige un método — SFT, DPO o RL — y un modelo base, iniciando desde la UI o la API. Fireworks Lab, también disponible de forma general desde el anuncio, incorpora investigadores e ingenieros desplegados en el cliente con los equipos del cliente; los compromisos comienzan con un diagnóstico que define la capacidad, la línea base, los criterios de éxito y el alcance, luego pasan a una implementación con tiempo limitado, y el cliente conserva el modelo listo para producción, el entorno de evaluación, los pipelines de datos, el bucle de entrenamiento y las recetas.

La propia API de Entrenamiento está dirigida a investigadores de ML y soporta SFT, DPO, ORPO, RL y destilación, desde LoRA en computación sin servidor hasta entrenamiento de parámetros completos en clústeres dedicados.

Aprendizaje por refuerzo a gran escala

Fireworks afirma que es una de las pocas organizaciones fuera de los laboratorios de vanguardia que ha operado aprendizaje por refuerzo con más de 10,000 GPUs, y enmarca el entrenamiento de RL en torno a tres requisitos: corrección, eficiencia de rendimiento y velocidad de desarrollo.

En cuanto a la corrección, la empresa señaló que el motor de rollout y el entrenador deben compartir la misma definición numérica, ya que una pequeña deriva numérica puede corromper la señal de aprendizaje mediante recorte de tokens o colapso de recompensas mientras todo parece funcionar. Fireworks alinea los formatos numéricos de extremo a extremo, incluidos BF16, FP8 por bloques y NVFP4, alinea los kernels y el comportamiento de reducción en ambos caminos, y utiliza Router Replay para preservar las decisiones de enrutamiento de mezcla de expertos entre el rollout y la pasada hacia atrás, junto con kernels invariantes por lote y reducciones determinísticas. La compañía afirma que valida la alineación ejecutando secuencias idénticas a través del motor de rollout y el entrenador y midiendo la divergencia KL entre entrenamiento e inferencia, con validación continua para todos los modelos lanzados en el entrenamiento de Fireworks.

En cuanto al rendimiento, Fireworks indicó que ejecuta RL asíncrono, superponiendo la recopilación de rollout con el entrenamiento, de modo que las GPUs de rollout comienzan a generar el siguiente lote mientras el entrenador actualiza el anterior, con envejecimiento de pesos limitado donde el algoritmo lo permite. Después de cada paso de entrenamiento, los pesos actualizados se cargan en caliente en el despliegue de rollout en ejecución en lugar de desmontarlo y recargar un modelo completo. Para los puntos de control de parámetros completos, la empresa dijo que calcula una diferencia XOR entre los pesos actuales y los anteriores y aplica compresión zstd, logrando hasta una reducción de 10 veces en el ancho de banda de transmisión.

En cuanto a la velocidad de desarrollo, la compañía describió un bucle continuo de entrenar, desplegar, evaluar y reentrenar en una sola plataforma, con los puntos de control pasando directamente al servicio y a los trazos de producción, evaluaciones y retroalimentación que alimentan la siguiente ejecución. Afirmó que los equipos reportan de dos a cuatro veces más iteraciones con el mismo presupuesto de entrenamiento.

Resultados de clientes citados

El anuncio citó a varios clientes. Harvey entrenó posteriormente Kimi K3 para trabajos legales de largo horizonte utilizando RL asíncrono; su modelo Harvey Tenet obtuvo un 19,7 % de aciertos totales en LAB frente al 11,5 % de Claude Fable 5, con aproximadamente un tercio del costo por tarea, según Fireworks. Vercel utilizó afinación por refuerzo y decodificación especulativa para el auto‑corregidor de v0, alcanzando una tasa de generación sin errores del 93 % y una mejora de latencia de extremo a extremo de 40 x, según la empresa. Heidi Health trasladó su asistente clínico a modelos abiertos afinados, pasando de una prueba de concepto a producción en cuatro semanas con una latencia 3,5 veces menor. Factory afinó dos adaptadores LoRA pequeños sobre una base abierta Qwen para detectar secretos expuestos; con un presupuesto de falsas alarmas del 5 %, el modelo entrenado capturó alrededor del 70 % de los secretos reales frente al aproximadamente 59 % de GPT‑5.5, informó Fireworks.

La API de Entrenamiento está disponible ahora a través del registro autoservicio de Fireworks, con acceso sin servidor que no requiere aprovisionamiento, y la empresa está orientando a los equipos que deseen soporte práctico a consultas de Fireworks Lab.

Theo Nash es un especialista en inteligencia artificial generada en Unite.AI, que cubre la infraestructura de inteligencia artificial, el cómputo y los sistemas de hardware que alimentan la inteligencia artificial moderna. Su trabajo se centra en los fundamentos técnicos detrás de las cargas de trabajo de inteligencia artificial a gran escala, incluyendo centros de datos, aceleradores, redes y las pilas de software que los unen.
Con una perspectiva analítica y basada en la ingeniería, Theo examina cómo los avances en GPUs, silicio personalizado, arquitecturas de memoria y sistemas distribuidos permiten nuevas generaciones de modelos de inteligencia artificial. Presta especial atención a los compromisos de rendimiento, la eficiencia energética, la escalabilidad y las limitaciones prácticas que dan forma a la implementación en el mundo real de la infraestructura de inteligencia artificial.
Los artículos escritos por Theo Nash son generados por inteligencia artificial y revisados por el equipo editorial de Unite.AI para garantizar la precisión técnica, la claridad y la cobertura responsable del paisaje de cómputo de inteligencia artificial en constante evolución.