Alianzas

Los agentes de voz en local obtienen una nueva ruta de hardware al unirse Smallest.ai a Tenstorrent

mm
Añade Unite.AI a tus fuentes preferidas en Google

Tenstorrent y Smallest.ai anunciaron una asociación el 1 de octubre de 2026, para ofrecer una pila de IA de voz de nivel de producción, en local, que ejecuta de forma nativa el modelo de texto a voz en tiempo real Lightning V2 de Smallest.ai en Tenstorrent Galaxy Blackhole servers.

Tenstorrent, una empresa de cómputo de IA, y Smallest.ai, un laboratorio de investigación de IA que construye infraestructura de IA de voz en tiempo real, dijeron que la pila conjunta está diseñada para reducir los costos de despliegue mientras brinda el rendimiento necesario para aplicaciones de voz en tiempo real. Las empresas afirmaron que ejecutar Lightning V2 en la arquitectura Blackhole permite a las organizaciones operar agentes de voz en tiempo real totalmente en local con plena soberanía de datos, dirigidos a cargas de trabajo de alto volumen y sensibles a los datos en los sectores de servicios financieros, telecomunicaciones, salud y entornos empresariales. Lightning V2 está disponible en hardware de Tenstorrent de inmediato, con precios basados en uso y sin compromisos iniciales.

“No debería ser necesario elegir entre rendimiento y costo – Tenstorrent ha creado un cómputo eficiente y escalable que reduce el costo de los flujos de trabajo existentes y hace que cargas de trabajo totalmente nuevas sean prácticas,” dijo Amr Elashmawi, Vicepresidente de Estrategia y Desarrollo de Negocios en Tenstorrent.

Hardware Galaxy Blackhole

La plataforma de servidor mencionada en el anuncio se construye alrededor de 32 ASIC Blackhole que entregan 23 PFLOPS de cómputo Block FP8, con 6,2 GB de SRAM en chip a 2,9 PB/s y 1 TB de memoria GDDR6 a 16 TB/s, según especificaciones Galaxy de Tenstorrent. Cada ASIC se conecta mediante diez enlaces de 400 GbE para una malla de aceleradores de 32 TB/s, y los sistemas escalan mediante hasta 56 puertos QSFP‑DD de 800 GbE. El chasis refrigerado por aire de 6U combina un procesador host AMD EPYC 9004 con hasta 576 GB de memoria DDR5, ejecuta Ubuntu 22.04, consume entre 8 y 10 kW en promedio, y tiene un precio de lista de $160,000.

Diseño de precisión reducida y resultados medidos

La ingeniería detrás de la asociación está documentada en un artículo, “Reescribiendo la economía de inferencia TTS: Lightning V2 en Tenstorrent logra un costo 4× menor que NVIDIA L40S,” escrito por Ranjith M S de Smallest.ai, Ingeniero Senior de Rendimiento de Inferencia de IA; Director de Tecnología Akshat Mandloi; y Director Ejecutivo Sudarshan Kamath. El artículo se presentó por primera vez el 24 de marzo de 2026 y se revisó el 7 de abril de 2026.

Ranjith, el primer autor del artículo, dijo en el anuncio: “La arquitectura de Tenstorrent es fundamentalmente diferente de los paradigmas existentes. Al trabajar con el NoC y una SRAM más grande, desbloqueamos ganancias 4× a una fracción del costo de una infraestructura GPU comparable, impulsando un cambio estructural en la economía de inferencia.”

Los autores informan que los modelos de texto a voz son significativamente más frágiles numéricamente que los modelos de lenguaje grande porque generan formas de onda continuas mediante refinamiento iterativo, de modo que pequeños errores numéricos se acumulan a lo largo de los pasos de desruido y aparecen como artefactos audibles. Frente a esa limitación, el artículo indica que más del 95 % de las capas de Lightning V2 operan con fidelidad computacional LoFi y que más del 80 % del modelo se despliega en BlockFloat8 sin degradación medible de la calidad de audio. Los autores también reportan una reducción de cómputo 4× en el modelo acústico de difusión, una reducción de cómputo 8× en el vocoder neuronal, una reducción aproximada de 2× en el tamaño del modelo y una reducción de 1,8× en el volumen de transferencia de memoria.

En cuanto a la calidad de salida, el artículo informa una puntuación perceptual DNSMOS de 3,872 para la referencia NVIDIA L40S frente a 3,801 en el P150 de Tenstorrent, una diferencia de 0,071 que los autores describen como dentro del rango de variación perceptual menor, y una tasa de error de palabras normalizada de 0,009 entre las salidas de los dos sistemas.

En pruebas con un solo dispositivo, el artículo indica que el L40S mantiene una concurrencia de 3 con una latencia de 300 ms frente a un costo de dispositivo listado de $9,000, mientras que el P150 y el P100 cada uno alcanzaron una concurrencia de 1 con una latencia de 250 ms a costos listados de $1,400 y $1,000, respectivamente, lo que representa ganancias de costo de 2,6× y 3,6×. Debido a que Lightning V2 se ejecuta en un solo chip sin paralelismo de varios chips ni la interconexión QSFP, la cifra de latencia del P100 se traslada de los resultados medidos del P150, señala el artículo.

A escala de flota, los autores modelan una carga de trabajo de 550 solicitudes simultáneas de TTS de cinco segundos a plena utilización. Calculan que mantenerla requeriría 11 GPU L40S con un costo de acelerador de aproximadamente $100,000, frente a 27 aceleradores P100 con un costo aproximado de $27,000 o 27 aceleradores P150 con un costo aproximado de $37,000, lo que representa una reducción de 3‑4× en el costo inicial en su comparación modelada.

El artículo también informa que una capa altamente optimizada de aproximadamente 6 mil millones de operaciones de multiplicación‑acumulación se ejecuta en unos 60 µs en el L40S frente a unos 31 µs en el P150. Los autores proyectan que extender dicha optimización a nivel de kernel a más capas podría generar una mejora normalizada de costo de 8‑12× sobre la referencia L40S, incrementando la ganancia actual a nivel de sistema de 3,6×.

Los autores presentan el soporte nativo de BlockFloat8 como una línea divisoria de costo de hardware: los GPU contemporáneos con esa capacidad se sitúan en una clase de precio de aproximadamente $40,000 por dispositivo, según informan, mientras que Tenstorrent permite la ejecución de BlockFloat8 en hardware de aproximadamente $1,000, una diferencia de orden de magnitud en el costo de adquisición según su descripción.

Fragilidad Numérica y el Caso del PCC

El artículo documenta un estudio de caso de depuración centrado en el Coeficiente de Correlación de Pearson, una métrica estándar de similitud numérica. Los autores informan que los resultados del L40S y de una CPU AMD EPYC 7352 mostraron un coeficiente de extremo a extremo de solo 0,72 a pesar de entradas idénticas, pero produjeron audio perceptualmente indistinguible. En otro caso, una capa cuyo coeficiente redondeó a 1,0 provocó una ruptura audible que tardó más de un mes en aislarse. Los autores concluyen que las métricas de similitud a nivel de tensor convencionales no son indicadores fiables de la calidad de audio perceptual en los sistemas TTS, y que es necesaria una validación perceptual de extremo a extremo para implementaciones de precisión reducida.

Limitaciones y Próximos Pasos

Los autores indican que ciertas capas siguen siendo demasiado sensibles numéricamente para la ejecución de baja fidelidad o de punto flotante en bloque sin degradación perceptual, lo que limita la cobertura de baja precisión de todo el modelo, y que las configuraciones del compilador y del programa aún no están completamente optimizadas.

En una publicación técnica del 28 de septiembre de 2026, Smallest.ai caracterizó Lightning V2 como el primer modelo TTS del mundo en ofrecer síntesis de voz de alta calidad bajo cuantización conjunta BlockFloat8 y aritmética de precisión reducida. La empresa dijo que su Lightning V3 más reciente ya supera a V2 en calidad y eficiencia arquitectónica, y que planea desplegar Lightning V3 en hardware Tenstorrent con los mismos principios de co‑diseño, apuntando a avances de costo similares o mayores.

Theo Nash es un especialista generado por IA en Unite.AI, cubriendo la infraestructura de IA, el cómputo y los sistemas de hardware que impulsan la inteligencia artificial moderna. Su trabajo se centra en los fundamentos técnicos detrás de cargas de trabajo de IA a gran escala, incluidos los centros de datos, los aceleradores, la conectividad y las pilas de software que los integran.

Con una perspectiva analítica y orientada a la ingeniería, Theo examina cómo los avances en GPUs, silicio personalizado, arquitecturas de memoria y sistemas distribuidos permiten nuevas generaciones de modelos de IA. Presta especial atención a los compromisos de rendimiento, la eficiencia energética, la escalabilidad y las limitaciones prácticas que moldean el despliegue real de la infraestructura de IA.

Los artículos escritos por Theo Nash son generados por IA y revisados por el equipo editorial de Unite.AI para garantizar la precisión técnica, la claridad y una cobertura responsable del panorama de cómputo de IA, que evoluciona rápidamente.