Modelos y plataformas de IA

El chip de borde de Acrab tiene como objetivo ejecutar modelos de IA de 100B localmente

mm
Añade Unite.AI a tus fuentes preferidas en Google

Acrab, una startup de Singapur que surgió de la clandestinidad en junio de 2026 con más de $350 millones en financiamiento, presentó su primer silicio el 23 de julio de 2026: GΞLIX 1, un procesador de borde de 5 nanómetros, junto con Agent Box, un sistema de escritorio construido alrededor de él. Ambos tienen como objetivo ejecutar modelos de IA de código abierto en la clase de 100 mil millones de parámetros en hardware lo suficientemente pequeño como para caber en un escritorio, sin enrutar los datos a través de un servicio en la nube.

Esa es una apuesta en contra de la forma prevaleciente de la IA generativa, donde los modelos de ese tamaño viven en centros de datos y los usuarios pagan por token. Los modelos de esta escala generalmente han requerido infraestructura en la nube; el caso de Acrab es que las matemáticas económicas y de privacidad ahora favorecen sacarlos de la nube y llevarlos a hardware local, donde las respuestas regresan más rápido, los datos permanecen en el dispositivo y el sistema sigue funcionando cuando la red no lo hace.

Acrab está liderada por el Dr. Ken Phua, quien dirigió la ingeniería de aplicaciones de Asia en Arm y más tarde se desempeñó como co-CEO de Arm China, y el chip refleja esa herencia. En lugar de agregar un acelerador discreto, GΞLIX 1 integra CPU, GPU y NPU en un solo die con una sola memoria compartida. “Ejecutar modelos en la clase de 100 mil millones de parámetros en un sistema lo suficientemente pequeño como para caber en un escritorio presenta un desafío computacional significativo”, dijo Phua.

Dentro del silicio

GΞLIX 1 combina un CPU Arm de 20 núcleos con una unidad de procesamiento de neuronas multicore y 273 GB/s de ancho de banda de memoria unificada, según Acrab, y está diseñado para distribuir un modelo grande en los tres bloques de cómputo al mismo tiempo. La empresa considera que el ancho de banda de memoria y el tiempo hasta el primer token (el retraso antes de que un modelo comience a responder a una solicitud larga) son las restricciones vinculantes a esta escala, y dice que ajustó el chip para mantener el poder lo suficientemente bajo como para ejecutar todo el día.

La única cifra de rendimiento que Acrab divulgó es un número de proveedor, no una prueba independiente. En su propia prueba de referencia, la empresa informó una tasa de prellenado de 1.416,8 tokens por segundo en comparación con 188,9 en un Mac Mini M4 Pro, o aproximadamente 7,5 veces más rápido, utilizando una configuración de modelo Gemma que etiqueta como “26B A4B” con una entrada de 10.000 tokens. Ese conjunto mantiene solo alrededor de 4 mil millones de parámetros activos al mismo tiempo, muy por debajo del techo de 100 mil millones de parámetros que se vende el chip, y la cifra cubre solo el prellenado. Acrab no publicó ninguna cifra de velocidad de decodificación ni resultado de MLPerf, por lo que la afirmación se basa en la propia medición de la empresa.

Una caja que compras en lugar de una factura que pagas

Agent Box es el primer producto construido en la plataforma, y lleva el argumento económico más afilado de Acrab. La empresa lo presenta como una compra única que elimina las tarifas por token recurrentes de la IA en la nube: ejecuta modelos de lenguaje y visión localmente, mantiene una memoria persistente de los datos del usuario en el dispositivo y coordina tareas en sistemas conectados. Está dirigido a hogares y espacios de trabajo personales, y Acrab dice que se vuelve más personalizado a medida que acumula contexto. La presentación es gasto de capital en lugar de una factura de operación: comprar el hardware una vez en lugar de medir cada solicitud.

Lo que Acrab no ha dicho es cuánto cuesta Agent Box, cuándo se enviará o qué fábrica produce el chip de 5 nanómetros. Esas son las cifras que un comprador necesitaría para realizar realmente la comparación. Hasta que haya un precio y una fecha de entrega, el intercambio entre un costo de hardware fijo y una suscripción en la nube es una afirmación en lugar de un cálculo.

Una apuesta más amplia en el borde

La presentación entra en un campo en disputa. Qualcomm (QCOM ) y Intel (INTC ) ya envían procesadores neuronales en PCs de IA, y una clase de cajas de IA de borde ejecuta modelos más pequeños en el dispositivo hoy en día; lo que Acrab afirma cambiar es el techo de parámetros, moviendo modelos de 100 mil millones de parámetros a un sistema local en lugar de los modelos más pequeños que se ejecutan cómodamente en el silicio que se envía en teléfonos y laptops ahora. Acrab dice que GΞLIX 1 y su pila de software están diseñados para servir como una base horizontal para otros fabricantes, con planes para llegar a cajas de almacenamiento de redes de IA, PCs de IA, vehículos inteligentes y robots industriales y de servicio. La ambición aterriza a medida que la conversación de infraestructura más amplia se desplaza de la formación hacia la inferencia, y a medida que los fabricantes de componentes empujan más silicio en formatos de borde y en dispositivo.

La empresa ha recaudado más de $350 millones acumulativamente desde su fundación en 2024, un total que divulgó en junio de 2026, con apoyo temprano de Vertex Ventures SEA & India y Vertex Growth, los fondos vinculados a Temasek, más un inversor que identifica como K3. Acrab dice que la plataforma GΞLIX ha sido validada en despliegues reales y se está moviendo hacia su primera adopción industrial y producción en masa. Lo que aún no ha demostrado es el chip ejecutando un modelo de 100 mil millones de parámetros a las velocidades que depende su presentación, medido por alguien más que Acrab.

Theo Nash es un especialista en inteligencia artificial generada en Unite.AI, que cubre la infraestructura de inteligencia artificial, el cómputo y los sistemas de hardware que alimentan la inteligencia artificial moderna. Su trabajo se centra en los fundamentos técnicos detrás de las cargas de trabajo de inteligencia artificial a gran escala, incluyendo centros de datos, aceleradores, redes y las pilas de software que los unen.
Con una perspectiva analítica y basada en la ingeniería, Theo examina cómo los avances en GPUs, silicio personalizado, arquitecturas de memoria y sistemas distribuidos permiten nuevas generaciones de modelos de inteligencia artificial. Presta especial atención a los compromisos de rendimiento, la eficiencia energética, la escalabilidad y las limitaciones prácticas que dan forma a la implementación en el mundo real de la infraestructura de inteligencia artificial.
Los artículos escritos por Theo Nash son generados por inteligencia artificial y revisados por el equipo editorial de Unite.AI para garantizar la precisión técnica, la claridad y la cobertura responsable del paisaje de cómputo de inteligencia artificial en constante evolución.