Modelli e piattaforme di IA

Runware Spedisce Data Center Containerizzati per Inferenza AI a Prezzi piÃđ Bassi

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Runware il 4 agosto 2026 ha lanciato il suo Sonic Inference Pod, un data center modulare che contiene fino a 1.200 GPU in un contenitore da 20 piedi, mentre il fornitore di inferenza AI passa dalla rivendita di capacità cloud all’uso di hardware costruito appositamente che afferma essere piÃđ economico rispetto ai data center tradizionali. La società con sede a Londra ha annunciato il lancio in un post sul proprio blog, e promette prezzi di inferenza del 30-80% piÃđ bassi, con la prima regione già attiva in Europa e il rollout negli Stati Uniti iniziato.

Ogni pod ÃĻ una struttura di inferenza autonoma: fino a 1.200 GPU dense che forniscono circa 1 MW di calcolo, raffreddate direttamente attraverso un sistema chiuso a circuito sigillato che ricicla circa 1,5 metri cubi di acqua e non ne consuma, secondo Runware. La società afferma che una nuova unità puÃē essere distribuita in pochi giorni – un tempo di costruzione medio di circa tre settimane – rispetto ai tempi di costruzione dei data center tradizionali di tre-cinque anni. L’inferenza ÃĻ venduta in due modi: i clienti possono eseguire il proprio codice sulla flotta di Runware a pagamento al secondo, o caricare modelli dietro un’API gestita a pagamento per output.

Il co-fondatore e CEO Flaviu Radulescu ha descritto la scommessa come una scommessa che l’economia dell’inferenza favorisce strutture piccole, distribuite e trasferibili rispetto ai grandi progetti di costruzione dei data center che dominano le spese per l’infrastruttura dell’AI. “La domanda di inferenza sta crescendo piÃđ velocemente di quanto le strutture possano essere costruite”, Radulescu ha detto a TechCrunch. “CiÃē che vogliamo ÃĻ alimentare l’intelligenza del mondo, essere la spina dorsale su cui ogni modello di intelligenza artificiale gira con una capacità che tenga il passo con la domanda invece di limitarla.”

Come vengono costruiti i pod

La proposta di Runware si basa sull’eliminazione degli oneri dei data center di uso generale. La società sostiene che il 40-60% delle spese per i data center tradizionali vanno a infrastrutture che il carico di lavoro di inferenza non utilizza, come sistemi di backup, ridondanze sovracostruite, edifici troppo grandi, e che circa un terzo dell’elettricità di un sito convenzionale va al raffreddamento invece del calcolo. Il raffreddamento a circuito chiuso del pod, al contrario, mantiene le temperature dei processori entro 2°C sotto carico sostenuto con un’efficienza energetica del 99%, e i suoi scambiatori di calore a secco significano che non si consuma acqua, un’affermazione significativa poichÃĐ l’uso dell’acqua nei data center incontra l’opposizione locale in tutta la parte degli Stati Uniti.

PoichÃĐ ogni pod si unisce a una rete singola, il routing ÃĻ una funzione invece di un piano di ridondanza: le richieste fluiscono verso la capacità piÃđ vicina all’utente, e un guasto del pod sposta il traffico invece di mettere fuori uso la struttura. I clienti che desiderano hardware dedicato possono riservare interi pod. Radulescu ha detto che la società attualmente ha 10 pod distribuiti in tutto il mondo, tra Stati Uniti, Europa e Asia-Pacifico, con 160 siti disponibili per alimentare altri, e conta Higgsfield AI e Wix tra i clienti di inferenza già presenti sulla piattaforma.

Il piano di rollout

Il cronogramma pubblicato da Runware prevede che l’Europa sia già attiva, il rollout negli Stati Uniti sia in corso, e che una prima ondata di capacità (10.000 nodi di inferenza in piÃđ regioni) sia prevista per essere online nella seconda metà del 2026. La società afferma di essere in fase di scalabilità verso 1 GW di capacità di inferenza entro il 2027. Sono elencate come regioni pianificate Stati Uniti Centrali, Stati Uniti Est, Europa settentrionale e meridionale, e Asia-Pacifico.

Il finanziamento dietro l’espansione

Il lancio del pod estende la strategia hardware che Runware sta costruendo dal suo $50 milioni di Serie A, annunciato a gennaio 2026 e guidato da Dawn Capital con la partecipazione di Comcast (CMCSA ) Ventures, Speedinvest, Insight Partners, e a16z speedrun. Quel round ha finanziato l’espansione della piattaforma a singola API, con la società che continua anche a costruire e distribuire i suoi pod di inferenza, un’infrastruttura che potrebbe essere posizionata ovunque il potere sia economico, evitando costruzioni che richiedono anni. Fondata nel 2023, Runware afferma di aver alimentato oltre 10 miliardi di generazioni per oltre 200.000 sviluppatori e 300 milioni di utenti finali attraverso la sua piattaforma a singola API, che aggrega quasi 300 classi di modelli.

La società sta entrando in una corsa a capitali intensivi dal lato opposto del campo. Mentre OpenAI, xAI e i grandi player commettono centinaia di miliardi per i grandi campus fissi, Runware sta scommettendo che una quota significativa della domanda di inferenza, carichi di lavoro indifferenti a dove vengono eseguiti, sarà servita piÃđ a buon mercato e piÃđ velocemente da capacità che possono essere caricate su camion, collegate e trasferite. Con i primi pod attivi e le prenotazioni di capacità aperte, quella scommessa ora ha un supporto hardware.

Aiden Cross ÃĻ uno stratega generato da AI presso Unite.AI, che copre la strategia dei prodotti AI, l'esecuzione e le sfide pratiche di trasformare modelli sperimentali in prodotti pronti per il mercato e scalabili. Il suo lavoro si concentra su come le startup e le squadre aziendali passino da prototipi e dimostrazioni a sistemi affidabili utilizzati da clienti reali.
Con una prospettiva pragmatica e attenta ai dettagli, Aiden analizza le roadmap dei prodotti, le strategie di go-to-market, le decisioni sulla piattaforma e i compromessi organizzativi che determinano se le iniziative AI abbiano successo o si fermino. Presta particolare attenzione alle realtà di deploy, all'adozione degli utenti, alle limitazioni dell'infrastruttura e all'allineamento tra capacità tecnica e valore aziendale.
Gli articoli scritti da Aiden Cross sono generati da AI e revisionati dal team editoriale di Unite.AI per garantire chiarezza, accuratezza e copertura responsabile di come i prodotti AI vengono costruiti, spediti e scalati nel mondo reale.