Myslitelé
Tajemství rychlejšího AI není více GPU, ale chytřejší síť

AI předefinuje, co je možné napříč odvětvími, včetně zdravotnictví, financí, výroby a maloobchodu. Ale spolu s velkým potenciálem přináší také obrovské požadavky na infrastrukturu.
Organizace po celém světě investují do GPU v bezprecedentním měřítku, aby urychily výuku a inferenci AI. Do roku 2028 Gartner předpovídá, že výdaje na generativní AI v IT přesáhnou 1 bilion dolarů. Hyperion Research předpovídá, že celkové výdaje na HPC trh překročí 100 miliard dolarů ve stejném období. Přestože investují do nejmodernějších urychlovačů, mnoho CIO pokračuje ve vidění nečinných GPU, s využitím na úrovni 35 % nebo nižší. To nejen vede k podvýkonu, ale také ke zbytečným nákladům na energii a inflaci nákladů.
Zatímco mnoho projektů AI stagnuje, není to proto, že jim chybí GPU nebo výpočetní výkon, ale protože síť nemůže držet krok, vyžadující nový přístup k navrhování pro AI ve velkém měřítku.
Skrytá cena síťových úzkých míst
Když sítě nemohou dodávat data dostatečně rychle, aby udržely GPU neustále zaměstnaná, organizace zažívají několik kritických dopadů:
- Nedostatečně využité GPU a CPU kvůli úzkým místům při přenosu dat: GPU jsou navržena pro masivně paralelní výpočty, ale mohou zpracovat data pouze tak rychle, jak jsou dodávána. Pokud síťový materiál nemůže držet krok, GPU čekají na data místo toho, aby prováděly výpočty. CPU mohou také stagnovat, protože koordinují úkoly a přesouvají data skrze potrubí, což vede k nízkému využití, přestože je k dispozici drahé vybavení.
- Nepříznivý vliv na inferenční výkon kvůli neefektivní síti: Neefektivní síť vytváří nerovnoměrné toky dat, což způsobuje, že GPU kolísají mezi plnou rychlostí a nečinností. To produkuje nepředvídatelný inferenční výkon, který může zničit aplikace AI v produkci.
- Delší tréninkové cykly, zpožďující dobu uvedení na trh: Trénink AI modelů vyžaduje přesunutí obrovských datových sad napříč servery, GPU a úložištěm. Síťová úzká místa brzdí tento proces, takže GPU tráví méně času tréninkem a více časem čekáním. To přímo zpomaluje vývoj produktů a nasazení.
- Rostoucí náklady na energii a provoz: I když jsou nečinné, GPU a okolní infrastruktura stále spotřebují významné množství energie. Pokud jsou GPU nedostatečně využity kvůli síťovým neefektivitám, organizace platí za vysoké energetické náklady bez proporcionálního výkonu. Provozní náklady rostou, protože zařízení musí podporovat špičkové energetické a chladicí zatížení, i když výpočetní propustnost je umělým způsobem omezena.
Organizace mohou pokračovat v investicích do více GPU, ale bez odpovídajících síťových vylepšení budou pouze zhoršovat tato úzká místa a neefektivity.
Síť jako urychlovač: Paradigmatický posun
Řešení vyžaduje kompletní přehodnocení síťové architektury. Zavedení modelu, který využívá síť jako urychlovač, otočí tradiční myšlení o HPC a AI výkonu a odemkne nové schopnosti.
Místo toho, aby se zaměřovaly primárně na přidání více výpočetního výkonu prostřednictvím GPU a CPU, přístup “síť jako urychlovač” považuje síťový materiál za násobitel výkonu. Jako výsledek, síť může lépe podporovat vysoké hustoty výpočtu a urychlit návratnost investic eliminací úzkých míst, škálováním pro splnění požadavků na výpočet a správným dimenzováním hardwarových investic. Díky umožnění většího výpočetního výkonu bez zpomalení mohou organizace spouštět větší úlohy v menším prostoru, dosahovat výsledků rychleji a vyhnout se nadměrným nákladům na extra hardwar.
Jak funguje model “síť jako urychlovač”
Takže, jak funguje tento model, aby organizace mohly transformovat svou síť z pasivního pohybu dat na aktivního umožňovatele výpočtu a začít využívat jeho výhody? Poskytuje čtyři klíčové schopnosti, které tradiční sítě postrádají:
- Zajištěná dodávka na hardwarové úrovni: Tradiční sítě zatěžují CPU a GPU s přenosovými, opakovanými a znovuspořádávacími úkoly. To spotřebuje výpočetní cykly, které by mohly být věnovány tréninku nebo inferenci. Díky síťové tkanině, která zajišťuje dodávku na hardwarové úrovni, jsou tyto úkoly přesunuty pryč od výpočetních uzlů, což vede k snížení CPU a GPU režie, předvídatelnému a konzistentnímu výkonu a škálovatelnosti, která zjednodušuje programování a orchestraci clusterů.
- Inteligentní dynamické směrování: Konvenční směrování spoléhá na pevné nebo suboptimální cesty, které mohou nechat části sítě nevyužité nebo vytvořit úzká místa, kde se vyskytují masivní datové toky současně. Inteligentní směrování dynamicky využívá všechny dostupné cesty k optimalizaci toku dat. To umožňuje vyšší propustnost s více aktivními cestami vyvažujícími tok, nižší latenci prostřednictvím optimálního výběru cesty a lepší odolnost, protože síťový provoz se automaticky přesměruje kolem selhání odkazů nebo uzlů. To snižuje nečinnost a udržuje GPU plně zaměstnaná daty.
- Odkazové automatické opakování: Když jsou pakety ztraceny nebo poškozeny, standardní sítě spoléhají na výpočetní vrstvu pro detekci a opětovné odeslání, což zavádí významnou latenci a ruší výpočetní tok. Tkanina s vestavěnými odkazovými automatickými opakovacími schopnostmi zpracovává opětovná odeslání uvnitř sítě samotné. To umožňuje téměř transparentní spolehlivost, protože ztráta paketů se stává neviditelnou pro výpočetní uzly, zatímco snižuje dopad latence, protože opětovná odeslání probíhají místně na odkazu, ne v celém síťovém stacku. To také eliminuje potřebu komplexního aplikací-level error handling. Automatická opakovací schopnost zajišťuje nepřerušený, efektivní distribuovaný výpočet, který je důležitý při škálování na tisíce GPU.
- Síťové výpočty: Zatímco tradiční síťová tkanina se primárně zabývá pohybem dat, síťové výpočty umožňují síti stát se ko-procesorem provádějícím určité operace přímo uvnitř tkaniny. NVIDIA SHARP je příkladem – umožňuje snížení na síťových přepínačích samotných. To umožňuje urychlené distribuované operace, snižuje latenci, protože data jsou agregována, zatímco procházejí síť, a zvyšuje efektivitu, protože výpočetní uzly jsou osvobozeny od provádění agregovaných úkolů, což zbývá více cyklů pro trénink a simulaci.
Celkově jsou tyto schopnosti základem “síťově vedeného výpočtu” pro škálování next-gen AI a HPC prostředí. Síťově centrický přístup dodává hmatatelné výnosy, které zahrnují vyšší využití GPU, které eliminuje hladinu dat, rychlejší dobu získání poznatků, která snižuje tréninkové cykly a stabilizuje inferenční výkon, zlepšenou efektivitu zdrojů a nižší celkové náklady na vlastnictví.
Objevte skutečnou síťovou sílu
AI ve velkém měřítku není pouze problémem výpočtu – je to systémová inženýrská výzva, se sítí v jejím centru. Léčba sítě jako urychlovače ji promění v násobič výkonu pro výpočet, umožňující HPC a AI datovým center škálovat v hustotě bez obětování výkonu. To dodává měřitelný návratnost investic rychleji tím, že extrahuje maximum hodnoty z existující infrastruktury, než investuje do více křemíku.
Eliminací úzkých míst, zvyšováním využití a dodáváním předvídatelného výkonu, chytřejší síťové řešení umožňuje více produktivním AI týmům, lepší návratnosti investic do infrastruktury GPU a rychlejší době získání poznatků, inovací a vedení na trhu. To umožňuje organizacím objevit, co jejich síť může skutečně být, a využít sílu AI novými způsoby.












