Partnerskap

NVIDIA och Palantir tillkännager suverän AI-stack för leveranskedjor

mm
Lägg till Unite.AI bland dina föredragna källor på Google

NVIDIA och Palantir Technologies tillkännagav den 10 september 2026 ett samarbete för att införa suverän AI i kritiska leveranskedjor, där den gemensamt byggda AI‑stacken först kommer att implementeras i NVIDIAs egna leveranskedjeoperationer.

Stacken integrerar NVIDIAs öppna Nemotron‑modeller i Palantir Foundry och Palantirs Artificial Intelligence Platform (AIP), baserade på Palantir‑ontologin. Företagen uppgav att systemet ger leveranskedjeteam ett gemensamt kommandocenter, med början i beslut om materialallokering, samtidigt som kunderna behåller kontroll och äganderätt till sina egna data. Stacken kommer att visas på Palantirs AIPCon 11‑konferens, och företagen sade att organisationer inom jordbruk, tillverkning, läkemedel, detaljhandel, teknik och offentlig sektor kan använda den i sina egna leveranskedjor.

NVIDIA uppgav att deras leveranskedja omfattar miljontals komponenter, tusentals leverantörer och ett globalt nätverk av tillverkningspartners, och att införandet av ett rack‑skalig AI‑system i produktion kräver samordnad tillgänglighet av beräkningskraft, minne, nätverk, ström, kylning och mekaniska komponenter. Varje NVIDIA Vera Rubin‑rack innehåller 1,3 miljon delar, enligt tillkännagivandet.

I det gemensamma tillkännagivandet sade Palantirs medgrundare och VD Alex Karp: “NVIDIA har utan tvekan den mest värdefulla, invecklade och komplexa leveranskedjan i världen. Vår suveräna stack, driven av Nemotron‑modeller och Ontologi, levererar funktioner som överträffar gränsen samtidigt som den ger alfa‑skyddsegenskaper som annars inte är tillgängliga.”

NVIDIAs grundare och VD Jensen Huang sade att företagen syftar till att omvandla den operativa grafen bakom AI‑infrastrukturen till suverän intelligens, genom att para ihop Nemotron‑modeller med Palantirs Ontologi för att samordna stegen från wafer‑produktion till token‑utmatning.

NVIDIAs leveranskedja och Foundry-kommandocentret

I ett tekniskt blogginlägg som publicerades i samband med tillkännagivandet sade NVIDIA att de mäter leveranskedjeprestanda från wafer‑utgång till första token. Intervallen delas in i två delar: time-to-rack sträcker sig från kisel som lämnar fabriken till ett monterat system som anländer till ett datacentergolv, och time-to-token omfattar den kraft, kylning, nätverk och mjukvaruarbete som gör infrastrukturen produktiv.

Grace Blackwell NVL72‑plattformarna bygger på miljontals komponenter och tusentals leverantörer, med slutliga system som monteras av dussintals OEM‑ och ODM‑företag. En enskild GB200 NVL72‑beräkningsbricka — en av arton i ett rack — kräver två Grace‑CPU:er, fyra Blackwell‑GPU:er och 32 HBM3e‑minnesstackar, och NVIDIA uppgav att leveranskedjan de skapade för Vera Rubin är dubbelt så stor som den bakom Grace Blackwell. För att spåra hur länge material står stilla använder NVIDIA en metrisk som kallas Time of Ownership: den tid som förflutit mellan att ett tillverkningsställe mottar material och att materialet lämnar som del av en delmontering eller produkt.

Varje vecka omarbetar planläggare manuellt det som NVIDIA kallar det kritiska materialallokeringsproblemet, och beslutar vilket material och hur mycket som ska gå till varje tillverkningsställe under det aktuella kvartalet och nästa. För att stödja detta arbete byggde NVIDIAs leveranskedje‑operationsteam ett Digital Supply Chain Intelligence‑kommandocenter med Palantir på Foundry, där Ontologin kopplar samman material, tillverkningsställen, åtaganden, kapacitet, allokeringar, produktionsutdata och ostrukturerade kvalitativa signaler till ett styrt datalager.

NVIDIA cuOpt, företagets open‑source‑bibliotek för GPU‑accelererad beslutsoptimering, löser den veckovisa allokeringen som ett mixed‑integer lineärt program vars mål är att minimera Time of Ownership, med indata från Ontologin och återför resultat som allokeringsbeslut. Inlägget rapporterar att cuOpt även identifierar vilka begränsningar som är bindande, så att planläggare kan se om kapacitet eller minnesförsörjning begränsade en viss vecka, och kan testa scenarier som en tio procents minskning av minnesförsörjningen eller en ny tillverkningsplats som tas i drift.

Post‑träning av Nemotron på allokeringsbeslut

NVIDIA och Palantir testade historiska allokeringsbeslut mot vad som faktiskt inträffade och fann, enligt inlägget, att mänskliga planläggare överträffade lösaren eftersom planläggarna agerade på information som den inte kunde se: e‑postutbyten med partners, svåra väderprognoser för nyckelregioner, geopolitiska händelser och leverantörsdebrief‑transkript, samt år av samlad expertis. Teamen byggde om arbetsflödet kring den expertisen och fångade varje allokeringsbeslut, dess motivering, förväntat resultat och faktiskt utfall i Ontologin.

Denna logg blev träningsdata. Teamen eftertränade Nemotron 3.5 Lightning, en öppen vikt‑blandning‑av‑experter‑modell med 30 miljarder parametrar och cirka 3 miljarder aktiva per framåtpassage, vilket inlägget säger valdes eftersom den är specifikt byggd för exekveringslagret i ett agentbaserat arbetsflöde och eftersom öppna modeller kan eftertränas inom en organisations egna beräkningsgränser. Pipelines använder NeMo Anonymizer för att ta bort personligt identifierbar information, NeMo Data Designer för att generera och balansera syntetiska exempel, och NeMo AutoModel för att träna en liten uppsättning LoRA‑adapterparametrar medan basvikterna förblir frysta, med Palantir Autopilot som hanterar livscykeln från Ontologidata till distribuerad modell.

På den utvecklingsbenchmark som beskrivs i inlägget nådde den eftertränade modellen 86,7 % korrekthet i allokeringsbeslut, jämfört med 55,5 % för den större Nemotron 3 Ultra och 17,5 % för grundmodellen Nemotron 3.5 Lightning. NVIDIA rapporterar en balanserad noggrannhet på 58,6 % mot Ultra:s 42,0 % och ett Macro‑F1‑resultat på 57,5 % mot 39,5 %. Författarna säger att dessa mått väger varje beslutstyp lika, vilket är viktigt eftersom planläggare minskar allokeringar mycket oftare än de ökar dem.

Inlägget varnar för att vinsterna är koncentrerade till det område som modellen eftertränades på och att prognostisering av framtida produktionsrisker förblev svår trots finjustering. LoRA‑träningskörningen avslutades på två NVIDIA B200‑GPU:er på några minuter, tillräckligt lätt för att kunna upprepas när feedback samlas in, enligt inlägget.

Modellen rekommenderar ett allokeringsintervall med tillhörande motivering och risker, men en mänsklig planläggare granskar varje rekommendation och fattar det slutgiltiga beslutet. Varje godkännande, redigering, överskrivning och produktionsresultat skrivs tillbaka till Ontologin tills tillräckligt representativ data finns för en ny styrd träningskörning. Inlägget påstår att modellen aldrig återtränar sig själv i produktion och att den samlade feedbacken är avsedd att stödja förstärkningsinlärning i framtiden.

Suverän implementering och infrastrukturpartners

Med tanke på känsligheten i NVIDIAs leveranskedja körs implementeringen på NVIDIAs referensarkitekturer och den gemensamt utvecklade Palantir Sovereign AI Operating System-referensarkitekturen, känd som SAIOS, som stöds av Dell Technologies och Cisco. Företagen sade att stacken kan implementeras på plats med systemtillverkare inklusive Cisco och Dell, eller i co‑location‑ och molnmiljöer med Rackspace och Nebius.

Inom Palantir AIP stödjer cuOpt optimering och scenarioplanering, medan NeMo Data Libraries, NeMo AutoModel och NeMo RL integreras med Palantir Autopilot i det som företagen beskriver som en styrd inlärningsslinga som mäter beslut mot verkliga resultat. Företagen sade att de planerar att utvidga det de lär sig från NVIDIAs implementering till företag inom tillverkning, energi, sjukvård, fordonsindustri och rymd.

Aiden Cross är en AI-genererad strateg som täcker AI-produktstrategi, genomförande och de praktiska utmaningarna med att omvandla experimentella modeller till skalbara, marknadsfärdiga produkter. Hans arbete fokuserar på hur startups och företagsgrupper går från prototyper och demon till pålitliga system som används av riktiga kunder.
Med en pragmatisk och detaljorienterad perspektiv analyserar Aiden produktvägar, marknadsstrategier, plattformsbeslut och organisatoriska avvägningar som avgör om AI-initiativ lyckas eller stannar av. Han ägnar särskild uppmärksamhet åt distributionsrealiteter, användarantagande, infrastruktur begränsningar och samstämmigheten mellan teknisk kapacitet och affärsverdi.
Artiklar skrivna av Aiden Cross är AI-genererade och granskade av Unite.AIs redaktion för att säkerställa tydlighet, noggrannhet och ansvarsfull rapportering om hur AI-produkter byggs, skickas och skalaras i den riktiga världen.