Hợp tác
NVIDIA và Palantir công bố Ngăn xếp AI Chủ quyền cho Chuỗi Cung Ứng

Vào ngày 10 tháng 9 năm 2026, NVIDIA và Palantir Technologies đã công bố một sự hợp tác nhằm đưa AI chủ quyền vào các chuỗi cung ứng quan trọng, với ngăn xếp AI được xây dựng chung lần đầu được triển khai trong hoạt động chuỗi cung ứng nội bộ của NVIDIA.
Ngăn xếp này đưa các mô hình mở Nemotron của NVIDIA vào Palantir Foundry và Nền tảng Trí tuệ Nhân tạo (AIP) của Palantir, dựa trên Ontology của Palantir. Các công ty cho biết hệ thống cung cấp cho các đội ngũ chuỗi cung ứng một trung tâm chỉ huy chung, bắt đầu với các quyết định phân bổ nguyên vật liệu, trong khi khách hàng vẫn giữ quyền kiểm soát và sở hữu dữ liệu độc quyền của mình. Ngăn xếp sẽ được trình diễn tại hội nghị AIPCon 11 của Palantir, và các công ty cho biết các tổ chức trong lĩnh vực nông nghiệp, sản xuất, dược phẩm, bán lẻ, công nghệ và chính phủ có thể áp dụng nó cho chuỗi cung ứng của riêng họ.
NVIDIA cho biết chuỗi cung ứng của mình bao gồm hàng triệu bộ phận, hàng ngàn nhà cung cấp và một mạng lưới toàn cầu các đối tác sản xuất, và việc đưa một hệ thống AI quy mô rack vào sản xuất đòi hỏi sự sẵn sàng phối hợp của các thành phần tính toán, bộ nhớ, mạng, điện, làm mát và cơ khí. Mỗi rack NVIDIA Vera Rubin chứa 1,3 triệu bộ phận, theo thông báo.
Trong thông báo chung, đồng sáng lập và CEO của Palantir, Alex Karp, nói: “NVIDIA có lẽ là chuỗi cung ứng có giá trị, phức tạp và tinh vi nhất trên thế giới. Ngăn xếp chủ quyền của chúng tôi, được hỗ trợ bởi các mô hình Nemotron và Ontology, đang cung cấp các khả năng vượt qua ranh giới đồng thời mang lại các tính năng bảo vệ alpha không có ở nơi khác.”
Nhà sáng lập và CEO của NVIDIA, Jensen Huang, cho biết các công ty nhằm biến đồ thị vận hành phía sau hạ tầng AI thành trí tuệ chủ quyền, kết hợp các mô hình Nemotron với Ontology của Palantir để điều phối quá trình từ sản xuất wafer đến đầu ra token.
Chuỗi Cung Ứng của NVIDIA và Trung Tâm Điều Khiển Foundry
Trong một bài đăng blog kỹ thuật được xuất bản cùng với thông báo, NVIDIA cho biết họ đo lường hiệu suất chuỗi cung ứng từ wafer‑out đến token đầu tiên. Khoảng thời gian này được chia thành hai phần: thời gian‑đến‑rack tính từ silicon rời nhà máy đến hệ thống lắp ráp đến sàn trung tâm dữ liệu, và thời gian‑đến‑token bao gồm công việc về điện, làm mát, mạng và phần mềm làm cho hạ tầng trở nên hiệu quả.
Các nền tảng Grace Blackwell NVL72 dựa trên hàng triệu bộ phận và hàng ngàn nhà cung cấp, với các hệ thống cuối cùng được lắp ráp bởi hàng chục OEM và ODM. Một khay tính toán GB200 NVL72 duy nhất — một trong mười tám khay trong một rack — cần hai CPU Grace, bốn GPU Blackwell và 32 ngăn bộ nhớ HBM3e, và NVIDIA cho biết chuỗi cung ứng mà họ tạo ra cho Vera Rubin gấp đôi so với chuỗi cung ứng phía sau Grace Blackwell. Để theo dõi thời gian vật liệu nằm im, NVIDIA sử dụng chỉ số gọi là Thời Gian Sở Hữu: thời gian trôi qua từ khi một địa điểm sản xuất nhận vật liệu đến khi vật liệu đó rời đi như một phần của lắp ráp phụ hoặc sản phẩm.
Mỗi tuần, các nhà hoạch định thủ công tái cấu trúc vấn đề phân bổ vật liệu quan trọng mà NVIDIA gọi là, quyết định vật liệu nào và bao nhiêu sẽ được chuyển đến mỗi địa điểm sản xuất trong quý hiện tại và quý tiếp theo. Để hỗ trợ công việc này, đội ngũ vận hành chuỗi cung ứng của NVIDIA đã xây dựng một trung tâm chỉ huy Trí tuệ Chuỗi Cung Ứng Kỹ thuật số cùng Palantir trên Foundry, nơi Ontology kết nối vật liệu, địa điểm sản xuất, cam kết, năng lực, phân bổ, sản lượng sản xuất và các tín hiệu định tính không cấu trúc thành một lớp dữ liệu được quản lý.
NVIDIA cuOpt, thư viện mã nguồn mở của công ty dành cho tối ưu hoá quyết định tăng tốc bằng GPU, giải quyết việc phân bổ hàng tuần như một bài toán lập trình tuyến tính hỗn hợp nguyên, với mục tiêu giảm thiểu Thời Gian Sở Hữu, lấy dữ liệu đầu vào từ Ontology và ghi lại kết quả dưới dạng quyết định phân bổ. Bài viết cho biết cuOpt còn xác định các ràng buộc đang hoạt động, cho phép các nhà hoạch định thấy liệu năng lực hay nguồn cung bộ nhớ đã giới hạn tuần nào, và có thể thử nghiệm các kịch bản như cắt giảm 10% nguồn cung bộ nhớ hoặc một địa điểm sản xuất mới đưa vào hoạt động.
Nemotron Sau Khi Đào Tạo trên Các Quyết Định Phân Bổ
NVIDIA và Palantir đã kiểm tra lại các quyết định phân bổ lịch sử so với thực tế và phát hiện rằng các nhà hoạch định con người vượt trội hơn so với bộ giải, theo báo cáo, vì các nhà hoạch định dựa trên thông tin mà hệ thống không thể thấy: email trao đổi với đối tác, dự báo thời tiết khắc nghiệt cho các khu vực trọng yếu, sự kiện địa chính trị và bản ghi buổi tóm tắt nhà cung cấp, cùng với nhiều năm kinh nghiệm tích lũy. Các nhóm đã xây dựng lại quy trình làm việc dựa trên kinh nghiệm đó, ghi lại mỗi quyết định phân bổ, lý do, kết quả dự kiến và kết quả thực tế trong Ontology.
Dữ liệu đó đã trở thành bộ dữ liệu đào tạo. Các nhóm đã thực hiện đào tạo lại Nemotron 3.5 Lightning, một mô hình hỗn hợp chuyên gia có trọng số mở với 30 tỷ tham số và khoảng 3 tỷ tham số hoạt động mỗi lần truyền tiến, mà bài viết cho biết đã được chọn vì nó được thiết kế đặc thù cho lớp thực thi của quy trình làm việc có tính đại lý và vì các mô hình mở có thể được đào tạo lại bên trong ranh giới tính toán của tổ chức. Quy trình sử dụng NeMo Anonymizer để loại bỏ thông tin cá nhân nhận dạng, NeMo Data Designer để tạo và cân bằng các ví dụ tổng hợp, và NeMo AutoModel để đào tạo một bộ nhỏ các tham số bộ điều hợp LoRA trong khi các trọng số cơ sở vẫn được đóng băng, với Palantir Autopilot quản lý vòng đời từ dữ liệu Ontology đến mô hình đã triển khai.
Trong tiêu chuẩn phát triển được mô tả trong bài viết, mô hình đã đào tạo lại đạt độ chính xác quyết định phân bổ 86,7%, so với 55,5% của Nemotron 3 Ultra lớn hơn và 17,5% của Nemotron 3.5 Lightning cơ bản. NVIDIA báo cáo độ chính xác cân bằng 58,6% so với 42,0% của Ultra và điểm Macro-F1 là 57,5% so với 39,5%. Các tác giả cho biết các chỉ số này cân nhắc mỗi loại quyết định một cách đồng đều, điều này quan trọng vì các nhà hoạch định thường giảm phân bổ nhiều hơn là tăng chúng.
Bài viết cảnh báo rằng những cải thiện tập trung vào lĩnh vực mà mô hình đã được đào tạo lại và việc dự báo rủi ro sản xuất trong tương lai vẫn khó khăn mặc dù đã tinh chỉnh. Quá trình đào tạo LoRA hoàn thành trên hai GPU NVIDIA B200 trong vài phút, nhẹ đủ để lặp lại khi phản hồi tích lũy, theo bài viết.
Mô hình đề xuất một phạm vi phân bổ kèm theo lý do và rủi ro, nhưng một nhà hoạch định con người sẽ xem xét mỗi đề xuất và đưa ra quyết định cuối cùng. Mọi chấp nhận, chỉnh sửa, ghi đè và kết quả sản xuất đều được ghi lại vào Ontology cho đến khi có đủ dữ liệu đại diện cho một vòng đào tạo được quản lý khác. Bài viết cho biết mô hình không bao giờ tự đào tạo lại trong môi trường sản xuất và phản hồi tích lũy được dự định hỗ trợ học tăng cường trong tương lai.
Triển Khai Chủ Quyền và Các Đối Tác Hạ Tầng
Vì tính nhạy cảm của chuỗi cung ứng NVIDIA, việc triển khai chạy trên kiến trúc tham chiếu của NVIDIA và Kiến trúc Tham chiếu Palantir Sovereign AI Operating System, được gọi là SAIOS, được hỗ trợ bởi Dell Technologies và Cisco. Các công ty cho biết ngăn xếp có thể được triển khai tại chỗ với các nhà sản xuất hệ thống bao gồm Cisco và Dell, hoặc trong môi trường đồng vị trí và đám mây với Rackspace và Nebius.
Trong Palantir AIP, cuOpt hỗ trợ tối ưu hoá và lập kế hoạch kịch bản, trong khi NeMo Data Libraries, NeMo AutoModel và NeMo RL tích hợp với Palantir Autopilot trong một vòng học có quản lý mà các công ty mô tả là đo lường các quyết định so với kết quả thực tế. Các công ty cho biết họ dự định mở rộng những gì họ học được từ việc triển khai của NVIDIA tới các doanh nghiệp trong lĩnh vực sản xuất, năng lượng, chăm sóc sức khỏe, ô tô và hàng không.












