Santé
Le modèle de monde chirurgical d’NVIDIA fonctionne désormais en direct sur une seule GPU
NVIDIA (NVDA ) a publié un simulateur chirurgical qui génère le champ opératoire en temps réel, suffisamment rapide pour qu’un chirurgien ou une politique robotique formée puisse diriger la scène pendant sa production. Le modèle, Cosmos-H-Dreams, fonctionne à environ 160 images par seconde sur une seule GPU RTX PRO 6000, contre environ 10 images par seconde pour le modèle hors ligne dont il a été distillé, selon les chiffres d’NVIDIA. Les poids et le code de service ont été publiés le 23 juillet 2026, et la société a publié la décomposition technique quatre jours plus tard.
Il n’y a pas de moteur de physique en dessous. Au lieu d’autoriser les tissus, les sutures et les contacts d’instruments à la main, le modèle apprend la dynamique visuelle à partir de vidéos chirurgicales appariées et de cinématiques de robot, puis prédit ce que la caméra verrait ensuite. Il prend une trame initiale plus un flux en direct de commandes de bras et génère le bloc de 12 trames suivant avant de consommer le prochain lot d’actions. Un client navigateur peut le piloter à partir d’un clavier, un casque Meta Quest peut mapper le mouvement de contrôleleur suivi en actions de robot, et une politique chirurgicale apprise peut être insérée dans la même boucle à la place de l’humain. La même classe de modèle a attiré de l’argent sérieux ailleurs dans l’industrie, notamment Odyssey’s $310 million Series B pour les modèles de monde.
Comment le taux d’images a été acheté
Cosmos-H-Dreams est un élève distillé d’un modèle plus lent. Le professeur, Cosmos-H-Surgical-Simulator, est construit sur le modèle vidéo 2 milliards de paramètres d’NVIDIA Cosmos-Predict2.5 et produit des simulations chirurgicales en une passe après les faits, ce qui convient au scoring d’une trajectoire enregistrée mais pas à la conduite d’une. L’élève a été formé pour continuer à partir de son propre historique généré plutôt que de la vérité terrain propre, une procédure que la carte de modèle appelle distillation auto-forçante, et il produit chaque trame latente en deux à quatre étapes de débruitage au lieu des nombreuses du professeur. FlashDreams, la bibliothèque d’inférence de streaming d’NVIDIA, couvre le reste en maintenant une cache de trames passées et en pré-capturant le travail GPU répété afin que le matériel ne le replane pas à chaque étape.
Le point de contrôle publié fait un travail : la suture de table sur le kit de recherche da Vinci, une plate-forme physique que les laboratoires universitaires utilisent pour développer et tester des politiques chirurgicales. Il fonctionne à 288 par 512 pixels et accepte des commandes à une fréquence effective de 10 Hz. C’est une tâche de banc, pas un corps.
Le mélange de formation est sans doute plus intéressant que le taux d’images. Aux côtés de démonstrations de suture et de nouage réussies de Johns Hopkins, NVIDIA a délibérément conservé des épisodes d’échec et hors-distribution : gouttes d’aiguille, lancers manqués, nœuds qui n’ont pas tenu. Sa raison déclarée est qu’un simulateur destiné à scorer des politiques doit reproduire les conséquences d’actions pauvres, et non seulement des démonstrations idéales.
Versius se connecte
NVIDIA dit avoir travaillé avec CMR Surgical et Cambridge Consultants, la société d’ingénierie appartenant à Capgemini, pour connecter le modèle au contrôleur de chirurgien pour la plate-forme Versius de CMR et le faire fonctionner en direct. CMR a démontré la configuration à un public chirurgical lors d’une conférence de chirurgie robotique en Floride à la fin juillet 2026. La société a une raison d’être dans cette boucle tôt : NVIDIA lui attribue la contribution de près de 500 heures de données de procédure Versius anonymisées au jeu de données Open-H Embodiment sur lequel la famille de modèles a été pré-formée, et CMR se décrit comme le plus grand contributeur à ce jeu de données.
CMR est également direct sur ce que la démonstration n’est pas. Une note de bas de page sur sa publication indique que la simulation est “à des fins de recherche et de démonstration uniquement”, ne fait pas partie du système Versius Plus homologué, et n’est pas destinée à la prise de décision clinique ou aux soins aux patients. Versius Plus lui-même n’est homologué aux États-Unis que pour la suppression de la vésicule biliaire chez les adultes, avec une application gynécologique en attente. L’homologation réglementaire pour le matériel chirurgical se déplace toujours procédure par procédure, comme Momentis’s Anovo robot l’a montré lorsqu’il a obtenu l’homologation américaine pour la chirurgie multiport. NVIDIA trace la même ligne dans son propre article : il s’agit d’une plate-forme de recherche et de développement, et non d’un système de diagnostic et non d’un contrôleur pour un robot chirurgical physique.
L’agenda de validation
Le modèle est la moitié générative du Medical Physics Simulation framework que NVIDIA a open-sourcé le 22 juillet 2026 dans son ensemble Isaac pour les soins de santé, où les solveurs conventionnels gèrent le contact et le frottement et le modèle appris gère la dynamique visuelle de la scène. C’est la même position qu’NVIDIA a prise sur le plan de production, fournissant la couche de simulation que d’autres fournisseurs construisent des produits.
L’article d’NVIDIA indique que l’étape immédiate suivante est d’évaluer plus que la qualité visuelle, et il propose une famille de tests en boucle fermée comme mesure de savoir si la version rapide est suffisamment précise pour être fiable :
- précision de la position et de la pose de l’outil
- fidélité et stabilité du cycle de pinces lorsque les instruments sont inactifs
- dérive sur de longs déploiements
- accord entre les résultats de politique simulés et réels
La preuve de transfert la plus proche à ce jour vient de la lignée précédente : un article de 2025 de chercheurs d’NVIDIA et de Johns Hopkins a rapporté une forte corrélation entre les déploiements dans le modèle chirurgical hors ligne et les résultats de politique sur un système de recherche da Vinci physique pour les tâches de suture-pad, ainsi qu’un alignement préliminaire sur le travail de la vésicule biliaire porcine ex-vivo. C’était le modèle bidirectionnel lent plutôt que l’élève à deux étapes, et le référentiel lui-même note que l’horaire plus rapide coûte un peu de fidélité.
Obtenir les mains dessus est bon marché par les normes des modèles de frontière. Les poids portent la licence de modèle ouvert d’NVIDIA et le code de service est Apache 2.0, avec le référentiel demandant une GPU avec 12 Go de mémoire, un pilote actuel et Linux. Il n’y a pas encore de rapport technique ; le lien du référentiel vers un pointe sur un fichier de placehold. Les politiques de robot conditionnées par vidéo sont déjà en train de passer à la production, comme mimic robotics’ FLUX-mimic à une usine Audi, mais la chirurgie a un test d’acceptation plus dur. Pour les laboratoires formant des politiques chirurgicales, la question qui compte est de savoir si un score gagné à l’intérieur de ce simulateur prédit ce que le bras fait sur un véritable suture-pad. NVIDIA a nommé cette référence, et ses résultats sont ce sur quoi la prochaine série de preuves tournera.












