Salud
El modelo de mundo quirúrgico de NVIDIA ahora se ejecuta en vivo en una sola GPU
NVIDIA (NVDA ) ha lanzado un simulador quirúrgico que genera el campo de operación en tiempo real, lo suficientemente rápido como para que un cirujano o una política de robot entrenada pueda controlar la escena mientras se produce. El modelo, Cosmos-H-Dreams, se ejecuta a aproximadamente 160 fotogramas por segundo en una sola GPU RTX PRO 6000, en comparación con los aproximadamente 10 fotogramas por segundo del modelo offline del que se derivó, según las propias cifras de NVIDIA. Los pesos y el código de servicio se publicaron el 23 de julio de 2026, y la empresa publicó el desglose técnico cuatro días después.
No hay un motor de física subyacente. En lugar de autorizar tejidos, suturas y contacto de instrumentos a mano, el modelo aprende dinámicas visuales a partir de videos quirúrgicos emparejados y cinemática de robot, y luego predice lo que la cámara vería a continuación. Se toma un fotograma inicial más una transmisión en vivo de comandos de brazo y genera el siguiente bloque de 12 fotogramas antes de consumir el siguiente lote de acciones. Un cliente de navegador puede controlarlo desde un teclado, un auricular Meta Quest puede asignar el movimiento de controlador rastreado a acciones de robot, y una política quirúrgica aprendida puede insertarse en el mismo bucle en lugar del ser humano. La misma clase de modelo ha atraído una gran cantidad de dinero en otras partes de la industria, incluyendo los 310 millones de dólares de la Serie B de Odyssey para modelos de mundo.
Cómo se compró la tasa de cuadros
Cosmos-H-Dreams es un estudiante destilado de un modelo más lento. El maestro, Cosmos-H-Surgical-Simulator, se basa en el modelo de video Cosmos-Predict2.5 de 2 mil millones de parámetros de NVIDIA y produce despliegues quirúrgicos en una pasada después de los hechos, lo que se adapta a la puntuación de una trayectoria grabada pero no a la conducción de una. El estudiante se entrenó para seguir adelante desde su propia historia generada en lugar de desde la verdad fundamental limpia, un procedimiento que la tarjeta del modelo llama destilación de auto-forzado, y produce cada fotograma latente en dos o cuatro pasos de desenoise en lugar de los muchos del maestro. FlashDreams, la biblioteca de inferencia de transmisión de NVIDIA, cubre el resto manteniendo una caché rodante de fotogramas pasados y pre-capturando el trabajo de GPU repetido para que el hardware no lo replanea en cada paso.
El punto de referencia publicado hace un trabajo: sutura en una mesa con el Kit de Investigación da Vinci, una plataforma física que los laboratorios académicos utilizan para desarrollar y probar políticas quirúrgicas. Se ejecuta a 288 por 512 píxeles y acepta comandos a una frecuencia efectiva de 10 Hz. Este es un trabajo de banco, no un cuerpo.
La mezcla de entrenamiento es más interesante que la tasa de cuadros. Junto con demostraciones exitosas de sutura y nudos de Johns Hopkins, NVIDIA mantuvo deliberadamente episodios de falla y fuera de distribución: caídas de aguja, lanzamientos fallidos, nudos que no se mantuvieron. Su razón declarada es que un simulador destinado a puntuar políticas debe reproducir las consecuencias de acciones deficientes, no solo demostraciones ideales.
Versius se conecta
NVIDIA dice que trabajó con CMR Surgical y Cambridge Consultants, la empresa de ingeniería propiedad de Capgemini, para conectar el modelo al controlador de cirujano para la plataforma Versius de CMR y ejecutarlo en vivo. CMR demostró la configuración a una audiencia quirúrgica en una conferencia de cirugía robótica en Florida a fines de julio de 2026. La empresa tiene razones para estar en este bucle temprano: NVIDIA le acredita haber contribuido con casi 500 horas de datos de procedimientos de Versius anónimos al conjunto de datos Open-H Embodiment en el que se preentrenó la familia de modelos, y CMR se describe a sí misma como la contribuyente más grande a ese conjunto de datos.
CMR también es directa sobre lo que la demostración no es. Una nota al pie de su lanzamiento establece que la simulación es “solo para fines de investigación y demostración”, no es parte del sistema Versius Plus aprobado, y no está destinada a la toma de decisiones clínicas o atención al paciente. Versius Plus en sí está aprobado en EE. UU. solo para la extracción de la vesícula biliar en adultos, con una aplicación de ginecología pendiente. La aprobación regulatoria para el hardware quirúrgico todavía se mueve de procedimiento en procedimiento, como mostró el robot Anovo de Momentis cuando obtuvo la aprobación de la FDA para la cirugía multiport. NVIDIA traza la misma línea en su propio mensaje: esta es una plataforma de investigación y desarrollo, no un sistema de diagnóstico y no un controlador para un robot quirúrgico físico.
La agenda de validación
El modelo es la mitad generativa del marco de simulación de física médica que NVIDIA publicó como código abierto el 22 de julio de 2026 dentro de su pila Isaac para la atención médica, donde los solvers convencionales manejan el contacto y la fricción y el modelo aprendido maneja la dinámica de la escena visual. Es la misma posición que NVIDIA ha adoptado en la planta de fabricación, suministrando la capa de simulación que otros proveedores construyen productos sobre ella.
El mensaje de NVIDIA dice que el próximo paso inmediato es evaluar más que la calidad visual, y propone una familia de pruebas de bucle cerrado como la medida de si la versión rápida es lo suficientemente precisa como para confiar en ella:
- precisión de posición y actitud de la punta de la herramienta
- fidelidad y estabilidad del ciclo de pinza cuando los instrumentos están inactivos
- deriva sobre despliegues largos
- acuerdo entre resultados de política simulados y reales
La evidencia de transferencia más cercana hasta ahora proviene de la línea anterior: un artículo de 2025 de investigadores de NVIDIA y Johns Hopkins informó una fuerte correlación entre despliegues en el modelo quirúrgico offline y resultados de política en un sistema de investigación da Vinci físico para tareas de almohadilla de sutura, más una alineación preliminar en trabajo de vesícula biliar porcina ex vivo. Ese fue el modelo bidireccional lento en lugar del estudiante de dos pasos, y el propio repositorio señala que el horario más rápido cuesta algo de fidelidad.
Obtener acceso a él es barato según los estándares de modelos de frontera. Los pesos llevan la licencia de modelo abierto de NVIDIA y el código de servicio es Apache 2.0, con el repositorio que solicita una GPU con 12 GB de memoria, un controlador actual y Linux. No hay un informe técnico todavía; el enlace del repositorio a uno apunta a un archivo de marcador de posición. Las políticas de robot condicionadas por video ya se están moviendo hacia las líneas de producción, como mimic robotics’ FLUX-mimic en una planta de Audi, pero la cirugía tiene una prueba de aceptación más difícil. Para los laboratorios que entrenan políticas quirúrgicas, la pregunta que importa es si una puntuación obtenida dentro de este simulador predice lo que el brazo hace en una almohadilla de sutura real. NVIDIA ha nombrado esa referencia, y sus resultados son lo que la próxima ronda de evidencia girará en torno a.












