Cosmos-H-Dreams: simulación generativa en tiempo real para robótica quirúrgica

Cosmos-H-Dreams transforma un modelo de mundo quirúrgico en un simulador interactivo que corre en tiempo real. Al combinar distilación docente‑alumno y el motor FlashDreams, permite evaluaciones cerradas y generación de datos sintéticos sin exponer equipos ni material biológico.

Por Redaccion TD
Cosmos-H-Dreams: simulación generativa en tiempo real para robótica quirúrgica

Por qué importa la simulación en cirugía robótica

La robótica quirúrgica avanza rápidamente desde la teleoperación hacia políticas que integran visión, lenguaje y acción. Entrenar y evaluar estos sistemas en el mundo real, sin embargo, es costoso, lento y arriesga daños a equipos e incluso material biológico. Las simulaciones convencionales ayudan, pero reproducir con fidelidad tejido deformable, suturas, superficies especulares, humo u oclusiones es extremadamente difícil.

Los modelos de mundo fundacionales ofrecen otra vía: en lugar de programar cada interacción física, aprenden dinámicas visuales directamente de video sincronizado y cinemática robótica. NVIDIA ya había mostrado este enfoque con Cosmos-H-Surgical-Simulator, capaz de generar video futuro a partir de un cuadro inicial y una secuencia de acciones del robot, facilitando evaluación offline y generación de datos sintéticos dentro del ecosistema Open-H-Embodiment.

Qué es Cosmos-H-Dreams

Cosmos-H-Dreams es la evolución de ese trabajo: un simulador generativo condicionado por acciones que opera en tiempo real. A partir de los priors multi‑embodiment aprendidos por Cosmos-H-Surgical-Simulator, NVIDIA especializó y destiló el modelo para tareas de sutura en mesa con el da Vinci Research Kit (dVRK). El modelo liberado recibe un fotograma RGB inicial y un flujo en vivo de cinemática del robot, y genera de manera autoregresiva los siguientes fragmentos de video que corresponden a las acciones entrantes.

Importante: Cosmos-H-Dreams no solo está pensado para reproducción offline. Sirve las predicciones a través de FlashDreams, la librería de inferencia por streaming acelerada de NVIDIA, y puede correr en una sola GPU NVIDIA RTX PRO 6000. El resultado es un entorno interactivo donde una persona o una política aprendida puede operar en lazo cerrado.

Cómo se logró: desde un “teacher” hasta un estudiante causal

Reducir el costo computacional sin perder las dinámicas quirúrgicas críticas fue el reto central. La solución fue un pipeline de distilación teacher‑to‑student diseñado para rollouts largos y autoregresivos.

  • El teacher (docente) parte del checkpoint Open‑H de Cosmos-H-Surgical-Simulator, construido sobre Cosmos-Predict2.5-2B y post‑entrenado con el dataset Open-H-Embodiment. Usa una representación de acción unificada de 44 dimensiones.
  • Para el modelo dVRK de mesa, las acciones dual‑brazo del dVRK (traslación relativa del efector final, rotación y estado de la pinza) se mapean a esa representación común.
  • El teacher se afina con la mezcla JHU dVRK tabletop que incluye no solo demostraciones exitosas, sino también episodios de fallo y fuera de distribución: caídas de aguja, lanzamientos fallidos y ataduras de nudo incompletas. Reproducir fallos es esencial: un simulador destinado a evaluar políticas debe mostrar las consecuencias de acciones pobres, no solo ejemplares.

Para mejorar la estabilidad en rollouts largos, el entrenamiento del teacher incrementa progresivamente el horizonte temporal: se empieza con ventanas cortas (por ejemplo, 12 cuadros) y se avanza hasta horizontes mayores (por ejemplo, 72 cuadros), re‑inicializando con pesos preentrenados en cada etapa de calentamiento.

Calentamiento causal y distilación por auto‑forzado

El siguiente paso transforma al student (estudiante) en un generador causal y eficiente:

  • Causal warmup: las trayectorias de denoising del teacher se precomputan y cachean. El student se inicializa desde el teacher y aprende a imitar esas trayectorias precomputadas, adaptando su atención a un esquema causal y usando un caché de clave/valor para streaming.

  • Self‑forcing distillation: durante el entrenamiento, el student genera su propio contexto y autorealiza rollouts. Un teacher congelado provee supervisión de distribución para guiar esas secuencias autoproducidas hacia video quirúrgico realista. Esto prepara al student para las condiciones imperfectas que encontrará en inferencia interactiva y permite reducir los pasos de difusión a muy pocos (en el límite, tan solo dos pasos de denoising por fotograma latente) en lugar del proceso de múltiples pasos del teacher.

El resultado es un modelo que conjuga los priors quirúrgicos del teacher con la estructura causal necesaria para streaming en tiempo real.

FlashDreams: motor de inferencia en tiempo real

La distilación por sí sola no basta: también se requiere infraestructuras de inferencia optimizadas. FlashDreams es la librería de NVIDIA para servir modelos autoregresivos de mundo y video con streaming acelerado. Combinada con Cosmos-H-Dreams, permite ofrecer predicciones continuamente a medida que llega la cinemática del robot, y ejecutarlas de forma interactiva sobre una GPU disponible.

Esta arquitectura permite que tanto operadores humanos como agentes automáticos cierren el lazo: enviar acciones, ver las consecuencias sintéticas en pantalla y ajustar la política sin mover un brazo físico.

Integraciones y versatilidad

NVIDIA ha demostrado la flexibilidad de Cosmos-H-Dreams integrándolo con plataformas distintas: además de la especialización para dVRK, se trabajó junto a CMR Surgical y Cambridge Consultants para conectarlo con el controlador del cirujano Versius, posibilitando operación en tiempo real sobre esa plataforma. Esto evidencia que los priors multi‑embodiment del modelo pueden adaptarse a diferentes hardware quirúrgico.

Relevancia para América Latina

Para centros de investigación y hospitales en América Latina, herramientas como Cosmos-H-Dreams representan oportunidades importantes:

  • Reducción de costos y riesgo para entrenamiento y evaluación de algoritmos: ensayar políticas en simulación evita desgastar equipos caros y reduce la necesidad de material biológico.
  • Generación de datos sintéticos: facilita ampliar conjuntos de entrenamiento cuando conseguir grabaciones quirúrgicas reales es difícil por regulaciones, privacidad o escala.
  • Aceleración de investigación local: laboratorios universitarios y startups pueden prototipar control y percepción con hardware más accesible si el entorno de simulación corre en una sola GPU potente.

No obstante, la adopción requiere integrar estas herramientas con los flujos regulatorios y de validación clínica locales, y complementar siempre con pruebas físicas controladas antes de cualquier aplicación en pacientes.

Qué sigue y cómo empezar

Cosmos-H-Dreams apunta hacia sistemas de “Physical AI” quirúrgica en lazo cerrado, donde modelos que comprenden y predicen el mundo físico facilitan control más seguro y autónomo. Para quienes deseen comenzar hoy, la combinación de modelos destilados más motores de inferencia acelerada ofrece una base práctica para experimentar políticas, generar datos y reducir dependencia de pruebas físicas costosas.

En resumen, Cosmos-H-Dreams trae al terreno de la robótica quirúrgica la posibilidad de simulación generativa interactiva y en tiempo real: una herramienta que puede acelerar investigación, mejorar la evaluación de políticas y reducir riesgos operativos, siempre en complemento con validación física y supervisión clínica.

Fuente original: Hugging Face Blog