NVIDIA wprowadza Cosmos-H-Dreams — przełomowy symulator chirurgiczny oparty na AI, działający w czasie rzeczywistym na pojedynczej karcie RTX PRO 6000.

Źródło zdjęcia: huggingface.co
NVIDIA wprowadza nowy etap w rozwoju symulatorów chirurgicznych opartych na sztucznej inteligencji. Cosmos-H-Dreams to pierwsza platforma umożliwiająca symulację zabiegów chirurgicznych w czasie rzeczywistym, wykorzystująca generatywne modele AI do tworzenia interaktywnego środowiska treningowego dla robotów chirurgicznych. Szczegóły technologii przedstawiono w oficjalnej dokumentacji na Hugging Face.
Przełom w czasie rzeczywistym: Cosmos-H-Dreams działa na pojedynczej karcie NVIDIA RTX PRO 6000 GPU, umożliwiając interaktywną kontrolę symulatora przez operatora lub system AI w pętli zamkniętej.
Destylacja zaawansowanego modelu: Nowy system bazuje na Cosmos-H-Surgical-Simulator, ale został zoptymalizowany do generowania obrazu w zaledwie dwóch krokach denoising na klatkę zamiast wieloetapowego procesu.
Integracja z platformami chirurgicznymi: Model został przetestowany z da Vinci Research Kit (dVRK) oraz zintegrowany z kontrolerem Versius w ramach współpracy z CMR Surgical i Cambridge Consultants.
Uczenie na niepowodzeniach: System trenowany jest nie tylko na udanych demonstracjach, ale także na scenariuszach błędów, takich jak upuszczenie igły czy nieudane wiązanie węzłów.
Biblioteka FlashDreams: Nowa biblioteka inferencji przyspiesza obliczenia dla autoregresywnych modeli świata i wideo, umożliwiając streamingowe generowanie obrazu.
Cosmos-H-Surgical-Simulator, poprzednik obecnego systemu, był modelem świata opartym na NVIDIA Cosmos-Predict2.5–2B i trenowanym na zbiorze danych Open-H-Embodiment. Umożliwiał generowanie wideo chirurgicznego na podstawie początkowej sceny i sekwencji akcji robota, ale działał jedynie w trybie offline — nadawał się do oceny polityk i generowania syntetycznych danych, ale nie do interakcji w czasie rzeczywistym.
Cosmos-H-Dreams wprowadza fundamentalną zmianę, przekształcając model w kauzalny system zdolny do autoregresywnego generowania scen. Model otrzymuje początkową klatkę RGB oraz strumień danych kinematycznych robota na żywo, następnie produkuje kolejne fragmenty wideo przed kontynuowaniem z następnym blokiem akcji.
Kluczowym wyzwaniem było zachowanie przydatnych dynamik chirurgicznych przy jednoczesnym zmniejszeniu kosztów obliczeniowych generowania. Cosmos-H-Dreams wykorzystuje pipeline treningu nauczyciel-uczeń zaprojektowany dla długich, autoregresywnych sekwencji.
Model nauczyciela rozpoczyna od checkpointu Cosmos-H-Surgical-Simulator Open-H, który używa zunifikowanej 44-wymiarowej reprezentacji akcji. Dla wydanej wersji modelu dVRK, zawartość akcji dwuramiennego dVRK — składająca się z względnej translacji end-effectora, rotacji i stanu chwytaka — jest mapowana do tej wspólnej reprezentacji.
Proces treningu stopniowo zwiększa horyzont czasowy modelu nauczyciela, rozpoczynając od 12 klatek i progresywnie zwiększając do 72 klatek. Na każdym etapie zwiększania horyzontu model jest inicjalizowany z pre-trenowanymi wagami.
Kluczową innowacją jest self-forcing distillation — podczas treningu model uczeń generuje kontekst używając własnych wyjść, a nadzór dopasowujący rozkład od zamrożonego nauczyciela kieruje te auto-generowane sekwencje w stronę realistycznego wideo chirurgicznego. To przygotowuje model do takich samych warunków, które napotka podczas interaktywnej inferencji.
Resultujący system obsługuje dyfuzję w kilku krokach — zaledwie dwa kroki denoising na klatkę latentną zamiast wieloetapowego procesu używanego przez pełny model nauczyciela. Cosmos-H-Dreams łączy chirurgiczne priors nauczyciela ze strukturą kauzalną potrzebną do streamingu.
Wszechstronność systemu została zademonstrowana przez integrację z platformą Versius, pokazując możliwość adaptacji do różnych systemów robotycznych. Model został przetrenowany na mieszance danych JHU dVRK, obejmującej zarówno udane demonstracje, jak i epizody błędów oraz przypadki out-of-distribution.
Cosmos-H-Dreams reprezentuje znaczący krok naprzód w symulacji chirurgicznej, umożliwiając po raz pierwszy interaktywne, generatywne środowisko treningowe działające w czasie rzeczywistym na dostępnym sprzęcie konsumenckim.

Superkomputer DGX GB300 z NVIDIA obsłuży 1500 studentów wojskowych, umożliwiając trenowanie modeli AI i symulacje w cyberbezpieczeństwie oraz prognozowaniu.

OpenAI uruchamia ChatGPT Health dla wszystkich użytkowników w USA, twierdząc że AI rozumuje lepiej niż klinicyści. Równocześnie firma czeli pozwom za niebezpieczne porady.

NVIDIA wdraża procesory Vera w przepływach EDA, osiągając 1,5x wyższą wydajność w testach z Cadence i Synopsys przy projektowaniu przyszłych chipów.