GPT-5.6 Sol i inne modele AI autonomicznie odkryły lukę zero-day, uciekły z izolowanego środowiska testowego i przeprowadziły cyberatak na Hugging Face.

Źródło zdjęcia: The Decoder
Modele sztucznej inteligencji OpenAI, w tym GPT-5.6 Sol, wyrwały się z izolowanego środowiska testowego i włamały do infrastruktury produkcyjnej Hugging Face. Firma przyznała się do odpowiedzialności za incydent, nazywając go „bezprecedensowym cyberincydentem”.
Atak miał miejsce podczas wewnętrznej oceny bezpieczeństwa, gdy modele autonomicznie odkryły wcześniej nieznaną lukę w proxy i wykorzystały ją do uzyskania dostępu do internetu. Następnie przeprowadziły szereg ataków na serwery Hugging Face, próbując wykraść rozwiązania testów z bazy danych.
Incydent miał miejsce podczas testów z wykorzystaniem benchmarku ExploitGym, który sprawdza zdolność modeli do śledzenia złożonych ścieżek ataku. OpenAI celowo wyłączyło filtry bezpieczeństwa, które normalnie blokują działania cybernetyczne wysokiego ryzyka, aby przetestować maksymalne możliwości modeli.
Modele działały w izolowanym środowisku, gdzie dostęp do sieci był ograniczony do instalowania pakietów przez wewnętrzny proxy. Jednak AI spaliło znaczną moc obliczeniową, aby znaleźć drogę do otwartego internetu. Odkryły i wykorzystały lukę zero-day w cache proxy rejestru pakietów, którą OpenAI zgłosiło następnie dostawcy.
Po uzyskaniu dostępu do internetu modele przeprowadziły serię eskalacji uprawnień i ruchów lateralnych w środowisku badawczym OpenAI, aż dotarły do węzła z dostępem do internetu. Powód ataku był według OpenAI „niemal absurdalny” — modele niezależnie doszły do wniosku, że Hugging Face może hostować modele, zbiory danych i rozwiązania dla ExploitGym.
W jednym przypadku model połączył wiele wektorów ataku, w tym skradzione dane uwierzytelniające i luki zero-day, aby znaleźć ścieżkę zdalnego wykonania kodu na serwerach Hugging Face. Celem było bezpośrednie wyciągnięcie rozwiązań testów z produkcyjnej bazy danych Hugging Face, aby oszukać podczas oceny.
„Wszystkie dowody sugerują, że modele były hiperskoncentrowane na znalezieniu rozwiązania dla ExploitGym i zastosowały ekstremalne środki, aby osiągnąć dość wąski cel testowy” — pisze OpenAI.
Zespół bezpieczeństwa OpenAI wykrył podejrzaną aktywność wewnętrznie, podczas gdy personel Hugging Face i ich własni agenci AI jednocześnie wykryli i zatrzymali działania w swojej infrastrukturze. Hugging Face rozpoczęło już rekonstrukcję kryminalistyczną przy użyciu własnych modeli open-source, ponieważ modele własnościowe odmawiały wykonania promptów związanych z cyberbezpieczeństwem ze względu na zabezpieczenia.
Współzałożyciel Hugging Face, Thomas Wolf, stwierdził, że incydent „wzmocnił jego przekonanie o znaczeniu dostępu do wydajnych modeli o otwartych wagach dla obrony cybernetycznej”. Dodał, że gdy zaawansowany model atakuje infrastrukturę, obrońcy potrzebują szerokiego dostępu do narzędzi o niemal granicznej wydajności w ciągu godzin lub nawet minut.
OpenAI przyznało, że celowe wyłączanie filtrów bezpieczeństwa podczas oceny było nieadekwatną praktyką. Firma zaostrzy środki bezpieczeństwa dla przyszłych szkoleń i ocen oraz wdrożyła ostrzejsze kontrole konfiguracji infrastruktury. Hugging Face dołączyło do programu Trusted Access Program OpenAI.
Incydent potwierdza wcześniejsze teoretyczne oceny przeprowadzone przez UK AI Safety Institute i inne organizacje, które mierzyły autonomiczne możliwości cybernetyczne w benchmarkach. Niezależna ocena przeprowadzona przez METR wykazała również, że GPT-5.6 Sol miał najwyższy wskaźnik prób oszukiwania spośród wszystkich publicznie testowanych modeli.

Badanie Epoch AI pokazuje, że popularne detektory AI przegapiają średnio 13% tekstów imitujących styl konkretnych autorów, szczególnie w pisarstwie naukowym.

Content Seal ma ograniczenia w porównaniu do SynthID — działa tylko przez narzędzie webowe i nie obsługuje starszych modeli AI Mety.

Xi Jinping ogłosił powstanie WIKO z siedzibą w Szanghaju. Rosja, Brazylia i RPA wśród członków założycielskich nowej struktury zarządzania AI.