Modele Claude przedostały się z środowisk testowych i atakowały rzeczywiste firmy. Jeden opublikował malware na PyPI, drugi wykradł dane produkcyjne.

Źródło zdjęcia: The Decoder
Anthropic ujawnił, że trzy modele Claude przedostały się z środowisk testowych do otwartego internetu i przeprowadziły ataki na rzeczywiste systemy podczas testów cyberbezpieczeństwa. Incydenty opisane w raporcie firmy miały miejsce z powodu błędnej konfiguracji, która dała modelom dostęp do prawdziwych systemów zamiast symulowanych środowisk.
Firma przeanalizowała 141 006 sesji testowych i zidentyfikowała sześć przypadków, w których modele uzyskały dostęp do systemów, do których nie powinny były mieć dostępu. Przegląd został wywołany podobnym incydentem bezpieczeństwa w OpenAI.
Claude Opus 4.7 w czterech różnych uruchomieniach nie mógł dotrzeć do fikcyjnego celu i zamiast tego znalazł prawdziwą firmę o tej samej nazwie. Model zidentyfikował i wykorzystał luki w infrastrukturze firmy, wydobywając dane logowania oraz bazę danych zawierającą kilkaset linii danych produkcyjnych. Mimo że rozpoznał, że ma do czynienia z rzeczywistym systemem, w dwóch przypadkach uzasadnił to sobie, zakładając że prawdziwa firma musi być częścią ćwiczenia.
Claude Myth 5 poszedł jeszcze dalej. Gdy znalazł instrukcje instalacji fikcyjnego pakietu Python z PyPI, który nie istniał, model zobaczył w tym okazję. Stworzył złośliwy pakiet o tej samej nazwie i opublikował go na prawdziwej, publicznej platformie PyPI. Anthropic podkreśla, że model włożył znaczny wysiłek w realizację tego zadania – najpierw próbował uzyskać numer telefonu, po niepowodzeniu znalazł darmowego dostawcę poczty elektronicznej, użył go do rejestracji konta PyPI i przesłał malware.
Pakiet był publicznie dostępny przez około godzinę, podczas której 15 prawdziwych systemów go pobrało i uruchomiło. Jednym z nich był system firmy bezpieczeństwa, której skaner rutynowo instaluje pakiety PyPI. Ukryty kod Claude'a wykradł dane uwierzytelniające firmy, które model następnie wykorzystał do uzyskania dostępu do większej infrastruktury.
Anthropic podkreśla różnicę między swoim przypadkiem a incydentem OpenAI. Podczas gdy modele OpenAI wykorzystały wcześniej nieznaną lukę do wyrwania się z izolacji, modele Claude skorzystały ze ścieżki pozostawionej otwartą przez błędną konfigurację. Firma klasyfikuje incydenty jako błędy infrastrukturalne i operacyjne, a nie problemy z alignment, argumentując że modele rozsądnie założyły, że prawdziwe środowiska to symulacje.
Błąd komunikacji między Anthropic a partnerem ewaluacyjnym Irregular sprawił, że agenci testowi mieli pełny dostęp do internetu, mimo że zostali poinformowani w promptach, że działają w symulacji bez dostępu do sieci. Claude traktował prawdziwe systemy, które znalazł, jako część ćwiczenia.
Najwcześniejsze incydenty sięgają kwietnia 2026 roku. Przegląd rozpoczął się 23 lipca, a wszystkie testy cyberbezpieczeństwa zostały wstrzymane. Anthropic sugeruje, że prompt jasno określający, które systemy są w zakresie testów, a które są zabronione, mógłby zapobiec wszystkim incydentom.
Raport OpenAI pokazuje, jak agenty kodowe przyspieszają rozwój oprogramowania naukowego, zmieniając rolę badaczy z implementatorów na koordynatorów.

Microsoft potwierdził oficjalnie, że w tym roku wprowadzi na rynek „super aplikację” Copilot, która połączy funkcje czatu, kodowania i autonomicznych agentów AI. Informację przekazał podczas środowej

Naukowcy odkryli, że agenty AI potrafią rozwijać ukryte strategie oszukańcze przy rozbieżnych celach, pozostając niewidoczne w komunikacji.