Brytyjski instytut wykazał, że GLM-5.2 i DeepSeek V4-Pro osiągają poziom systemów zamkniętych sprzed kilku miesięcy, przy kosztach 50 razy niższych.

Źródło zdjęcia: The Decoder
Brytyjski Instytut Bezpieczeństwa AI (AISI) opublikował pierwszą publiczną analizę luki między otwartymi i zamkniętymi modelami AI w zakresie zdolności cybernetycznych. Wyniki wskazują na znaczące zmniejszenie dystansu między tymi systemami — obecne modele otwarte dorównują poziomom, które najlepsze zamknięte systemy osiągnęły zaledwie 4–7 miesięcy wcześniej.
Wcześniej ta różnica wynosiła 6–10 miesięcy, co oznacza systematyczne doganianie przez modele open-weight. GLM-5.2 i DeepSeek V4-Pro wykazały w testach porównywalne wyniki z wcześniejszymi wersjami Claude Opus, przy dramatycznie niższych kosztach użytkowania.
AISI zastosowało dwie różne metody oceny zdolności cybernetycznych. Pierwsza, zwana „Narrow Cyber Tasks”, obejmuje 70 zadań podzielonych na cztery poziomy trudności — od pracy nietechnicznej po wyzwania na poziomie eksperckim. Test pokrywa obszary takie jak badanie podatności, inżynieria wsteczna, eksploitacja webowa i kryptografia.
GLM-5.2, wydany w czerwcu 2026 roku, osiągnął w tych zadaniach wyniki porównywalne z Opus 4.6 z lutego 2026, co oznacza około czterech miesięcy opóźnienia. DeepSeek V4-Pro wykazał wydajność na poziomie Opus 4.5 z listopada 2025 roku.
Druga metoda, „Cyber Ranges”, testuje autonomiczne zdolności cybernetyczne w symulowanych sieciach. Scenariusz „The Last Ones” symuluje 32-etapowy atak na sieć korporacyjną z czterema podsieciami i około 20 hostami. AISI szacuje, że ekspert potrzebowałby około 20 godzin na jego ukończenie.
W tym teście GLM-5.2 osiągnął wyniki podobne do Opus 4.5, podczas gdy DeepSeek V4-Pro wypadł słabiej od Sonnet 4.5. Najlepsze rezultaty uzyskał GPT-5.6-Sol, wyprzedzając Claude Mythos 5.
Różnice w kosztach między modelami są dramatyczne. Test Cyber Range z 100 milionami tokenów kosztuje około 85$ dla Opus 4.5 lub 4.6, około 46$ dla GLM-5.2 i zaledwie 1,19$ dla DeepSeek V4-Pro. W przypadku pojedynczych zadań, które oba porównywane modele rozwiązały niezawodnie, Opus 4.6 kosztuje około 15$ za zadanie, GLM-5.2 około 6$, a DeepSeek V4-Pro jedynie 28 centów.
AISI odkryło, że środki bezpieczeństwa w modelach otwartych są w dużej mierze nieskuteczne. DeepSeek V4-Pro czasami odmawiał wykonania zadań inżynierii wstecznej, ale zwykłe ponowienie próby wystarczało do ominięcia ograniczenia. Zabezpieczenia takie jak monitoring, klasyfikatory i limity użytkowników nie mogą być niezawodnie przeniesione na modele otwarte, ponieważ zależą od kontrolowania dostępu do modelu.
AISI postrzega lukę między otwartymi i zamkniętymi modelami jako okno na przygotowanie się. W tym czasie obrońcy cyberbezpieczeństwa z dostępem do najsilniejszych zamkniętych systemów mogą działać, zanim te same możliwości staną się swobodnie dostępne bez porównywalnych zabezpieczeń.
W kwietniu 2026 roku dwa zamknięte modele, Mythos Preview i GPT-5.5, dostarczyły jedne z największych postępów w zdolnościach cybernetycznych AI od czasu rozpoczęcia testów przez AISI. Brytyjskie Narodowe Centrum Cyberbezpieczeństwa wydało następnie międzynarodowe ostrzeżenia, że krajobraz zagrożeń cybernetycznych szybko się zmienia.
Analiza AISI pokazuje, że democratyzacja zaawansowanych zdolności AI w cyberbezpieczeństwie postępuje szybciej niż wcześniej przewidywano, co wymaga pilnego dostosowania strategii obronnych przez organizacje na całym świecie.

Badanie pokazuje, że modele AI są o 65% bardziej skłonne do stereotypizowania kandydatów do pracy niż ludzie, co rodzi pytania o sprawiedliwość.
Model AI Claude Fable znalazł kontrprzykład obalający 90-letnią Hipotezę Jakobianową, jeden z najważniejszych problemów matematyki algebraicznej.

Anthropic zawarło z AMD umowę wartą do 5 miliardów dolarów na dostawę 2 gigawatów GPU do trenowania modeli Claude. Pierwsza faza w 2027 roku.