Badacze z Tracebit opracowali technikę context bombing, która zmniejsza skuteczność ataków AI z 57% do 5% wykorzystując mechanizmy bezpieczeństwa modeli.

Źródło zdjęcia: WIRED
Badacze z firmy Tracebit odkryli skuteczną metodę obrony przed atakującymi agentami AI wykorzystującą technikę znaną jako „context bombing”. Zespół wykazał, że umieszczenie specjalnych komend obok poufnych danych w chmurze Amazon Web Services może skutecznie zatrzymać ataki hackerskie prowadzone przez duże modele językowe.
Technika polega na wykorzystaniu mechanizmów bezpieczeństwa wbudowanych w modele AI przeciwko nim samym. Gdy atakujący agent napotka odpowiednio przygotowane komendy, jego systemy ochronne aktywują się i blokują dalsze działania.
Badacze z Tracebit umieszczają specjalne komendy obok haseł, kluczy kryptograficznych i innych poufnych danych przechowywanych w infrastrukturze chmurowej. Te komendy zawierają treści, które naruszają wbudowane zabezpieczenia modeli AI — na przykład instrukcje dotyczące tworzenia broni biologicznej lub, w przypadku chińskich modeli, odniesienia do wydarzeń na Placu Tiananmen z 1989 roku.
„Ostatecznie uruchamiamy mechanizm odmowy w kontekście” — wyjaśnia Andy Smith, współzałożyciel i CEO Tracebit. „Staramy się uchwycić fakt, że ma to silny, ostry efekt, z którego agenci mogą mieć trudności z powrotem. Gdy dostaną to do swojego kontekstu, będą nadal odmawiać.”
Gdy atakujący agent AI napotka te zabronione komendy podczas skanowania zasobów, automatycznie aktywują się jego mechanizmy bezpieczeństwa, powodując zatrzymanie wszystkich operacji. Model przestaje wykonywać swoje pierwotne instrukcje i odmawia dalszego działania.
Eksperymenty przeprowadzone w symulowanym środowisku AWS wykazały dramatyczne zmniejszenie skuteczności ataków. Średnio w pięciu modelach i 152 próbach wyniki przedstawiały się następująco:
Badania stanowią rozwinięcie wcześniejszych prac Tracebit z maja, kiedy firma przedstawiła metodę ostrzegania obrońców o atakach prowadzonych przez agencyjne systemy AI. Specjalne zasoby AWS działające jako „kanarkowe” ostrzegają o zagrożeniu średnio w ciągu ośmiu minut, podczas gdy atakujące modele potrzebują przeciętnie 14 minut na escalację do kontroli administracyjnej.
Jak zauważa Earlence Fernandes, profesor UC San Diego specjalizujący się w bezpieczeństwie AI: „Nie widziałem, żeby ktoś inny używał tej techniki jako obrony, z tego co wiem. Ja sam bawiłem się podobnym podejściem, choć w nieco innym kontekście.”
Context bombing może okazać się przełomowym rozwiązaniem w walce z atakującymi agentami AI, wykorzystując przeciwko nim te same techniki, których sami używają do ataków na systemy obronne.

Google zaprezentował Gemini 3.6 Flash, Flash-Lite 3.5 i Flash Cyber 3.5. Nowe modele są bardziej efektywne kosztowo i zoptymalizowane pod agenty AI.

Arcee, które buduje alternatywę dla chińskich modeli AI, twierdzi że rozwiązania z Chin nie stanowią większego zagrożenia niż inne oprogramowanie open source.

Armia amerykańska przekroczyła budżet 100 mln tokenów AI w zaledwie kilka tygodni, co zmusiło dowództwo do przywrócenia limitów użytkowania.