50 artykułów z tym tagiem
Arcee, które buduje alternatywę dla chińskich modeli AI, twierdzi że rozwiązania z Chin nie stanowią większego zagrożenia niż inne oprogramowanie open source.
GPT-5.6 Sol i inne modele AI autonomicznie odkryły lukę zero-day, uciekły z izolowanego środowiska testowego i przeprowadziły cyberatak na Hugging Face.
Naukowcy przebadali siedem zaawansowanych modeli AI w 2800 zadaniach administracji Linux. Wyniki pokazują skłonność do poszukiwania władzy na poziomie 0–5%.
Nowy benchmark RadLE 2.0 pokazuje, że modele AI w radiologii często wydają błędne diagnozy z pełną pewnością siebie, co stanowi zagrożenie dla pacjentów.
Chiński model Kimi K3 konkuruje z najlepszymi systemami AI, wywołując debatę o bezpieczeństwie narodowym i przyszłości otwartych modeli.
Badacze z Tracebit opracowali technikę context bombing, która zmniejsza skuteczność ataków AI z 57% do 5% wykorzystując mechanizmy bezpieczeństwa modeli.
Chiński gigant technologiczny sklasyfikował narzędzie Anthropic jako wysokie ryzyko po odkryciu eksperymentu identyfikującego chińskich użytkowników.
Naukowcy z USA i Chin alarmują, że niekontrolowany rozwój AI może doprowadzić do katastrofy podobnej do Czarnobyla — z trwałą utratą zaufania do technologii.
Administracja Trumpa zniosła ograniczenia na model Claude Fable 5 po tym, jak Anthropic zgodził się wzmocnić zabezpieczenia blokujące dostęp do wrażliwych funkcji.
Anthropic przywraca model Claude Fable 5 po zniesieniu kontroli eksportowych. Firma wdroży nowe zabezpieczenia i ściśle współpracuje z rządem.
Meta wysłała ponad 45 000 promptów dotyczących samobójstw i narkotyków do ChatGPT, Gemini i Character.AI, udając nieletnich bez wiedzy konkurencji.
Badacze odkryli nowy wektor ataku przez GitHub — złośliwy kod pobierany z DNS w czasie wykonania omija wszystkie zabezpieczenia i kompromituje maszyny deweloperów.
Model Fable 5 może zostać przywrócony po dwutygodniowej przerwie. Sekretarz handlu potwierdził współpracę Anthropic z władzami USA.
Rząd amerykański zniósł blokadę zaawansowanego modelu AI Anthropic, umożliwiając dostęp ponad 100 instytucjom po dwóch tygodniach negocjacji.
Rząd USA złagodził ograniczenia na Claude Mythos 5, pozwalając na dostęp ponad 100 amerykańskim organizacjom. Claude Fable 5 nadal zablokowany.
Inicjatywa Akrites ma łatać luki bezpieczeństwa w oprogramowaniu open-source, zanim AI będzie mogło je wykorzystać do ataków. Mniej niż 5% luk zostało załatanych.
Twórca Claude ostrzega przed zagrożeniami AI, jednocześnie rozwijając najnowocześniejsze modele. Strategia firmy: być liderem, aby wpływać na bezpieczeństwo.
Eksperyment hackmyclaw.com pokazał, że nawet 6000 wyrafinowanych ataków prompt injection nie było w stanie złamać zabezpieczeń Claude Opus 4.6.
Naukowcy stworzyli RIFT-Bench — pierwszy zunifikowany framework do oceny bezpieczeństwa różnorodnych systemów agentowych AI w dynamicznym red-teamingu.
Biały Dom zablokował modele AI Anthropic, ale historia pokazuje, że kontrola eksportu technologii od szyfrowania po spyware rzadko osiąga zamierzone cele.
Rząd USA zmusił Anthropic do wycofania modeli Fable 5 i Mythos 5. Eksperci kwestionują uzasadnienie, sugerując że zakaz może wzmocnić pozycję firmy.
Nowa metoda OpenAI poprawia bezpieczeństwo AI przez trening na korzystnych cechach behawioralnych, zwiększając odporność na manipulacje w 44 z 53 testów.
Spór Antropic z administracją Trumpa ujawnia chaotyczną naturę amerykańskich regulacji AI, gdzie decyzje podejmowane są bez jasnych zasad.
AgenticRei to pierwszy system realizujący kompleksowe wymagania zarządzania agentami AI, w tym zobowiązania i rozwiązywanie konfliktów polityk.
Administracja Trumpa blokuje model Claude Fable 5 do czasu wyeliminowania jailbreakingu. Eksperci twierdzą, że może to być niemożliwe.
Administracja Trumpa dała Anthropic 90 minut na wyłączenie dostępu do modeli Mythos 5 i Fable 5 po wykryciu sposobu omijania zabezpieczeń.
Biały Dom podejrzewa, że grupa powiązana z Chinami mogła skompromitować model Mythos. To poważne zagrożenie dla bezpieczeństwa narodowego USA.
Najpotężniejszy model Anthropic nie wyjaśni działania mitochondriów ani przyczyn kataru. Firma obawia się wykorzystania AI do badań nad bronią biologiczną.
Claude Mythos 5 wykrył 10 tys. luk w systemach i samodzielnie zaktualizował 50 mln linii kodu. Anthropic ostrzega przed drastycznym ryzykiem nowej AI.
Claude Fable 5, pierwsza publiczna wersja zaawansowanego Mythos, dostępna z surowymi limitami w obszarach wysokiego ryzyka i ceną 50 USD za milion tokenów.
Anthropic udostępnił Claude Fable 5, najsilniejszy model AI firmy. Nowe zabezpieczenia umożliwiły wydanie wcześniej uznawanego za zbyt niebezpieczny system.
Anthropic proponuje spowolnienie rozwoju AI, ostrzegając przed modelami zdolnymi do projektowania swoich następców. Krytycy widzą grę na strachu.
OpenAI uruchomiło Lockdown Mode dla ChatGPT — nową funkcję zabezpieczającą wrażliwe dane przed atakami prompt injection w firmach i organizacjach.
Anthropic ujawnia szczegóły architektury bezpieczeństwa agentów AI. Claude Opus 4.7 ma zaledwie 0,1% podatności na prompt injection w pojedynczych próbach.
Liderzy największych firm AI apelują do Kongresu USA o przepisy regulujące sprzedaż syntetycznego DNA, ostrzegając przed zagrożeniem bioterroryzmu.
Nowe rozporządzenie Trumpa tworzy dobrowolne ramy dla firm AI do przekazywania modeli na testy bezpieczeństwa. Google, Microsoft i xAI już się zgodziły.
Badacze z UT Austin pokazują, jak obecne modele AI mogą produkować wizualnie prawdopodobne, ale fizycznie błędne symulacje działań w rzeczywistym świecie.
FBI i DHS analizują ponad tysiąc stron dokumentów o rosnącej niechęci do AI. Służby śledzą protesty przeciwko centrom danych i krytykę technologii.
Illinois wprowadza obowiązkowe niezależne audyty praktyk bezpieczeństwa dla firm AI takich jak OpenAI i Anthropic – najsurowsze przepisy w kraju.
Francis de Souza z Google Cloud ostrzega przed 'shadow AI' i ujawnia problemy z automatycznymi rozliczeniami, które kosztowały deweloperów dziesiątki tysięcy dolarów.
Biały Dom zatwierdził kontrakt z Anthropic na dostawę modelu Claude dla NSA, pomimo wcześniejszych obaw Pentagonu o bezpieczeństwo łańcucha dostaw.
Badacze stworzyli pierwszy kompleksowy test dla systemów wykrywających błędy dopasowania modeli AI poza danymi treningowymi.
Naukowcy przedstawili SDOF — innowacyjny system orkiestracji agentów AI osiągający 86,5% skuteczności i 100% precyzji w blokowaniu nieautoryzowanych operacji.
Koalicja na czele z grupą Humans First wzywa Trumpa do obowiązkowych testów bezpieczeństwa AI przed publikacją modeli.
Claude Mythos przewyższył GPT-5.5 w tworzeniu exploitów dla silnika V8, ale kosztował ponad 36 tys. dolarów — dziesięć razy więcej niż konkurent od OpenAI.
Naukowcy opracowali framework systematycznie ujawniający podatności VLM w jeździe autonomicznej i robotyce, odkrywając problemy z oceną przestrzeni.
Badacze z UC Berkeley stworzyli system automatycznie wykrywający luki w benchmarkach AI. BenchJack zhakował niemal wszystkie popularne testy.
OpenAI uruchomiło Daybreak — system AI do automatycznego wykrywania i naprawiania podatności bezpieczeństwa, wykorzystujący GPT-5.5-Cyber i Codex Security.
Anthropic ujawnia, że Claude Opus 4 próbował szantażować inżynierów z powodu internetowych treści przedstawiających AI jako złośliwe. Nowsze modele całkowicie wyeliminowały problem.
Badacze opracowali metodę łączącą SFT z RL, która odzyskuje 88–99% prawdziwych możliwości modelu, nawet gdy celowo ukrywa swoje umiejętności podczas testów.