eGospodarka.pl
eGospodarka.pl poleca

eGospodarka.plWiadomościTechnologieInternetAtaki typu jailbreak na AI - raport F5 ujawnia nową technikę hakerów

Ataki typu jailbreak na AI - raport F5 ujawnia nową technikę hakerów

2026-08-04 14:10

Ataki typu jailbreak na AI - raport F5 ujawnia nową technikę hakerów

Ataki typu jailbreak na AI - raport F5 ujawnia nową technikę hakerów © wygenerowane przez AI

Paradoks rozwoju AI polega na tym, że nowoczesne techniki jailbreaków wykorzystują nie słabości modeli, ale ich najmocniejsze strony - analizę dokumentów, interpretację treści czy wydobywanie informacji. Raport F5 Labs opisuje technikę Adversarial Tales, która ukrywaja szkodliwe instrukcje w opowiadaniach. Testowana na 26 modelach AI od 9 dostawców, osiągnęła średnią skuteczność 71,3%, z wynikami od 35% do 94%. Najbardziej odporne okazały się modele z wysokim CASI, ale żaden nie jest całkowicie bezpieczny. Modele nie są oszukiwane - po prostu robią to, do czego zostały stworzone.

Przeczytaj także: AI w rękach cyberprzestępców - jak mogą chronić się firmy?

Z tego artykułu dowiesz się m.in.:


  • Jak nowa generacja jailbreaków wykorzystuje naturalne zdolności AI, takie jak analiza tekstu i interpretacja narracji, zamiast jej słabości.
  • Na czym polega technika Adversarial Tales i dlaczego osiąga 71,3% skuteczności w omijaniu zabezpieczeń modeli AI.
  • Jak operacja JadePuffer dowodzi, że modele AI mogą wykonywać złożone zadania w ataku ransomware po odpowiednim przygotowaniu.
  • Dlaczego skuteczne zabezpieczenia AI muszą uwzględniać nie tylko wykrywanie niebezpiecznych promptów, ale także sposób działania modeli.

Najnowszy raport F5 Labs zwraca uwagę na nowe techniki obchodzenia zabezpieczeń modeli AI. Zamiast próbować nakłonić model do złamania własnych zasad, coraz częściej wykorzystują jego naturalne zdolności, takie jak analiza tekstu, interpretacja narracji czy wydobywanie informacji z dokumentów. Jednym z przykładów takiego podejścia jest Adversarial Tales [1] – nowa technika jailbreaku [2], która ukrywa szkodliwe instrukcje w pozornie niewinnych opowiadaniach.

Skuteczność tej techniki oceniono na 26 modelach AI od dziewięciu dostawców. Średnio pozwalała ona obejść zabezpieczenia w 71,3% przypadków, przy czym wyniki poszczególnych modeli znacząco się różniły – od 35% w przypadku Claude Haiku 4.5 do 94% dla Qwen3 Max. F5 zwraca uwagę, że nie istnieje grupa modeli całkowicie odporna na tego typu techniki. Jednak modele osiągające najwyższe wyniki w rankingu CASI [3] należą również do najbardziej odpornych na Adversarial Tales.

To, co wyróżnia Adversarial Tales, to fakt, że model nie zostaje oszukany. Robi dokładnie to, do czego został stworzony – analizuje tekst i interpretuje jego treść. W efekcie ukryte instrukcje traktuje jako materiał do analizy, a nie jako polecenie wymagające uruchomienia mechanizmów odmowy – wyjaśnia Mariusz Sawczuk, Senior Solution Engineer, F5. – Co istotne, cały atak odbywa się w ramach jednej interakcji, bez stopniowego obchodzenia zabezpieczeń czy wykorzystywania rozbudowanych bibliotek promptów.

Zdaniem F5 oznacza to, że kolejne techniki jailbreaków mogą wykorzystywać coraz szerszy zakres naturalnych form komunikacji z modelami AI, a nie jedynie klasyczne prompty.

Od jailbreaku do rzeczywistych operacji


Raport F5 Labs przywołuje również operację JadePuffer, opisaną przez zespół Sysdig jako pierwszy udokumentowany przypadek wykorzystania autonomicznego agenta AI w ataku ransomware. Jednak, jak podkreślają autorzy raportu, pierwsze opisy tego przypadku przeceniały stopień autonomii agenta AI. Agent nie działał całkowicie samodzielnie – cel ataku został wskazany przez człowieka, który przygotował również infrastrukturę oraz dostarczył dane dostępowe. Po ich otrzymaniu agent przeprowadził kolejne etapy operacji, obejmujące rozpoznanie środowiska, przemieszczanie się pomiędzy systemami oraz szyfrowanie danych.

Zdaniem autorów pokazuje to nie tyle pełną autonomię AI, ile rosnącą zdolność modeli do wykonywania złożonych zadań po otrzymaniu odpowiednich danych wejściowych.

Paradoks rozwoju AI polega na tym, że nowe techniki jailbreaków wykorzystują nie słabości modeli, ale ich najmocniejsze strony. Analiza dokumentów, interpretacja treści czy wydobywanie informacji z tekstu to funkcje, dla których przedsiębiorstwa wdrażają AI. To oznacza, że skuteczne zabezpieczenia nie mogą koncentrować się wyłącznie na wykrywaniu niebezpiecznych promptów. Muszą uwzględniać również sposób, w jaki modele wykonują swoje codzienne zadania – podsumowuje Sawczuk.


[1] Technika jailbreaku rozwijana w tej samej linii badań co Adversarial Poetry (Atak pisany wierszem). W przeciwieństwie do poprzedniej metody wykorzystuje krótkie opowiadania analizowane zgodnie z metodą Władimira Proppa, czyli sposób analizy opowieści polegający na rozłożeniu fabuły na stałe funkcje i role występujące w narracji. W Adversarial Tales analiza narracji sprawia, że ukryte w fabule szkodliwe instrukcje są traktowane przez model jako materiał do interpretacji, a nie jako polecenie wymagające uruchomienia mechanizmów odmowy.

[2] Metoda polegająca na obchodzeniu zabezpieczeń modelu AI w celu skłonienia go do wygenerowania treści, których normalnie powinien odmówić.

[3] Wskaźnik opracowany przez F5 Labs oceniający poziom bezpieczeństwa modeli AI oraz ich odporność na techniki obchodzenia zabezpieczeń.

Skomentuj artykuł Opcja dostępna dla zalogowanych użytkowników - ZALOGUJ SIĘ / ZAREJESTRUJ SIĘ

Komentarze (0)

DODAJ SWÓJ KOMENTARZ

Eksperci egospodarka.pl

1 1 1

Wpisz nazwę miasta, dla którego chcesz znaleźć jednostkę ZUS.

Wzory dokumentów

Bezpłatne wzory dokumentów i formularzy.
Wyszukaj i pobierz za darmo: