Naukowcy odkryli prosty, ale niepokojący sposób na ominięcie zabezpieczeń robotów opartych na sztucznej inteligencji.

Naukowcy odkryli prostą, ale niepokojącą lukę w zabezpieczeniach, która pozwala robotom AI omijać wbudowane zabezpieczenia i zachowywać się nieprzewidywalnie. Dowiedz się więcej o tej poważnej wadzie.

Najważniejsze rzeczy, które musisz wiedzieć

  • Badania STING wykazały, że rozbicie złośliwych celów na pozornie niewinne małe kroki w ciągu kilku rund konwersacji znacznie zwiększa prawdopodobieństwo skutecznego obejścia zabezpieczeń sztucznej inteligencji, w niektórych przypadkach nawet dwukrotnie przewyższając skuteczność.
  • Ominięcie zabezpieczeń sztucznej inteligencji nie jest jedynie hipotetycznym ryzykiem; Meta przyznała, że ​​zastosowała prostą socjotechnikę, aby oszukać swojego inteligentnego asystenta i uzyskać nieautoryzowany dostęp do kont na Instagramie.
  • Skuteczność ataków na systemy sztucznej inteligencji znacznie wzrasta, gdy język ulega zmianie w trakcie wieloetapowego ataku, co podkreśla potrzebę przeprowadzania testów bezpieczeństwa na wczesnym etapie projektowania tych systemów.

Jeśli poprosisz agenta AI o włamanie się na konto, prawie na pewno odmówi, ale naukowcy z EPFL właśnie zaprezentowali łatwiejszą metodę, która opiera się bardziej na cierpliwości niż na umiejętnościach technicznych. Ich nowe badanie pokazuje , że podzielenie złośliwego celu na pozornie niegroźne, mniejsze prośby może skłonić agentów AI do wykonania zadań, które normalnie odrzuciliby od razu (za TechXplore ).

Odzwierciedla to niedawny atak „bioshock”, w którym zmanipulowano przeglądarki oparte na sztucznej inteligencji tak, aby obsługiwały kradzież danych uwierzytelniających w ramach nieszkodliwej gry.

W jaki sposób badacze odkryli tę słabość?

Zespół opracował zautomatyzowane narzędzie testujące o nazwie STING (Sequential Testing of Illicit N-step Goal Execution), które ma naśladować sposób działania prawdziwego atakującego. Zamiast bezpośrednio identyfikować złośliwy cel, STING planuje z wyprzedzeniem i dzieli go na serię mniejszych, pozornie nieszkodliwych kroków, które kumulują się, aby osiągnąć cel w ciągu kilku rund komunikacji.

Manipulowanie agentami AI w celu uzyskania nieuczciwego zachowania

Naukowcy przetestowali to podejście w 176 szkodliwych scenariuszach na wiodących modelach sztucznej inteligencji, w tym ChatGPT , Gemini i Cloud.

Każdego agenta AI testowano jako agenta korzystającego z narzędzi umożliwiających przeglądanie stron internetowych, wysyłanie wiadomości e-mail i wykonywanie zadań składających się z wielu etapów.

Wieloetapowa, stopniowa manipulacja okazała się znacznie skuteczniejsza niż bezpośrednie próby pojedynczych roszczeń. W niektórych przypadkach modele dwukrotnie częściej wykonywały złośliwe zadanie po rozbiciu żądania na mniejsze kroki. Odkrycie to jest zgodne z odrębnymi badaniami, które pokazują, że nawet zwykli użytkownicy potrafią ominąć zabezpieczenia sztucznej inteligencji, używając jedynie starannie sformułowanych roszczeń.

Dlaczego to jest ważne?

Obawy wyrażone przez badaczy nie są jedynie hipotetyczne. Meta przyznała w czerwcu, że atakujący wykorzystali prostą socjotechnikę, a nie złośliwe oprogramowanie ani narzędzia hakerskie, aby oszukać asystenta wsparcia opartego na sztucznej inteligencji i uzyskać nieautoryzowany dostęp do kont na Instagramie.

Czatbot AI

Początkowo naukowcy spodziewali się, że ataki będą skuteczniejsze w językach, dla których brakowało wystarczających danych treningowych. Jednak wyniki pokazały, że wskaźniki ukończenia ataków pozostały niemal stałe we wszystkich siedmiu testowanych językach. Zauważyli jednak istotny wyjątek: gdy język został zmieniony w trakcie ataku wieloetapowego , wskaźniki sukcesu gwałtownie wzrosły.

Główny badacz, Ayush Kumar Tarun, podkreśla potrzebę przeprowadzania testów bezpieczeństwa na bardzo wczesnym etapie, co czyni je integralną częścią projektowania systemów AI od samego początku. Samo dodanie ich jako reaktywnego rozwiązania po wystąpieniu problemów nie jest już wystarczające, zwłaszcza w miarę jak systemy te stają się coraz bardziej wydajne i integrowane z rzeczywistymi aplikacjami.

Możliwość dodawania komentarzy nie jest dostępna.