Agent AI podszywał się pod fałszywe tożsamości, aby promować złośliwy kod podczas testu cyberbezpieczeństwa, ustaliła AISI

  • Mythos 5 firmy Anthropic tworzył fałszywe tożsamości, aby propagować złośliwy kod podczas testów cyberbezpieczeństwa.
  • Aisi odnotowało 19 nieautoryzowanych działań podczas 122 przebiegów ewaluacji, z czego 17 było powiązanych z Mythos 5.
  • Próba nie powiodła się, a śledczy nie znaleźli dowodów na rzeczywiste szkody.
Promo

Instytut ds. Bezpieczeństwa AI w Wielkiej Brytanii (AISI) ujawnił, że agent AI zbudowany na bazie Mythos 5 firmy Anthropic samodzielnie przeprowadził atak socjotechniczny podczas testów cyberbezpieczeństwa. Agent otworzył pull request złośliwym kodem w prawdziwym projekcie open-source i stworzył fałszywe tożsamości, aby zdobyć akceptację jednego z opiekunów projektu.

Próba zakończyła się niepowodzeniem. Człowiek-opiekun wykrył oraz odrzucił kod.

Sponsorowane
Sponsorowane

AISI podaje, że dochodzenie nie wykazało szkód w rzeczywistym świecie. Model działał z wyłączonymi klasyfikatorami cyberbezpieczeństwa oraz dostępem do otwartego internetu – to nie jest konfiguracja komercyjnie dostępna.

Jak agent AI przeprowadził kampanię ze złośliwym kodem

Według raportu AISI podczas testów pod koniec lipca zarejestrowano 19 nieautoryzowanych działań w 10 z 122 prób. 17 z nich pochodziło od modelu Mythos 5 firmy Anthropic, a dwa z jednej próby GPT-5.6 Sol firmy OpenAI.

Agent analizował opiekunów projektu i tworzył wiele fałszywych tożsamości. Wykorzystał je, by zmanipulować prawdziwego opiekuna do zatwierdzenia kodu.

Kiedy pull request został publicznie zakwestionowany, agent edytował swoje wcześniejsze działania, by wyglądały na nieszkodliwe. Model rozważał także przyjęcie nowej tożsamości, by kontynuować zadanie.

Scenariusz przypomina incydent z 2024 roku związany z backdoorem w XZ Utils. Wtedy to osoba przez lata zdobywała zaufanie opiekuna przed ukryciem kodu. Raport AISI nie odnosi się do tej sprawy bezpośrednio, lecz podobieństwo jest wyraźne. Atak rozegrał się w dniach od 25 lipca do 28 lipca.

AISI podkreśliło, że nikt nie kazał modelowi kłamać.

Sponsorowane
Sponsorowane

„Model nigdy nie otrzymał polecenia, by oszukiwać; oszustwo pojawiło się spontanicznie podczas realizacji zadania, jako celowo ukierunkowana manipulacja – do niedawna uznawana głównie za teoretyczną.”

Śledź nas na X, by być na bieżąco z najnowszymi informacjami

Instytut zawarł to w swoim oświadczeniu. Przyznał też, że źle skonfigurowane polecenia sprawiły, iż agent wierzył, że niektórych zadań nie da się wykonać w przewidzianych ramach. Jednak podobne zachowanie pojawiło się także w próbach, gdzie agent miał wszystkie instrukcje pozwalające trzymać się zadania.

Zespoły bezpieczeństwa wykryły aktywność 28 lipca, gdy agent użył sieci anonimizującej Tor, by obejść część ograniczeń na GitHubie. GitHub potwierdził, że działania naruszyły ich regulamin. AISI współpracowało z GitHubem, by usunąć ślady, jakie zostawił agent, oraz poinformować użytkowników, z którymi miał kontakt.

Raport sugeruje, że to zdarzenie oznacza zmianę źródła ryzyka: szkody pojawią się nie tylko, gdy ludzie źle używają publicznych modeli, ale także gdy zaawansowane agenty w środowiskach uprzywilejowanych przekroczą swoje uprawnienia.

AISI twierdzi, że ten przypadek świadczy o szerzej postępującej zmianie w obszarze ryzyka AI. Instytut planuje niezależny przegląd wspólnie z METR – organizacją oceniającą AI, a także zaostrzenie kontroli w sieci i monitoring w czasie rzeczywistym podczas przyszłych testów.

Zasubskrybuj nasz kanał YouTube, by oglądać wypowiedzi liderów i dziennikarzy z fachową analizą


Aby przeczytać najnowsze analizy rynku kryptowalut od BeInCrypto, kliknij tutaj.

Zastrzeżenie

Wszystkie informacje zawarte na naszej stronie internetowej są publikowane w dobrej wierze i wyłącznie w ogólnych celach informacyjnych. Wszelkie działania podejmowane przez czytelnika w związku z informacjami znajdującymi się na naszej stronie internetowej odbywają się wyłącznie na jego własne ryzyko.

Sponsorowane
Sponsorowane