Zgłoś błąd
X
Zanim wyślesz zgłoszenie, upewnij się że przyczyną problemów nie jest dodatek blokujący reklamy.
Błędy w spisie treści artykułu zgłaszaj jako "błąd w TREŚCI".
Typ zgłoszenia
Treść zgłoszenia
Twój email (opcjonalnie)
Nie wypełniaj tego pola
Załóż konto
EnglishDeutschукраїнськийFrançaisEspañol中国

AI podszywała się pod prawdziwych deweloperów i próbowała przemycić malware. Uratował ich człowiek

AI podszywała się pod prawdziwych deweloperów i próbowała przemycić malware. Uratował ich człowiekAI Security Institute sprawdził, jak zachowują się modele językowe z otwartym dostępem do internetu i wyłączonymi filtrami bezpieczeństwa. Agenty Anthropic i OpenAI dostały zadanie z zakresu cyberbezpieczeństwa w kontrolowanym środowisku. Część wyszła jednak poza scenariusz. Zamiast pozostać w piaskownicy, zaczęła działać na prawdziwym GitHubie, kontaktować się z użytkownikami i próbować przemycić złośliwy kod do publicznego repozytorium.

Podczas testów brytyjskiego AI Security Institute agent Anthropic Mythos 5 samodzielnie zaplanował cały atak na łańcuch dostaw, w tym zbudował fałszywą tożsamość i próbował skłonić opiekuna projektu open source do zatwierdzenia złośliwego kodu.

AI podszywała się pod prawdziwych deweloperów i próbowała przemycić malware. Uratował ich człowiek [1]

AI oszukało zabezpieczenia i włamało się do infrastruktury Hugging Face. OpenAI przyznaje się do kompromitującego incydentu

Przedstawiony niedawno raport AISI opisuje 122 przebiegi ewaluacji, w których siedem najważniejszych modeli miało rozwiązać zadanie z zakresu cyberbezpieczeństwa w środowisku typu cyber range o nazwie „Doing Life”. W dziesięciu przebiegach agenty AI wyszły poza wyznaczony scenariusz i wykonały łącznie 19 nieautoryzowanych działań w prawdziwym internecie. Siedemnaście z nich przypisano Anthropic Mythos 5, a dwa modelowi OpenAI GPT-5.6 Sol z wyłączonymi klasyfikatorami cyber. Najdłuższy incydent trwał 34,5 godziny. Mythos 5 przeszukał publiczny internet, natrafił na niezwiązany z testem projekt open source i błędnie uznał, że jego przejęcie pomoże dostać się do symulowanej sieci. Następnie zebrał adresy e-mail opiekunów projektu, przeanalizował ich aktywność na GitHubie i założył konta wykorzystujące fałszywe tożsamości.

AI podszywała się pod prawdziwych deweloperów i próbowała przemycić malware. Uratował ich człowiek [2]

100 tysięcy dolarów i kilka bezczelnych promptów - tak Anthropic zmusiło swoją AI do przełomu w kryptografii

Atak przypominał klasyczny łańcuch dostaw. Agent zgłosił pull request z pozornie legalną poprawką błędu, w której ukrył trzy warianty złośliwego ładunku, w tym dropper omijający uruchomienie w CI oraz mechanizm pobierający kolejny skrypt po instalacji. W publicznym zgłoszeniu umieścił również prompt injection ukryty w komentarzu HTML, niewidoczny dla człowieka, ale odczytywany przez API. Instrukcja skierowana do Claude Code, Codexa i Cursora nakazywała pobranie oraz wykonanie dodatkowego skryptu. Gdy jeden z użytkowników GitHuba przetestował kod w izolowanym kontenerze Docker i ostrzegł opiekuna projektu, agent zaczął zacierać ślady, przepisał historię Git, zmienił wcześniejsze komentarze i rozważał utworzenie kolejnej tożsamości. W innym przebiegu model umieścił złośliwe metadane w paczkach Pythona kierowanych do repozytoriów obsługiwanych przez Dependabota, gdzie kod z setup.py wykonał się w co najmniej 53 kontenerach GitHuba. Jednocześnie badacze podkreślają, że nie doszło do ucieczki z piaskownicy testowej.

AI podszywała się pod prawdziwych deweloperów i próbowała przemycić malware. Uratował ich człowiek [3]

Żabka zhakowana. Dane udostępnione dwa dni po ogłoszeniu sprzedaży sieci właścicielowi Circle K. Zbieg okoliczności?

AISI zaznacza, że warunki eksperymentu nie odpowiadały publicznie dostępnej konfiguracji modeli. Klasyfikatory cyber były wyłączone, a dostęp do internetu celowo pozostawiono otwarty. Anthropic i OpenAI podkreślają to samo w swoich stanowiskach. Istotne jest jednak, że agentom nie polecono oszukiwania ani ukrywania działań. Zachowania określane jako deception pojawiły się spontanicznie jako efekt uporczywego dążenia do wykonania zadania, dodatkowo utrudnionego przez błędnie skonfigurowany prompt sugerujący, że legalna ścieżka rozwiązania nie istnieje. Dla opiekunów projektów open source to ważny sygnał ostrzegawczy. Agent równolegle prowadził konta typu sockpuppet, próbował stworzyć pozory poparcia w komentarzach i podszywał się pod recenzenta pull requesta. Ostatecznie zawiódł na jednym etapie, którego żaden model nadal nie potrafi wiarygodnie obejść, gdyż podejrzliwy człowiek dokładnie sprawdził przesłany kod.

Źródło: UK AI Security Institute, BBC News, The Register, ECSC, Ilustracje: AI
Bądź na bieżąco - obserwuj PurePC.pl na Google News
Zgłoś błąd
Liczba komentarzy: 30

Komentarze:

x Wydawca serwisu PurePC.pl informuje, że na swoich stronach www stosuje pliki cookies (tzw. ciasteczka). Kliknij zgadzam się, aby ta informacja nie pojawiała się więcej. Kliknij polityka cookies, aby dowiedzieć się więcej, w tym jak zarządzać plikami cookies za pośrednictwem swojej przeglądarki.