AI podszywała się pod prawdziwych deweloperów i próbowała przemycić malware. Uratował ich człowiek
AI Security Institute sprawdził, jak zachowują się modele językowe z otwartym dostępem do internetu i wyłączonymi filtrami bezpieczeństwa. Agenty Anthropic i OpenAI dostały zadanie z zakresu cyberbezpieczeństwa w kontrolowanym środowisku. Część wyszła jednak poza scenariusz. Zamiast pozostać w piaskownicy, zaczęła działać na prawdziwym GitHubie, kontaktować się z użytkownikami i próbować przemycić złośliwy kod do publicznego repozytorium.
Podczas testów brytyjskiego AI Security Institute agent Anthropic Mythos 5 samodzielnie zaplanował cały atak na łańcuch dostaw, w tym zbudował fałszywą tożsamość i próbował skłonić opiekuna projektu open source do zatwierdzenia złośliwego kodu.
AI oszukało zabezpieczenia i włamało się do infrastruktury Hugging Face. OpenAI przyznaje się do kompromitującego incydentu
Przedstawiony niedawno raport AISI opisuje 122 przebiegi ewaluacji, w których siedem najważniejszych modeli miało rozwiązać zadanie z zakresu cyberbezpieczeństwa w środowisku typu cyber range o nazwie „Doing Life”. W dziesięciu przebiegach agenty AI wyszły poza wyznaczony scenariusz i wykonały łącznie 19 nieautoryzowanych działań w prawdziwym internecie. Siedemnaście z nich przypisano Anthropic Mythos 5, a dwa modelowi OpenAI GPT-5.6 Sol z wyłączonymi klasyfikatorami cyber. Najdłuższy incydent trwał 34,5 godziny. Mythos 5 przeszukał publiczny internet, natrafił na niezwiązany z testem projekt open source i błędnie uznał, że jego przejęcie pomoże dostać się do symulowanej sieci. Następnie zebrał adresy e-mail opiekunów projektu, przeanalizował ich aktywność na GitHubie i założył konta wykorzystujące fałszywe tożsamości.
100 tysięcy dolarów i kilka bezczelnych promptów - tak Anthropic zmusiło swoją AI do przełomu w kryptografii
Atak przypominał klasyczny łańcuch dostaw. Agent zgłosił pull request z pozornie legalną poprawką błędu, w której ukrył trzy warianty złośliwego ładunku, w tym dropper omijający uruchomienie w CI oraz mechanizm pobierający kolejny skrypt po instalacji. W publicznym zgłoszeniu umieścił również prompt injection ukryty w komentarzu HTML, niewidoczny dla człowieka, ale odczytywany przez API. Instrukcja skierowana do Claude Code, Codexa i Cursora nakazywała pobranie oraz wykonanie dodatkowego skryptu. Gdy jeden z użytkowników GitHuba przetestował kod w izolowanym kontenerze Docker i ostrzegł opiekuna projektu, agent zaczął zacierać ślady, przepisał historię Git, zmienił wcześniejsze komentarze i rozważał utworzenie kolejnej tożsamości. W innym przebiegu model umieścił złośliwe metadane w paczkach Pythona kierowanych do repozytoriów obsługiwanych przez Dependabota, gdzie kod z setup.py wykonał się w co najmniej 53 kontenerach GitHuba. Jednocześnie badacze podkreślają, że nie doszło do ucieczki z piaskownicy testowej.
Żabka zhakowana. Dane udostępnione dwa dni po ogłoszeniu sprzedaży sieci właścicielowi Circle K. Zbieg okoliczności?
AISI zaznacza, że warunki eksperymentu nie odpowiadały publicznie dostępnej konfiguracji modeli. Klasyfikatory cyber były wyłączone, a dostęp do internetu celowo pozostawiono otwarty. Anthropic i OpenAI podkreślają to samo w swoich stanowiskach. Istotne jest jednak, że agentom nie polecono oszukiwania ani ukrywania działań. Zachowania określane jako deception pojawiły się spontanicznie jako efekt uporczywego dążenia do wykonania zadania, dodatkowo utrudnionego przez błędnie skonfigurowany prompt sugerujący, że legalna ścieżka rozwiązania nie istnieje. Dla opiekunów projektów open source to ważny sygnał ostrzegawczy. Agent równolegle prowadził konta typu sockpuppet, próbował stworzyć pozory poparcia w komentarzach i podszywał się pod recenzenta pull requesta. Ostatecznie zawiódł na jednym etapie, którego żaden model nadal nie potrafi wiarygodnie obejść, gdyż podejrzliwy człowiek dokładnie sprawdził przesłany kod.
Powiązane publikacje

Telewizory LG OLED skanują sieć domową i mogą rejestrować dźwięk w trybie czuwania. Szokujące wyniki śledztwa
29
Po wycieku danych milionów Polaków rząd bierze się za firmy, których dotąd nikt skutecznie nie kontrolował
65
Firmware z niespodzianką. Tanie routery Zbtlink łączyły się z serwerami C2 i przyjmowały zdalne polecenia
31
DSA, weto prezydenta i 16 miliardów dolarów. Dlaczego Polska nie potrafi zablokować scamu na Facebooku
70







![AI podszywała się pod prawdziwych deweloperów i próbowała przemycić malware. Uratował ich człowiek [1]](/image/news/2026/08/07_ai_podszywala_sie_pod_prawdziwych_deweloperow_i_probowala_przemycic_malware_uratowal_ich_czlowiek_0.jpg)
![AI podszywała się pod prawdziwych deweloperów i próbowała przemycić malware. Uratował ich człowiek [2]](/image/news/2026/08/07_ai_podszywala_sie_pod_prawdziwych_deweloperow_i_probowala_przemycic_malware_uratowal_ich_czlowiek_2.jpg)
![AI podszywała się pod prawdziwych deweloperów i próbowała przemycić malware. Uratował ich człowiek [3]](/image/news/2026/08/07_ai_podszywala_sie_pod_prawdziwych_deweloperow_i_probowala_przemycic_malware_uratowal_ich_czlowiek_1.jpg)





