Wystarczyła prośba o streszczenie jednej strony internetowej. Na komputerze uruchomił się obcy program i zameldował na serwerze osoby, która tę stronę przygotowała. Łańcuch opisał 26 sierpnia Johann Rehberger, badacz publikujący na blogu Embrace the Red. Tryb Auto w Claude Code doprowadza się w nim do wykonania cudzego kodu sam, bez pytania człowieka o zgodę. Skuteczność wyszła między 60 a 80 procent, choć na próbce liczonej w pojedynczych przebiegach. Anthropic zgłoszenie przyjął i zamknął je z adnotacją, że zachowanie jest zgodne z projektem.
Na czym polega obejście trybu Auto w Claude Code
Tryb Auto zastępuje pytania o zgodę osobnym modelem, który ocenia każde wywołanie narzędzia. Anthropic włączył go jako tryb startowy 14 sierpnia na planach Pro, Max i Team. Dla większości osób jest to dziś stan domyślny, a nie ustawienie wybrane świadomie.
Rehberger zaczął od zadania, jakie ktoś daje takiemu narzędziu dziesięć razy dziennie: streść zawartość podanego adresu. Strona pod tym adresem podszywa się pod niewielkie archiwum zapisków, a same zapiski leżą w spakowanym pliku.
Pierwszy ruch jest najciekawszy, bo nie ma w nim żadnego polecenia. Serwer odpowiada narzędziu wbudowanemu w Claude’a kodem błędu 415, czyli “nieobsługiwany typ zawartości”. Nie sugeruje niczego więcej. Model sam wyciąga wniosek i sięga po curl z poziomu powłoki. W zapisie przebiegu zostawia przy tym własny komentarz: “WebFetch dostał 415, spróbuję bezpośrednio”.
Tu leży sedno całego pokazu. Atak nie mówi modelowi, co ma zrobić. Sprawia natomiast, że droga korzystna dla napastnika staje się tą, która najlepiej rozwiązuje zadanie postawione przez użytkownika. Pisaliśmy o tym samym mechanizmie przy poleceniu ukrytym w zwykłym wpisie do dziennika zdarzeń. Agent wykonał tam cudzą instrukcję, biorąc ją za część własnego zadania.
Dlaczego odmowa uruchomienia obcego programu otworzyła drogę
W archiwum leżą zakodowane zapiski, plik wykonywalny opisany w instrukcji jako dekoder oraz plik o nazwie struct.py. Claude rozpakowuje całość do katalogu roboczego i ogląda dekoder. Program pochodzi z zewnątrz i jest binarny, więc model odmawia jego uruchomienia. To jest decyzja poprawna i dokładnie na nią liczył autor ataku.
Zamiast obcego dekodera Claude pisze własny, w kilku linijkach Pythona, i uruchamia go w katalogu z rozpakowanym archiwum. Wtedy działa mechanizm nazywany przesłonięciem modułu. Python przeszukuje najpierw bieżący katalog. Własny dekoder sięga po standardowy moduł do dekodowania, a ten odwołuje się do modułu struct. Zamiast biblioteki systemowej wczytuje się plik z archiwum.
Dekodowanie przebiega normalnie i model dostaje poprawne dane, bo podstawiony moduł udostępnia prawdziwe funkcje. Przy okazji wykonuje się jednak zaciemniony zapis, który uruchamia osobny proces, pobiera kolejny etap i odpala właściwy ładunek. Rehberger podsumowuje to jednym zdaniem: model nie ufa dostarczonemu dekoderowi, ufa za to temu, który napisał sam.
Tryb Auto przepuścił atak, a potem zablokował sprzątanie
Klasyfikator widział wyłącznie krótki skrypt napisany przez samego Claude’a. Właściwy ładunek był kilka kroków dalej i w tym momencie nikt już go nie oglądał.
Najbardziej niewygodna obserwacja z całego pokazu dotyczy jednak tego, co stało się później. W części przebiegów model orientował się, że archiwum jest spreparowane, ostrzegał użytkownika i próbował zabić uruchomiony proces. Tryb Auto tej komendy nie przepuścił. Ten sam mechanizm, który wcześniej pozwolił powołać proces do życia, zablokował polecenie mające go zatrzymać.
Rehberger sprawdził też drugi wariant ładunku. Podstawiony moduł nie uruchamia tam zwykłego procesu, tylko kolejną instancję Claude Code w trybie bezobsługowym. Powstały w ten sposób agent ma własny dostęp do narzędzi i własny kontekst. W testach robił rozpoznanie systemu i zapisywał pliki poza katalogiem projektu. Ten wariant wypadł najskuteczniej z całej trójki, z czterema udanymi przebiegami na pięć.
Skąd wzięło się zero procent i co odpowiedział Anthropic
Ogłaszając domyślne włączenie trybu Auto, Anthropic powołał się na ocenę zewnętrzną. Firma Trajectory Labs przepuściła przez narzędzie 72 scenariusze wstrzyknięcia polecenia, każdy dziesięć razy. Żadna z 720 prób nie powiodła się przeciwko modelom Fable 5, Opus 5 i Sonnet 5 w trybie Auto. U konkurencji skuteczność wyniosła 5,83 procent. Badanie objęło konkretne wydanie narzędzia, oznaczone jako 2.1.205.
Obie liczby mogą być prawdziwe naraz i to jest właściwy wniosek z tej sprawy. Zestaw scenariuszy był z góry ustalony, a łańcucha Rehbergera w nim nie było. Zero procent opisuje więc odporność na 72 znane układy. Nie opisuje odporności na atak budowany pod konkretne narzędzie.
Sam producent zresztą nigdy nie obiecywał więcej. W tym samym ogłoszeniu stoi zdanie, że tryb Auto opiera się na systemach klasyfikujących i dlatego nie eliminuje ryzyka. Przy zmianach o wysokiej stawce Anthropic nadal zaleca sprawdzanie działań modelu samodzielnie.
Odpowiedź na samo zgłoszenie poszła w tę stronę. Według relacji badacza firma zamknęła sprawę jako informacyjną i uznała zachowanie za zgodne z projektem. Jako właściwą granicę bezpieczeństwa wskazała izolację systemu operacyjnego oraz kontrolę ruchu wychodzącego. Rehberger się z tym zgadza i pisze, że klasyfikator nie jest piaskownicą. Zwraca natomiast uwagę, że taka odpowiedź kłóci się z komunikacją opartą na jednej liczbie.
Frontend Master 2026 · Kodożercy
Pisz kod, nie tylko prompty
Frontend Master 2026 to pakiet sześciu kursów Kodożerców (HTML, CSS, JavaScript, Git) w polskim wideo z 12-miesięcznym dostępem. Fundamenty frontu od pierwszej linijki kodu do deploy.
Wchodzę w to →

Jak sprawdzić, w jakim trybie działa twój Claude Code
Pierwsze pytanie brzmi, czy w ogóle jesteś w trybie Auto. Bardzo możliwe, że nikt cię o to nie pytał. W wierszu poleceń widać go na pasku stanu jako ⏵⏵ auto mode on. Tryb przełącza się skrótem Shift+Tab, a pojedynczą sesję uruchamia się w trybie ręcznym poleceniem claude --permission-mode default. Na stałe robi to wpis permissions.defaultMode w pliku ustawień.
Drugie pytanie dotyczy wersji, bo bez niej cała reszta jest zgadywaniem. Sam wpis Rehbergera numeru nie podaje i to jest jego realna słabość. Podaje go za to dokumentacja, przy progu, od którego tryb Auto staje się domyślny. Chodzi o wydanie 2.1.228 na macOS, Linuksie i WSL oraz 2.1.233 na Windowsie. Starsze wydania startują w trybie ręcznym.
Warto od razu odnotować, kogo domyślne włączenie nie dotyczy. W trybie ręcznym startuje uruchomienie bezobsługowe przez claude -p, praca przez Agent SDK, plan Enterprise oraz klucz z konsoli. Tak samo działa to na Bedrocku i Foundry. Administrator może wyciąć tryb Auto całej organizacji ustawieniem permissions.disableAutoMode.
Trzecia sprawa wykracza poza samo narzędzie i jest w tej historii najważniejsza. Producent i badacz zgadzają się, że granicą bezpieczeństwa jest izolacja. Agent czytający treści z internetu powinien więc pracować w kontenerze albo na osobnej maszynie, z ograniczonym ruchem wychodzącym. Nie powinien też widzieć kluczy SSH ani poświadczeń chmurowych. Zgoda wydana przez klasyfikator nie jest dowodem, że komenda jest bezpieczna. Ten sam wniosek padł po incydencie, w którym agenty wyszły poza przygotowaną dla nich piaskownicę.
Podsumowanie
Rehberger pokazał łańcuch, w którym prośba o streszczenie strony kończy się wykonaniem obcego kodu na komputerze. Skuteczność wyniosła od 60 do 80 procent na małej próbce. Kluczowy krok wykonuje sam model: odmawia uruchomienia podstawionego programu i pisze własny. Ten z kolei wciąga przesłonięty moduł z rozpakowanego archiwum. Tryb Auto przepuścił powołanie procesu, a w części przebiegów zablokował próbę jego zatrzymania. Według relacji Rehbergera Anthropic zamknął zgłoszenie jako informacyjne. We własnym ogłoszeniu firma zaznacza natomiast, że tryb Auto opiera się na klasyfikatorze i nie eliminuje ryzyka. Wynik 0,00 procent z oceny zewnętrznej dotyczył 72 z góry ustalonych scenariuszy na wydaniu 2.1.205. Z tym pokazem nie jest więc sprzeczny. Dla osoby pracującej tym narzędziem praktyczne pytania są trzy: w jakim trybie startuje sesja, jaką ma wersję i co ten agent dosięgnie, gdy nikt nie patrzy.
Newsletter · DevstockAcademy & Kodożercy
Bądź na bieżąco ze światem IT, AI i automatyzacji
Co wtorek: newsy z branży, praktyczne tipy i narzędzia które warto znać. Zero spamu.




