Komunikaty firm rozwijających sztuczną inteligencję zwykle mówią, ile udało się zablokować. Ten mówi, ile blokowano niepotrzebnie. Anthropic opisał 7 sierpnia 2026, jak przepisał reguły filtra pilnującego pytań z biologii w modelu Fable 5, i podał, o ile spadła liczba odrzuconych zapytań. Powód firma nazywa wprost: pierwotne reguły były za szerokie i przerywały rozmowy, które nie miały nic wspólnego z zagrożeniem. Zabezpieczenia Claude zostały więc przestawione nie po to, żeby przepuszczać więcej ryzyka, ale żeby trafniej rozdzielać jedno od drugiego. Tak opisuje to sama firma i warto od razu zapamiętać, że wszystkie liczby w tym komunikacie pochodzą z jej własnych testów.
Co to jest klasyfikator i co się w nim zmieniło
Klasyfikator to osobny mechanizm, który ogląda zapytanie, zanim zajmie się nim model główny. Działa jak bramka na wejściu: przepuszcza albo kieruje sprawę gdzie indziej. Anthropic pilnuje w ten sposób obszaru biologii, bo tam przebiega jedna z najtrudniejszych granic w całej branży. Pytanie o mechanizm działania wirusa może pochodzić od licealisty przed maturą i od kogoś o zupełnie innych zamiarach, a treść samego zapytania bywa niemal identyczna.
Zmiana polega na przepisaniu reguł, którymi ta bramka się kieruje. Firma nazywa je konstytucją klasyfikatora i opisuje dwie rzeczy: szczegółowe wypisanie zastosowań nieszkodliwych oraz uwzględnienie uwag ekspertów. Na tak poprawionych regułach klasyfikator został wytrenowany od nowa.
To ważne rozróżnienie, bo łatwo je zgubić w skrócie. Nie obniżono progu ryzyka ani nie wyłączono żadnego zabezpieczenia. Zmieniono opis tego, co bramka ma uznawać za nieszkodliwe. Dla użytkownika, któremu rozmowa przestała się urywać, efekt bywa nie do odróżnienia, ale w środku dzieje się co innego.
Skąd się wzięło 85 procent i czego ta liczba nie mówi
Firma podaje, że aktualizacja zmniejszyła liczbę odrzuceń związanych z biologią o około 85 procent na wszystkich powierzchniach produktowych. W oryginale jest przy tym zastrzeżenie “w naszych testach” i to zastrzeżenie trzeba nieść razem z liczbą. Nie ma opisu metodyki, nie ma wielkości próbki, nie ma informacji, jakie zapytania w tych testach zadawano.
Drugi zestaw liczb bywa mylony z pierwszym, a mówi o czymś innym. Claude.ai 67 procent, Cowork 55 procent, Claude Code 17 procent, Claude Platform 7 procent. To nie są wyniki dla biologii w rozbiciu na platformy. To spodziewany spadek wszystkich odrzuceń, z biologii i z dowolnego innego powodu, opisany słowem “spodziewamy się”, a nie “zmierzyliśmy”. Prognoza, nie pomiar.
Skąd bierze się rozstrzał od 67 do 7 procent, firma nie wyjaśnia. Nasuwa się odpowiedź przez rodzaj rozmów: na Claude.ai ludzie pytają o wszystko, a w Claude Code rozmowa dotyczy kodu, więc filtr biologiczny miałby tam mniej okazji do zadziałania. To jednak nasz domysł, a nie ustalenie ze źródła. Bez metodyki nie da się nawet powiedzieć, jaka część każdej z tych prognoz wynika akurat z poprawki w klasyfikatorze biologicznym.
Co dalej trafia do Opus 5
Zakres, który pozostaje zamknięty, firma opisuje jako zapytania podwójnego zastosowania, czyli takie, które da się wykorzystać zarówno w pracy zawodowej, jak i do zrobienia krzywdy. Wymienia trzy obszary: wirusologię, toksykologię i projektowanie molekularne. Zawodowe pytania o tworzenie leków też zostają po tej stronie granicy.
Ciekawszy jest sam mechanizm odmowy, bo to nie jest odmowa w potocznym sensie. Kiedy bramka zadziała, zapytanie zostaje przekierowane do Opus 5. Firma opisuje ten model jako sprawny, ale nieposiadający tych samych możliwości w biologii co Fable 5. Użytkownik nie widzi więc komunikatu o odrzuceniu, tylko dostaje odpowiedź od słabszego w tej dziedzinie modelu. Z perspektywy pytającego to bywa gorsze niż zwykła odmowa: łatwiej zorientować się, że rozmowa została ucięta, niż że odpowiada ktoś inny.
Anthropic dokłada do tego zastrzeżenie, którego zwykle w takich materiałach brakuje. Fałszywe alarmy “nieuchronnie pozostaną”, bo część zapytań zawsze wpadnie w margines bezpieczeństwa bramki. To zdanie jest uczciwe i zarazem wygodne, bo z góry tłumaczy każdą przyszłą skargę.
Pierwsza Misja AI · Kodożercy
Rozumiesz zagrożenia AI, gdy rozumiesz jak naprawdę działa.
Kurs Pierwsza Misja AI ma dedykowaną lekcję o ciemnej stronie AI: halucynacje, deepfakes, manipulacja. Zanim zaczniesz się bać – zacznij rozumieć.
Poznaj pełny program →

Fałszywy alarm też ma swoją cenę
Za szeroka bramka wygląda w tabelce niewinnie, bo pomyłka w tę stronę nikomu nie robi krzywdy. Koszt jest jednak realny i płacą go zwykli ludzie. Nauczyciel przygotowujący lekcję o odporności bakterii na antybiotyki, student przed egzaminem z mikrobiologii, ktoś, kto chce zrozumieć wynik badania krwi. Po dwóch czy trzech ucięciach taka osoba może zrezygnować z pytań o biologię, a to jest trwalsza szkoda niż jedna nieudana rozmowa.
Jest też druga strona tego rachunku, o której w komunikacie nie ma ani słowa. Wiemy, jak zmieniła się liczba pomyłek w jedną stronę, czyli zapytań niewinnych zatrzymanych bez potrzeby. Nie wiemy nic o pomyłkach w drugą stronę, czyli o zapytaniach ryzykownych, które bramka mogłaby przepuścić. Lepszy klasyfikator potrafi zmniejszyć jedno bez zwiększania drugiego i firma twierdzi, że właśnie to zrobiła. Taką deklarację potwierdza jednak audyt, a nie akapit na blogu producenta.
Ostatnia zapowiedź dotyczy badaczy, którym pełne możliwości modelu są w pracy potrzebne. Anthropic pisze o budowie bezpiecznych ścieżek dostępu dla zweryfikowanych odbiorców, bez podania terminu. Pomysł nie jest nowy w tej branży: OpenAI poszło tą samą drogą przy modelu do cyberbezpieczeństwa, udostępniając go wąskiej, sprawdzonej grupie zamiast wszystkim.
Czego w tym komunikacie nie ma
Braków jest kilka i każdy trzeba sobie dopisać samemu. Nie ma metodyki pomiaru ani liczby zapytań, na której liczono spadek. Brakuje daty uruchomienia ścieżek dostępu dla badaczy. Nigdzie nie pada też ocena zewnętrzna: cały materiał to opis własnej zmiany, wykonany przez firmę, która ma interes w pokazaniu, że jej produkt przestał przeszkadzać.
Osobno warto odnotować kontekst tygodnia, w którym ten wpis się ukazał, i od razu go od tej sprawy oddzielić. Kilka laboratoriów tłumaczy się teraz z modeli wychodzących poza zakres środowiska testowego. To osobne wydarzenia, z innymi przyczynami i innymi firmami. Zbieżność dat nie czyni z nich jednej historii, a układanie ich w ciąg przyczynowy byłoby nadużyciem.
Podsumowanie
Bramka pilnująca pytań z biologii ma po aktualizacji przepuszczać więcej nieszkodliwych pytań niż przed nią i to jest cała zmiana. Anthropic przepisał reguły klasyfikatora, wypisując w nich szczegółowo zastosowania nieszkodliwe, i przetrenował go od nowa. Odrzuceń w biologii ma być o około 85 procent mniej, przy czym liczba pochodzi z testów samej firmy. Osobno podane wartości dla poszczególnych platform dotyczą wszystkich odrzuceń i są prognozą, więc nie mówią o biologii nic ponad to. Wirusologia, toksykologia i projektowanie molekularne dalej trafiają do Opus 5, a fałszywe alarmy według producenta pozostaną. Nie ma w tym materiale metodyki pomiaru, terminu dla obiecanych ścieżek dostępu dla badaczy ani żadnej oceny z zewnątrz. Kto pyta model o biologię zawodowo, powinien sprawdzić, czy odpowiada mu ten model, o który prosił.
Newsletter · DevstockAcademy & Kodożercy
Bądź na bieżąco ze światem IT, AI i automatyzacji
Co wtorek: newsy z branży, praktyczne tipy i narzędzia które warto znać. Zero spamu.




