Skip to content
KURS: Agenci AI od podstaw
zbuduj zespół cyfrowych pomocników
Sprawdzam
KURS: Agenci AI
Sprawdzam
logo Devstock
  • O nas
  • Moduły Akademii
    • Moduł 1
    • Moduł 2
    • Moduł 3
    • Pozostałe moduły
  • Kursy AI i IT
    • Pierwsza Misja AI (Podstawy)
    • Automatyzacje z n8n 2.0
    • Frontend Master 2026
  • Blog
  • Kontakt
  • O nas
  • Moduły Akademii
    • Moduł 1
    • Moduł 2
    • Moduł 3
    • Pozostałe moduły
  • Kursy AI i IT
    • Pierwsza Misja AI (Podstawy)
    • Automatyzacje z n8n 2.0
    • Frontend Master 2026
  • Blog
  • Kontakt
Live o agentach AI, poniedziałek 21 września o 20:00, udział bezpłatny - zapisz się
Branża IT i Nowe Technologie

Cloudflare: blokada trenowania AI bez straty w Google

  • 16 wrz, 2026
  • Komentarze 0
blokada trenowania AI - pomarańczowy znak firmowy Cloudflare na jasnej elewacji budynku, w tle zieleń i błękitne niebo

Jeden wiersz w pliku robots.txt, Content-signal: search=yes, ai-train=no, use=reference, przekazuje robotom trzy preferencje naraz. Wolno budować z tej strony indeks wyszukiwarki, nie wolno brać jej do trenowania modeli, wolno ją cytować i linkować jako źródło. Od 15 września 2026 wstawia ten wiersz pojedynczy przełącznik w panelu Cloudflare’a, dostępny na każdym planie, także darmowym. Blokada trenowania AI przestaje więc wymagać rezygnacji z ruchu z wyszukiwarki, bo u Apple’a i Google’a jedno chodziło dotąd w pakiecie z drugim. Microsoft ma obsłużyć taki zapis dopiero na początku 2027 roku.

Co dokładnie robi ustawienie Disallow AI Training

Ustawienie nazywa się Disallow AI Training i siedzi w ustawieniach bezpieczeństwa domeny. Cloudflare udostępnił je w komunikacie z 15 września wszystkim klientom, bez podziału na plany. Po włączeniu firma publikuje w pliku robots.txt preferencję “bez trenowania” dla tej domeny.

Rozdziela to dwie czynności, które u Apple’a, Google’a i Microsoftu wykonywał dotąd jeden robot. Pierwsza to przejście po stronie na potrzeby indeksu wyszukiwarki. Druga to zebranie tekstu do zbioru treningowego modelu. Cloudflare nazywa takie roboty mieszanymi i opisuje problem wprost: bez osobnych sterowań właściciel strony nie może odmówić jednego, nie odmawiając drugiego.

Po stronie operatorów mechanizm jest banalnie prosty i istnieje od dawna. Google czyta regułę zapisaną dla nazwy Google-Extended, Apple dla Applebot-Extended. Googlebot, Applebot i Bingbot chodzą po stronie dalej, bo one obsługują wyszukiwarkę. Nowe jest to, że nie trzeba już tego składać ręcznie ani śledzić, komu doszła kolejna nazwa robota.

Preferencja w pliku i blokada na brzegu sieci to dwie różne rzeczy

Wpis w robots.txt jest prośbą, nie murem. Robot, który tego pliku nie czyta, nie zacznie go czytać dlatego, że doszedł nowy wiersz. Warto to sobie powiedzieć na początku, zanim ktoś uzna, że jednym przełącznikiem zamknął temat. Pisaliśmy już zresztą o robotach podszywających się pod cudze nazwy i klucze, a wobec takich deklaracja w pliku tekstowym nie znaczy nic.

Cloudflare deklaruje, że dokłada do tego warstwę techniczną. Firma publikuje preferencję, rozpoznaje roboty wchodzące na stronę i klasyfikuje, po co przyszły. Te, które preferencję zignorują, blokuje, a zachowanie każdego operatora obiecuje pokazywać na Radarze. Działa to tylko dla ruchu, który faktycznie przechodzi przez jej sieć.

Firma nie podała ani jednej liczby o skuteczności. Nie wiadomo, ile domen ustawienie włączyło, ilu robotom zostało zablokowane wejście ani jak często dochodzi do prób obejścia. Przy ocenie takiej nowości to jest istotna dziura, bo cała reszta opiera się na deklaracjach.

Którzy operatorzy zadeklarowali, że to uszanują

Cloudflare wprowadził dla operatorów oznaczenie “Accountable” i podał cztery warunki jego uzyskania. Firma musi dać sposób na rezygnację z trenowania przez robots.txt albo podobny standard. Musi mieć osobny mechanizm rezygnacji z podsumowań AI. Musi pokazać na poziomie adresu, które podstrony poszły do trenowania. I musi zapewnić, że rezygnacja z trenowania nie odbije się na zwykłych wynikach wyszukiwania. Do tej grupy Cloudflare zalicza Apple’a, Google’a i Microsoft. Oznaczenie obejmuje przy tym również funkcje dopiero zapowiedziane, a nie wyłącznie gotowe i działające.

Jedno zastrzeżenie jest tu ważniejsze od reszty. Bing jeszcze tego nie obsługuje. Microsoft dopiero buduje mechanizm czytania takiej preferencji na poziomie domeny i celuje w początek 2027 roku. Do tego czasu ustawienie w Cloudflare nie przekazuje niczego do Binga. Rezygnację z trenowania wyraża się tam metatagiem NOARCHIVE, a Cloudflare wskazuje dodatkowo narzędzie Block URLs. Microsoft deklaruje przy tym, że NOARCHIVE nie wpływa na pozycje w wynikach, wyłącza jednak stronę także z odpowiedzi Bing Chatu.

W tej samej klasyfikacji siedzą też roboty zbierające wyłącznie do trenowania, między innymi Amazona, Anthropica, Mety i OpenAI. Przy nich nie ma czego rozdzielać, bo one nie budują indeksu wyszukiwarki. W tle dojrzewa standard ai-prefs w IETF, który ma ujednolicić przekazywanie takich preferencji przez nagłówek HTTP albo osobną regułę w robots.txt. Na razie pozostaje projektem, a Cloudflare zapowiada powrót do tematu, gdy standard okrzepnie.

blokada trenowania AI - tabela operatorów: kto honoruje preferencję, jaka reguła obowiązuje w robots.txt i od kiedy
Trzej operatorzy z górnej części tabeli zbierają treść i do wyszukiwarki, i do trenowania. Czterej z części środkowej zbierają wyłącznie do trenowania, więc przy nich nie ma czego rozdzielać.

Co wpisać w plik robots.txt bez Cloudflare’a

Strona bez Cloudflare’a nie jest tu na straconej pozycji. Cała mechanika sprowadza się do pliku tekstowego serwowanego pod adresem /robots.txt. Reguły z niego czytają te roboty, które ten protokół respektują. Jeżeli u siebie takiego pliku nie masz, wystarczy go założyć.

Minimalna wersja, która rozdziela wyszukiwanie od trenowania u Google’a i Apple’a, wygląda tak:

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

Te dwie reguły nie dotykają Googlebota ani Applebota, więc indeksowanie idzie dalej swoim trybem. Jeżeli chcesz odciąć również roboty czysto treningowe, dopisujesz kolejne bloki dla nazw GPTBot, ClaudeBot, meta-externalagent, Amazonbot, Bytespider i CCBot.

Pełnym odpowiednikiem przełącznika to jednak nie jest. Cloudflare w dokumentacji swojego zarządzanego pliku publikuje dodatkowo wiersz Content-signal i regułę Allow: / dla wszystkich robotów. Swoje dyrektywy dokleja na początku istniejącego pliku, a gdy pliku nie ma, tworzy go i serwuje sam. Do tego dochodzi blokowanie na brzegu sieci, którego żadnym wpisem w pliku się nie odtworzy.

Na WordPressie plik bywa wirtualny i generuje go wtyczka SEO, więc wpisu szukaj najpierw w niej, a nie przez FTP. Po zapisaniu zmiany otwórz twojadomena.pl/robots.txt w przeglądarce i sprawdź, czy widzisz to, co wpisałeś. Warto przy okazji pamiętać, że samo istnienie pliku niczego nie gwarantuje. Sprawdziliśmy to kiedyś na dziennikach serwerowych przy pliku llms.txt, po który roboty prawie nie sięgają.

Czego to ustawienie nie wyłączy w Google

Tu zaczyna się część, którą łatwo przeczytać na opak. Zablokowanie Google-Extended nie usuwa strony z AI Overviews. Google pisze o tym wprost w dokumentacji funkcji AI w wyszukiwarce. Sztuczna inteligencja jest wbudowana w Search i stanowi część jego działania. Sterowaniem dla właściciela strony pozostają więc reguły robots.txt dla Googlebota. Google-Extended ogranicza trenowanie oraz wykorzystywanie treści jako bieżącego kontekstu dla modelu w części innych systemów firmy.

Praktyczny wniosek jest taki, że blokada trenowania i obecność w generowanych odpowiedziach Google to dwa osobne mechanizmy. Do ograniczenia tego, ile twojej treści wyświetla się w funkcjach AI w Search, służą inne narzędzia: nosnippet, data-nosnippet, max-snippet i noindex. Trzy pierwsze ograniczają fragmenty pokazywane w wynikach, również te zwykłe. Ostatnie idzie dalej i usuwa stronę z wyników w całości.

Co się przy tym realnie traci, wiadomo mniej, niż sugerują nagłówki. Sygnał ma ograniczyć wykorzystanie treści do trenowania przez tych operatorów, którzy go honorują. Dostępne źródła nie pozwalają ocenić, co dzieje się z danymi pobranymi wcześniej ani z kopiami krążącymi poza tym obiegiem. Znaczenie tej decyzji zależy od modelu biznesowego i od tego, ile warta jest dla firmy kontrola nad własnymi danymi treningowymi. Dostępne źródła nie pozwalają tego bilansu wyliczyć za nikogo.

Frontend Master 2026 · Kodożercy

Zrozum, co się dzieje pod spodem twojej strony

Frontend Master 2026 to sześć kursów Kodożerców z HTML, CSS, JS i Git. Z fundamentami przestajesz kopiować bez zrozumienia, zaczynasz świadomie poprawiać, łączyć i rozszerzać każdy projekt.

Zobacz program →
Frontend Master 2026 - Kodożercy

Najczęstsze pytania

Czym jest plik robots.txt i gdzie go szukać?

To tekstowa odpowiedź serwowana pod adresem twojadomena.pl/robots.txt. Może pochodzić z fizycznego pliku albo być generowana dynamicznie. Roboty respektujące ten protokół sprawdzają zapisane tam reguły przed pobraniem objętych nimi adresów. Otworzysz go w przeglądarce jak każdą podstronę. Na WordPressie bywa generowany przez wtyczkę SEO i wtedy edytuje się go w jej ustawieniach, nie na serwerze.

Czy blokada trenowania obniży pozycje strony w Google?

Według deklaracji Apple’a, Google’a i Microsoftu przytoczonych przez Cloudflare’a rezygnacja z trenowania nie wpływa na zwykłe wyniki wyszukiwania, a zapewnienie tego jest jednym z czterech warunków oznaczenia “Accountable”. Reguły dla Google-Extended i Applebot-Extended nie dotyczą robotów obsługujących indeks. Danych pomiarowych potwierdzających to niezależnie na razie nie ma, więc po włączeniu warto obserwować Search Console.

Podsumowanie

Kolejność czynności jest krótka. Otwórz twojadomena.pl/robots.txt i sprawdź, co masz tam dzisiaj, bo zaskakująco często nie ma tam nic. Jeżeli korzystasz z Cloudflare’a, wejdź w ustawienia bezpieczeństwa domeny, odfiltruj pozycje dotyczące ruchu botów i włącz przełącznik blokady trenowania w robots.txt. Bez Cloudflare’a wpisz ręcznie dwa bloki dla Google-Extended i Applebot-Extended, a potem dołóż roboty czysto treningowe, jeśli ich też nie chcesz. Dla Binga dołóż metatag NOARCHIVE, bo Microsoft obsługę zapisu w robots.txt zapowiada dopiero na początek 2027 roku. Na koniec odnotuj datę zmiany i przez kilka tygodni popatrz na wyświetlenia w Search Console. Wychwycisz tam ewentualny ruch w widoczności, ale nie to, czy ktoś uszanował zakaz trenowania. Tego z zewnątrz nie sprawdzisz w ogóle.

Newsletter · DevstockAcademy & Kodożercy

Bądź na bieżąco ze światem IT, AI i automatyzacji

Co wtorek: newsy z branży, praktyczne tipy i narzędzia które warto znać. Zero spamu.


Udostępnij na:
Mateusz Wojdalski

Specjalista SEO i content marketingu w Devstock. Zajmuję się strategią treści, automatyzacją procesów marketingowych i wdrożeniami AI w codziennej pracy. Badam nowe narzędzia, adaptuję je do realnych zadań i piszę o tym, co faktycznie działa.

Jak sprawdzić, czy zdjęcie jest wygenerowane przez AI
26 procent czy 86? Spór o łatanie kodu przez AI
Pudelko kursu Agenci AI od Kodozercow z robotem i schematem przeplywu agentow
Banner reklamowy Frontend Master 2026

Najnowsze wpisy

Thumb
Gemini 3.8 Live: ile kosztuje godzina rozmowy
16 wrz, 2026
Thumb
26 procent czy 86? Spór o łatanie
16 wrz, 2026
Thumb
Cloudflare: blokada trenowania AI bez straty w
16 wrz, 2026
Thumb
Jak sprawdzić, czy zdjęcie jest wygenerowane przez
16 wrz, 2026
Thumb
Weryfikacja wieku Google – jak działa i
16 wrz, 2026

Kategorie

  • Aktualności i Wydarzenia (101)
  • Bezpieczeństwo i Jakość (198)
  • Branża IT i Nowe Technologie (263)
  • Design i User Experience (4)
  • Narzędzia i Automatyzacja (151)
  • Programowanie i Technologie Webowe (81)
  • Rozwój kariery i Edukacja (40)

Tagi

5G AI Architektura Cyberbezpieczeństwo Feedback Frontend Git IoT JavaScript Motywacja Nauka efektywna Optymalizacja i wydajność Programowanie React.JS Rozwój osobisty WebDevelopment
Logo FitBody Center Warszawa

Odkryj zabiegi Endermologii LPG Infinity w FitBody Center Warszawa

Maszyna zabiegowa - endermologia lpg infinity
banner-reklamowy-frontend-master
Pudelko kursu Agenci AI od Kodozercow z robotem i schematem przeplywu agentow
Group-5638-1

Devstock – Akademia programowania z gwarancją pracy

🏠 ul. Bronowska 5a,
03-995 Warszawa
📞 +48 517 313 589
✉️ contact@devstockacademy.pl

Linki

  • Poznaj firmę Devstock
  • Wejdź do społeczności Devstock
  • Polityka prywatności
  • Regulamin

FitBody Center

Strona

  • Strona główna
  • Kontakt

Newsletter

Bądź na bieżąco, otrzymuj darmową wiedzę i poznaj nas lepiej!


Icon-facebook Icon-linkedin2 Icon-instagram Icon-youtube Tiktok
Copyright 2026 Devstock. Wszelkie prawa zastrzeżone
Devstock AcademyDevstock Academy
Sign inSign up

Sign in

Don’t have an account? Sign up
Lost your password?

Sign up

Already have an account? Sign in