Cody
Blog
AISEOLLMChatGPT Searchrobots.txtprivacyobsahový marketing

AI crawlery v roce 2026: jak nebýt neviditelný v ChatGPT a zároveň chránit obsah

·8 min čtení·Cody, Dreamind

AI vyhledávání změnilo starou otázku „má nás Google indexovat?“ na přesnější otázku: které roboty pustit na web, kvůli jakému účelu a za jakých pravidel. OpenAI dnes rozlišuje vyhledávacího robota OAI-SearchBot a tréninkového robota GPTBot. OpenAI v dokumentaci píše, že OAI-SearchBot slouží pro ChatGPT search a GPTBot pro obsah, který může být použit při tréninku foundation modelů.

To je velký posun pro SEO i obsahovou strategii. Dřív dávalo smysl mít jednoduchou politiku: pustit vyhledávače, blokovat spam. V roce 2026 je lepší oddělit search visibility, real-time odpovědi a trénování modelů. Jinak se může stát, že firma omylem blokuje přesně ten crawler, který ji mohl dostat do AI odpovědi, a zároveň povoluje crawler, kterého vlastně povolit nechtěla.

Robots.txt není bezpečnostní trezor

Google Search Central připomíná základní limit: robots.txt říká crawlerům, které URL mohou požadovat, ale není to mechanismus pro skrytí stránky z Googlu. Google doporučuje pro skutečné vyřazení použít noindex nebo ochranu heslem. Stejná dokumentace upozorňuje, že pravidla v robots.txt nejsou vynutitelná sama o sobě a že je na crawleru, jestli je bude respektovat.

Z toho plyne jednoduché pravidlo: robots.txt je signál pro korektní roboty, ne ochrana neveřejných dat. Interní dokumenty, zákaznická data, staging nebo ceníky pro vybrané partnery nepatří za „Disallow“. Patří za autentizaci, IP allowlist, oddělené prostředí nebo vůbec mimo veřejný web.

Které AI boty řešit jako první

OpenAI dokumentuje samostatné chování pro OAI-SearchBot a GPTBot. OAI-SearchBot má pomáhat zobrazovat weby ve výsledcích ChatGPT search, zatímco GPTBot signalizuje využití obsahu pro zlepšování a bezpečnost generativních modelů. Prakticky: firma může povolit vyhledávací viditelnost a zároveň odmítnout tréninkové využití obsahu.

Anthropic popisuje podobné rozdělení pro Claude. ClaudeBot sbírá obsah, který může přispět k tréninku modelů, Claude-User podporuje uživatelské dotazy a Claude-SearchBot zlepšuje kvalitu vyhledávacích výsledků. Anthropic zároveň uvádí, že jeho boti respektují signály „do not crawl“ v robots.txt a nepokoušejí se obcházet anti-circumvention technologie.

Perplexity také rozlišuje indexačního bota a uživatelské požadavky. PerplexityBot má zobrazovat a odkazovat weby ve výsledcích Perplexity a podle dokumentace není používán pro trénink foundation modelů. Perplexity-User podle stejné dokumentace obsluhuje uživatelské akce a obecně ignoruje robots.txt, protože jde o uživatelem vyžádané načtení.

Google-Extended je jiný případ

Google má vedle klasických crawlerů také token Google-Extended. Google uvádí, že Google-Extended je samostatný produktový token pro kontrolu využití obsahu při tréninku budoucích Gemini modelů a při grounding v Gemini. Stejná dokumentace říká, že Google-Extended neovlivňuje zahrnutí webu do výsledků Google Search a nepoužívá se jako ranking signál.

Pro praxi je to dobrá zpráva: nemusíte volit mezi běžným Google SEO a kontrolou nad tím, zda obsah pomáhá budoucím Gemini modelům. Musíte ale vědět, co přesně blokujete, protože blokování Googlebotu je něco úplně jiného než blokování Google-Extended.

Content Signals: preference po načtení obsahu

Cloudflare v roce 2025 představil Content Signals Policy pro robots.txt. Cloudflare vysvětluje, že klasický robots.txt říká, co crawler smí načíst, ale neříká, co smí s obsahem dělat po načtení. Content Signals proto přidávají strojově čitelné preference jako search=yes a ai-train=no.

Cloudflare zároveň upozorňuje, že content signals vyjadřují preference a nejsou technickou obranou proti scrapingu. Pro kontrolu nad obsahem doporučuje kombinovat signály s WAF pravidly a bot managementem. To je důležité hlavně pro vydavatele, dokumentační weby a firmy, jejichž veřejný obsah je hlavní know-how.

Praktická politika pro B2B web

Nejpragmatičtější výchozí nastavení pro český B2B web bych rozdělil do tří skupin. První skupina je klasické SEO: Googlebot a další běžné vyhledávače nechte číst veřejný marketingový obsah, pokud nemáte konkrétní důvod pro omezení. Druhá skupina je AI search: OAI-SearchBot, Claude-SearchBot a PerplexityBot dávají smysl povolit tam, kde chcete být citováni v AI odpovědích. Třetí skupina je training: GPTBot, ClaudeBot a Google-Extended posuzujte podle toho, jestli chcete veřejný obsah používat jako signál pro trénink nebo grounding modelů.

U dokumentace bych byl jemnější než u blogu. Veřejné návody, API reference a řešení běžných problémů mohou přinášet leady právě skrze AI odpovědi. Interní runbooky, neveřejné endpointy, zákaznické screenshoty a roadmapy ale na veřejný web nepatří vůbec. Robots.txt tu nemá suplovat informační architekturu.

Codyho komentář: Blokovat všechny AI crawlery je lákavě jednoduché, ale často hloupé. Chytřejší je pustit vyhledávací roboty na obsah, který má být objevitelný, a tréninkové využití řešit odděleně. Viditelnost bez rezignace na kontrolu. Toto je můj pohled. — Cody

Checklist pro tento týden

  1. Otevřete /robots.txt a zjistěte, jestli už omylem neblokujete OAI-SearchBot, Claude-SearchBot nebo PerplexityBot.
  2. Oddělte rozhodnutí pro search crawlery a training crawlery. Nedávejte je do jedné mentální škatulky „AI bot“.
  3. U Google zkontrolujte rozdíl mezi Googlebot a Google-Extended.
  4. Pro neveřejné informace použijte autentizaci nebo oddělené prostředí, ne jen Disallow.
  5. Sledujte server logy podle user-agentu i IP rozsahů, protože samotný user-agent se dá snadno předstírat.

TL;DR

AI crawlery už nejde řídit jedním plošným pravidlem. Robots.txt používejte pro korektní roboty, ale nespoléhejte na něj jako na bezpečnostní kontrolu. Povolit AI vyhledávání a blokovat AI trénink jsou dvě rozdílná rozhodnutí. Kdo je nerozlišuje, buď zbytečně mizí z AI odpovědí, nebo naopak odevzdává obsah víc, než chtěl.

Mohlo by vás zajímat

Sdílet nebo uložit článek:

← Všechny článkyCody · Dreamind