Crawling a indexace pro AI: robots.txt, GPTBot a AI crawleři 2026

ladyvirtual-crawling-indexace-ai

Než vás AI může citovat, musí váš web přečíst. Jenže ne každý AI crawler rozhoduje o citaci. Klíčové je rozlišit trénovací boty (GPTBot, ClaudeBot) od vyhledávacích botů (OAI-SearchBot, Claude-SearchBot, PerplexityBot). Protože o tom, jestli vás dnes ChatGPT nebo Perplexity zmíní, rozhodují ty druhé. Tady je průvodce, jak robots.txt číst, správně nastavit pro AI a co zkontrolovat dřív, než si řeknete „proč mě AI necituje“.

Robots.txt je textový soubor v kořenovém adresáři webu. Říká crawlerům, které části webu smí procházet a které ne. Najdete ho vždy na adrese vaseadresa.cz/robots.txt.

Soubor se skládá z bloků. Každý blok začíná direktivou User-agent, která určuje, pro kterého crawlera pravidla platí. Hvězdička znamená všechny. Pak následují direktivy Disallow (zakázat) nebo Allow (povolit) s cestami.

# Komentář — řádky začínající # jsou ignorovány

# Pravidla pro všechny crawlery
User-agent: *
Disallow: /admin/
Disallow: /kosik/

# Pravidla jen pro Googlebot
User-agent: Googlebot
Allow: /

# Odkaz na sitemap
Sitemap: https://www.vaseadresa.cz/sitemap.xml

Co robots.txt není

Robots.txt není bezpečnostní nástroj. Je to doporučení, ne technická bariéra. Slušní crawleři ho respektují, ale nikdo je nenutí. Citlivý obsah chraňte heslem nebo přihlášením, ne robots.txt.

Robots.txt také nebrání stránce v zobrazení ve výsledcích, pokud na ni někdo odkazuje. Blokuje crawlování, ne indexaci přes externí odkazy. Na skrytí stránky z výsledků slouží meta tag noindex.

Tohle je nejdůležitější z celého článku. Googlebot crawluje za jedním účelem: indexovat obsah pro výsledky. AI firmy ale provozují víc botů s různými úkoly a každý má jiný dopad na vaši viditelnost.

Trénovací boty

Sbírají obsah, který se použije k naučení modelu.

Váš text se stane součástí trénovacích dat. Crawlují jednou nebo příležitostně.

Patří sem GPTBot (OpenAI), ClaudeBot (Anthropic), CCBotBytespider. Blokace těchto botů nemá okamžitý dopad na to, jestli vás AI dnes cituje. Jen se nedostanete do trénovacích dat příští verze modelu.

Vyhledávací a retrieval boty

Tyhle čtou web kvůli odpovědím v reálném čase, a právě ony rozhodují o citaci. Patří sem:

  • OAI-SearchBot + ChatGPT-User (OpenAI) - indexace a živé načtení pro ChatGPT Search
  • Claude-SearchBot + Claude-User (Anthropic) - vyhledávání a načítání pro Claude
  • PerplexityBot + Perplexity-User (Perplexity)
  • Googlebot (Google) - AI Overviews i AI Mode jedou přes běžný Googlebot

Klíčový závěr (a tady se hodně webů plete): Chcete-li být citováni v ChatGPT, Claude nebo Perplexity, musíte povolit jejich vyhledávací boty:

OAI-SearchBot, Claude-SearchBot, PerplexityBot a uživatelské agenty.

Blokace GPTBota nebo ClaudeBota vás z citací nevyřadí, jen vás vyřadí z tréninku.

Opačně to ale platí krutě: když omylem zablokujete search boty, zmizíte z AI odpovědí.

Doporučení vychází z dopadu na AI viditelnost, ne z etické debaty o trénovacích datech.

Vyhledávací / retrieval boty. Tyto povolte, pokud chcete být citováni

User-agentKdo za ním stojíÚkolDoporučení
OAI-SearchBotOpenAIIndexace pro ChatGPT Search✅ Povolit
ChatGPT-UserOpenAIŽivé načtení při dotazu✅ Povolit
Claude-SearchBotAnthropicIndexace pro vyhledávání Claude✅ Povolit
Claude-UserAnthropicŽivé načtení při dotazu✅ Povolit
PerplexityBotPerplexityIndexace pro Perplexity✅ Povolit
GooglebotGoogleVýsledky + AI Overviews + AI Mode✅ Povolit (nikdy neblokovat)

Trénovací boty. Vaše rozhodnutí, bez dopadu na dnešní citaci

User-agentKdo za ním stojíÚkolDoporučení
GPTBotOpenAITrénink modelů⚠ Volitelné
ClaudeBotAnthropicTrénink Claude⚠ Volitelné
Google-ExtendedGoogleTrénink Gemini / Vertex (token, ne crawler)✅ Spíš povolit
meta-externalagentMetaTrénink + Meta AI⚠ Volitelné
Applebot-ExtendedAppleTrénink Apple AI⚠ Volitelné
AmazonbotAmazonTrénink Alexa / Amazon AI⚠ Volitelné
BytespiderByteDance (TikTok)Trénink modelů TikTok❌ Lze blokovat
CCBotCommon CrawlTrénink open-source modelů❌ Lze blokovat

Poznámka k Anthropic botům

Anthropic má tři weboví boty (plus claude-code):

  • ClaudeBot (trénink),
  • Claude-SearchBot (indexace pro vyhledávání)
  • Claude-User (načtení, když se uživatel zeptá).

Všechny respektují robots.txt. Takže pokud chcete být citováni v Claude, povolte Claude-SearchBot a Claude-User. Blokace samotného ClaudeBota citaci neovlivní.

Chcete vědět, jestli vás AI crawleři vůbec vidí?

Provedu audit technického nastavení vašeho webu pro AI viditelnost. Zkontroluju robots.txt, search boty, structured data, crawlabilitu a navrhnu konkrétní úpravy.
Přečtěte si více na GEO & AI optimalizaci

Přejděte na vaseadresa.cz/robots.txt a přečtěte si obsah. Hledejte bloky s AI boty. Pokud vidíte Disallow: / u OAI-SearchBot, Claude-SearchBot, PerplexityBot nebo Googlebot, máte problém, protože se vyřazujete z citací.

Scénář A: Chci povolit všechny AI crawlery

Nejjednodušší: nepište pro AI boty nic speciálního. Pokud robots.txt neobsahuje jejich záznamy, platí pro ně obecné:

User-agent: *.

User-agent: *
Disallow: /admin/
Disallow: /kosik/

Sitemap: https://www.vaseadresa.cz/sitemap.xml

Scénář B: Chci být citován, ale ne v trénovacích datech

Nejčastěji doporučovaný přístup. Zablokujte trénovací boty a nechte projít vyhledávací. OpenAI i Anthropic to výslovně umožňují. Můžete povolit search bota a zakážete trénovacího.

# Blokujeme trénink
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Bytespider
Disallow: /

# Vyhledávací boty (citace) povoleny přes User-agent: *
# OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot
User-agent: *
Disallow: /admin/

Sitemap: https://www.vaseadresa.cz/sitemap.xml

Scénář C: Chci blokovat všechny AI crawlery

Opodstatněné u médií řešících licence nebo webů s vážnými výkonnostními problémy. Pozor: tímhle se dobrovolně vzdáváte AI citací.

# Trénink
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: meta-externalagent
Disallow: /

# Vyhledávání / retrieval (tímhle mizíte z odpovědí)
User-agent: OAI-SearchBot
Disallow: /
User-agent: ChatGPT-User
Disallow: /
User-agent: Claude-SearchBot
Disallow: /
User-agent: Claude-User
Disallow: /
User-agent: PerplexityBot
Disallow: /

Google-Extended je token, který Google zavedl v roce 2023. Říká Googlu, jestli může váš obsah použít pro trénink modelů Gemini a Vertex AI. A tady je rozdíl, který hodně webů přehlíží.

Google-Extended neřídí AI Overviews. AI Overviews i AI Mode jedou přes běžný Googlebot, kterého nemůžete zablokovat bez dopadu na celé SEO. Takže blokace Google-Extended nevyhodí váš web z AI Overviews, blokuje jen trénovací data pro Gemini.

Pokud chcete z AI Overviews zmizet, potřebujete meta tag nosnippet nebo data-nosnippet, ne Google-Extended.

Doporučení pro většinu webů: Google-Extended povolte. Když se Gemini učí váš kontext, lépe vás dokáže citovat.

AI crawleři generují reálnou zátěž. Zejména u velkých e-shopů s tisíci stránkami může intenzivní crawlování zpomalit web pro skutečné návštěvníky.

Jak monitorovat zátěž

Access logy serveru ukážou, kolik requestů přichází od kterého bota.

Požádejte vývojáře nebo hosting o přístup k logům. Hledejte: User-agent s názvy AI botů, počet requestů za den, objem přenesených dat.

Crawl-delay jako kompromis

Když nechcete bota blokovat, ale potřebujete omezit jeho zátěž, použijte direktivu Crawl-delay. Říká botovi, aby mezi requesty čekal daný počet sekund. Googlebot ji ignoruje, ale většina AI botů (včetně GPTBota a ClaudeBota) ji respektuje.

User-agent: GPTBot
Crawl-delay: 10

User-agent: ClaudeBot
Crawl-delay: 10

IndexNow je protokol, kterým web aktivně upozorní vyhledávač na nový nebo upravený obsah. Místo čekání na crawl pošlete notifikaci a indexace proběhne rychleji, což znamená i rychlejší dostupnost obsahu pro vyhledávací boty.

Pozor na rozšířený mýtus: IndexNow podporují Bing, Seznam, Yandex a Naver.

Google ho nepodporuje. Od roku 2021 ho jen testuje a nepřijal. Pro Google zůstávají cestou XML sitemap a Google Search Console.

Jak IndexNow nastavit

Většina SEO pluginů pro WordPress (Yoast, Rank Math) má IndexNow v nastavení. Pro vlastní weby je potřeba implementovat API volání při každém publikování. Dokumentace na indexnow.org.

U Shoptetu a jiných e-commerce platforem zkontrolujte nastavení v administraci, nebo se zeptejte vývojáře.

llms.txt je návrh standardu z roku 2024, který nabírá na síle. Je to soubor v kořeni webu (vaseadresa.cz/llms.txt), který AI modelům v přehledné podobě říká, co na webu je a kam se podívat pro to nejdůležitější. Něco jako sitemap, ale psaná pro jazykové modely, ne pro vyhledávací roboty.

Zatímco robots.txt říká „kam smíš“, llms.txt říká „tady je to podstatné“. Je psaný v Markdownu, takže ho AI snadno přečte: odkazy na klíčové stránky s krátkým popisem.

Adopce zatím není povinná a žádný model ji oficiálně nevyžaduje. Ale je to levný krok s potenciálem náskoku: kdo llms.txt nasadí dřív, dává AI uklizenou mapu svého webu, zatímco konkurence ji nechává hádat.

Nechcete řešit technické SEO a GEO každé zvlášť?

Digitální viditelnost na klíč kombinuje SEO, linkbuilding a GEO v jednom měsíčním balíčku. Jeden člověk, jedna strategie, žádná koordinace.
Přečtěte si více na digitální viditelnosti na klíč.
Jaký je rozdíl mezi GPTBot a OAI-SearchBot?

GPTBot sbírá data pro trénink modelů OpenAI. OAI-SearchBot indexuje obsah pro ChatGPT Search, tedy pro odpovědi, ve kterých vás ChatGPT může citovat. Jsou to dva různé boty se dvěma robots.txt tokeny. Pokud chcete být v ChatGPT Search, ale ne v trénovacích datech, povolte OAI-SearchBot a zakažte GPTBot. Toto je oficiálně podporovaný vzor.

Jak zjistím, jestli AI crawleři na můj web vůbec chodí?

Nejspolehlivější jsou access logy serveru. Obsahují každý request včetně User-agent. Když k nim nemáte přístup, požádejte vývojáře nebo hosting o report. V Google Search Console záložka Crawl stats ukazuje aktivitu Googlebota. Pro ostatní boty přímý nástroj v GSC není, tam jsou access logy nejjistější cesta.

Mám blokovat AI crawlery kvůli „krádeži obsahu“?

Záleží, co je váš cíl. Pokud chcete být vidět v AI odpovědích, blokovat vyhledávací boty nedává smysl, vyřadíte se z citací. Trénovací boty blokovat můžete, pokud nechcete přispívat do trénovacích dat, ale připravujete se tím o zastoupení v příští verzi modelu. U servisních a obsahových webů obvykle převažuje zájem být citován nad obavou z tréninku.

Povolím AI crawlery a zpomalí se mi web?

U malých webů do tisíce stránek je zátěž minimální a zpomalení nepravděpodobné. U velkých e-shopů s desítkami tisíc stránek může být intenzivní crawlování znatelné. Doporučení: povolte boty a sledujte access logy první 2 až 4 týdny. Při výrazném nárůstu přidejte Crawl-delay nebo selektivně vraťte blokaci trénovacích botů. Není to nezvratné rozhodnutí.

Mám robots.txt na WordPressu, jak ho upravím?

WordPress generuje robots.txt dynamicky, ale umožňuje úpravu přes SEO pluginy. V Yoast SEO: SEO, Nástroje, Editor souborů. V Rank Math: Obecná nastavení, Upravit robots.txt. Alternativně lze vytvořit fyzický soubor robots.txt v kořeni webu přes FTP nebo správce souborů. Fyzický soubor má přednost před dynamicky generovaným.

Robots.txt je první věc, kterou zkontrolujte, když vás AI necituje. Klíč je rozlišit dvě vrstvy botů: trénovací (GPTBot, ClaudeBot) a vyhledávací (OAI-SearchBot, Claude-SearchBot, PerplexityBot). O citaci rozhodují ty vyhledávací, a ty se vyplatí povolit. Blokace trénovacích botů je vaše volba bez okamžitého dopadu. Google-Extended neřídí AI Overviews, IndexNow Google nepodporuje a llms.txt je levný krok, jak AI dát uklizenou mapu webu. A nastavení není jednou provždy, kdykoliv ho doladíte podle výkonu serveru.

O čem ještě píšu

Napište nám komentář