Než vás AI může citovat, musí váš web přečíst. Jenže ne každý AI crawler rozhoduje o citaci. Klíčové je rozlišit trénovací boty (GPTBot, ClaudeBot) od vyhledávacích botů (OAI-SearchBot, Claude-SearchBot, PerplexityBot). Protože o tom, jestli vás dnes ChatGPT nebo Perplexity zmíní, rozhodují ty druhé. Tady je průvodce, jak robots.txt číst, správně nastavit pro AI a co zkontrolovat dřív, než si řeknete „proč mě AI necituje“.
Obsah
ToggleRobots.txt je textový soubor v kořenovém adresáři webu. Říká crawlerům, které části webu smí procházet a které ne. Najdete ho vždy na adrese vaseadresa.cz/robots.txt.
Soubor se skládá z bloků. Každý blok začíná direktivou User-agent, která určuje, pro kterého crawlera pravidla platí. Hvězdička znamená všechny. Pak následují direktivy Disallow (zakázat) nebo Allow (povolit) s cestami.
# Komentář — řádky začínající # jsou ignorovány
# Pravidla pro všechny crawlery
User-agent: *
Disallow: /admin/
Disallow: /kosik/
# Pravidla jen pro Googlebot
User-agent: Googlebot
Allow: /
# Odkaz na sitemap
Sitemap: https://www.vaseadresa.cz/sitemap.xml
Robots.txt není bezpečnostní nástroj. Je to doporučení, ne technická bariéra. Slušní crawleři ho respektují, ale nikdo je nenutí. Citlivý obsah chraňte heslem nebo přihlášením, ne robots.txt.
Robots.txt také nebrání stránce v zobrazení ve výsledcích, pokud na ni někdo odkazuje. Blokuje crawlování, ne indexaci přes externí odkazy. Na skrytí stránky z výsledků slouží meta tag noindex.
Tohle je nejdůležitější z celého článku. Googlebot crawluje za jedním účelem: indexovat obsah pro výsledky. AI firmy ale provozují víc botů s různými úkoly a každý má jiný dopad na vaši viditelnost.
Sbírají obsah, který se použije k naučení modelu.
Váš text se stane součástí trénovacích dat. Crawlují jednou nebo příležitostně.
Patří sem GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot, Bytespider. Blokace těchto botů nemá okamžitý dopad na to, jestli vás AI dnes cituje. Jen se nedostanete do trénovacích dat příští verze modelu.
Tyhle čtou web kvůli odpovědím v reálném čase, a právě ony rozhodují o citaci. Patří sem:
Klíčový závěr (a tady se hodně webů plete): Chcete-li být citováni v ChatGPT, Claude nebo Perplexity, musíte povolit jejich vyhledávací boty:
OAI-SearchBot, Claude-SearchBot, PerplexityBot a uživatelské agenty.
Blokace GPTBota nebo ClaudeBota vás z citací nevyřadí, jen vás vyřadí z tréninku.
Opačně to ale platí krutě: když omylem zablokujete search boty, zmizíte z AI odpovědí.
Doporučení vychází z dopadu na AI viditelnost, ne z etické debaty o trénovacích datech.
| User-agent | Kdo za ním stojí | Úkol | Doporučení |
|---|---|---|---|
| OAI-SearchBot | OpenAI | Indexace pro ChatGPT Search | ✅ Povolit |
| ChatGPT-User | OpenAI | Živé načtení při dotazu | ✅ Povolit |
| Claude-SearchBot | Anthropic | Indexace pro vyhledávání Claude | ✅ Povolit |
| Claude-User | Anthropic | Živé načtení při dotazu | ✅ Povolit |
| PerplexityBot | Perplexity | Indexace pro Perplexity | ✅ Povolit |
| Googlebot | Výsledky + AI Overviews + AI Mode | ✅ Povolit (nikdy neblokovat) |
| User-agent | Kdo za ním stojí | Úkol | Doporučení |
|---|---|---|---|
| GPTBot | OpenAI | Trénink modelů | ⚠ Volitelné |
| ClaudeBot | Anthropic | Trénink Claude | ⚠ Volitelné |
| Google-Extended | Trénink Gemini / Vertex (token, ne crawler) | ✅ Spíš povolit | |
| meta-externalagent | Meta | Trénink + Meta AI | ⚠ Volitelné |
| Applebot-Extended | Apple | Trénink Apple AI | ⚠ Volitelné |
| Amazonbot | Amazon | Trénink Alexa / Amazon AI | ⚠ Volitelné |
| Bytespider | ByteDance (TikTok) | Trénink modelů TikTok | ❌ Lze blokovat |
| CCBot | Common Crawl | Trénink open-source modelů | ❌ Lze blokovat |
Anthropic má tři weboví boty (plus claude-code):
Všechny respektují robots.txt. Takže pokud chcete být citováni v Claude, povolte Claude-SearchBot a Claude-User. Blokace samotného ClaudeBota citaci neovlivní.
| Provedu audit technického nastavení vašeho webu pro AI viditelnost. Zkontroluju robots.txt, search boty, structured data, crawlabilitu a navrhnu konkrétní úpravy. Přečtěte si více na GEO & AI optimalizaci |
Přejděte na vaseadresa.cz/robots.txt a přečtěte si obsah. Hledejte bloky s AI boty. Pokud vidíte Disallow: / u OAI-SearchBot, Claude-SearchBot, PerplexityBot nebo Googlebot, máte problém, protože se vyřazujete z citací.
Nejjednodušší: nepište pro AI boty nic speciálního. Pokud robots.txt neobsahuje jejich záznamy, platí pro ně obecné:
User-agent: *.
User-agent: *
Disallow: /admin/
Disallow: /kosik/
Sitemap: https://www.vaseadresa.cz/sitemap.xml
Nejčastěji doporučovaný přístup. Zablokujte trénovací boty a nechte projít vyhledávací. OpenAI i Anthropic to výslovně umožňují. Můžete povolit search bota a zakážete trénovacího.
# Blokujeme trénink
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Bytespider
Disallow: /
# Vyhledávací boty (citace) povoleny přes User-agent: *
# OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot
User-agent: *
Disallow: /admin/
Sitemap: https://www.vaseadresa.cz/sitemap.xml
Opodstatněné u médií řešících licence nebo webů s vážnými výkonnostními problémy. Pozor: tímhle se dobrovolně vzdáváte AI citací.
# Trénink
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: meta-externalagent
Disallow: /
# Vyhledávání / retrieval (tímhle mizíte z odpovědí)
User-agent: OAI-SearchBot
Disallow: /
User-agent: ChatGPT-User
Disallow: /
User-agent: Claude-SearchBot
Disallow: /
User-agent: Claude-User
Disallow: /
User-agent: PerplexityBot
Disallow: /
Google-Extended je token, který Google zavedl v roce 2023. Říká Googlu, jestli může váš obsah použít pro trénink modelů Gemini a Vertex AI. A tady je rozdíl, který hodně webů přehlíží.
Google-Extended neřídí AI Overviews. AI Overviews i AI Mode jedou přes běžný Googlebot, kterého nemůžete zablokovat bez dopadu na celé SEO. Takže blokace Google-Extended nevyhodí váš web z AI Overviews, blokuje jen trénovací data pro Gemini.
Pokud chcete z AI Overviews zmizet, potřebujete meta tag nosnippet nebo data-nosnippet, ne Google-Extended.
Doporučení pro většinu webů: Google-Extended povolte. Když se Gemini učí váš kontext, lépe vás dokáže citovat.
AI crawleři generují reálnou zátěž. Zejména u velkých e-shopů s tisíci stránkami může intenzivní crawlování zpomalit web pro skutečné návštěvníky.
Access logy serveru ukážou, kolik requestů přichází od kterého bota.
Požádejte vývojáře nebo hosting o přístup k logům. Hledejte: User-agent s názvy AI botů, počet requestů za den, objem přenesených dat.
Když nechcete bota blokovat, ale potřebujete omezit jeho zátěž, použijte direktivu Crawl-delay. Říká botovi, aby mezi requesty čekal daný počet sekund. Googlebot ji ignoruje, ale většina AI botů (včetně GPTBota a ClaudeBota) ji respektuje.
User-agent: GPTBot
Crawl-delay: 10
User-agent: ClaudeBot
Crawl-delay: 10
IndexNow je protokol, kterým web aktivně upozorní vyhledávač na nový nebo upravený obsah. Místo čekání na crawl pošlete notifikaci a indexace proběhne rychleji, což znamená i rychlejší dostupnost obsahu pro vyhledávací boty.
Pozor na rozšířený mýtus: IndexNow podporují Bing, Seznam, Yandex a Naver.
Google ho nepodporuje. Od roku 2021 ho jen testuje a nepřijal. Pro Google zůstávají cestou XML sitemap a Google Search Console.
Většina SEO pluginů pro WordPress (Yoast, Rank Math) má IndexNow v nastavení. Pro vlastní weby je potřeba implementovat API volání při každém publikování. Dokumentace na indexnow.org.
U Shoptetu a jiných e-commerce platforem zkontrolujte nastavení v administraci, nebo se zeptejte vývojáře.
llms.txt je návrh standardu z roku 2024, který nabírá na síle. Je to soubor v kořeni webu (vaseadresa.cz/llms.txt), který AI modelům v přehledné podobě říká, co na webu je a kam se podívat pro to nejdůležitější. Něco jako sitemap, ale psaná pro jazykové modely, ne pro vyhledávací roboty.
Zatímco robots.txt říká „kam smíš“, llms.txt říká „tady je to podstatné“. Je psaný v Markdownu, takže ho AI snadno přečte: odkazy na klíčové stránky s krátkým popisem.
Adopce zatím není povinná a žádný model ji oficiálně nevyžaduje. Ale je to levný krok s potenciálem náskoku: kdo llms.txt nasadí dřív, dává AI uklizenou mapu svého webu, zatímco konkurence ji nechává hádat.
| Digitální viditelnost na klíč kombinuje SEO, linkbuilding a GEO v jednom měsíčním balíčku. Jeden člověk, jedna strategie, žádná koordinace. Přečtěte si více na digitální viditelnosti na klíč. |
GPTBot sbírá data pro trénink modelů OpenAI. OAI-SearchBot indexuje obsah pro ChatGPT Search, tedy pro odpovědi, ve kterých vás ChatGPT může citovat. Jsou to dva různé boty se dvěma robots.txt tokeny. Pokud chcete být v ChatGPT Search, ale ne v trénovacích datech, povolte OAI-SearchBot a zakažte GPTBot. Toto je oficiálně podporovaný vzor.
Nejspolehlivější jsou access logy serveru. Obsahují každý request včetně User-agent. Když k nim nemáte přístup, požádejte vývojáře nebo hosting o report. V Google Search Console záložka Crawl stats ukazuje aktivitu Googlebota. Pro ostatní boty přímý nástroj v GSC není, tam jsou access logy nejjistější cesta.
Záleží, co je váš cíl. Pokud chcete být vidět v AI odpovědích, blokovat vyhledávací boty nedává smysl, vyřadíte se z citací. Trénovací boty blokovat můžete, pokud nechcete přispívat do trénovacích dat, ale připravujete se tím o zastoupení v příští verzi modelu. U servisních a obsahových webů obvykle převažuje zájem být citován nad obavou z tréninku.
U malých webů do tisíce stránek je zátěž minimální a zpomalení nepravděpodobné. U velkých e-shopů s desítkami tisíc stránek může být intenzivní crawlování znatelné. Doporučení: povolte boty a sledujte access logy první 2 až 4 týdny. Při výrazném nárůstu přidejte Crawl-delay nebo selektivně vraťte blokaci trénovacích botů. Není to nezvratné rozhodnutí.
WordPress generuje robots.txt dynamicky, ale umožňuje úpravu přes SEO pluginy. V Yoast SEO: SEO, Nástroje, Editor souborů. V Rank Math: Obecná nastavení, Upravit robots.txt. Alternativně lze vytvořit fyzický soubor robots.txt v kořeni webu přes FTP nebo správce souborů. Fyzický soubor má přednost před dynamicky generovaným.
Robots.txt je první věc, kterou zkontrolujte, když vás AI necituje. Klíč je rozlišit dvě vrstvy botů: trénovací (GPTBot, ClaudeBot) a vyhledávací (OAI-SearchBot, Claude-SearchBot, PerplexityBot). O citaci rozhodují ty vyhledávací, a ty se vyplatí povolit. Blokace trénovacích botů je vaše volba bez okamžitého dopadu. Google-Extended neřídí AI Overviews, IndexNow Google nepodporuje a llms.txt je levný krok, jak AI dát uklizenou mapu webu. A nastavení není jednou provždy, kdykoliv ho doladíte podle výkonu serveru.
Po předchozí dohodě
SEO & linkbuilding:
Obsah a konzultace:
Lady Virtual (Míša Vránová Matanelli)
Slavňovice 39, Stádlec
okres Tábor, 391 61, Jihočeský kraj
IČ: 76342280
DIČ: CZ8261013596