Často se objeví zdánlivě jednoduchá otázka: Máme na web přidat llms.txt, aby nás umělá inteligence správně četla — a zároveň si nebrala obsah pro trénink? Odpověď není jedno univerzální ano nebo ne. V jedné větě se totiž smíchaly tři různé věci: přístup crawlerů, viditelnost ve vyhledávání a nápověda pro AI agenty.
Právě jejich oddělení je důležitější než samotný soubor. Když ho neuděláme, můžeme nevědomky zablokovat návštěvnost, kterou chceme, a přitom nezískat ochranu, kterou jsme čekali.
Nejdřív si ujasněte, čeho chcete dosáhnout
- Chci, aby stránku našel Google nebo ChatGPT Search. Řešíme indexaci, technické SEO a pravidla konkrétního vyhledávacího crawleru.
- Nechci poskytovat obsah pro trénink modelů. Řešíme crawler určený k tréninku a podmínky konkrétní služby.
- Chci agentovi nabídnout stručnou mapu dokumentace. Tady může dávat smysl
llms.txt. - Chci chránit neveřejný obsah. Tady nestačí žádný textový soubor. Potřebuji autentizaci, oprávnění a skutečné zabezpečení.
Tato rozhodnutí mohou vypadat podobně, technicky jsou však nezávislá. Vyhledávací crawler jedné firmy a její tréninkový crawler mohou mít jiný název i jiná pravidla.
Co je llms.txt — a co není
LLMs.txt je návrh jednoduchého markdownového souboru v kořeni webu. Má agentovi nabídnout krátký popis webu a odkazy na důležité zdroje. U rozsáhlé dokumentace může fungovat jako rozcestník: tady je produkt, tady API, tady podmínky a tady nejčastější postupy.
Není to přístupová politika. Neříká závazně, kdo smí obsah použít k tréninku, nezabrání stažení stránky a nezaručí citaci ve výsledku. Google navíc ve své dokumentaci výslovně uvádí, že pro jeho AI funkce ve Vyhledávání není potřeba žádný speciální AI soubor a llms.txt pro Google Search nic nepřináší.
Na firemním webu bych jej nasadil tehdy, když umíme udržovat krátký, pravdivý a užitečný seznam zdrojů. Ne jako prázdné SEO gesto. Zastaralá mapa je horší než žádná, protože agentovi nabídne neplatné ceny, staré návody nebo zrušené stránky.
Robots.txt řídí crawling, nikoli důvěru ani zabezpečení
Soubor robots.txt sděluje spolupracujícím crawlerům, kam mají nebo nemají chodit. Je veřejný a pravidla jsou závislá na konkrétním user-agentovi. Není to firewall a u neposlušného robota nic nevynutí.
Stejně důležitá je hranice, kterou často potkávám i u běžného SEO: blokace v robots.txt není spolehlivý způsob odstranění URL z vyhledávače. Google může adresu znát z jiných odkazů, i když její obsah nesmí načíst. Pro neveřejná data použijte přihlášení. Pro stránku, která nemá být ve výsledcích, typicky noindex na crawlable URL nebo odpovídající stavový kód podle situace.
Jeden přepínač pro všechny AI roboty neexistuje
OpenAI: vyhledávání a trénink lze rozhodnout odděleně
OpenAI dokumentuje samostatné crawlery. OAI-SearchBot slouží k objevování obsahu pro vyhledávání v ChatGPT, zatímco GPTBot souvisí s možným využitím obsahu pro zlepšování generativních modelů. Proto může dávat smysl povolit první a zakázat druhý:
User-agent: OAI-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /
ChatGPT-User označuje požadavek vyvolaný uživatelem a není mechanismem pro zařazení do vyhledávání. I zde je dobré číst aktuální podmínky poskytovatele, ne kopírovat starý seznam user-agentů z cizího blogu.
Google: Search a Google-Extended nejsou totéž
AI Overviews a AI Mode jsou podle dokumentace Google Search postavené na vyhledávacím indexu a jeho systémech. Přístup Googlebotu proto ovlivňuje běžné vyhledávání i způsobilost pro tyto funkce.
Google-Extended je naopak samostatný produktový token pro použití obsahu při zlepšování modelů Gemini a pro grounding v některých produktech. Google uvádí, že jeho zákaz nemá vliv na zařazení ani pořadí ve Vyhledávání. Není tedy náhradou pravidel pro Googlebot.
Další služby mají vlastní pravidla
Anthropic rozlišuje například ClaudeBot, Claude-SearchBot a uživatelské načítání. Perplexity popisuje PerplexityBot pro svůj vyhledávací index. Názvy i účel se mohou měnit. Správný postup je vést seznam služeb, které jsou pro firmu důležité, a pravidelně jej kontrolovat proti jejich primární dokumentaci.
Jak bych rozhodnutí udělal na firemním webu
- Sepíšu obchodní cíl. Chci organickou návštěvnost, citace, ochranu placeného obsahu, nebo všechno s různými pravidly?
- Zkontroluji technický základ. Kanonické URL, indexaci, stavové kódy, sitemapu a interní odkazy. Bez toho speciální soubor nic nezachrání.
- Rozdělím crawler podle účelu. Vyhledávání, trénink a uživatelem vyvolané načítání neposuzuji jako jednu kategorii.
- Neveřejná data skutečně zabezpečím. Nabídky pro konkrétní klienty, administraci a interní dokumenty neschovávám pouze pokynem robotovi.
- LLMs.txt přidám jen s vlastníkem obsahu. Někdo musí hlídat, že odkazy a popisy zůstávají pravdivé.
- Výsledek měřím. Sleduji logy, Search Console a návštěvy z relevantních zdrojů. Neberu samotnou existenci souboru jako hotovou optimalizaci.
Pokud řešíte, jak se stát zdrojem pro AI odpovědi, začal bych spíš obsahem a důkazy než souborem v kořeni webu. Podrobně to rozebírám v článku Jak AI a Google vybírají zdroje. A pokud chcete projít konkrétní nastavení crawlerů bez rizika, že si odstřihnete organickou návštěvnost, ozvěte se mi přes kontakt.