Az AI-crawlerek olyan automata botok, amelyek nyelvi modellek és generatív keresők számára töltik le a weboldalak tartalmát. Két, élesen eltérő csoportra bomlanak: az egyik a modell tanításához gyűjt szöveget, a másik egy konkrét felhasználói kérdés pillanatában kéri le az oldalt.
Hogyan működik
Minden bot saját nevet küld a HTTP-kérés User-Agent fejlécében. Ez a név a belépőkártya: a robots.txt fájlban user-agent szinten döntöd el, ki jöhet be és ki nem.
A tiltás nem technikai zár, hanem szabály. A nagy szolgáltatók botjai betartják, de a névtelen scraperek nem törődnek vele. Ezért a robots.txt láthatósági eszköz, nem biztonsági megoldás.
Miért nem egyforma két bot
A tréning-bot vs kereső-bot különbség adja a lényeget. A tréning-botok, például a GPTBot vagy a ClaudeBot, a jövőbeli modellek tudásához gyűjtenek. Ha tiltod őket, a mai forgalmad nem csökken.
A kereső-botok viszont valós időben dolgoznak. Amikor valaki kérdez a ChatGPT-ben vagy a Perplexityben, az OAI-SearchBot és a PerplexityBot tölti le az oldalt, hogy a válasz hivatkozhasson rá. A ChatGPT-User akkor indul, amikor a felhasználó konkrétan a te linkedre kattint vagy azt kéri be.
Mikor számít igazán
Ha a kereső-botokat tiltod, kikerülsz a generatív válaszokból. Nem rosszabb helyre kerülsz, hanem sehova: a modell nem tudja megnyitni az oldalt, így nem is idéz.
A riportokban ezt látjuk a leggyakrabban: valaki egy általános Disallow: / szabályt vagy egy net-en talált "AI-blokkoló" listát másol be, és a kereső-botokat is kizárja. A magyar KKV-oldalak többségén viszont egyszerűen nincs semmilyen AI-bot szabály, ami rendben van, mert az alapértelmezés az engedés.
Röviden: a tréning-botok tiltása üzleti döntés, a kereső-botok tiltása önkizárás az AI-válaszokból.
Technikai példa
Példa robots.txt: a kereső-botok engedve, a tréning-botok tiltva.
# Kereső-botok: ezek hoznak idézést és forgalmat
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
# Tréning-botok: tudatos szerzői döntés
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://pelda.hu/sitemap.xml
Ellenőrzés terminálból. Az első parancs kilistázza a bot-sorokat, a második azt mutatja meg, hogy a szervered tényleg kiszolgálja-e a kereső-botot.
curl -s https://pelda.hu/robots.txt | grep -iE "gptbot|searchbot|perplexity|claude|ccbot|extended"
curl -s -A "OAI-SearchBot/1.0" -o /dev/null -w "%{http_code}\n" https://pelda.hu/
Ha a második parancs 403-at vagy 429-et ad, nem a robots.txt a gond, hanem a tűzfal vagy a CDN bot-szűrője.
Gyakori kérdések
Ha tiltom a GPTBot-ot, eltűnök a ChatGPT válaszaiból?
Nem. A GPTBot a modell tanításához gyűjt tartalmat, a válaszokhoz az OAI-SearchBot és a ChatGPT-User tölti le az oldalt. A tréning-bot tiltása tehát nem érinti a megjelenésedet. Akkor esel ki, ha a kereső-botokat zárod ki.
Kell egyáltalán foglalkoznom ezzel, ha nincs AI-bot szabály a robots.txt-ben?
Alapértelmezésben minden bot beengedett, tehát a hiányzó szabály nem hiba. Érdemes viszont egyszer átnézni, mert sok sablon és biztonsági plugin tesz be saját sorokat. A legtöbb problémát pont ezek okozzák.
Megvédi a tartalmamat a robots.txt a másolástól?
Nem. A robots.txt kérés, amit a nagy szolgáltatók betartanak, de jogilag nem kötelező érvényű. Aki szándékosan másol, az figyelmen kívül hagyja. Valódi védelemhez szerveroldali szűrés, rate limit vagy bejelentkezés kell.
Honnan tudom, hogy jártak-e nálam ezek a botok?
A szerver hozzáférési naplójában látod a user-agent nevét és az IP-címet. Keress rá a bot nevére, és nézd meg a visszaadott státuszkódot. Ha sok a 403-as, valamelyik védelmi réteg blokkolja őket.
Mi történik, ha a kereső-botokat engedem, de az oldal lassú vagy JavaScripttel tölti a tartalmat?
A legtöbb AI-crawler a nyers HTML-t dolgozza fel, és nem futtat JavaScriptet. Ha a szöveg csak kliensoldalon jelenik meg, a bot üres oldalt lát. A szerveroldali renderelés vagy a statikus HTML ilyenkor sokat javít.