AI-értelmezhetőség Szakszó

AI-crawlerek (GPTBot, ClaudeBot, PerplexityBot és társaik)

Szerző: · 7 perc olvasás · Frissítve:
AI-crawlerek (GPTBot, ClaudeBot, PerplexityBot és társaik) - AI-értelmezhetőség (szakszó) a tudástárban
AI-crawlerek (GPTBot, ClaudeBot, PerplexityBot és társaik) - AI-értelmezhetőség | eClick GEO-audit tudástár

Az AI-crawlerek olyan automata botok, amelyek nyelvi modellek és generatív keresők számára töltik le a weboldalak tartalmát. Két, élesen eltérő csoportra bomlanak: az egyik a modell tanításához gyűjt szöveget, a másik egy konkrét felhasználói kérdés pillanatában kéri le az oldalt.

Hogyan működik

Minden bot saját nevet küld a HTTP-kérés User-Agent fejlécében. Ez a név a belépőkártya: a robots.txt fájlban user-agent szinten döntöd el, ki jöhet be és ki nem.

A tiltás nem technikai zár, hanem szabály. A nagy szolgáltatók botjai betartják, de a névtelen scraperek nem törődnek vele. Ezért a robots.txt láthatósági eszköz, nem biztonsági megoldás.

Miért nem egyforma két bot

A tréning-bot vs kereső-bot különbség adja a lényeget. A tréning-botok, például a GPTBot vagy a ClaudeBot, a jövőbeli modellek tudásához gyűjtenek. Ha tiltod őket, a mai forgalmad nem csökken.

A kereső-botok viszont valós időben dolgoznak. Amikor valaki kérdez a ChatGPT-ben vagy a Perplexityben, az OAI-SearchBot és a PerplexityBot tölti le az oldalt, hogy a válasz hivatkozhasson rá. A ChatGPT-User akkor indul, amikor a felhasználó konkrétan a te linkedre kattint vagy azt kéri be.

Mikor számít igazán

Ha a kereső-botokat tiltod, kikerülsz a generatív válaszokból. Nem rosszabb helyre kerülsz, hanem sehova: a modell nem tudja megnyitni az oldalt, így nem is idéz.

A riportokban ezt látjuk a leggyakrabban: valaki egy általános Disallow: / szabályt vagy egy net-en talált "AI-blokkoló" listát másol be, és a kereső-botokat is kizárja. A magyar KKV-oldalak többségén viszont egyszerűen nincs semmilyen AI-bot szabály, ami rendben van, mert az alapértelmezés az engedés.

Röviden: a tréning-botok tiltása üzleti döntés, a kereső-botok tiltása önkizárás az AI-válaszokból.

Miért fontos

Láthatóság

A generatív keresők csak olyan oldalt idéznek, amit le tudnak tölteni. A kereső-bot tiltása ugyanaz, mint egy noindex a Google felé: a tartalom létezik, de a rendszer nem hivatkozhat rá.

Üzleti hatás

A kereső-botok forgalmat és említést hoznak. Egy AI-válaszban megjelenő link ma kevesebb kattintást ad, mint egy klasszikus találat, de a márkanevet beleteszi a döntési folyamatba.

A tréning-botok ezzel szemben nem hoznak látogatót. Ha a tartalmad értéke maga a szöveg, például kurzus, adatbázis vagy szakmai anyag, a tiltásuk védhető döntés.

Kockázat

  • Egy rossz robots.txt sor percek alatt kivonja az oldalt a generatív keresőkből.
  • A hiba hónapokig észrevétlen marad, mert semmilyen analitika nem jelzi.
  • A visszaállítás olcsó, de a kiesett időszak nem pótolható.

Kikre vonatkozik

Minden nyilvános, indexelésre szánt oldalra vonatkozik. Céges honlap, webshop, blog, szolgáltatásoldal: mindegyiknél a kereső-botok engedése az alap.

Külön mérlegelést kíván:

  • Kiadó, hírportál, szakmai tartalomgyár: a tréning-botok tiltása (GPTBot, ClaudeBot, CCBot) gyakori és indokolt.
  • Zárt tartalom, fizetőfal mögötti anyag: a robots.txt itt nem elég, jogosultsági rendszer kell.
  • Staging és fejlesztői környezet: ott teljes tiltás a helyes, minden botra.

Nem vonatkozik belső admin-felületre, API-végpontra és bejelentkezés mögötti oldalra. Azokat botoktól függetlenül zárva tartod.

Hogyan ellenőrzöd

  1. Nyisd meg a https://sajatdomain.hu/robots.txt címet böngészőben.
  2. Keresd meg a bot-neveket: GPTBot, OAI-SearchBot, ChatGPT-User, PerplexityBot, ClaudeBot, Claude-SearchBot, CCBot, Google-Extended, Applebot-Extended.
  3. Nézd meg, melyik user-agent blokk alatt van Disallow: /.
  4. Ellenőrizd a fájl végét: egy User-agent: * blokk nem írja felül a nevesített szabályokat, de a nevesített hiányában az érvényes.
  5. Terminálban gyorsabb: curl -s https://sajatdomain.hu/robots.txt.

Jó jel:

  • A kereső-botoknál nincs tiltás, vagy kifejezett Allow: / szerepel.
  • A fájl 200-as státusszal, text/plain típussal jön vissza.
  • A szabályok user-agent szinten, névvel vannak megadva.

Rossz jel:

  • Disallow: / az OAI-SearchBot, PerplexityBot vagy ChatGPT-User alatt.
  • Egy hosszú, másolt AI-blokkoló lista, amiben a kereső- és tréning-botok keverednek.
  • A robots.txt 404-et vagy HTML-oldalt ad vissza.

Mit néz ebből a riport

Az audit user-agent szinten elemzi a robots.txt-t, és szétválasztja a két bot-típust. A kereső-botok tiltását súlyos hibaként jelzi, mert az AI-válaszokból való kimaradást jelenti. A tréning-botok tiltása csak jelzés marad, mivel az tudatos szerzői döntés is lehet.

Hogyan javítod

A javítás mindenhol ugyanaz a logika: a kereső-botokat engeded, a tréning-botoknál te döntesz.

WordPress

  1. Ha nincs fizikai robots.txt a gyökérben, a WordPress virtuálisat generál.
  2. Yoast SEO esetén: Yoast SEO > Eszközök > Fájlszerkesztő, ott szerkeszthető a robots.txt.
  3. Rank Math esetén: Rank Math > Általános beállítások > Edit robots.txt.
  4. Mentés után töltsd újra a /robots.txt címet, és ellenőrizd a tartalmát.

Shopify

  1. Online Store > Themes > Edit code.
  2. Hozz létre vagy nyiss meg egy robots.txt.liquid sablont.
  3. Az alapértelmezett szabályok mellé vedd fel a saját user-agent blokkjaidat.
  4. Mentés után nézd meg a boltod /robots.txt címét.

Unas

  1. Az adminban keresd a robots.txt szerkesztésére szolgáló beállítást.
  2. Vedd fel a nevesített bot-szabályokat, a meglévő sorok törlése nélkül.
  3. Ha a felület nem engedi a szerkesztést, az ügyfélszolgálat tudja beállítani.

Shoprenter

  1. Az admin SEO-beállításai között található a robots.txt tartalma.
  2. Írd be a bot-blokkokat, majd mentsd.
  3. Ellenőrizd a nyilvános URL-en, mert a sablon felülírhatja a kézi sorokat.

Egyedi fejlesztés

  1. Tedd a robots.txt-t statikus fájlként a dokumentumgyökérbe.
  2. Győződj meg róla, hogy a válasz Content-Type: text/plain és 200-as.
  3. Ha CDN vagy reverse proxy van előtte, ürítsd a cache-t.
  4. Verziókövetésbe tedd be, hogy egy deploy ne írja felül.

A Google-Extended külön eset: a tiltása a Gemini-alkalmazások tanítását érinti, a Google-keresésben való megjelenést nem.

Gyakori hibák

  • Minden AI-botot egyszerre tiltanak - a kereső-botok is kiesnek, és az oldal eltűnik a generatív válaszokból.
  • Netről másolt blokkoló lista - a bot-nevek keverednek, senki nem tudja megmondani, melyik sor mit csinál.
  • Elgépelt user-agent név - a GPT-Bot vagy Perplexity-Bot alakra egyetlen crawler sem illeszkedik, a szabály hatástalan.
  • A robots.txt-t biztonsági eszköznek hiszik - a nem együttműködő scrapereket nem állítja meg, ahhoz szerveroldali szűrés kell.
  • Staging beállítás kerül élesbe - a Disallow: / sor deploykor átjön, és hetekig senki nem veszi észre.
  • WAF vagy CDN szabály tiltja a botot - a robots.txt engedélyez, a tűzfal mégis 403-at ad, így a kérés meg sem érkezik.
  • Nincs sitemap a fájlban - a botok nehezebben találják meg az oldalstruktúrát, pedig egy sor elég lenne.

Technikai példa

Példa robots.txt: a kereső-botok engedve, a tréning-botok tiltva.

# Kereső-botok: ezek hoznak idézést és forgalmat
User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

# Tréning-botok: tudatos szerzői döntés
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://pelda.hu/sitemap.xml

Ellenőrzés terminálból. Az első parancs kilistázza a bot-sorokat, a második azt mutatja meg, hogy a szervered tényleg kiszolgálja-e a kereső-botot.

curl -s https://pelda.hu/robots.txt | grep -iE "gptbot|searchbot|perplexity|claude|ccbot|extended"

curl -s -A "OAI-SearchBot/1.0" -o /dev/null -w "%{http_code}\n" https://pelda.hu/

Ha a második parancs 403-at vagy 429-et ad, nem a robots.txt a gond, hanem a tűzfal vagy a CDN bot-szűrője.

Gyakori kérdések

Ha tiltom a GPTBot-ot, eltűnök a ChatGPT válaszaiból?
Nem. A GPTBot a modell tanításához gyűjt tartalmat, a válaszokhoz az OAI-SearchBot és a ChatGPT-User tölti le az oldalt. A tréning-bot tiltása tehát nem érinti a megjelenésedet. Akkor esel ki, ha a kereső-botokat zárod ki.
Kell egyáltalán foglalkoznom ezzel, ha nincs AI-bot szabály a robots.txt-ben?
Alapértelmezésben minden bot beengedett, tehát a hiányzó szabály nem hiba. Érdemes viszont egyszer átnézni, mert sok sablon és biztonsági plugin tesz be saját sorokat. A legtöbb problémát pont ezek okozzák.
Megvédi a tartalmamat a robots.txt a másolástól?
Nem. A robots.txt kérés, amit a nagy szolgáltatók betartanak, de jogilag nem kötelező érvényű. Aki szándékosan másol, az figyelmen kívül hagyja. Valódi védelemhez szerveroldali szűrés, rate limit vagy bejelentkezés kell.
Honnan tudom, hogy jártak-e nálam ezek a botok?
A szerver hozzáférési naplójában látod a user-agent nevét és az IP-címet. Keress rá a bot nevére, és nézd meg a visszaadott státuszkódot. Ha sok a 403-as, valamelyik védelmi réteg blokkolja őket.
Mi történik, ha a kereső-botokat engedem, de az oldal lassú vagy JavaScripttel tölti a tartalmat?
A legtöbb AI-crawler a nyers HTML-t dolgozza fel, és nem futtat JavaScriptet. Ha a szöveg csak kliensoldalon jelenik meg, a bot üres oldalt lát. A szerveroldali renderelés vagy a statikus HTML ilyenkor sokat javít.

Források

Kapcsolódó fogalmak

A te oldaladon hogy áll a(z) „AI-crawlerek (GPTBot, ClaudeBot, PerplexityBot és társaik)”?

Futtass egy GEO-auditot: pontszám, fejlesztői ítélet, a leggyorsabb javítások, és minden tételhez bizonyíték.

Ingyenes GEO-audit indítása