AI-értelmezhetőség Szakszó

Tréning-bot vs kereső-bot

Szerző: · 8 perc olvasás · Frissítve:
Tréning-bot vs kereső-bot - AI-értelmezhetőség (szakszó) a tudástárban
Tréning-bot vs kereső-bot - AI-értelmezhetőség | eClick GEO-audit tudástár

A tréning-bot az a robot, amely az oldalad szövegét egy nyelvi modell tanítóanyagához gyűjti be, a kereső-bot pedig az, amely egy konkrét kérdés megválaszolásához olvassa, majd idézi az oldaladat. Ugyanarról a szerverről töltenek le HTML-t, de más a céljuk, más a user agent nevük, és külön is szabályozhatók.

Hogyan működik

Mindkettő sima HTTP-kéréssel érkezik, és a user agent stringjében mondja meg, kicsoda. A robots.txt ezekre a nevekre ad engedélyt vagy tiltást, külön blokkokban.

A gyakorlatban három szerepkör létezik:

  • Tréning-gyűjtés: GPTBot, ClaudeBot, CCBot. A letöltött szöveg modellek tanítására vagy adathalmazba kerülhet.
  • Keresés és idézés: OAI-SearchBot, Claude-SearchBot, PerplexityBot. Ezek töltik fel az asszisztensek találati listáját.
  • Felhasználói lekérés: ChatGPT-User és társai. Akkor futnak, amikor valaki konkrétan a te linkedet dobja be egy chatbe.

Miért nem ugyanaz a kettő

Ha tréning-botot tiltasz, a jövőbeli modellek nem tanulnak a szövegedből. Attól még megjelenhetsz a válaszokban, mert az idézés a kereső-bot dolga.

Ha viszont kereső-botot tiltasz, kiesel az idézhető források közül. Ott veszítesz, ahol forgalom, link és márkaemlítés lenne. A riportokban ezt látjuk a leggyakoribb önsebzésnek: valaki bemásol egy "AI-tiltó" robots.txt-t, és a keresőoldali botot is kizárja vele.

A Google külön eset

A Google-Extended nem egy létező crawler, hanem csak egy robots.txt-token. Nem külön kérésekben jelenik meg a logban, hanem azt vezérli, felhasználható-e a Googlebot által már letöltött tartalom a Gemini-modellek tanításához és megalapozásához. A Google Search rangsorolására és indexelésére nincs hatása. Hasonló logikával működik az Applebot-Extended is.

Mikor számít igazán

Kiadónál, online tananyagnál, fizetős tartalomnál valódi döntés, hogy adsz-e ingyen tanítóanyagot. Szolgáltatónál és webshopnál viszont ritkán éri meg bármit tiltani, mert az idézhetőség hozza az ügyfelet. Az AI-crawlerek teljes listája és viselkedése gyorsan változik, ezért érdemes félévente átnézni a szabályokat.

Röviden: a tréning-bot a jövő modelljét eteti, a kereső-bot a ma adott választ, és a kettőt sosem szabad egy szabállyal kezelni.

Miért fontos

Forgalom és láthatóság

Az asszisztensek válaszaiban a forrás-link a kereső-boton múlik. Ha az nem tud letölteni, nem leszel idézhető forrás, és a versenytársad kerül a válaszba.

A tiltás nem visszamenőleges

A robots.txt a jövőbeli letöltéseket szabályozza. Ami korábban már bekerült egy tanítóhalmazba vagy a Common Crawl archívumába, azt nem veszi ki onnan.

Üzleti döntés, nem technikai

A tréning-bot tiltása tartalomvédelmi kérdés. Ha a tartalmad maga a termék, van értelme. Ha a tartalmad marketing, a tiltás csak a saját elérésedet csökkenti.

Amit a hibás szabály okoz

  • Kimaradsz a ChatGPT search és a Perplexity forráslistáiból.
  • A márkanevedre adott válaszok pontatlanabbak lesznek, mert csak külső forrásból dolgoznak.
  • Nő a hallucináció esélye a szolgáltatásaidról.

Kikre vonatkozik

Vonatkozik rá:

  • Minden nyilvános weboldal, ahol van saját szöveg. A KKV-honlaptól a nagy webshopig.
  • Kiadók, blogok, tudásbázisok, ahol a tartalom maga az érték.
  • Több domaines cégek: minden domainnek saját robots.txt-je van.

Kevésbé vagy egyáltalán nem vonatkozik rá:

  • Staging és fejlesztői környezet. Ott a teljes tiltás és a jelszavas védelem a helyes, nem a botonkénti finomhangolás.
  • Belépés mögötti felületek. Oda egyik bot sem jut be.
  • Intranet, zárt rendszerek.

Webshopnál külön figyelj: a kereső-botok elől nem érdemes elzárni a termékoldalakat, a kosár- és pénztár-útvonalak viszont minden botnak tilthatók.

Hogyan ellenőrzöd

  1. Nyisd meg böngészőben a https://domained.hu/robots.txt címet.
  2. Keresd meg a User-agent: sorokat. Nézd végig ezeket a neveket: GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-SearchBot, PerplexityBot, CCBot, Google-Extended, Applebot-Extended.
  3. Nézd meg, van-e User-agent: * alatt Disallow: /. Az mindenkit kizár, keresőt és asszisztenst egyaránt.
  4. Tesztelj élőben curl-lel, botnévvel a fejlécben. A 200-as státusz a jó válasz, a 403 vagy 429 tiltást jelent.
  5. Nézd meg a szerverlogot vagy a CDN statisztikáját. Szűrj user agentre, és nézd meg, mely botok kapnak hibakódot.
  6. Ellenőrizd a CDN- vagy WAF-beállítást. Cloudflare-nél az "AI Scrapers and Crawlers" kapcsoló a robots.txt-től függetlenül blokkol.

Jó jel:

  • Külön blokk a tréning-botoknak és külön a kereső-botoknak.
  • A kereső-botok 200-as választ kapnak a fő tartalomra.
  • A robots.txt-ben ott a sitemap sora is.

Rossz jel:

  • Egyetlen nagy Disallow: / blokk sok AI-botnévvel egymás alatt.
  • A logban WAF tiltja a kereső-botot, miközben a robots.txt engedi.
  • A robots.txt 404-et vagy HTML-hibaoldalt ad vissza.

Hogyan javítod

WordPress

  1. Ha nincs fizikai robots.txt a gyökérben, a WordPress virtuálisat szolgál ki.
  2. Szerkeszd a Yoast SEO vagy a Rank Math beépített robots.txt-szerkesztőjével. Yoastnál: Yoast SEO > Eszközök > Fájlszerkesztő.
  3. Vedd fel külön blokkban a tiltandó tréning-botokat, és hagyd érintetlenül a kereső-botokat.
  4. Mentés után hívd le a fájlt inkognitó ablakban, hogy lásd az élő tartalmat.
  5. Ellenőrizd a biztonsági plugint is. A Wordfence és társai user agent alapján is tudnak blokkolni.

Shopify

  1. Admin > Áruház > Témák > Kód szerkesztése.
  2. Hozz létre új sablont: robots.txt.liquid.
  3. A Shopify alapértelmezett szabályait tartsd meg, és csak a saját blokkjaidat told hozzá.
  4. Mentés után nézd meg a /robots.txt kimenetét élesben.

Unas

  1. Az adminban a SEO-beállításoknál találod a robots.txt tartalmát.
  2. Írd bele a bot-specifikus blokkokat, a meglévő rendszer-szabályok törlése nélkül.
  3. Ha a mező nem szerkeszthető a csomagodban, kérd az ügyfélszolgálattól.

Shoprenter

  1. Az admin SEO- vagy robots.txt-szerkesztőjében módosíts.
  2. Ugyanaz a logika: tréning-bot külön blokk, kereső-bot marad engedve.
  3. Mentés után ürítsd a boltcache-t, és töltsd le a fájlt.

Egyedi fejlesztés

  1. A robots.txt legyen statikus fájl a dokumentumgyökérben, text/plain típussal.
  2. Ha útvonal- vagy fájlszinten akarsz tiltani, használd az X-Robots-Tag fejlécet nginx vagy Apache szinten.
  3. A WAF- és rate limit szabályokat vizsgáld felül. Tipikus hiba, hogy a szabály minden ismeretlen user agentet dob.
  4. Ha ténylegesen blokkolni akarsz, 403-at adj vissza, ne lassú timeoutot.
  5. Dokumentáld, melyik botot miért tiltottad. Fél év múlva már senki nem fogja tudni.

Mit néz ebből a riport

A riport letölti a robots.txt-et, és megnézi, hogy az ismert tréning- és kereső-botok engedve vagy tiltva vannak-e. Jelzi, ha egy keresőoldali bot ki van zárva, mert az közvetlen láthatóság-vesztés. Azt is jelzi, ha a fájl hiányzik vagy hibás státusszal jön vissza.

Gyakori hibák

  • Egy kalap alá venni minden AI-botot: a másolt tiltólisták a kereső-botot is kizárják, így az idézésekből is kiesel.
  • Disallow: / a User-agent: * alatt: nem csak az AI-t, a Googlebotot is kitiltja, és néhány hét alatt eltűnsz a találati oldalról.
  • A Google-Extended-et crawlernek hinni: nem az, és a tiltása nem befolyásolja a Google Search rangsorolását.
  • Visszamenőleges hatást várni: a tiltás a jövőbeli letöltésre vonatkozik, a korábban begyűjtött szöveget nem törli.
  • A WAF és a robots.txt ellentmondása: a robots.txt engedi a botot, a tűzfal viszont 403-mal dobja, és senki nem nézi a logot.
  • Elgépelt botnév: a GPTbot vagy a gptbot sor szóközzel nem talál semmit, a szabály némán hatástalan.
  • Tiltás helyett lassítás: a szándékos timeout a kereső-botot is elriasztja, mert az sávszélesség-korlát alatt dolgozik.

Technikai példa

Tipikus, jól szétválasztott robots.txt. A tréning-gyűjtés tiltva, a keresés és idézés engedve:

# Tanításra gyujto botok
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: CCBot
Disallow: /

# Keresohoz es idezeshez hasznalt botok: maradnak engedve
User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

# Google modell-tanitas kulon token, nem crawler
User-agent: Google-Extended
Disallow: /

User-agent: *
Disallow: /kosar/
Disallow: /penztar/
Disallow: /kereses

Sitemap: https://domained.hu/sitemap.xml

Élő teszt curl-lel. Az első parancs a tiltott, a második az engedett botot utánozza:

curl -s -o /dev/null -w "%{http_code}\n" -A "GPTBot/1.2" https://domained.hu/
curl -s -o /dev/null -w "%{http_code}\n" -A "OAI-SearchBot/1.0" https://domained.hu/

A robots.txt önmagában nem blokkol, csak kér. Ha a kereső-bot a második parancsra 403-at vagy 429-et kap, akkor a szervered vagy a CDN-ed tiltja, nem a robots.txt.

Gyakori kérdések

Ha kitiltom a GPTBotot, eltűnök a ChatGPT-ből?
Nem. A GPTBot a tanításhoz gyűjt, a válaszokban való megjelenést az OAI-SearchBot hozza. Ha csak a GPTBotot tiltod, a ChatGPT search továbbra is idézhet. Ha viszont az OAI-SearchBotot is kizárod, akkor tényleg kiesel a forráslistákból.
A Google-Extended tiltása ront a Google-rangsoromon?
Nem. A Google-Extended csak azt vezérli, felhasználható-e a tartalmad a Gemini-modellek tanításához és megalapozásához. A Google Search indexelésére és rangsorolására nincs hatása. A keresőben megjelenő szövegrészleteket a snippet-vezérlők szabályozzák.
Törli a tiltás a már betanult adatot?
Nem. A robots.txt a jövőbeli letöltésekre vonatkozik. Amit egy modell korábban megtanult, vagy ami bekerült egy nyílt adathalmazba, azt ez nem érinti. Ezért érdemes a döntést minél korábban meghozni.
Honnan tudom, hogy tényleg az a bot jött, akinek mondja magát?
A user agent hamisítható. A nagy szolgáltatók publikálnak IP-tartományokat, illetve fordított DNS-lekérdezéssel ellenőrizhető a származás. Ha a botforgalom terheli a szervert, az IP-alapú ellenőrzés a megbízható út, nem a név.
Kell egyáltalán bármit tiltanom egy KKV-honlapon?
A legtöbb esetben nem. Ha a tartalmad marketing célú, a tiltás csak a saját elérésedet csökkenti. Akkor érdemes gondolkodni rajta, ha a szöveg maga a termék, például fizetős tananyag vagy kutatási anyag.

Források

Kapcsolódó fogalmak

A te oldaladon hogy áll a(z) „Tréning-bot vs kereső-bot”?

Futtass egy GEO-auditot: pontszám, fejlesztői ítélet, a leggyorsabb javítások, és minden tételhez bizonyíték.

Ingyenes GEO-audit indítása