A tréning-bot az a robot, amely az oldalad szövegét egy nyelvi modell tanítóanyagához gyűjti be, a kereső-bot pedig az, amely egy konkrét kérdés megválaszolásához olvassa, majd idézi az oldaladat. Ugyanarról a szerverről töltenek le HTML-t, de más a céljuk, más a user agent nevük, és külön is szabályozhatók.
Hogyan működik
Mindkettő sima HTTP-kéréssel érkezik, és a user agent stringjében mondja meg, kicsoda. A robots.txt ezekre a nevekre ad engedélyt vagy tiltást, külön blokkokban.
A gyakorlatban három szerepkör létezik:
- Tréning-gyűjtés: GPTBot, ClaudeBot, CCBot. A letöltött szöveg modellek tanítására vagy adathalmazba kerülhet.
- Keresés és idézés: OAI-SearchBot, Claude-SearchBot, PerplexityBot. Ezek töltik fel az asszisztensek találati listáját.
- Felhasználói lekérés: ChatGPT-User és társai. Akkor futnak, amikor valaki konkrétan a te linkedet dobja be egy chatbe.
Miért nem ugyanaz a kettő
Ha tréning-botot tiltasz, a jövőbeli modellek nem tanulnak a szövegedből. Attól még megjelenhetsz a válaszokban, mert az idézés a kereső-bot dolga.
Ha viszont kereső-botot tiltasz, kiesel az idézhető források közül. Ott veszítesz, ahol forgalom, link és márkaemlítés lenne. A riportokban ezt látjuk a leggyakoribb önsebzésnek: valaki bemásol egy "AI-tiltó" robots.txt-t, és a keresőoldali botot is kizárja vele.
A Google külön eset
A Google-Extended nem egy létező crawler, hanem csak egy robots.txt-token. Nem külön kérésekben jelenik meg a logban, hanem azt vezérli, felhasználható-e a Googlebot által már letöltött tartalom a Gemini-modellek tanításához és megalapozásához. A Google Search rangsorolására és indexelésére nincs hatása. Hasonló logikával működik az Applebot-Extended is.
Mikor számít igazán
Kiadónál, online tananyagnál, fizetős tartalomnál valódi döntés, hogy adsz-e ingyen tanítóanyagot. Szolgáltatónál és webshopnál viszont ritkán éri meg bármit tiltani, mert az idézhetőség hozza az ügyfelet. Az AI-crawlerek teljes listája és viselkedése gyorsan változik, ezért érdemes félévente átnézni a szabályokat.
Röviden: a tréning-bot a jövő modelljét eteti, a kereső-bot a ma adott választ, és a kettőt sosem szabad egy szabállyal kezelni.
Technikai példa
Tipikus, jól szétválasztott robots.txt. A tréning-gyűjtés tiltva, a keresés és idézés engedve:
# Tanításra gyujto botok
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
# Keresohoz es idezeshez hasznalt botok: maradnak engedve
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
# Google modell-tanitas kulon token, nem crawler
User-agent: Google-Extended
Disallow: /
User-agent: *
Disallow: /kosar/
Disallow: /penztar/
Disallow: /kereses
Sitemap: https://domained.hu/sitemap.xml
Élő teszt curl-lel. Az első parancs a tiltott, a második az engedett botot utánozza:
curl -s -o /dev/null -w "%{http_code}\n" -A "GPTBot/1.2" https://domained.hu/
curl -s -o /dev/null -w "%{http_code}\n" -A "OAI-SearchBot/1.0" https://domained.hu/
A robots.txt önmagában nem blokkol, csak kér. Ha a kereső-bot a második parancsra 403-at vagy 429-et kap, akkor a szervered vagy a CDN-ed tiltja, nem a robots.txt.
Gyakori kérdések
Ha kitiltom a GPTBotot, eltűnök a ChatGPT-ből?
Nem. A GPTBot a tanításhoz gyűjt, a válaszokban való megjelenést az OAI-SearchBot hozza. Ha csak a GPTBotot tiltod, a ChatGPT search továbbra is idézhet. Ha viszont az OAI-SearchBotot is kizárod, akkor tényleg kiesel a forráslistákból.
A Google-Extended tiltása ront a Google-rangsoromon?
Nem. A Google-Extended csak azt vezérli, felhasználható-e a tartalmad a Gemini-modellek tanításához és megalapozásához. A Google Search indexelésére és rangsorolására nincs hatása. A keresőben megjelenő szövegrészleteket a snippet-vezérlők szabályozzák.
Törli a tiltás a már betanult adatot?
Nem. A robots.txt a jövőbeli letöltésekre vonatkozik. Amit egy modell korábban megtanult, vagy ami bekerült egy nyílt adathalmazba, azt ez nem érinti. Ezért érdemes a döntést minél korábban meghozni.
Honnan tudom, hogy tényleg az a bot jött, akinek mondja magát?
A user agent hamisítható. A nagy szolgáltatók publikálnak IP-tartományokat, illetve fordított DNS-lekérdezéssel ellenőrizhető a származás. Ha a botforgalom terheli a szervert, az IP-alapú ellenőrzés a megbízható út, nem a név.
Kell egyáltalán bármit tiltanom egy KKV-honlapon?
A legtöbb esetben nem. Ha a tartalmad marketing célú, a tiltás csak a saját elérésedet csökkenti. Akkor érdemes gondolkodni rajta, ha a szöveg maga a termék, például fizetős tananyag vagy kutatási anyag.