A GPTBot az OpenAI feltérképező robotja, amely nyilvános weboldalakat tölt le azért, hogy a tartalom a modellek tanítóanyagába kerülhessen. Nem ez a bot állítja össze a ChatGPT válaszait, és nem ez felel a ChatGPT keresőjének találataiért.
Hogyan működik
A GPTBot úgy viselkedik, mint bármelyik keresőrobot: HTTP-kérésekkel végigjárja az oldalaidat, és elmenti a HTML-t. Letöltés előtt megnézi a domain /robots.txt állományát, és tiszteletben tartja az ott talált szabályokat.
Azonosítani a user agent alapján tudod. A kérés fejlécében a GPTBot token szerepel, a teljes sztring pedig egy verziószámot és egy OpenAI-URL-t is tartalmaz. Az OpenAI publikálja a botjai IP-tartományait, így a hamisított kéréseket ki lehet szűrni.
Miben más, mint egy kereső-bot
A GPTBot célja az adatgyűjtés, nem a válaszadás. Amit ma letölt, az legfeljebb egy későbbi modellverzióban jelenhet meg, tömörítve és forrásmegjelölés nélkül. Ezzel szemben az OAI-SearchBot egy kereshető indexet épít, a ChatGPT-User pedig akkor indul el, amikor egy felhasználó kérdése miatt kell friss oldal. A különbségről bővebben a tréning-bot vs kereső-bot szól.
Ebből következik a leggyakoribb félreértés: a GPTBot tiltása nem vesz el a ChatGPT-ben megjelenő hivatkozásaidból. Azokat másik bot hozza.
Mikor számít igazán a döntés
Ha a tartalom maga a termék, akkor van értelme mérlegelni. Ilyen a fizetős szakmai anyag, a nagy cikkarchívum vagy a saját kutatás. A magyar KKV-oldalak többségénél viszont a tiltás inkább veszteség: a márkád így ki sem kerül a modellek szövegvilágába. A többi robotról az AI-crawlerek (GPTBot, ClaudeBot, PerplexityBot és társaik) cikk ad áttekintést.
Mit néz ebből a riport
Az audit lekéri a robots.txt fájlt, és szabályonként megnézi, melyik AI-bot kap tiltást. Külön jelzi, ha a GPTBot tiltva van, de a kereső-botok nem, és azt is, ha egy globális Disallow: / mindent elzár. A riport nem minősíti jónak vagy rossznak a tiltást, hanem azt mutatja meg, hogy tudatos döntés vagy véletlen melléktermék.
Röviden: a GPTBot tanuláshoz gyűjt anyagot, nem válaszol, ezért a tiltása a jövőbeli jelenlétedet érinti, nem a mai forgalmadat.
Technikai példa
Külön csoport a tréning-botnak, a kereső-botok pedig maradnak engedve. A csoportokat üres sor választja el.
# robots.txt
# Tanito celu letoltes tiltasa
User-agent: GPTBot
Disallow: /
# Keresohasznalat engedelyezve marad
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
Sitemap: https://pelda.hu/sitemap.xml
Részleges tiltás, ha csak bizonyos könyvtárakat védenél:
User-agent: GPTBot
Disallow: /tudastar/premium/
Disallow: /fiok/
Allow: /
Ellenőrzés parancssorból. Az első hívás a tényleges státuszkódot mutatja, a második a logban keresi a bot nyomát.
curl -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.2; +https://openai.com/gptbot" -I https://pelda.hu/
grep -i "GPTBot" /var/log/nginx/access.log | tail -20
A 200 azt jelenti, hogy a szerver kiszolgálja a botot. A 403 vagy 429 szerveroldali blokkolásra utal, ami független a robots.txt tartalmától.
Gyakori kérdések
Ha tiltom a GPTBotot, eltűnök a ChatGPT-ből?
Nem. A ChatGPT válaszaiban megjelenő hivatkozásokat más botok hozzák, elsősorban az OAI-SearchBot és a ChatGPT-User. A GPTBot tiltása a jövőbeli modellek tanítóanyagára hat. A mai forgalmadon nem fog látszani.
Kiszedhetem a tartalmam abból, amit a GPTBot korábban letöltött?
A robots.txt csak a jövőbeli letöltéseket állítja meg. Ami már bekerült egy betanított modellbe, azt egy fájlszerkesztéssel nem lehet onnan eltávolítani. Ha jogi igényed van, azt közvetlenül a szolgáltatóval kell rendezni.
Honnan tudom, hogy tényleg a GPTBot jár nálam, nem valaki más?
A user agent hamisítható, ezért önmagában nem bizonyíték. Az OpenAI publikálja a botjai IP-tartományait, ezeket érdemes összevetni a log IP-címeivel. Ha egy kérés GPTBotnak vallja magát, de ismeretlen tartományból jön, kezeld gyanúsan.
Terheli a szerveremet a GPTBot?
Normál esetben mérsékelten. Nagy oldalakon viszont érdemes figyelni a kéréssűrűséget, és szükség esetén CDN vagy cache mögé tenni a kiszolgálást. Ha a terhelés tartósan zavaró, részleges tiltás is megoldás.
Kell külön llms.txt is, ha már van robots.txt-m?
A kettő nem ugyanaz. A robots.txt a hozzáférést szabályozza, az llms.txt pedig egy javasolt tartalmi útmutató, amit nem minden bot használ. A hozzáférési döntést mindig a robots.txt és a szerveroldali szabályok hordozzák.