A keresőrobot (crawler, bot, spider) olyan automata program, amely HTTP-kéréssel letölti egy weboldal tartalmát, majd a talált linkeket követve továbbhalad. Nem ember, nem kattint, nem vár: azt látja, amit a szerver a kérésére válaszol.
Hogyan működik
A robot egy URL-listából indul. Minden címre HTTP-kérést küld, és megnézi a státuszkódot meg a válasz törzsét. A HTML-ből kiszedi a szöveget, a metaadatokat és a linkeket, ezeket pedig visszateszi a sorba. Ez a ciklus a feltérképezés.
Minden robot azonosítja magát a User-Agent fejlécben. A Googlebot, a Bingbot, a GPTBot vagy a PerplexityBot mind külön néven jelenik meg a szerver logjában. Ezért tudsz robotonként eltérő szabályt adni a robots.txt fájlban.
Mit lát és mit nem
A legtöbb robot először a nyers HTML-t kapja meg. A Googlebot ezután renderelési sorba teszi az oldalt, és lefuttatja a JavaScriptet. A generatív keresők botjai jellemzően kevésbé türelmesek: sok közülük csak a szerver által küldött HTML-lel dolgozik.
Ebből egy gyakorlati szabály következik. Ha a fő tartalom csak JS után jelenik meg, azt a robotok egy része soha nem látja. A riportokban ezt főleg React- és Vue-alapú KKV-oldalakon látjuk.
Miért nem mindegy, melyik robot jön
A klasszikus keresőrobot azért jön, hogy indexeljen, és később forgalmat küldjön. Az AI-crawlerek egy része tanítóanyagot gyűjt, másik része élő válaszhoz keres forrást. A különbséget a tréning-bot vs kereső-bot írás bontja ki. Ugyanaz a tiltás az egyiknél költség, a másiknál elveszett említés.
Röviden: a keresőrobot az a látogató, aki a nyers HTTP-választ olvassa, és pontosan azt hiszi el rólad, amit abban talál.