Alapok Szakszó

Keresőrobot (crawler, bot)

Szerző: · 7 perc olvasás · Frissítve:
Keresőrobot (crawler, bot) - Alapok (szakszó) a tudástárban
Keresőrobot (crawler, bot) - Alapok | eClick GEO-audit tudástár

A keresőrobot (crawler, bot, spider) olyan automata program, amely HTTP-kéréssel letölti egy weboldal tartalmát, majd a talált linkeket követve továbbhalad. Nem ember, nem kattint, nem vár: azt látja, amit a szerver a kérésére válaszol.

Hogyan működik

A robot egy URL-listából indul. Minden címre HTTP-kérést küld, és megnézi a státuszkódot meg a válasz törzsét. A HTML-ből kiszedi a szöveget, a metaadatokat és a linkeket, ezeket pedig visszateszi a sorba. Ez a ciklus a feltérképezés.

Minden robot azonosítja magát a User-Agent fejlécben. A Googlebot, a Bingbot, a GPTBot vagy a PerplexityBot mind külön néven jelenik meg a szerver logjában. Ezért tudsz robotonként eltérő szabályt adni a robots.txt fájlban.

Mit lát és mit nem

A legtöbb robot először a nyers HTML-t kapja meg. A Googlebot ezután renderelési sorba teszi az oldalt, és lefuttatja a JavaScriptet. A generatív keresők botjai jellemzően kevésbé türelmesek: sok közülük csak a szerver által küldött HTML-lel dolgozik.

Ebből egy gyakorlati szabály következik. Ha a fő tartalom csak JS után jelenik meg, azt a robotok egy része soha nem látja. A riportokban ezt főleg React- és Vue-alapú KKV-oldalakon látjuk.

Miért nem mindegy, melyik robot jön

A klasszikus keresőrobot azért jön, hogy indexeljen, és később forgalmat küldjön. Az AI-crawlerek egy része tanítóanyagot gyűjt, másik része élő válaszhoz keres forrást. A különbséget a tréning-bot vs kereső-bot írás bontja ki. Ugyanaz a tiltás az egyiknél költség, a másiknál elveszett említés.

Röviden: a keresőrobot az a látogató, aki a nyers HTTP-választ olvassa, és pontosan azt hiszi el rólad, amit abban talál.

Miért fontos

SEO

Amit egy robot nem tud letölteni, az nem kerül az indexbe. Nincs index, nincs találat, nincs organikus forgalom. Egy rossz robots.txt-sor vagy egy 403-as válasz órák alatt levisz egy egész szekciót.

AI-értelmezhetőség

A generatív keresők ugyanúgy robotokkal dolgoznak. Ha a botjukat kizárod, vagy a szervered időtúllépést ad nekik, az oldalad nem lesz forrás. A márkád akkor sem jelenik meg a válaszban, ha a tartalmad a legjobb a piacon.

Üzlet

A robotforgalom erőforrást fogyaszt. Egy paraméterezett szűrőoldal-halmaz több tízezer felesleges kérést generálhat. Ilyenkor a szerver lassul, a valódi vásárló pedig várakozik. Az ellenkező véglet is drága: teljes tiltásnál nulla a láthatóság.

Kikre vonatkozik

  • Minden nyilvános weboldal: blog, céges oldal, webshop, portál. Ha az URL elérhető az internetről, robotok is jönnek rá.
  • Webshopok: kiemelten, mert sok az URL és sok a szűrő-paraméter. Itt a legnagyobb a pazarlás kockázata.
  • Staging és fejlesztői környezet: ide pont hogy nem akarsz robotot. A tiltást HTTP-alapú jelszóval vagy noindex fejléccel érdemes megoldani, nem csak robots.txt-vel.
  • Bejelentkezés mögötti felületek: a robot nem tud belépni, szóval ezeket a részeket eleve nem látja.
  • Belső hálózaton futó rendszerek: rájuk nem vonatkozik, nem érhetők el kívülről.

Hogyan ellenőrzöd

  1. Nyisd meg a https://domain.hu/robots.txt címet böngészőben. Nézd meg, van-e Disallow: / sor bármelyik User-agent alatt.
  2. Kérd le a főoldalt robotként: curl -A "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)" -I https://domain.hu/. Figyeld a státuszkódot.
  3. Kérd le a HTML-t JavaScript nélkül: curl -s https://domain.hu/ | wc -c. Ha alig pár kilobyte jön, a tartalom kliensoldalon épül.
  4. A Search Console URL-ellenőrzés funkciójával nézd meg egy konkrét oldal feltérképezett változatát.
  5. A Search Console Beállítások / Feltérképezési statisztikák riportjában nézd a válaszidőt és a hibaarányt.
  6. A szerver access logjában szűrj User-Agent szerint, például grep -i gptbot access.log.

Jó jel

  • A robots.txt engedi a fő tartalmat, és hivatkozik az XML sitemapre.
  • A robotkérésre 200-as válasz jön, ugyanazzal a tartalommal, mint a böngészőnek.
  • A nyers HTML-ben ott a szöveg, a H1 és a fő linkek.
  • Az átlagos válaszidő a feltérképezési riportban 500 ms alatt marad.

Rossz jel

  • 403 vagy 429 státusz a robot User-Agentre.
  • Üres <body>, minden tartalom JS-ből jön.
  • A logban csak böngésző-user-agentek vannak hetek óta.
  • A feltérképezési riportban emelkedő 5xx-arány.

Hogyan javítod

WordPress

  1. Beállítások / Olvasás: a „Láthatóság keresőmotorok számára” pipa legyen kikapcsolva.
  2. Yoast vagy Rank Math alatt szerkeszd a virtuális robots.txt-t, és vedd ki a felesleges tiltást.
  3. Biztonsági bővítménynél (Wordfence, iThemes) nézd meg a bot-blokkoló szabályokat. Ezek szokták kizárni az AI-botokat is.
  4. Ha van oldalgyorsító plugin, ellenőrizd, hogy a cache-elt HTML tartalmazza-e a szöveget.

Shopify

  1. A robots.txt a robots.txt.liquid sablonnal szerkeszthető a témakódban.
  2. Csak akkor nyúlj hozzá, ha konkrét okod van. Az alapértelmezés a legtöbb boltnak jó.
  3. A Cloudflare előtti bot-védelmet a Shopify kezeli, a Googlebot engedett.

Unas

  1. Admin / Beállítások / SEO résznél találod a robots.txt szerkesztőt.
  2. A szűrő- és rendezés-paraméteres URL-eket tiltsd, a termék- és kategórialapokat hagyd szabadon.

Shoprenter

  1. Beállítások / SEO alatt szerkeszthető a robots.txt.
  2. A kosár-, pénztár- és fiók-útvonalakat tiltsd le, mert csak feltérképezési keretet visznek.

Egyedi fejlesztés

  1. Tedd statikus fájlba a robots.txt-t, ne generáld futásidőben.
  2. WAF-ban és rate limiterben engedélyezd a hitelesített robotokat IP-alapú ellenőrzés után.
  3. Rate limitnél 429 helyett inkább lassíts, a 429 tartós ismétlése visszafogja a feltérképezést.
  4. SPA esetén használj szerveroldali renderelést vagy prerendert a fő oldalakra.
  5. A robotok kéréseit logold User-Agent és státuszkód szerint, hogy legyen mit nézni.

Gyakori hibák

  • A staging robots.txt kerül élesbe: a Disallow: / sor egy indulás napján kinyírja a teljes indexelést.
  • Bot-blokkolás biztonsági bővítménnyel: a széles szabály a Googlebotot is kizárja, nem csak a scrapereket.
  • User-Agent alapján eltérő tartalom: ez cloaking, és büntetést von maga után.
  • Minden AI-bot azonnali tiltása: a tanító botot és a válaszidéző botot külön kell kezelni, különben feleslegesen esel ki az AI-válaszokból.
  • Kliensoldali renderelés SSR nélkül: a robotok egy része üres oldalt lát, a magyar KKV-oldalak új generációján ezt rendszeresen látjuk.
  • Végtelen URL-tér: naptár, szűrő és rendezés-paraméterek milliónyi címet gyártanak, a robot ezekben elvész.
  • A robots.txt-t titkosításnak hiszik: a tiltott útvonal ettől még nyilvános, aki tudja a címet, megnyitja.

Technikai példa

Robotonként eltérő szabály a robots.txt-ben. A leghosszabb illeszkedő szabály nyer, a csoportok között nincs öröklődés.

User-agent: Googlebot
Allow: /
Disallow: /kosar/
Disallow: /*?rendezes=

User-agent: GPTBot
Disallow: /admin/
Allow: /

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://domain.hu/sitemap.xml

Robotként lekért főoldal fejlécei. Az első parancs azt mutatja meg, mit kap a Googlebot, a második azt, hogy van-e szöveg a nyers HTML-ben.

curl -sI -A "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)" https://domain.hu/
# HTTP/2 200
# content-type: text/html; charset=utf-8
# x-robots-tag: index, follow

curl -s https://domain.hu/ | grep -o "<h1>.*</h1>"

Ha a második parancs nem ad vissza semmit, a H1 kliensoldalon készül. Ez a robotok egy részénél elveszett tartalmat jelent.

Mit néz ebből a riport

Az audit robotként kéri le az oldalt, és rögzíti a státuszkódot meg a válaszidőt. Megnézi a robots.txt szabályait, külön a klasszikus és az AI-botokra. Jelzi, ha a nyers HTML-ben nincs érdemi szöveg.

Gyakori kérdések

Honnan tudom, hogy tényleg a Googlebot jött, nem egy hamisító?
A User-Agent bármikor hamisítható, önmagában nem bizonyíték. A Google fordított DNS-ellenőrzést javasol: a kérés IP-jéből visszafejtett névnek googlebot.com vagy google.com alá kell esnie. A Google publikus IP-listát is közzétesz, ehhez is illesztheted a kérést. Ugyanez a logika a Bingbotra és a nagyobb AI-botokra is működik.
Tiltsam ki az AI-botokat?
Attól függ, melyiket. A tanításra gyűjtő botok tiltása nem befolyásolja a keresőben elért forgalmadat. A válaszidézéshez használt botok tiltása viszont azt jelenti, hogy nem jelenhetsz meg forrásként az AI-válaszokban. Nézd meg a tréning-bot vs kereső-bot különbséget, és botonként dönts.
A robots.txt tiltás azt jelenti, hogy az oldal nem kerül a Google-be?
Nem feltétlenül. A tiltás a letöltést akadályozza, nem az indexelést. Ha más oldal linkel rá, a cím megjelenhet a találatok között leírás nélkül. Ha biztosan ki akarsz zárni egy oldalt, noindex jelölést használj, és engedd, hogy a robot letöltse.
Mennyi robotforgalom számít normálisnak?
Nincs univerzális szám, de az arány árulkodó. Egy pár száz oldalas céges oldalnál napi néhány száz robotkérés bőven elég. Ha ez tízezres nagyságrendbe ugrik, szinte biztosan paraméteres URL-eket vagy végtelen naptárat térképez fel valami. Ilyenkor a feltérképezési keretet URL-szinten érdemes rendezni.
A robot látja a cookie-banner mögötti tartalmat?
A robot nem kattint, szóval a sütikérést soha nem fogadja el. Ha a banner blokkolja a tartalom megjelenését, a robot üres vagy hiányos oldalt lát. A megoldás: a fő tartalom legyen a HTML-ben, a banner pedig overlay rétegként jelenjen meg felette.

Források

Kapcsolódó fogalmak

A te oldaladon hogy áll a(z) „Keresőrobot (crawler, bot)”?

Futtass egy GEO-auditot: pontszám, fejlesztői ítélet, a leggyorsabb javítások, és minden tételhez bizonyíték.

Ingyenes GEO-audit indítása