A crawl az a folyamat, amikor egy automata program HTTP-kéréssel letölti egy weboldal címeit, majd a talált linkeket követve újabb URL-eket kér le. Feltérképezés nélkül nincs semmi más: amit a robot nem töltött le, azt nem is tudja feldolgozni.
Hogyan működik
A robot egy várólistából dolgozik. Ebbe kerülnek a már ismert címek, a XML sitemap bejegyzései és a frissen felfedezett linkek. Minden URL-re küld egy kérést, és a válaszból ezeket nézi:
- a státuszkódot (200, 301, 404, 500)
- a válaszfejléceket
- a HTML-törzset
A HTML-ből kiszedi a hivatkozásokat, és a sorba teszi őket. A ciklus ismétlődik. A letöltés után külön lépés a renderelés, és megint külön az indexelés. Attól, hogy egy oldalt feltérképeztek, még nem lesz belőle találat.
Mi szabja meg a crawl mennyiségét
Két dolog együtt: mennyit bír el a szervered, és mennyit tart érdemesnek a robot. Lassú válaszidő vagy sok 5xx hiba után a Google visszavesz a tempóból. Az értéktelen, duplikált vagy végtelen paraméteres címek elszívják a keretet az igazi tartalom elől. Egy pár száz oldalas KKV-oldalon ez ritkán szűk keresztmetszet. Tízezer termék felett viszont napi szintű probléma.
Miért más ez a generatív keresőknél
Az AI-rendszerek nem egy robotot küldenek, hanem többfélét. Van, amelyik tréningadatot gyűjt, és van, amelyik egy konkrét kérdés miatt jön le élőben. A válaszidő itt keményebb korlát: a valós idejű lekérés pár másodperc után feladja. A robots.txt soraidban külön user-agentekkel találkozol, ezekről az AI-crawlerek (GPTBot, ClaudeBot, PerplexityBot és társaik) cikkben van több.
Mit néz ebből a riport
Az audit lekéri a kezdőlapot és néhány fontos aloldalt, és rögzíti a státuszkódot, a válaszidőt és a robots-szabályokat. Ha egy cím blokkolt vagy időtúllépéssel válaszol, a többi szabály sem tud lefutni rá. Ezért kerül a feltérképezhetőség a riport elejére.
Röviden: a crawl az a pillanat, amikor a robot letölti az oldalad, és minden más lépés ezután következik.
Technikai példa
Így nézed meg, mit lát a robot egy konkrét címnél:
curl -sI -A "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)" https://pelda.hu/szolgaltatasok
A válaszban ezt keresed:
HTTP/2 200
content-type: text/html; charset=utf-8
x-robots-tag: all
cache-control: public, max-age=3600
A 200-as kód azt jelenti, hogy a tartalom letölthető. Ha x-robots-tag: noindex szerepel benne, a robot letölti, de nem indexeli.
Egy józan robots.txt éles oldalon:
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /kosar/
Disallow: /penztar/
Disallow: /?s=
Sitemap: https://pelda.hu/sitemap_index.xml
CSS- és JS-könyvtárat ne tilts. Ha a robot nem tudja betölteni a stíluslapot, torz oldalt lát.
Gyakori kérdések
Milyen gyakran térképezi fel a Google az oldalamat?
Nincs fix ütem. Egy ritkán frissülő KKV-oldalnál hetes nagyságrend a jellemző, egy napi tartalmat gyártó hírportálnál percek is lehetnek. A gyakoriságot a frissítési ütem, a szerver teherbírása és az oldal fontossága együtt határozza meg. A Search Console feltérképezési statisztikájában látod a valós számokat.
Ha feltérképezték az oldalt, akkor már indexelve is van?
Nem, ez két külön lépés. A feltérképezés csak a letöltés, az indexelés ezután dönt arról, bekerül-e a találati listába. A Search Console rendszeresen mutat „Feltérképezve, jelenleg nem indexelt” állapotot. Ez általában tartalmi minőségi kérdés, nem technikai hiba.
Kell foglalkoznom a crawl budget kérdésével egy 50 oldalas honlapnál?
Gyakorlatilag nem. A keret pár ezer URL alatt szinte sosem szűk keresztmetszet. Ott a sebesség, a belső linkelés és a tartalom számít jobban. A crawl budget optimalizálása tízezres nagyságrendű oldalszám felett lesz valódi téma.
Blokkoljam az AI-robotokat a robots.txt-ben?
Ez üzleti döntés, nem technikai. Ha azt szeretnéd, hogy az AI-asszisztensek ajánljanak, engedd be a kereső célú botokat. A tréningadat-gyűjtő botokat külön user-agent néven tilthatod, ha ezt fontosnak tartod. A kettő szétválasztásáról a tréning-bot és kereső-bot megkülönböztetés szól.
Miért nem találja a robot néhány aloldalamat?
A leggyakoribb ok, hogy egyetlen link sem mutat rájuk az oldalon belül. Ilyenkor csak a sitemap marad, ami felfedezéshez gyenge jelzés. Nézd meg azt is, hogy a menü nem JavaScriptből épül-e fel kattintás után. A nyers HTML forrásban látható linkekkel dolgozik a robot a legbiztosabban.