Alapok Szakszó

Crawl (feltérképezés)

Szerző: · 7 perc olvasás · Frissítve:
Crawl (feltérképezés) - Alapok (szakszó) a tudástárban
Crawl (feltérképezés) - Alapok | eClick GEO-audit tudástár

A crawl az a folyamat, amikor egy automata program HTTP-kéréssel letölti egy weboldal címeit, majd a talált linkeket követve újabb URL-eket kér le. Feltérképezés nélkül nincs semmi más: amit a robot nem töltött le, azt nem is tudja feldolgozni.

Hogyan működik

A robot egy várólistából dolgozik. Ebbe kerülnek a már ismert címek, a XML sitemap bejegyzései és a frissen felfedezett linkek. Minden URL-re küld egy kérést, és a válaszból ezeket nézi:

  • a státuszkódot (200, 301, 404, 500)
  • a válaszfejléceket
  • a HTML-törzset

A HTML-ből kiszedi a hivatkozásokat, és a sorba teszi őket. A ciklus ismétlődik. A letöltés után külön lépés a renderelés, és megint külön az indexelés. Attól, hogy egy oldalt feltérképeztek, még nem lesz belőle találat.

Mi szabja meg a crawl mennyiségét

Két dolog együtt: mennyit bír el a szervered, és mennyit tart érdemesnek a robot. Lassú válaszidő vagy sok 5xx hiba után a Google visszavesz a tempóból. Az értéktelen, duplikált vagy végtelen paraméteres címek elszívják a keretet az igazi tartalom elől. Egy pár száz oldalas KKV-oldalon ez ritkán szűk keresztmetszet. Tízezer termék felett viszont napi szintű probléma.

Miért más ez a generatív keresőknél

Az AI-rendszerek nem egy robotot küldenek, hanem többfélét. Van, amelyik tréningadatot gyűjt, és van, amelyik egy konkrét kérdés miatt jön le élőben. A válaszidő itt keményebb korlát: a valós idejű lekérés pár másodperc után feladja. A robots.txt soraidban külön user-agentekkel találkozol, ezekről az AI-crawlerek (GPTBot, ClaudeBot, PerplexityBot és társaik) cikkben van több.

Mit néz ebből a riport

Az audit lekéri a kezdőlapot és néhány fontos aloldalt, és rögzíti a státuszkódot, a válaszidőt és a robots-szabályokat. Ha egy cím blokkolt vagy időtúllépéssel válaszol, a többi szabály sem tud lefutni rá. Ezért kerül a feltérképezhetőség a riport elejére.

Röviden: a crawl az a pillanat, amikor a robot letölti az oldalad, és minden más lépés ezután következik.

Miért fontos

A feltérképezés a nulladik lépés. Ha elakad, hiába jó a szöveg, a séma vagy a design.

Konkrét következmények, ha rosszul megy a crawl:

  • Új oldalak késnek. Egy friss szolgáltatásoldal hetekig nem jelenik meg a találatok között.
  • Régi állapot ragad be. Az árváltozás vagy a lecserélt telefonszám sokáig a régi verzióval él tovább.
  • Az AI-válaszok kimaradnak. A valós idejű lekérés időtúllépés esetén egyszerűen nem tér vissza tartalommal.
  • Elpazarolt kapacitás. A robot szűrőoldalakat és keresési találati URL-eket töltöget a termékoldalak helyett.

A riportokban ezt látjuk a leggyakrabban: egy fejlesztői környezetből örökölt tiltás marad az éles oldalon. A hiba egy sor, a hatás teljes láthatatlanság.

Kikre vonatkozik

Vonatkozik rá minden nyilvános weboldal. Blog, céges bemutatkozó oldal, webshop, portál. Ha azt akarod, hogy a Google vagy egy AI-asszisztens ismerje a tartalmad, feltérképezhetőnek kell lennie.

Különösen érzékeny terület:

  • Nagy webshopok. Sok ezer termék, szűrők, paraméteres URL-ek, gyorsan fogy a keret.
  • Több nyelvű oldalak. Minden nyelvi változat külön feltérképezendő címhalmaz.
  • JavaScript-alapú frontendek. A nyers HTML gyakran üres, a robot pedig nem mindig renderel.

Nem cél a teljes feltérképezés a staging- és fejlesztői környezeteknél. Ott a blokkolás a helyes állapot, de jelszavas védelemmel, nem csak egy robots-sorral. Belső adminfelületek, kosár- és fiókoldalak szintén nem valók a listába.

Hogyan ellenőrzöd

  1. Nyisd meg a robots.txt fájlt a böngészőben: https://pelda.hu/robots.txt. Nézd meg, mit tilt a User-agent: * blokk.
  2. Kérd le a kezdőlapot curl-lel, és nézd a státuszkódot meg a válaszidőt. A -I kapcsoló csak a fejléceket hozza.
  3. Search Console, Oldalak jelentés. Itt látod, mennyi oldal maradt kint és miért.
  4. Search Console, Feltérképezési statisztika. A Beállítások alatt található. Ebből kiderül a napi kérésszám és az átlagos válaszidő.
  5. URL-ellenőrzés eszköz. Egy konkrét címre megmutatja, mikor járt ott a robot, és mit látott.
  6. Szerverlog. A legpontosabb forrás, ha hozzáférsz. Szűrj a Googlebot user-agentre.

Jó jel

  • A fontos oldalak 200-as kóddal válaszolnak
  • A szerver válaszideje 600 ms alatt marad
  • A robots.txt csak admin- és technikai útvonalakat tilt
  • A Search Console szerint a feltérképezett oldalak zöme indexelt

Rossz jel

  • Disallow: / a robots.txt-ben éles oldalon
  • Sok 5xx vagy időtúllépés a feltérképezési statisztikában
  • Átlagos válaszidő másodpercben mérve
  • Több ezer paraméteres cím a feltérképezett listában
  • Fontos oldal, amelyet a robot még soha nem kért le

A HTTP-státuszkódok (200, 301, 404, 500) cikk részletezi, melyik kód mit üzen a robotnak.

Hogyan javítod

WordPress

  1. Beállítások, Olvasás menü. Vedd ki a pipát a „Keresőmotorok láthatóságának tiltása” opciónál.
  2. Yoast vagy Rank Math alatt ellenőrizd a robots.txt tartalmát és a sitemap URL-jét.
  3. Kapcsolj be oldalgyorsítótárat. A gyorsabb válasz több feltérképezést enged.
  4. A keresési találati oldalakat (/?s=) tiltsd le, mert végtelen sok címet generálnak.

WooCommerce

  1. Tiltsd a kosár-, pénztár- és fiók-útvonalakat a robots.txt-ben.
  2. A szűrő- és rendezés-paramétereket zárd ki, vagy tedd őket canonical alá.
  3. Ellenőrizd, hogy a termékkategóriák lapozói elérhetők maradnak.

Shopify

  1. A robots.txt.liquid sablonnal tudod felülírni az alap szabályokat. Óvatosan nyúlj hozzá.
  2. A jelszóvédelmet vedd le indulás után, különben minden oldal zárva marad.
  3. Az automatikus sitemapet add be a Search Console-ba.

Unas

  1. SEO beállítások alatt nézd meg a robots.txt szerkesztőt.
  2. A szűrős és rendezős listaoldalakat zárd ki a feltérképezésből.
  3. Ellenőrizd, hogy a generált sitemap tartalmazza a termékeket.

Shoprenter

  1. Az adminban a keresőoptimalizálás résznél találod a robots.txt kezelését.
  2. A karbantartási mód kikapcsolását külön ellenőrizd élesítés után.
  3. A szűrőparaméteres URL-eket állítsd noindex vagy tiltott állapotra.

Egyedi fejlesztés

  1. Vedd ki a deploy-pipeline-ból a staging robots.txt fájlt. Környezetenként külön fájl kell.
  2. Állíts be szerveroldali gyorsítótárat, hogy a TTFB stabil maradjon.
  3. Ellenőrizd, hogy a nyers HTML tartalmazza a fő szöveget és a linkeket.
  4. Erősítsd a belső linkelést: árva oldalt a robot nem talál meg.
  5. A végtelen naptár- és paraméterkombinációkat zárd ki.

Gyakori hibák

  • Staging robots.txt az éles oldalon. Egy Disallow: / sor teljes eltűnést okoz a találatokból.
  • A robots.txt tiltását indexelés-tiltásnak hiszik. A blokkolt cím továbbra is megjelenhet a találatok között, cím és leírás nélkül. Erre való a noindex, meta robots és X-Robots-Tag.
  • Blokkolt CSS és JS. A robot nem tudja rendesen renderelni az oldalt, és hiányos tartalmat lát.
  • Árva oldalak. Amire egyetlen link sem mutat, azt csak a sitemapből lehet megtalálni, és az sem garancia.
  • Lassú szerver. Ha az átlagos válaszidő másodpercekben mérhető, a robot visszavesz a kérések számából.
  • Paraméterrobbanás. A szűrők több tízezer URL-t generálnak, és felemésztik a keretet.
  • Soft 404 tömeg. A „nincs találat” oldal 200-as kóddal tér vissza, így a robot valós tartalomnak veszi.

Technikai példa

Így nézed meg, mit lát a robot egy konkrét címnél:

curl -sI -A "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)" https://pelda.hu/szolgaltatasok

A válaszban ezt keresed:

HTTP/2 200
content-type: text/html; charset=utf-8
x-robots-tag: all
cache-control: public, max-age=3600

A 200-as kód azt jelenti, hogy a tartalom letölthető. Ha x-robots-tag: noindex szerepel benne, a robot letölti, de nem indexeli.

Egy józan robots.txt éles oldalon:

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /kosar/
Disallow: /penztar/
Disallow: /?s=

Sitemap: https://pelda.hu/sitemap_index.xml

CSS- és JS-könyvtárat ne tilts. Ha a robot nem tudja betölteni a stíluslapot, torz oldalt lát.

Gyakori kérdések

Milyen gyakran térképezi fel a Google az oldalamat?
Nincs fix ütem. Egy ritkán frissülő KKV-oldalnál hetes nagyságrend a jellemző, egy napi tartalmat gyártó hírportálnál percek is lehetnek. A gyakoriságot a frissítési ütem, a szerver teherbírása és az oldal fontossága együtt határozza meg. A Search Console feltérképezési statisztikájában látod a valós számokat.
Ha feltérképezték az oldalt, akkor már indexelve is van?
Nem, ez két külön lépés. A feltérképezés csak a letöltés, az indexelés ezután dönt arról, bekerül-e a találati listába. A Search Console rendszeresen mutat „Feltérképezve, jelenleg nem indexelt” állapotot. Ez általában tartalmi minőségi kérdés, nem technikai hiba.
Kell foglalkoznom a crawl budget kérdésével egy 50 oldalas honlapnál?
Gyakorlatilag nem. A keret pár ezer URL alatt szinte sosem szűk keresztmetszet. Ott a sebesség, a belső linkelés és a tartalom számít jobban. A crawl budget optimalizálása tízezres nagyságrendű oldalszám felett lesz valódi téma.
Blokkoljam az AI-robotokat a robots.txt-ben?
Ez üzleti döntés, nem technikai. Ha azt szeretnéd, hogy az AI-asszisztensek ajánljanak, engedd be a kereső célú botokat. A tréningadat-gyűjtő botokat külön user-agent néven tilthatod, ha ezt fontosnak tartod. A kettő szétválasztásáról a tréning-bot és kereső-bot megkülönböztetés szól.
Miért nem találja a robot néhány aloldalamat?
A leggyakoribb ok, hogy egyetlen link sem mutat rájuk az oldalon belül. Ilyenkor csak a sitemap marad, ami felfedezéshez gyenge jelzés. Nézd meg azt is, hogy a menü nem JavaScriptből épül-e fel kattintás után. A nyers HTML forrásban látható linkekkel dolgozik a robot a legbiztosabban.

Források

Kapcsolódó fogalmak

A te oldaladon hogy áll a(z) „Crawl (feltérképezés)”?

Futtass egy GEO-auditot: pontszám, fejlesztői ítélet, a leggyorsabb javítások, és minden tételhez bizonyíték.

Ingyenes GEO-audit indítása