Technikai alapok Szakszó

robots.txt

Szerző: · 7 perc olvasás · Frissítve:
robots.txt - Technikai alapok (szakszó) a tudástárban
robots.txt - Technikai alapok | eClick GEO-audit tudástár

A robots.txt egy sima szöveges fájl a domain gyökerében, ami megmondja a robotoknak, mely URL-eket térképezhetik fel és melyeket nem. Mindig a https://domain.hu/robots.txt címen kell elérhetőnek lennie, más útvonalon a robotok nem keresik.

Hogyan működik

A fájl User-agent blokkokból áll. Minden blokk egy robotra vagy robot-csoportra vonatkozik, alatta Disallow és Allow sorok jelölik az útvonalakat. A robot a legjobban illeszkedő blokkot választja ki magának, nem az összeset alkalmazza egyszerre.

A szabály önkéntes megállapodás, nem technikai zár. A komoly keresőrobotok betartják, a kártékony scraperek nem. Ha valamit tényleg el kell zárni, azt jelszó vagy szerveroldali korlátozás védi, nem a robots.txt.

Amit a robots.txt nem tud

Ez a leggyakoribb félreértés: a robots.txt a feltérképezést tiltja, nem az indexelést. Ha egy letiltott URL-re máshonnan link mutat, a Google indexelheti a címet tartalom nélkül. Ilyenkor a találati oldalon megjelenik az URL egy „nincs leírás” jellegű sorral.

Az indexelés kizárására a noindex, meta robots és X-Robots-Tag való. A kettő együtt viszont nem működik: ha a robots.txt tiltja az oldalt, a robot be sem olvassa a noindex meta taget. Aminek nem szabad indexbe kerülnie, annak feltérképezhetőnek kell maradnia.

Miért számít a generatív keresőknek

A nyelvi modellek mögött álló AI-crawlerek (GPTBot, ClaudeBot, PerplexityBot és társaik) ugyanezt a fájlt olvassák. A GPTBot, a ClaudeBot, a PerplexityBot és társaik saját User-agent névvel jelentkeznek. Itt dől el, hogy a tartalmad bekerülhet-e egy AI-válaszba forrásként. Egy elgépelt vagy túl szigorú szabály csendben kizár a generatív találatokból.

Röviden: a robots.txt a feltérképezés forgalomirányítója, nem az indexelés zárja.

Miért fontos

Ami múlik rajta

Egy rossz sor a robots.txt-ben az egész oldalt kiveheti a keresőből. A User-agent: * és Disallow: / páros minden robotot kizár. Éles oldalon ez kapu-szabály: amíg ott van, a többi optimalizálás értelmetlen.

A gyakorlatban ez nem elméleti kockázat. A fejlesztői környezetből élesítéskor gyakran ottmarad a teljes tiltás. Hetekig senki nem veszi észre, közben az organikus forgalom elfogy.

AI-oldalról

A generatív keresők forrásmegjelölése crawl-alapú. Ha a robots.txt kizárja a keresőrobotjaikat, a márkád nem tud forrásként megjelenni. Ez nem rangsorolási hátrány, hanem teljes hiány.

A pozitív oldal

A fájl a XML sitemap bejelentésének standard helye is. Egy Sitemap: sorral megmutatod minden robotnak, hol kezdje. A magyar KKV-oldalak többségén ez a sor hiányzik, pedig egy perc alatt pótolható.

Kikre vonatkozik

Kikre vonatkozik

  • Minden éles weboldalra. Nincs olyan publikus oldal, ahol a robots.txt hiánya vagy hibája ne számítana.
  • Webshopokra fokozottan. A szűrt listaoldalak és a paraméteres URL-ek feltérképezési kapacitást égetnek.
  • Nagy oldalakra. Ezer oldal felett a crawl budget kezelése valódi tényező.

Ahol más a helyzet

Staging és fejlesztői címeken a teljes tiltás szándékos lehet. Ilyenkor a hiba-jelzés félrevezető: a vizsgálat nem tudja eldönteni, mi a cél. Ezt nem ellenőrizhető állapotként érdemes kezelni, nem hibaként.

Egyetlen landing oldalnál a finomhangolás túlzás. Ott elég egy minimális fájl a sitemap-hivatkozással.

Hogyan ellenőrzöd

Lépések

  1. Nyisd meg böngészőben a https://domain.hu/robots.txt címet. Sima szöveget kell látnod, nem 404-et és nem HTML-t.
  2. Nézd meg a státuszkódot: curl -I https://domain.hu/robots.txt. A válasz 200 legyen, a Content-Type pedig text/plain.
  3. Keresd a Disallow: / sort. Ha User-agent: * alatt áll, minden robot ki van zárva.
  4. Ellenőrizd a Sitemap: sort. Teljes, abszolút URL-nek kell lennie.
  5. A Search Console robots.txt jelentésében nézd meg, mit lát a Google. Ott a feldolgozás dátuma és az esetleges hibák is látszanak.
  6. Egy konkrét URL-t az URL-ellenőrző eszközzel tesztelj. Megmondja, blokkolja-e a robots.txt.

Jó jel

  • 200-as státusz, text/plain típus
  • Nincs globális Disallow: / élesben
  • Van legalább egy Sitemap: sor abszolút URL-lel
  • Az admin- és kosár-útvonalak célzottan tiltva

Rossz jel

  • 404 vagy 500 a fájlra (a 500-at a Google átmeneti teljes tiltásként is kezelheti)
  • HTML-oldal válaszol robots.txt helyett
  • Disallow: / a csillagos blokkban
  • A CSS- és JS-könyvtárak tiltva vannak, így a robot nem látja a kirenderelt oldalt
  • A fájl nem a gyökérben van, hanem almappában

Hogyan javítod

WordPress

  1. Nézd meg a Beállítások > Olvasás menüben a „Keresőmotorok láthatósága” jelölőnégyzetet. Ha be van pipálva, vedd ki. Ez a leggyakoribb ok.
  2. Ha Yoast vagy Rank Math fut, a fájlt a plugin eszközei között szerkesztheted.
  3. Ha van fizikai robots.txt a gyökérben, az felülírja a virtuálisat. FTP-vel vagy fájlkezelővel javítsd.
  4. Ellenőrizd, hogy a sitemap URL a plugin által generált címre mutat.

Shopify

  1. A fájl alapból generált és tartalmazza a sitemap sort.
  2. Módosításhoz a téma kódjában hozz létre robots.txt.liquid sablont.
  3. Csak indokolt esetben nyúlj hozzá, az alapértelmezés a legtöbb boltnak megfelelő.

Unas

  1. Az adminban a beállítások között kereshető a robots.txt szerkesztő.
  2. A rendszer generálja az alapokat, a saját sorokat ide írd be.
  3. Élesítés után nézd meg publikus címen is a tartalmat.

Shoprenter

  1. Az admin SEO-beállításainál található a robots.txt tartalma.
  2. Mentés után ürítsd a gyorsítótárat, majd ellenőrizd a publikus fájlt.

Egyedi fejlesztés

  1. Tedd a fájlt a webszerver document rootjába. Ne alkalmazás-route generálja, ha elkerülhető.
  2. Élesítéskor környezetfüggő legyen a tartalom. A staging kapjon teljes tiltást, az éles ne.
  3. Vedd fel a deploy-ellenőrzésbe: éles domainen tilos a Disallow: /.
  4. Minimum tartalom: engedélyező alapszabály plusz a sitemap sor.

Minden platformon ugyanaz a cél: legyen robots.txt fájl, ne tiltsa az indexelést, és hivatkozzon a sitemapre.

Gyakori hibák

  • Élesítéskor ottmaradt teljes tiltás - a Disallow: / napok alatt kiüríti a keresőtalálatokat.
  • Robots.txt-vel próbálnak noindexelni - a blokkolt oldal URL-je így is bekerülhet az indexbe, leírás nélkül.
  • Egyszerre tiltás és noindex - a robot be sem olvassa a meta taget, mert nem tölti le az oldalt.
  • Hiányzó Sitemap sor - a robotnak nehezebb dolga van, pedig egy sorral segíthetnél.
  • CSS és JS letiltása - a kereső nem látja a kirenderelt oldalt, torzul a mobilbarát értékelés.
  • Relatív sitemap-útvonal - a szabvány abszolút URL-t vár, a relatív hivatkozást a robot figyelmen kívül hagyja.
  • AI-botok vak kizárása - a User-agent: GPTBot tiltás a generatív találatokból is kivesz, nem csak a tréningből.

Technikai példa

Egy működő, minimális robots.txt egy webshopnak:

User-agent: *
Allow: /
Disallow: /kosar
Disallow: /penztar
Disallow: /kereses
Disallow: /*?orderby=

Sitemap: https://domain.hu/sitemap.xml

Az Allow: / explicit engedély, a Disallow sorok a tranzakciós és szűrt oldalakat zárják ki. A Sitemap sor abszolút URL, és a User-agent blokkoktól függetlenül érvényes.

Ellenőrzés parancssorból:

curl -sI https://domain.hu/robots.txt | head -n 3
curl -s https://domain.hu/robots.txt | grep -iE "disallow: /$|sitemap:"

Az első parancs a státuszkódot és a fejléceket mutatja. A második kiszűri a teljes tiltást és a sitemap sort. Ha az első grep találatot ad Disallow: / sorra, azonnal nézd meg, melyik User-agent blokkban van.

Mit néz ebből a riport

A riport a „robots.txt elérhetőség” szabállyal vizsgálja a fájlt: létezik-e, és nem tiltja-e az indexelést. A hatás alacsony, a hatókör kód. Ha éles címen teljes tiltást talál, az kapu-szabályként kritikus jelzést kap. Staging címen ugyanez nem ellenőrizhetőként jelenik meg, mert szándékos is lehet.

Gyakori kérdések

Kötelező robots.txt fájl?
Nem kötelező, a hiánya nem hiba önmagában. Ha nincs, a robotok mindent feltérképezhetnek. Viszont érdemes létrehozni, mert a sitemap bejelentésének ez a standard helye, és a felesleges útvonalakat is itt zárhatod ki.
Ha letiltom robots.txt-ben, eltűnik a Google-ból?
Nem feltétlenül. A tiltás a feltérképezést akadályozza, nem az indexelést. Egy már indexelt oldal bent maradhat, csak leírás nélkül jelenik meg. Kivételhez a noindex kell, és ahhoz a robotnak le kell tudnia tölteni az oldalt.
Kizárjam az AI-botokat?
Ez üzleti döntés, nem technikai. A tréning-botok és a kereső-botok különválnak: az utóbbiak forrásmegjelöléssel hoznak látogatót. Ha kizárod őket, a márkád nem jelenhet meg az AI-válaszokban. A legtöbb oldalnak a kereső-botokat érdemes beengednie.
Milyen gyorsan veszi észre a Google a módosítást?
A Google általában 24 óránként frissíti a gyorsítótárazott robots.txt-t. A Search Console robots.txt jelentésében látod az utolsó letöltés időpontját és a feldolgozott tartalmat. Sürgős javításnál ott kérheted az újraolvasást.
Mi a baj a szűrt webshop-oldalak feltérképezésével?
A paraméteres kombinációkból tízezrével keletkezhetnek URL-ek. A robot ezekre pazarolja az idejét a valódi termékoldalak helyett. A szűrő-paraméterek robots.txt-ben való kizárása a legegyszerűbb védekezés.

Források

Kapcsolódó fogalmak

A te oldaladon hogy áll a(z) „robots.txt”?

Futtass egy SEO-auditot: pontszám, fejlesztői ítélet, a leggyorsabb javítások, és minden tételhez bizonyíték.

Ingyenes SEO-audit indítása