A robots.txt egy sima szöveges fájl a domain gyökerében, ami megmondja a robotoknak, mely URL-eket térképezhetik fel és melyeket nem. Mindig a https://domain.hu/robots.txt címen kell elérhetőnek lennie, más útvonalon a robotok nem keresik.
Hogyan működik
A fájl User-agent blokkokból áll. Minden blokk egy robotra vagy robot-csoportra vonatkozik, alatta Disallow és Allow sorok jelölik az útvonalakat. A robot a legjobban illeszkedő blokkot választja ki magának, nem az összeset alkalmazza egyszerre.
A szabály önkéntes megállapodás, nem technikai zár. A komoly keresőrobotok betartják, a kártékony scraperek nem. Ha valamit tényleg el kell zárni, azt jelszó vagy szerveroldali korlátozás védi, nem a robots.txt.
Amit a robots.txt nem tud
Ez a leggyakoribb félreértés: a robots.txt a feltérképezést tiltja, nem az indexelést. Ha egy letiltott URL-re máshonnan link mutat, a Google indexelheti a címet tartalom nélkül. Ilyenkor a találati oldalon megjelenik az URL egy „nincs leírás” jellegű sorral.
Az indexelés kizárására a noindex, meta robots és X-Robots-Tag való. A kettő együtt viszont nem működik: ha a robots.txt tiltja az oldalt, a robot be sem olvassa a noindex meta taget. Aminek nem szabad indexbe kerülnie, annak feltérképezhetőnek kell maradnia.
Miért számít a generatív keresőknek
A nyelvi modellek mögött álló AI-crawlerek (GPTBot, ClaudeBot, PerplexityBot és társaik) ugyanezt a fájlt olvassák. A GPTBot, a ClaudeBot, a PerplexityBot és társaik saját User-agent névvel jelentkeznek. Itt dől el, hogy a tartalmad bekerülhet-e egy AI-válaszba forrásként. Egy elgépelt vagy túl szigorú szabály csendben kizár a generatív találatokból.
Röviden: a robots.txt a feltérképezés forgalomirányítója, nem az indexelés zárja.
Miért fontos
Ami múlik rajta
Egy rossz sor a robots.txt-ben az egész oldalt kiveheti a keresőből. A User-agent: * és Disallow: / páros minden robotot kizár. Éles oldalon ez kapu-szabály: amíg ott van, a többi optimalizálás értelmetlen.
A gyakorlatban ez nem elméleti kockázat. A fejlesztői környezetből élesítéskor gyakran ottmarad a teljes tiltás. Hetekig senki nem veszi észre, közben az organikus forgalom elfogy.
AI-oldalról
A generatív keresők forrásmegjelölése crawl-alapú. Ha a robots.txt kizárja a keresőrobotjaikat, a márkád nem tud forrásként megjelenni. Ez nem rangsorolási hátrány, hanem teljes hiány.
A pozitív oldal
A fájl a XML sitemap bejelentésének standard helye is. Egy Sitemap: sorral megmutatod minden robotnak, hol kezdje. A magyar KKV-oldalak többségén ez a sor hiányzik, pedig egy perc alatt pótolható.
Technikai példa
Egy működő, minimális robots.txt egy webshopnak:
User-agent: *
Allow: /
Disallow: /kosar
Disallow: /penztar
Disallow: /kereses
Disallow: /*?orderby=
Sitemap: https://domain.hu/sitemap.xml
Az Allow: / explicit engedély, a Disallow sorok a tranzakciós és szűrt oldalakat zárják ki. A Sitemap sor abszolút URL, és a User-agent blokkoktól függetlenül érvényes.
Ellenőrzés parancssorból:
curl -sI https://domain.hu/robots.txt | head -n 3
curl -s https://domain.hu/robots.txt | grep -iE "disallow: /$|sitemap:"
Az első parancs a státuszkódot és a fejléceket mutatja. A második kiszűri a teljes tiltást és a sitemap sort. Ha az első grep találatot ad Disallow: / sorra, azonnal nézd meg, melyik User-agent blokkban van.
Mit néz ebből a riport
A riport a „robots.txt elérhetőség” szabállyal vizsgálja a fájlt: létezik-e, és nem tiltja-e az indexelést. A hatás alacsony, a hatókör kód. Ha éles címen teljes tiltást talál, az kapu-szabályként kritikus jelzést kap. Staging címen ugyanez nem ellenőrizhetőként jelenik meg, mert szándékos is lehet.
Gyakori kérdések
Kötelező robots.txt fájl?
Nem kötelező, a hiánya nem hiba önmagában. Ha nincs, a robotok mindent feltérképezhetnek. Viszont érdemes létrehozni, mert a sitemap bejelentésének ez a standard helye, és a felesleges útvonalakat is itt zárhatod ki.
Ha letiltom robots.txt-ben, eltűnik a Google-ból?
Nem feltétlenül. A tiltás a feltérképezést akadályozza, nem az indexelést. Egy már indexelt oldal bent maradhat, csak leírás nélkül jelenik meg. Kivételhez a noindex kell, és ahhoz a robotnak le kell tudnia tölteni az oldalt.
Kizárjam az AI-botokat?
Ez üzleti döntés, nem technikai. A tréning-botok és a kereső-botok különválnak: az utóbbiak forrásmegjelöléssel hoznak látogatót. Ha kizárod őket, a márkád nem jelenhet meg az AI-válaszokban. A legtöbb oldalnak a kereső-botokat érdemes beengednie.
Milyen gyorsan veszi észre a Google a módosítást?
A Google általában 24 óránként frissíti a gyorsítótárazott robots.txt-t. A Search Console robots.txt jelentésében látod az utolsó letöltés időpontját és a feldolgozott tartalmat. Sürgős javításnál ott kérheted az újraolvasást.
Mi a baj a szűrt webshop-oldalak feltérképezésével?
A paraméteres kombinációkból tízezrével keletkezhetnek URL-ek. A robot ezekre pazarolja az idejét a valódi termékoldalak helyett. A szűrő-paraméterek robots.txt-ben való kizárása a legegyszerűbb védekezés.