AI-értelmezhetőség Szakszó

CCBot (Common Crawl)

Szerző: · 7 perc olvasás · Frissítve:
CCBot (Common Crawl) - AI-értelmezhetőség (szakszó) a tudástárban
CCBot (Common Crawl) - AI-értelmezhetőség | eClick GEO-audit tudástár

A CCBot a Common Crawl nonprofit szervezet webrobotja, amely nyilvános, bárki által ingyen letölthető webarchívumot épít a feltérképezett oldalakból. Ez az archívum az elmúlt évek legtöbb nagy nyelvi modelljének tanítóanyagában szerepelt, ezért a CCBot közvetve az AI-k egyik legfontosabb adatforrása.

Hogyan működik

A CCBot időről időre végigjárja a web nyilvános részét, és nyers HTML-t ment el. Az eredmény szabványos archívumfájlokba kerül, amit kutatók, cégek és modellfejlesztők egyaránt letölthetnek.

  • A user-agent neve CCBot, a teljes string jellemzően CCBot/2.0 (https://commoncrawl.org/faq/).
  • Felhőből fut, tehát az IP-cím alapján nem különíthető el kényelmesen a többi AI-crawlertől.
  • A dokumentációja szerint betartja a robots.txt szabályait, és figyelembe veszi a nofollow jelzést.
  • Nem renderel JavaScriptet úgy, ahogy egy modern keresőrobot tenné, a nyers HTML számít.

Miért más, mint egy keresőbot

A CCBot nem küld látogatót, és nem is idéz téged valós időben egy chat-válaszban. Adatot gyűjt későbbi felhasználásra. Ez a klasszikus tréning-bot szerep, szemben a válasz közben letöltő robotokkal.

A különbség a tiltásnál válik élessé. Ha a GPTBot-ot tiltod, az OpenAI tanítóadatából maradsz ki. Ha a CCBot-ot tiltod, egy egész ökoszisztéma adatforrásából maradsz ki, mert az archívumot sokan használják.

Mikor számít igazán

A CCBot csak a jövőbeli feltérképezésekre hat. A korábban archivált másolatok nem tűnnek el attól, hogy ma letiltod. A riportokban azt látjuk, hogy a magyar KKV-oldalak többsége soha nem döntött erről tudatosan: az öröklött robots.txt dönt helyettük.

Röviden: a CCBot nyilvános tanítókorpuszt épít, és a tiltása nem a mai AI-válaszokat, hanem a jövőbeli modellek tudását érinti.

Miért fontos

Az AI tudásának alapanyaga

Ha egy modell tanítóadatából kimaradsz, a márkád nem lesz része a modell belső tudásának. Nem tudja, mit csinálsz, hol vagy, kinek szolgáltatsz. Ez nem rangsorolási kérdés, hanem ismertségi.

A mai válaszokra alig hat

A generatív keresők nagy része ma él webes lekérést használ. Azokat más robotok végzik, nem a CCBot. Egy CCBot-tiltás tehát nem csökkenti a márkaemlítéseidet a mai chat-válaszokban.

Amiért mégis tudatos döntés kell

  • Tartalomtulajdonosként jogosan nem akarsz ingyen tanítóanyagot adni.
  • Helyi szolgáltatóként viszont pont az ismertség hiánya fáj a legjobban.
  • A döntés visszafordítható, de lassan: a következő crawl-ciklusig tart, amíg érvényesül.

A riportokban ezt látjuk: a legtöbb oldalon a tiltás nem stratégia, hanem egy plugin alapbeállítása.

Kikre vonatkozik

Kikre vonatkozik

  • Minden nyilvános, indexelhető weboldalra, mérettől függetlenül.
  • Tartalomközpontú oldalakra a leginkább: blog, tudástár, szolgáltatásoldal, hírportál.
  • Webshopokra részben: a termékleírások és a márkaoldalak számítanak, a szűrt listaoldalak nem.

Kikre nem

  • Staging és fejlesztői környezetekre, ezeket amúgy is teljes körűen zárni kell.
  • Belépés mögötti felületekre, mert azokat a CCBot nem látja.
  • Kosár- és pénztároldalakra, ott nincs értelmes tartalom.

Ha az oldalad kizárólag zárt ügyfélportál, a CCBot kérdése gyakorlatilag nem releváns.

Hogyan ellenőrzöd

Lépések

  1. Nyisd meg a https://domain.hu/robots.txt címet böngészőben.
  2. Keress rá a CCBot szóra, és nézd meg, milyen Disallow sor tartozik hozzá.
  3. Ellenőrizd a User-agent: * blokkot is, mert a CCBot arra is illeszkedik, ha nincs saját blokkja.
  4. Kérd le a szervert a bot nevében: curl -A "CCBot/2.0" -I https://domain.hu/.
  5. Nézd meg a válasz státuszkódját, illetve az X-Robots-Tag fejlécet.
  6. Ha van tűzfalad vagy bot-védelmed, nézd meg a szabálylistát, mert sok WAF alapból blokkolja az AI-robotokat.

Jó jel

  • A curl 200-as választ ad, és a HTML-ben ott a valódi tartalom.
  • A robots.txt szándékos, dokumentált sorokat tartalmaz.
  • A fő tartalom szerverről érkezik, nem csak JavaScript után jelenik meg.

Rossz jel

  • User-agent: CCBot + Disallow: / úgy, hogy senki nem tud róla.
  • 403-as vagy 429-es válasz a bot user-agentjére, miközben böngészőből minden rendben.
  • Üres <body> a nyers HTML-ben, mert minden kliensoldalon épül fel.

Mit néz ebből a riport

Az audit lekéri a robots.txt-et, és külön kiírja, hogy a CCBot engedélyezett vagy tiltott-e. Emellett jelzi, ha a szerver eltérően válaszol a botnak és a böngészőnek. A riport nem dönt helyetted, csak láthatóvá teszi az aktuális állapotot.

Hogyan javítod

Előbb döntsd el, engedni vagy tiltani akarsz. Utána állítsd be egységesen.

WordPress

  1. Ha van SEO-plugin (Yoast, Rank Math), annak robots.txt-szerkesztőjében módosíts.
  2. Plugin nélkül hozz létre fizikai robots.txt fájlt a gyökérkönyvtárban.
  3. Ellenőrizd a biztonsági pluginok bot-szabályait is, ezek felülírhatják a szándékodat.

Shopify

  1. Szerkeszd a robots.txt.liquid sablonfájlt a téma kódszerkesztőjében.
  2. Adj hozzá saját szabályt a CCBot-ra, a generált alapblokkok megtartásával.
  3. Mentés után töltsd be a /robots.txt címet, és nézd meg az eredményt.

Unas

  1. Az adminban keresd a SEO-beállítások alatti robots.txt szerkesztőt.
  2. Illeszd be a CCBot blokkot a meglévő sorok után.
  3. Ha a szerkesztő nem érhető el, nyiss ügyfélszolgálati jegyet.

Shoprenter

  1. Az admin SEO-beállításai között találod a robots.txt tartalmát.
  2. Írd be a kívánt szabályt, majd mentsd el.
  3. Ellenőrizd élesben, mert a rendszer több sort automatikusan generál.

Egyedi fejlesztés

  1. Tedd a robots.txt-et verziókövetésbe, ne kézzel szerkeszd a szerveren.
  2. Ha oldaltípusonként szabályoznál, használj X-Robots-Tag fejlécet a webszerver szintjén.
  3. Nézd át a CDN és a WAF bot-szabályait, mert ezek erősebbek a robots.txt-nél.
  4. Írd le a döntés okát a kódban vagy a dokumentációban.

Ha az AI-robotokat egységesen kezelnéd, érdemes együtt átnézni a GPTBot, a Google-Extended és a többi AI-crawler szabályát.

Gyakori hibák

  • Véletlen teljes tiltás: egy öröklött plugin-beállítás zárja ki a CCBot-ot, és senki nem tud róla.
  • A tréning és a keresés összekeverése: a CCBot tiltásától még idéznek a chatbotok, csak a tanítóadatból maradsz ki.
  • Bot-védelem a robots.txt ellenében: a WAF 403-at ad, miközben a robots.txt engedélyez.
  • Visszamenőleges hatás feltételezése: a már archivált másolatok nem tűnnek el a tiltástól.
  • Csak a robots.txt-re hagyatkozás: a JavaScriptből épülő oldalon a bot üres HTML-t lát.
  • llms.txt és llms-full.txt helyettesítőként kezelése: az nem korlátoz semmit, a hozzáférést a robots.txt szabályozza.
  • Indoklás nélküli szabály: fél év múlva senki nem tudja megmondani, miért van ott a sor.

Technikai példa

Teljes tiltás, ha nem akarsz tanítóanyagot adni:

# robots.txt
User-agent: CCBot
Disallow: /

Részleges engedés: a tartalom mehet, a tranzakciós és szűrt oldalak nem.

# robots.txt
User-agent: CCBot
Disallow: /kosar/
Disallow: /penztar/
Disallow: /kereses
Disallow: /*?szuro=
Allow: /

Sitemap: https://domain.hu/sitemap.xml

Ellenőrzés parancssorból, a bot nevében:

curl -A "CCBot/2.0 (https://commoncrawl.org/faq/)" -I https://domain.hu/
curl -s https://domain.hu/robots.txt | grep -i -A3 ccbot

A -I csak a fejléceket kéri le. Ha itt 403-at vagy 429-et kapsz, miközben böngészőből 200 az eredmény, akkor a tűzfal blokkol, nem a robots.txt.

Gyakori kérdések

Ha letiltom a CCBot-ot, eltűnök a ChatGPT-ből?
Nem. A mai chat-válaszok nagy része élő webes lekéréssel dolgozik, amit más robotok végeznek. A CCBot-tiltás a jövőbeli tanítókorpuszokra hat. A már meglévő modellek tudásán nem változtat semmit.
Visszavonható a tiltás?
Igen, elég kivenni a sort a robots.txt-ből. A hatás viszont nem azonnali, mert a következő feltérképezési ciklusig tart. Ez jellemzően hetekben mérhető, nem órákban.
Honnan tudom, hogy valódi CCBot járt nálam?
A szerver hozzáférési naplójában keresd a CCBot user-agentet. A user-agent önmagában hamisítható, ezért nagy forgalom esetén érdemes az IP-t is ellenőrizni. Kis oldalon ez a szint általában felesleges.
Érdemes engedni egy kis magyar cégoldalnak?
A legtöbb esetben igen. Egy helyi szolgáltatónál az a nagyobb kockázat, ha a modellek egyáltalán nem ismerik a céget. Ha viszont az egyedi tartalom maga a termék, jogos döntés a tiltás.
Elég a robots.txt, vagy kell más is?
A robots.txt a szabványos jelzés, és a CCBot a dokumentációja szerint betartja. Ha technikailag is ki akarod zárni, szerver- vagy CDN-szinten kell szűrnöd. A kettőnek egy irányba kell mutatnia, különben zavaros az állapot.

Források

Kapcsolódó fogalmak

A te oldaladon hogy áll a(z) „CCBot (Common Crawl)”?

Futtass egy GEO-auditot: pontszám, fejlesztői ítélet, a leggyorsabb javítások, és minden tételhez bizonyíték.

Ingyenes GEO-audit indítása