A CCBot a Common Crawl nonprofit szervezet webrobotja, amely nyilvános, bárki által ingyen letölthető webarchívumot épít a feltérképezett oldalakból. Ez az archívum az elmúlt évek legtöbb nagy nyelvi modelljének tanítóanyagában szerepelt, ezért a CCBot közvetve az AI-k egyik legfontosabb adatforrása.
Hogyan működik
A CCBot időről időre végigjárja a web nyilvános részét, és nyers HTML-t ment el. Az eredmény szabványos archívumfájlokba kerül, amit kutatók, cégek és modellfejlesztők egyaránt letölthetnek.
- A user-agent neve
CCBot, a teljes string jellemzően CCBot/2.0 (https://commoncrawl.org/faq/).
- Felhőből fut, tehát az IP-cím alapján nem különíthető el kényelmesen a többi AI-crawlertől.
- A dokumentációja szerint betartja a robots.txt szabályait, és figyelembe veszi a
nofollow jelzést.
- Nem renderel JavaScriptet úgy, ahogy egy modern keresőrobot tenné, a nyers HTML számít.
Miért más, mint egy keresőbot
A CCBot nem küld látogatót, és nem is idéz téged valós időben egy chat-válaszban. Adatot gyűjt későbbi felhasználásra. Ez a klasszikus tréning-bot szerep, szemben a válasz közben letöltő robotokkal.
A különbség a tiltásnál válik élessé. Ha a GPTBot-ot tiltod, az OpenAI tanítóadatából maradsz ki. Ha a CCBot-ot tiltod, egy egész ökoszisztéma adatforrásából maradsz ki, mert az archívumot sokan használják.
Mikor számít igazán
A CCBot csak a jövőbeli feltérképezésekre hat. A korábban archivált másolatok nem tűnnek el attól, hogy ma letiltod. A riportokban azt látjuk, hogy a magyar KKV-oldalak többsége soha nem döntött erről tudatosan: az öröklött robots.txt dönt helyettük.
Röviden: a CCBot nyilvános tanítókorpuszt épít, és a tiltása nem a mai AI-válaszokat, hanem a jövőbeli modellek tudását érinti.
Technikai példa
Teljes tiltás, ha nem akarsz tanítóanyagot adni:
# robots.txt
User-agent: CCBot
Disallow: /
Részleges engedés: a tartalom mehet, a tranzakciós és szűrt oldalak nem.
# robots.txt
User-agent: CCBot
Disallow: /kosar/
Disallow: /penztar/
Disallow: /kereses
Disallow: /*?szuro=
Allow: /
Sitemap: https://domain.hu/sitemap.xml
Ellenőrzés parancssorból, a bot nevében:
curl -A "CCBot/2.0 (https://commoncrawl.org/faq/)" -I https://domain.hu/
curl -s https://domain.hu/robots.txt | grep -i -A3 ccbot
A -I csak a fejléceket kéri le. Ha itt 403-at vagy 429-et kapsz, miközben böngészőből 200 az eredmény, akkor a tűzfal blokkol, nem a robots.txt.
Gyakori kérdések
Ha letiltom a CCBot-ot, eltűnök a ChatGPT-ből?
Nem. A mai chat-válaszok nagy része élő webes lekéréssel dolgozik, amit más robotok végeznek. A CCBot-tiltás a jövőbeli tanítókorpuszokra hat. A már meglévő modellek tudásán nem változtat semmit.
Visszavonható a tiltás?
Igen, elég kivenni a sort a robots.txt-ből. A hatás viszont nem azonnali, mert a következő feltérképezési ciklusig tart. Ez jellemzően hetekben mérhető, nem órákban.
Honnan tudom, hogy valódi CCBot járt nálam?
A szerver hozzáférési naplójában keresd a CCBot user-agentet. A user-agent önmagában hamisítható, ezért nagy forgalom esetén érdemes az IP-t is ellenőrizni. Kis oldalon ez a szint általában felesleges.
Érdemes engedni egy kis magyar cégoldalnak?
A legtöbb esetben igen. Egy helyi szolgáltatónál az a nagyobb kockázat, ha a modellek egyáltalán nem ismerik a céget. Ha viszont az egyedi tartalom maga a termék, jogos döntés a tiltás.
Elég a robots.txt, vagy kell más is?
A robots.txt a szabványos jelzés, és a CCBot a dokumentációja szerint betartja. Ha technikailag is ki akarod zárni, szerver- vagy CDN-szinten kell szűrnöd. A kettőnek egy irányba kell mutatnia, különben zavaros az állapot.