A Claude-SearchBot az Anthropic keresési célú webrobotja: akkor tölti le az oldaladat, amikor a Claude webes keresője forrásokat gyűjt és rangsorol a válaszaihoz. Nem modelltanításhoz gyűjt anyagot, hanem ahhoz, hogy a keresési réteg tudja, milyen oldalak léteznek, és melyik mire jó válasz.
Hogyan működik
A robot sima HTTP GET kérésekkel dolgozik, ugyanúgy, mint bármelyik keresőrobot. A User-Agent fejlécében ott a Claude-SearchBot token, erről ismered fel a naplóban.
A szabályok a megszokottak. Követi a robots.txt előírásait, figyeli a HTTP-státuszkódot, és a szerver által visszaadott HTML-t dolgozza fel. Ha a tartalmad csak kliensoldali JavaScript után jelenik meg, komoly a kockázata, hogy üres oldalt lát.
Miben más, mint a ClaudeBot
A kettő külön user-agent, külön céllal. A ClaudeBot a tréning- és általános gyűjtő robot, a Claude-SearchBot pedig a kereséshez tartozik. Ez a különbség a tréning-bot vs kereső-bot logika lényege: a tréning-robot kizárása nem zárja ki automatikusan a keresőt, és fordítva.
Ez a gyakorlatban fontos döntés. Sok tulajdonos nem akarja, hogy a szövegéből modell tanuljon, de azt igenis akarja, hogy a Claude hivatkozzon rá. A két szándékhoz két külön robots-blokk kell. A AI-crawlerek (GPTBot, ClaudeBot, PerplexityBot és társaik) mindegyikénél érdemes ugyanígy végiggondolni a szerepet.
Mikor számít igazán
Akkor, ha szolgáltatást vagy terméket keresnek nálad, és a felhasználó a chatben kérdez rá. Ilyenkor a keresési réteg pár forrást választ ki, és azokból épül a válasz. Ha a robot nem jut be, nem leszel a kiválasztható források között. A citálhatóság itt dől el, nem a szöveg szépségén.
Mit néz ebből a riport
Az audit megnézi, hogy a robots.txt tiltja-e a keresési robotokat, és hogy a szerver ugyanazt a tartalmat adja-e vissza bot user-agenttel. A riport külön jelzi, ha a tréning-tiltás véletlenül a keresőrobotokra is kiterjed. Ez a leggyakoribb, teljesen néma hiba.
Röviden: a Claude-SearchBot az a robot, amelyik eldönti, hogy egyáltalán szóba jöhetsz-e a Claude válaszaiban.
Technikai példa
Robots.txt, amely a tréning-robotot kizárja, a keresési robotot viszont beengedi:
# Tréning célú gyűjtés tiltása
User-agent: ClaudeBot
Disallow: /
# Keresési robot beengedése, tranzakciós útvonalak nélkül
User-agent: Claude-SearchBot
Allow: /
Disallow: /kosar/
Disallow: /penztar/
Disallow: /kereses
Sitemap: https://pelda.hu/sitemap.xml
A blokkok sorrendje nem számít, a pontos user-agent név viszont igen. A Disallow mindig a blokkon belül érvényes.
Ellenőrzés parancssorból, majd a naplóban:
# Mit kap a keresési robot?
curl -s -o /dev/null -w "%{http_code}\n" \
-A "Mozilla/5.0 (compatible; Claude-SearchBot/1.0; +claudebot@anthropic.com)" \
https://pelda.hu/szolgaltatasok
# Jár-e egyáltalán az oldalon?
grep -i "Claude-SearchBot" /var/log/nginx/access.log | tail -20
A várt eredmény 200, ugyanazzal a fő szöveggel, mint böngészőben. Ha a bot más tartalmat kap, az cloaking gyanús, és javítani kell.
Gyakori kérdések
Ha kitiltom a ClaudeBot-ot, kitiltottam a Claude-SearchBot-ot is?
Nem. A kettő külön user-agent, külön robots.txt-blokkal. A ClaudeBot tiltása a tréning célú gyűjtésre vonatkozik, a keresési robot ettől még jöhet. Ha mindkettőt tiltani akarod, mindkét nevet fel kell venned.
Rontja a Google-pozíciómat, ha beengedem?
Nem. A Google saját robotokkal dolgozik, ezek függetlenek egymástól. A Claude-SearchBot forgalma sem a rangsorolást, sem az indexelést nem befolyásolja. Egyetlen érzékeny pont a szerverterhelés, ha nagyon gyenge a tárhely.
Honnan tudom, hogy valóban az Anthropic robotja járt nálam?
A user-agent önmagában hamisítható, bárki beírhatja. Érdemes az IP-t is ellenőrizni, és összevetni a szolgáltató által közzétett tartományokkal. Ha a forgalom gyanúsan nagy egy ismeretlen IP-ről, kezeld sima bot-forgalomként.
Mennyi idő, amíg a robots.txt módosítása hat?
A robots.txt-et a robotok gyorsítótárazzák, jellemzően legfeljebb egy napig. A tartalom újrajárása ennél lassabb, ez napokban vagy hetekben mérhető. Sürgős tiltásnál a szerveroldali blokkolás a gyorsabb megoldás.
Elég, ha csak az llms.txt fájlt teszem ki?
Nem elég. Az llms.txt kiegészítő jelzés, a hozzáférést továbbra is a robots.txt és a szerver szabályozza. Ha a robot nem jut be a HTML-hez, az llms.txt sem segít.