AI-értelmezhetőség Szakszó

PerplexityBot

Szerző: · 7 perc olvasás · Frissítve:
PerplexityBot - AI-értelmezhetőség (szakszó) a tudástárban
PerplexityBot - AI-értelmezhetőség | eClick GEO-audit tudástár

A PerplexityBot a Perplexity nevű válaszkereső feltérképező robotja: azért járja végig a weboldalakat, hogy a tartalmuk bekerülhessen a keresési indexébe, és forrásként megjelenhessen a generált válaszok hivatkozásai között. Nem modelltanításra gyűjti a szöveget, hanem keresési találatokat épít belőle.

Hogyan működik

A bot sima HTTP-kéréseket küld a szerverednek, és a User-Agent fejlécben azonosítja magát. A kérésben szerepel a PerplexityBot token és egy +https:// kezdetű URL, ami a bot dokumentációjára mutat. A robots.txt szabályait figyelembe veszi, tehát saját nevére szóló tiltással kizárható.

A lekért HTML-ből a szöveges tartalom, a címsorok és a strukturált adatok érdeklik. Az AI-crawlerek jellemzően a szerver által visszaadott HTML-lel dolgoznak, és a JavaScript futtatása nem garantált. Ha a fő tartalmad csak kliensoldalon jelenik meg, könnyen üres oldalt lát.

Miben más, mint egy tréning-bot

A cégek több botot üzemeltetnek, más-más céllal. A tréning-bot vs kereső-bot különbség itt gyakorlati kérdés: a keresőrobot kizárása a hivatkozásokból is kizár, a tréning-bot kizárása nem. A Perplexity oldalán két user agentet érdemes ismerni:

  • PerplexityBot: az index építéséhez térképezi fel az oldalakat, a robots.txt-t követi.
  • Perplexity-User: akkor kér le egy oldalt, amikor a felhasználó konkrétan arra kattint vagy arról kérdez. Ez felhasználói művelet, ezért a robots.txt nem állítja meg.

Ebből következik, hogy a kettő tiltása két külön döntés. A magyar KKV-oldalak többségén egyik sincs tudatosan beállítva: ami történik, azt a tema vagy egy biztonsági plugin default szabálya dönti el.

Mikor számít igazán

Akkor, ha a témádban információt keresnek, nem csak terméket vásárolnak. Szolgáltatói, szakmai és tudásbázis-tartalmaknál a hivatkozás valódi látogatót hoz. A riportokban azt látjuk, hogy a botot leggyakrabban nem szándékosan tiltják, hanem egy WAF vagy egy bot-szűrő modul dobja ki 403-mal.

Röviden: a PerplexityBot az a robot, amelyik eldönti, hogy a Perplexity válaszaiban egyáltalán szóba jöhet-e az oldalad forrásként.

Miért fontos

A hivatkozás a válaszban ma az egyik kevés hely, ahonnan még kattintás jön. Ha a bot nem jut be, nincs miből idézni, és a márkaemlítés esélye is nulla.

  • Forgalom: a forrásmegjelölés kattintható link, mérhető látogatóval.
  • Kontroll: ha nem te döntöd el, mi történik a bottal, akkor egy plugin default beállítása dönt helyetted.
  • Konzisztencia: amit a bot lát, az kerül a válaszba. Elavult ár vagy régi cím ugyanúgy bekerül.

A blokkolás egyben adatvédelmi és üzleti döntés is. Van, ahol indokolt, csak legyen tudatos.

Mit néz ebből a riport

Az audit megnézi, hogy a robots.txt és a szerver válasza beengedi-e a PerplexityBot nevű user agentet. Külön jelzi, ha a tiltás nem a robots.txt-ben, hanem a HTTP-válaszban (403, 429) jelenik meg. A riport ezt állapotként közli, nem javaslatként: a beengedés vagy tiltás a te döntésed.

Kikre vonatkozik

Vonatkozik minden nyilvános, indexelésre szánt oldalra:

  • szolgáltatói és bemutatkozó oldalak,
  • blogok, tudásbázisok, GYIK-ek,
  • webshopok kategória- és termékoldalai,
  • helyi vállalkozások kontakt- és árlista-oldalai.

Nem vonatkozik a staging és fejlesztői környezetekre, a belépés mögötti fiókoldalakra, a kosárra és a pénztárra. Ezeket amúgy is ki kell zárni a botok elől, lásd noindex, meta robots és X-Robots-Tag és kosár- és pénztár-oldalak indexelése.

Ha jogi vagy üzleti okból nem akarod, hogy a tartalmad AI-válaszokban szerepeljen, a tiltás legitim választás. Ilyenkor a AI-crawlerek (GPTBot, ClaudeBot, PerplexityBot és társaik) egész körét érdemes egységesen kezelni, nem csak egy botot.

Hogyan ellenőrzöd

  1. Nyisd meg a https://sajatdomain.hu/robots.txt fájlt böngészőben. Keresd a PerplexityBot és a Perplexity-User nevet.
  2. Ellenőrizd a User-agent: * blokkot is. Egy globális Disallow: / minden botra érvényes.
  3. Kérd le a főoldalt a bot user agentjével curl-lel, és nézd meg a státuszkódot.
  4. Nézd át a szerver access logját. Keress rá a perplexitybot stringre, kis- és nagybetű nélkül.
  5. Ha van WAF vagy CDN-szintű bot-védelem, nyisd meg a bot-szabályok listáját. Sok szolgáltatónál külön kapcsoló van az AI-crawlerekre.
  6. Nézd meg a lekért HTML forrását. Ha a fő szöveg nincs benne, a bot sem látja.

Jó jel

  • A robots.txt vagy nem említi a botot, vagy Allow: / szabályt ad neki.
  • A curl-kérés 200-as választ ad, és a HTML tartalmazza a fő szöveget.
  • A logban rendszeresen látszanak PerplexityBot-kérések.

Rossz jel

  • 403-as vagy 429-es válasz a bot user agentjére, miközben a böngésző 200-at kap.
  • Disallow: / a bot nevére, anélkül hogy bárki döntött volna róla.
  • A logban hónapok óta nulla kérés, pedig az oldal él és indexelt.
  • A curl-lel kapott HTML üres váz, a tartalom csak JS-ből épül fel.

Hogyan javítod

WordPress

  1. A robots.txt-t sok SEO-plugin kezeli. A plugin beállításai között szerkeszd a fájlt, ne FTP-n.
  2. Vedd ki a PerplexityBot nevére szóló Disallow sorokat, ha be akarod engedni.
  3. Nézd át a biztonsági pluginek (tűzfal, bot-szűrő) blokkolási listáját. Sok esetben ott van a tiltás, nem a robots.txt-ben.
  4. Ellenőrizd, hogy a cache-plugin nem ad-e más HTML-t ismeretlen user agentre.

Shopify

  1. Hozz létre vagy szerkessz egy robots.txt.liquid sablonfájlt a témában.
  2. A Liquid blokkban adj hozzá saját szabályt a bot nevére.
  3. Mentés után hívd le a /robots.txt címet, és nézd meg a végeredményt.

Unas

  1. Az adminban keresd a robots.txt szerkesztésére szolgáló mezőt a keresőoptimalizálás résznél.
  2. Írd be a bot nevére szóló szabályt, majd mentsd.
  3. Ha a felület nem engedi, a támogatással kérhető a beállítás.

Shoprenter

  1. A robots.txt a SEO-beállítások alatt szerkeszthető.
  2. Ugyanígy a bot nevére adj Allow vagy Disallow sort.
  3. Ellenőrizd, hogy a szűrős kategórialistákat továbbra is kizárod.

Egyedi fejlesztés

  1. A robots.txt-t a repóban verziózd, ne kézzel szerkeszd a szerveren.
  2. A webszerver és a WAF bot-szabályait nézd át együtt: a 403 gyakran onnan jön.
  3. Ha rate limitet használsz, adj a botnak elfogadható küszöböt, például néhány kérés másodpercenként.
  4. Szerveroldali rendereléssel vagy prerendereléssel add ki a fő tartalmat HTML-ben.
  5. A bot azonosításához a publikált IP-listát használd, ne csak a user agent stringet.

Gyakori hibák

  • A tiltást nem is te írtad: egy biztonsági plugin vagy CDN-preset zárja ki a botot, és senki nem tud róla.
  • A robots.txt engedi, a tűzfal nem: a fájl rendben van, a szerver mégis 403-at ad a bot user agentjére.
  • A tréning-bot és a keresőbot összemosása: aki mindent tilt, a hivatkozásokból is kimarad.
  • Csak a user agent stringre épített szűrés: bárki beírhatja a nevet, így a hamis bot bejut, a valódi kint marad.
  • Üres HTML: a tartalom csak JavaScriptből áll össze, a bot pedig vázat kap.
  • Elavult adat az oldalon: a régi ár vagy cím ugyanúgy bekerül a válaszba, mert a bot azt látta.
  • A staging nyitva marad: az audit-domain szövege forrásként megjelenhet a live helyett.

Technikai példa

Explicit szabály a robots.txt-ben. A két user agent két külön döntés:

# Keresőrobot: az index építéséhez jár
User-agent: PerplexityBot
Allow: /
Disallow: /kosar/
Disallow: /penztar/
Disallow: /kereses

# Felhasználói kérésre induló lekérés
User-agent: Perplexity-User
Allow: /

Sitemap: https://pelda.hu/sitemap.xml

Ellenőrzés curl-lel és a logban. A státuszkód és a HTML-tartalom együtt számít:

# Mit kap a bot?
curl -s -o /dev/null -w "%{http_code}\n" \
  -A "Mozilla/5.0 (compatible; PerplexityBot/1.0; +https://perplexity.ai/perplexitybot)" \
  https://pelda.hu/

# Járt-e nálunk egyáltalán?
grep -i "perplexitybot" /var/log/nginx/access.log | tail -20

A 200-as kód a minimum. Ha 403 vagy 429 jön, a blokkolás a szerveren vagy a WAF-ban van, nem a robots.txt-ben.

Gyakori kérdések

Ha beengedem a PerplexityBotot, azzal a modelljüket tanítom?
Nem ez a bot elsődleges célja. A PerplexityBot keresési indexet épít, hogy a tartalmad forrásként hivatkozható legyen a válaszokban. A modelltanításra gyűjtő botok külön user agenttel jönnek, lásd tréning-bot vs kereső-bot. A kettőt külön szabállyal tudod kezelni a robots.txt-ben.
Blokkoljam vagy engedjem?
Ez üzleti döntés, nem technikai. Ha a témádban információt keresnek, a hivatkozás forgalmat és láthatóságot hoz, ezért az engedés a jellemző választás. Ha a tartalmad maga a termék, például fizetős adatbázis vagy egyedi kutatás, a tiltás indokolt. A lényeg, hogy tudatos legyen, ne egy plugin default beállítása.
Miért nem jelenik meg az oldalam a válaszokban, ha a bot járt nálam?
A bejutás csak a belépő. Utána a tartalomnak idézhetőnek kell lennie: konkrét, tényszerű, önállóan is érthető állításokkal. A citálhatóság (idézhetőség) és a tény-sűrűség itt dönt. Az általános marketingszöveget nincs miből idézni.
Hogyan tudom biztosan, hogy valódi PerplexityBot járt nálam?
A user agent string önmagában nem bizonyíték, bárki beírhatja. A Perplexity publikálja a botjai IP-címtartományait JSON-fájlban, ezekhez érdemes hasonlítani a logban szereplő IP-t. Az ellenőrzést a szerveren vagy a CDN-en automatizálhatod.
Elég a robots.txt, vagy máshol is be kell állítani?
Gyakran nem elég. A riportokban a tiltás többsége nem a robots.txt-ben van, hanem a tűzfal, a CDN vagy egy biztonsági plugin bot-szabályában. Mindig teszteld curl-lel is, mit kap a bot. A 403-as válasz erősebb, mint bármilyen robots.txt sor.

Források

Kapcsolódó fogalmak

A te oldaladon hogy áll a(z) „PerplexityBot”?

Futtass egy GEO-auditot: pontszám, fejlesztői ítélet, a leggyorsabb javítások, és minden tételhez bizonyíték.

Ingyenes GEO-audit indítása