A PerplexityBot a Perplexity nevű válaszkereső feltérképező robotja: azért járja végig a weboldalakat, hogy a tartalmuk bekerülhessen a keresési indexébe, és forrásként megjelenhessen a generált válaszok hivatkozásai között. Nem modelltanításra gyűjti a szöveget, hanem keresési találatokat épít belőle.
Hogyan működik
A bot sima HTTP-kéréseket küld a szerverednek, és a User-Agent fejlécben azonosítja magát. A kérésben szerepel a PerplexityBot token és egy +https:// kezdetű URL, ami a bot dokumentációjára mutat. A robots.txt szabályait figyelembe veszi, tehát saját nevére szóló tiltással kizárható.
A lekért HTML-ből a szöveges tartalom, a címsorok és a strukturált adatok érdeklik. Az AI-crawlerek jellemzően a szerver által visszaadott HTML-lel dolgoznak, és a JavaScript futtatása nem garantált. Ha a fő tartalmad csak kliensoldalon jelenik meg, könnyen üres oldalt lát.
Miben más, mint egy tréning-bot
A cégek több botot üzemeltetnek, más-más céllal. A tréning-bot vs kereső-bot különbség itt gyakorlati kérdés: a keresőrobot kizárása a hivatkozásokból is kizár, a tréning-bot kizárása nem. A Perplexity oldalán két user agentet érdemes ismerni:
- PerplexityBot: az index építéséhez térképezi fel az oldalakat, a robots.txt-t követi.
- Perplexity-User: akkor kér le egy oldalt, amikor a felhasználó konkrétan arra kattint vagy arról kérdez. Ez felhasználói művelet, ezért a robots.txt nem állítja meg.
Ebből következik, hogy a kettő tiltása két külön döntés. A magyar KKV-oldalak többségén egyik sincs tudatosan beállítva: ami történik, azt a tema vagy egy biztonsági plugin default szabálya dönti el.
Mikor számít igazán
Akkor, ha a témádban információt keresnek, nem csak terméket vásárolnak. Szolgáltatói, szakmai és tudásbázis-tartalmaknál a hivatkozás valódi látogatót hoz. A riportokban azt látjuk, hogy a botot leggyakrabban nem szándékosan tiltják, hanem egy WAF vagy egy bot-szűrő modul dobja ki 403-mal.
Röviden: a PerplexityBot az a robot, amelyik eldönti, hogy a Perplexity válaszaiban egyáltalán szóba jöhet-e az oldalad forrásként.
Miért fontos
A hivatkozás a válaszban ma az egyik kevés hely, ahonnan még kattintás jön. Ha a bot nem jut be, nincs miből idézni, és a márkaemlítés esélye is nulla.
- Forgalom: a forrásmegjelölés kattintható link, mérhető látogatóval.
- Kontroll: ha nem te döntöd el, mi történik a bottal, akkor egy plugin default beállítása dönt helyetted.
- Konzisztencia: amit a bot lát, az kerül a válaszba. Elavult ár vagy régi cím ugyanúgy bekerül.
A blokkolás egyben adatvédelmi és üzleti döntés is. Van, ahol indokolt, csak legyen tudatos.
Mit néz ebből a riport
Az audit megnézi, hogy a robots.txt és a szerver válasza beengedi-e a PerplexityBot nevű user agentet. Külön jelzi, ha a tiltás nem a robots.txt-ben, hanem a HTTP-válaszban (403, 429) jelenik meg. A riport ezt állapotként közli, nem javaslatként: a beengedés vagy tiltás a te döntésed.
Gyakori kérdések
Ha beengedem a PerplexityBotot, azzal a modelljüket tanítom?
Nem ez a bot elsődleges célja. A PerplexityBot keresési indexet épít, hogy a tartalmad forrásként hivatkozható legyen a válaszokban. A modelltanításra gyűjtő botok külön user agenttel jönnek, lásd
tréning-bot vs kereső-bot. A kettőt külön szabállyal tudod kezelni a robots.txt-ben.
Blokkoljam vagy engedjem?
Ez üzleti döntés, nem technikai. Ha a témádban információt keresnek, a hivatkozás forgalmat és láthatóságot hoz, ezért az engedés a jellemző választás. Ha a tartalmad maga a termék, például fizetős adatbázis vagy egyedi kutatás, a tiltás indokolt. A lényeg, hogy tudatos legyen, ne egy plugin default beállítása.
Miért nem jelenik meg az oldalam a válaszokban, ha a bot járt nálam?
A bejutás csak a belépő. Utána a tartalomnak idézhetőnek kell lennie: konkrét, tényszerű, önállóan is érthető állításokkal. A
citálhatóság (idézhetőség) és a
tény-sűrűség itt dönt. Az általános marketingszöveget nincs miből idézni.
Hogyan tudom biztosan, hogy valódi PerplexityBot járt nálam?
A user agent string önmagában nem bizonyíték, bárki beírhatja. A Perplexity publikálja a botjai IP-címtartományait JSON-fájlban, ezekhez érdemes hasonlítani a logban szereplő IP-t. Az ellenőrzést a szerveren vagy a CDN-en automatizálhatod.
Elég a robots.txt, vagy máshol is be kell állítani?
Gyakran nem elég. A riportokban a tiltás többsége nem a robots.txt-ben van, hanem a tűzfal, a CDN vagy egy biztonsági plugin bot-szabályában. Mindig teszteld curl-lel is, mit kap a bot. A 403-as válasz erősebb, mint bármilyen robots.txt sor.