AI-értelmezhetőség Szakszó

OAI-SearchBot

Szerző: · 6 perc olvasás · Frissítve:
OAI-SearchBot - AI-értelmezhetőség (szakszó) a tudástárban
OAI-SearchBot - AI-értelmezhetőség | eClick GEO-audit tudástár

Az OAI-SearchBot az OpenAI keresési célú robotja: azokat a nyilvános oldalakat gyűjti be, amelyekre a ChatGPT a válaszaiban forrásként hivatkozhat. Nem modelltanításhoz gyűjt szöveget, hanem keresőindexet épít, ezért külön user-agent néven fut, és külön engedélyezhető, mint a GPTBot.

Hogyan működik

A robot végigjárja a nyilvános URL-jeidet, letölti a HTML-t, és a tartalmat egy keresési indexbe teszi. Amikor valaki friss vagy ellenőrizhető információt kér a ChatGPT-ben, a rendszer ebből az indexből válogat forrásokat. A megjelenő link mögött tehát nem a modell memóriája áll, hanem egy korábbi letöltés. A felhasználói oldalról nézve ez a ChatGPT search.

A robot a robots.txt szabályait követi, és a saját nevére írt direktívát nézi először. Az IP-tartományait az OpenAI publikálja, így a látogatás hitelessége visszaellenőrizhető.

Miben más, mint a többi OpenAI-robot

  • GPTBot: modelltanításhoz gyűjt tartalmat.
  • OAI-SearchBot: a keresési indexet és a forrásmegjelölést szolgálja.
  • ChatGPT-User: akkor kér le egy URL-t, amikor a felhasználó vagy egy ügynök éppen arra kéri.

Mindhárom külön nevet használ, tehát külön szabályozható. A logikai különbségről bővebben: Tréning-bot vs kereső-bot.

Mikor számít igazán

Akkor, ha a márkád vagy a terméked meg akar jelenni a generatív válaszokban forrásként. Ha a robotot kizárod, a ChatGPT keresési rétege nem tud friss tartalmat idézni tőled. A riportokban rendszeresen látunk olyan robots.txt-t, amely sablonból másolva minden AI-robotot kitilt. Utána a tulajdonos csodálkozik, hogy a ChatGPT a versenytársat idézi.

Röviden: a tréning-bot tiltása üzleti döntés, a kereső-bot tiltása viszont önkéntes eltűnés a generatív találatokból.

Miért fontos

Láthatóság

A ChatGPT keresési válaszaiban megjelenő hivatkozások abból az indexből jönnek, amit ez a robot épít. Ha nem fér hozzá az oldaladhoz, nincs miből idézni. Ez ma egy önálló forgalmi csatorna, nem a Google-találatok másolata.

Rossz döntés rossz helyen

Sok oldal a szerzői jog miatt tiltja az AI-robotokat. A tréning-bot esetében ez védhető, a kereső-botnál viszont a saját márkaemlítéseidet vágod el. A kettő nem ugyanaz a kockázat.

Üzleti hatás

A generatív keresés jellemzően kevés forrást mutat. Aki nincs az indexben, az nem is versenyez. A zero-click keresésben a forrásmegjelölés gyakran az egyetlen esély a kattintásra.

Mérhetőség

A robot látogatásai a szerverlogban nyomon követhetők. Ebből látod, mely aloldalakat tartja érdemesnek begyűjteni, és hol akad el.

Kikre vonatkozik

Vonatkozik rá minden nyilvános oldal, amelynek tartalma megjelenhet AI-válaszokban:

  • Szolgáltató- és KKV-oldalak, ahol a cég neve és kínálata a tét.
  • Webshopok, ahol a termék- és szállítási információ kerülhet idézésre.
  • Blogok, tudástárak, dokumentációk: ezeket idézik a leggyakrabban.
  • Hírportálok és kiadók, ahol a licencelés külön üzleti kérdés.

Nem vonatkozik rá:

  • Staging- és fejlesztői környezetek, ahol az egész site-ot amúgy is zárni kell.
  • Bejelentkezés mögötti felületek, kosár, fiók, admin.
  • Belső hálózaton futó, kívülről el nem érhető rendszerek.

Aki kiadói jogdíjat vár az AI-használatért, annak külön stratégia kell. Ott is érdemes szétválasztani a tréning-hozzáférést a keresési hozzáféréstől.

Hogyan ellenőrzöd

  1. Nyisd meg a https://sajatdomain.hu/robots.txt címet a böngészőben.
  2. Keress rá az OAI-SearchBot névre. Ha nincs benne, a User-agent: * blokk érvényes rá.
  3. Nézd meg, hogy a csillagos blokkban nincs-e Disallow: / sor.
  4. Ellenőrizd a CDN vagy WAF beállításait is. A Cloudflare-nél például külön kapcsoló tiltja az AI-robotokat, a robots.txt-től függetlenül.
  5. Keress rá a szerverlogban a user-agentre, és nézd meg a visszaadott státuszkódot.
  6. Teszteld a válaszodat curl-lel, a robot user-agentjével megadva.

Jó jel:

  • A robots.txt engedi a fő tartalmi útvonalakat.
  • A logban 200-as válaszok vannak a robot kéréseire.
  • A tartalom szerveroldali HTML-ben is benne van, nem csak JavaScriptből épül fel.

Rossz jel:

  • Disallow: / a csillagos vagy a nevesített blokkban.
  • 403 vagy 429 válaszok a robot kéréseire, WAF-tiltás miatt.
  • Az oldal noindex alatt van, vagy a robots.txt teljes szekciókat zár ki feleslegesen.

Mit néz ebből a riport

Az audit lekéri a robots.txt-t, és megnézi, hogy a nevesített AI-robotok engedélyezve vannak-e. Külön jelzi, ha a tréning-bot és a kereső-bot egyszerre van tiltva. A riport azt is megmutatja, ha egy általános Disallow szabály véletlenül vonatkozik a keresési robotra.

Hogyan javítod

WordPress

  1. Ha van fizikai robots.txt a gyökérben, azt szerkeszd; különben a Yoast vagy a Rank Math beépített robots.txt-szerkesztőjét használd.
  2. Vedd ki a Disallow: / sort a rá vonatkozó blokkból.
  3. Ellenőrizd a biztonsági bővítményeket, mert több is blokkol ismeretlen botokat.

Shopify

  1. Admin, Online Store, Themes, Edit code.
  2. Hozz létre vagy szerkessz egy robots.txt.liquid sablont.
  3. A Liquid blokkban adj hozzá saját szabályt, majd nyilvános URL-en ellenőrizd az eredményt.

Unas

  1. Az adminban keresd a robots.txt szerkesztésére szolgáló mezőt a SEO vagy egyéb beállítások között.
  2. Írd be a nevesített engedélyező blokkot.
  3. Ha a mező nem elérhető a csomagodban, kérd az ügyfélszolgálat segítségét.

Shoprenter

  1. A robots.txt tartalma az admin SEO-beállításai között módosítható.
  2. Hagyd nyitva a kategória- és termékoldalakat.
  3. A kosarat és a pénztárt továbbra is zárd, lásd kosár- és pénztár-oldalak indexelése.

Egyedi fejlesztés

  1. Állítsd be a robots.txt-t a webszerver vagy a keretrendszer útvonalán.
  2. Nézd át a WAF és a rate limit szabályait, és tegyél kivételt a robot publikált IP-tartományaira.
  3. Ha a tartalom kliensoldalon renderelődik, adj szerveroldali HTML-t, különben a robot üres oldalt lát.
  4. Élesítés után curl-lel ellenőrizd a választ.

Gyakori hibák

  • Mindent egy kalap alá venni: a User-agent: * tiltás a kereső-botot is kizárja, nem csak a tréninget.
  • Sablonos AI-tiltó lista másolása: tíz bot neve bekerül a fájlba, üzleti döntés nélkül.
  • CDN-szintű blokk elfelejtése: a robots.txt engedélyez, a WAF viszont 403-mal válaszol.
  • Elgépelt bot-név: a OAI-Searchbot vagy OAISearchBot írásmód nem egyezik, a szabály hatástalan.
  • Kizárólag JavaScriptből épülő tartalom: a robot letölt egy szinte üres HTML-t, nincs mit indexelni.
  • A robots.txt-t adatvédelemnek hinni: nem véd, csak kér, a zárt tartalmat jelszó mögé kell tenni.
  • Teszt nélküli élesítés: senki nem nézi meg a robots.txt-t a módosítás után.

Technikai példa

Nevesített szabály a robots.txt-ben. Itt a tanító robot tiltva van, a keresési robot viszont engedve:

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /
Disallow: /kosar/
Disallow: /fiok/

User-agent: *
Disallow: /wp-admin/
Sitemap: https://pelda.hu/sitemap.xml

Ellenőrzés a robot user-agentjével. A 200-as státusz és a valódi HTML a jó válasz:

curl -I -A "Mozilla/5.0 (compatible; OAI-SearchBot/1.0; +https://openai.com/searchbot)" https://pelda.hu/

Szerverlogból így szűröd ki a robot kéréseit és a kapott státuszkódokat:

grep "OAI-SearchBot" /var/log/nginx/access.log | awk '{print $9}' | sort | uniq -c

Gyakori kérdések

Ha tiltom az OAI-SearchBotot, védem a tartalmamat a tanítástól?
Nem. A tanítóadatot a GPTBot gyűjti, a keresési robot az indexelésért felel. A kereső-bot tiltásával csak a forrásmegjelölésből esel ki. Ha a tanítást akarod kizárni, a másik robot nevére írj szabályt.
Miért nem látom a logban az OAI-SearchBotot?
Több oka lehet. A robot nem jár minden oldalon egyformán gyakran, kis site-okon hetek is eltelhetnek látogatás nélkül. Az is előfordul, hogy a CDN szűri ki a kérést, mielőtt az az origin szerverre érne. Nézd meg a CDN logjait is.
Elég, ha engedélyezem, és akkor idézni fog a ChatGPT?
Az engedély szükséges feltétel, de nem elegendő. A tartalomnak érthetőnek és idézhetőnek kell lennie, lásd citálhatóság (idézhetőség). Segít a tiszta címhierarchia, a tényszerű megfogalmazás és a strukturált adat.
Kell külön llms.txt fájl is hozzá?
Az llms.txt és llms-full.txt egy javaslat, nem támogatott szabvány. Az OpenAI robotjai a robots.txt-t követik, tehát azzal kezdd. Az llms.txt kiegészítés lehet, de nem helyettesíti a helyes robots-beállítást.

Források

Kapcsolódó fogalmak

A te oldaladon hogy áll a(z) „OAI-SearchBot”?

Futtass egy GEO-auditot: pontszám, fejlesztői ítélet, a leggyorsabb javítások, és minden tételhez bizonyíték.

Ingyenes GEO-audit indítása