AI-értelmezhetőség Szakszó

RAG (retrieval-augmented generation)

Szerző: · 7 perc olvasás · Frissítve:
RAG (retrieval-augmented generation) - AI-értelmezhetőség (szakszó) a tudástárban
RAG (retrieval-augmented generation) - AI-értelmezhetőség | eClick GEO-audit tudástár

A RAG (retrieval-augmented generation) az a működési mód, amelyben a nyelvi modell válaszadás előtt külső forrásokból kikeres releváns szövegrészleteket, és azokat beemeli a válasz alapjába. A modell így nem csak a tanult súlyaiból dolgozik, hanem friss, hivatkozható szövegből is.

Hogyan működik

  1. A rendszer a kérdést lekérdezéssé alakítja, sokszor többfélére bontva.
  2. Egy keresőindexből vagy vektoradatbázisból kikeresi a legjobban illeszkedő szövegrészeket.
  3. A találatokat rangsorolja, és csak a legjobb néhányat tartja meg.
  4. Ezeket beteszi a nyelvi modell elé a kérdéssel együtt.
  5. A modell ebből a szövegből fogalmaz választ, és általában megjelöli a forrásokat.

A kulcslépés a kiválasztás. A modell nem az oldaladat olvassa el egészben, hanem néhány kiragadott bekezdést. Ami nem fér be a kontextus-ablakba, az a válasz szempontjából nem létezik.

Miért más ez, mint a klasszikus rangsorolás

A hagyományos találati listán az oldal egésze verseng egy pozícióért. RAG-nál a bekezdéseid versengenek egymással és mások bekezdéseivel. Egy jó oldal is kieshet, ha a benne lévő tudás hosszú, szétszórt mondatokba van elrejtve.

Ezért lett a citálhatóság önálló szempont. A generatív keresők szinte kivétel nélkül RAG-gal dolgoznak, amikor friss vagy konkrét adatot kérdezel tőlük.

Mikor számít igazán

  • Ha az oldalad ára, nyitvatartása vagy szolgáltatási köre gyakran változik.
  • Ha szakmai kérdésekre adsz választ, és ezekre AI-ban akarsz megjelenni.
  • Ha a márkádról rossz információ kering, és ezt friss szöveggel akarod felülírni.

Röviden: RAG esetén nem az oldalad rangsorol, hanem a bekezdéseid, ezért az számít, mennyire kiemelhető belőlük egy önálló, igaz mondat.

Miért fontos

SEO-hatás

A RAG-alapú válaszok forrásmegjelöléssel járnak. Aki bekerül az idézett források közé, márkaemlítést és kattintást kap. Aki nem, az láthatatlan marad, még akkor is, ha a klasszikus találati listán jól áll.

AI-értelmezhetőség

A kiválasztás gépi hasonlóságon alapul. Ha egy bekezdés csak a címsorral együtt érthető, a rendszer nagy eséllyel kihagyja. Az önmagukban is teljes mondatok nyernek.

Üzleti következmény

A rossz forrásbázis nem csak kimaradást jelent. Ha a modell nem talál friss adatot rólad, régi vagy idegen forrásból pótolja. Ilyenkor jön a hallucináció: elavult ár, megszűnt szolgáltatás, rossz telefonszám. A riportokban ezt főleg ott látjuk, ahol évek óta nem frissült a szolgáltatásoldal szövege.

Kikre vonatkozik

Minden nyilvános, indexelhető oldalra vonatkozik, ahol tényszerű információ van. Leginkább az alábbiakra:

  • szolgáltatásoldalak és árlisták,
  • termékoldalak és készletinformáció,
  • GYIK, tudásbázis, blog,
  • kapcsolati és cégadatok.

Kevésbé érinti a tisztán vizuális portfóliót vagy a kampány-landingeket. Ott ritkán van olyan tény, amit egy AI kikeresne.

Nem vonatkozik staging és fejlesztői környezetre. Azokat eleve ki kell zárni az indexelésből, különben a RAG-rendszerek is beszippanthatják a félkész szöveget.

Zárt, bejelentkezés mögötti tartalom szintén kimarad. Amit a robot nem ér el, az nem kerül semmilyen forrásbázisba.

Hogyan ellenőrzöd

Lépések

  1. Kérdezd meg egy generatív keresőtől a saját szolgáltatásodat, magyarul, vásárlói megfogalmazásban.
  2. Nézd meg, megjelenik-e a domained a megjelölt források között.
  3. Nyisd meg az idézett mondatot, és keresd vissza az oldaladon.
  4. Futtasd le ugyanezt a márkaneveddel: „Mivel foglalkozik a [cégnév]?”
  5. Ellenőrizd curl vagy a böngésző devtools „View source” nézetével, hogy a válaszban szereplő tény benne van-e a nyers HTML-ben.
  6. A Search Console Oldalak jelentésében nézd meg, egyáltalán indexelt-e az adott URL.

Jó jel

  • A válaszban szereplő mondat szó szerint megtalálható az oldalad forráskódjában.
  • A tény egy rövid bekezdésben áll, cím alatt, körítés nélkül.
  • A hivatkozott URL a végleges, kanonikus cím.

Rossz jel

  • Az AI a Facebook-oldaladat vagy egy katalógust idéz a saját oldalad helyett.
  • A válasz olyan árat mond, ami két éve érvényes volt.
  • A tényt csak kép, PDF vagy JavaScript után betöltött blokk tartalmazza.

Mit néz ebből a riport

Az audit azt méri, mennyire emelhető ki az oldaladból önálló, forrásként használható állítás. Vizsgálja a nyers HTML-ben elérhető szöveget, a címhierarchiát és a tények sűrűségét. A riport ebből következtet arra, hogy egy RAG-rendszer találna-e rajtad idézhető részletet.

Hogyan javítod

WordPress

  1. A fő tényeket (ár, terület, nyitvatartás) tedd külön, 2-4 mondatos bekezdésbe, beszédes H2 vagy H3 alá.
  2. Kapcsold ki az olyan effekteket, amelyek csak görgetésre töltik be a szöveget.
  3. Ha oldalépítőt használsz, nézd meg a forráskódot: a szövegnek a HTML-ben kell lennie, nem shortcode-eredményként utólag.
  4. Egy SEO-pluginnal adj FAQPage és Organization sémát a kulcsoldalakhoz.

Shopify

  1. A termékleírás első bekezdése tartalmazza a lényeget: mi ez, kinek, mennyiért.
  2. A szállítási és elállási feltételeket ne csak felugró ablakban add meg, hanem önálló oldalon is.
  3. Ellenőrizd, hogy a Product séma ára és készlete egyezik a látható szöveggel.

Unas

  1. A kategóriaoldalak tetejére írj 3-5 mondatos, tényszerű bevezetőt.
  2. A GYIK-blokkot statikus szövegként tedd ki, ne csak kattintásra betöltődő elemként.
  3. Töltsd ki a termékadatlap gyártó- és paraméter-mezőit, ezekből lesz kereshető tény.

Shoprenter

  1. Az áruházi információs oldalakat (szállítás, fizetés, garancia) tartsd frissen, dátummal.
  2. A sablon beépített séma-kimenetét ellenőrizd a Rich Results teszttel.
  3. A fontos szövegblokkokat ne fülekbe rejtsd, ha elkerülhető.

Egyedi fejlesztés

  1. Szerveroldali renderelést használj a tényeket tartalmazó blokkokra.
  2. Egy URL egy témát fedjen le, tiszta H1-H2-H3 hierarchiával.
  3. Adj minden cikkhez dateModified mezőt, és tényleg frissítsd.
  4. Engedd be a AI-crawlereket a robots.txt-ben, ha azt akarod, hogy idézzenek.

Gyakori hibák

  • Minden tény egyetlen hosszú bekezdésben: a kiválasztó vagy az egészet hozza, vagy semmit, és általában az utóbbi.
  • Csak kattintásra betöltődő GYIK: ami nincs a nyers HTML-ben, az sok feldolgozónál nem létezik.
  • Névmásokkal teli szöveg: a „ez nálunk ingyenes” mondat önmagában értelmezhetetlen, ezért kiesik a rangsorolásból.
  • Képbe égetett árlista: a szám nem kereshető, így a modell máshonnan találja ki.
  • Dátum nélküli tartalom: a friss forrást előnyben részesítő rendszerek nem tudják eldönteni, mennyire aktuális.
  • AI-botok tiltása, miközben AI-megjelenést vársz: a kereső-botok tiltása egyenlő a kimaradással.
  • Marketingszöveg tények helyett: a „piacvezető megoldások” mondatból nincs mit idézni.

Technikai példa

Először nézd meg, hogy a tény ott van-e a szerver által küldött HTML-ben. Ha a curl nem találja, akkor nagy eséllyel egy RAG-rendszer sem:

curl -sL https://pelda.hu/arak | grep -i "óradíj"

Egy jól kiemelhető blokk egyszerű és önálló. A címsor a kérdés, a bekezdés a válasz:

<h2>Mennyibe kerül egy weboldal karbantartása?</h2>
<p>A havi karbantartás díja 25 000 Ft-tól indul. Ez tartalmazza a frissítéseket, a napi mentést és a hibajavítást. Az ár 2026. januártól érvényes.</p>

Ugyanezt géppel olvasható formában is kiteheted. A JSON-LD blokk megerősíti a látható szöveget:

{
  "@context": "https://schema.org",
  "@type": "FAQPage",
  "mainEntity": [
    {
      "@type": "Question",
      "name": "Mennyibe kerül egy weboldal karbantartása?",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "A havi karbantartás díja 25 000 Ft-tól indul, és tartalmazza a frissítéseket, a mentést és a hibajavítást."
      }
    }
  ]
}

A séma szövege egyezzen a látható tartalommal. Az eltérés cloakingnak minősül.

Gyakori kérdések

A RAG ugyanaz, mint a keresőoptimalizálás?
Nem, de átfedik egymást. A RAG a válaszgenerálás technikai módja, a SEO pedig a te oldalad felkészítése. Az átfedés az, hogy a RAG legtöbbször keresőindexből dolgozik, így az indexelés és a kereshetőség közös alap.
Ha RAG-gal dolgozik a modell, akkor nem hallucinál?
Csökken a kockázat, de nem szűnik meg. Ha nincs jó forrás, vagy a kiválasztás rossz részletet hoz, a modell akkor is magabiztosan fogalmaz. A saját oldaladon annyit tehetsz, hogy friss és egyértelmű tényeket adsz neki.
Miért idéz engem az AI rosszul, ha jó a szövegem?
Általában azért, mert a tény nem önállóan áll. A kiválasztott bekezdés kontextus nélkül félreérthető, vagy egy régebbi verzió maradt fenn máshol. Nézd meg, melyik URL-t jelöli meg forrásként, és javítsd elsőként azt.
Kell külön tartalmat írnom az AI-nak?
Nem kell külön verzió. Ugyanaz a szöveg működik embernek és gépnek, ha rövid bekezdésekben, beszédes címsorok alatt áll. A magyar KKV-oldalak többségén nem a tartalom hiányzik, hanem a tagolás.
Segít, ha blokkolom az AI-botokat?
Csak akkor, ha nem akarsz megjelenni az AI-válaszokban. A kereső-botok tiltásával kiesel a forrásbázisból, miközben a rólad szóló téves információ máshonnan tovább él. Érdemes külön kezelni a tréning-botokat és a válaszadáshoz kereső botokat.

Források

Kapcsolódó fogalmak

A te oldaladon hogy áll a(z) „RAG (retrieval-augmented generation)”?

Futtass egy GEO-auditot: pontszám, fejlesztői ítélet, a leggyorsabb javítások, és minden tételhez bizonyíték.

Ingyenes GEO-audit indítása