AI-értelmezhetőség Szakszó

Kontextus-ablak

Szerző: · 7 perc olvasás · Frissítve:
Kontextus-ablak - AI-értelmezhetőség (szakszó) a tudástárban
Kontextus-ablak - AI-értelmezhetőség | eClick GEO-audit tudástár

A kontextus-ablak az a maximális szövegmennyiség, amit egy nyelvi modell egyszerre lát és feldolgoz: a kérdés, a beemelt dokumentumok és a saját készülő válasza együtt. Mérete tokenben mérhető, nem karakterben és nem szóban.

Hogyan működik

Egy LLM (nagy nyelvi modell) nem úgy olvas, mint te. Nincs memóriája a korábbi oldalakról. Minden válasznál csak azt ismeri, ami az ablakba éppen bekerült. Ami kimarad, az számára nem létezik.

A mai modellek ablaka jellemzően 128 000 és 1 000 000 token között mozog. Magyar szövegnél egy token nagyjából 2-3 karakter. Ugyanaz a mondat magyarul több tokent fogyaszt, mint angolul.

Miért szűkebb a gyakorlatban

Az ablak sosem a te oldaladé egyedül. Osztozik rajta a rendszerutasítás, a beszélgetés előzménye, a többi forrás szövege és a generált válasz. Egy generatív keresőben a te oldalad tipikusan néhány ezer tokent kap, nem többet.

Ez a néhány ezer token a teljes HTML-ből lesz kivonatolva. Ha a látható szöveg felét menü, süti-sáv, kapcsolati blokk és lábléc viszi el, a lényeg kiszorul. Erről szól a tartalmi zaj (a fő tartalom aránya) és részben az oldalméret (HTML-méret) is.

Mikor számít igazán

  • Hosszú szolgáltatásoldalaknál, ahol az ár és a folyamat a szöveg végén van.
  • Webshop-kategóriáknál, ahol 60 termék listája elnyomja a leíró részt.
  • RAG-alapú rendszereknél, ahol az oldaladat darabokra vágják, és csak 1-2 darab jut be.

A hosszú ablak nem egyenletes minőségű. A modellek az eleje és a vége felé pontosabbak, a közepére szorult részleteket gyakrabban hagyják ki. Ezért nyer az az oldal, amelyik az első bekezdésben megmondja a lényeget.

Röviden: nem az a kérdés, mekkora az ablak, hanem hogy a te lényeged belefér-e az első pár ezer tokenbe.

Miért fontos

A modell nem azért hagyja ki az ajánlatodat, mert rossz. Azért hagyja ki, mert nem fért bele az ablakba.

  • Pontatlan idézés. Ha a szolgáltatásod leírása bekerül, az ára nem, akkor hiányos válasz születik rólad.
  • Elveszett differenciálás. A referenciák és a szakmai részletek általában a lap alján vannak, ott pedig már fogy a keret.
  • Rossz sorrend. Két hasonló oldal közül azt idézik, amelyiknek az eleje konkrétabb. Ez a citálhatóság (idézhetőség) lényege.

A riportokban ezt látjuk a leggyakrabban: a főoldal 600 kB HTML, de a valódi mondanivaló 40 szó. Ebből egy modell semmit nem tud kezdeni.

Kikre vonatkozik

Vonatkozik rá:

  • Minden nyilvános oldal, amit generatív kereső vagy chatbot beolvashat.
  • Hosszú szolgáltatás- és tudástár-oldalak, ahol sok a szöveg.
  • Webshopok, ahol a sablon sokszorosa a valódi tartalomnak.
  • Belső AI-asszisztensek, amelyek a saját dokumentumaidra épülnek.

Kevésbé vonatkozik rá:

  • Jelszóval védett felületek és staging-környezetek.
  • Tisztán tranzakciós oldalak, például kosár vagy pénztár.
  • Rövid, egyoldalas bemutatkozók, ahol eleve minden belefér.

Hogyan ellenőrzöd

Nincs hozzá gomb a böngészőben. Közelítéssel dolgozol, és az arányokat nézed.

  1. Nyisd meg az oldalt, és mentsd ki a nyers HTML-t: curl -s https://pelda.hu/oldal -o oldal.html.
  2. Nézd meg a fájl méretét. Ez a teljes oldalméret (HTML-méret).
  3. Szedd ki a tageket, és mérd meg a maradék látható szöveget.
  4. Oszd a karakterszámot 3-mal. Nagyjából ennyi token a magyar szövegedből.
  5. A böngésző devtools Elements fülén nézd meg, hol kezdődik a <main> vagy az érdemi tartalom.
  6. Olvasd el az első 400 szót úgy, mintha a többi nem létezne. Kiderül belőle, mit csinálsz?

Jó jel:

  • A látható szöveg aránya a HTML-hez képest 15 százalék felett van.
  • Az első bekezdésben ott a szolgáltatás, a terület és a célcsoport.
  • A címsorok önmagukban is elmondják a lap logikáját.

Rossz jel:

  • 500 kB HTML 300 szó szöveggel. Lásd szöveg / HTML arány.
  • Az érdemi mondat a harmadik képernyő után kezdődik.
  • Ugyanaz a hosszú lábléc és menü ismétlődik minden aloldalon.

Mit néz ebből a riport

Az audit nem méri közvetlenül a kontextus-ablakot, mert az a modell oldalán van. Azt nézi, mi kerülne bele belőle: a fő tartalom arányát, a HTML méretét és azt, hogy az oldal eleje mennyire beszédes. Ha a riport tartalmi zajt jelez, az gyakorlatban ablak-pazarlás.

Hogyan javítod

A cél mindig ugyanaz: a lényeg kerüljön előre, a sablon pedig fogyjon.

WordPress

  1. Írj a H1 alá egy 2-3 mondatos összefoglalót, konkrét adatokkal.
  2. Kapcsold ki a nem használt oldalépítő modulokat, ezek rengeteg üres divet generálnak.
  3. A sidebart és a hosszú láblécet vágd rövidebbre az aloldalakon.
  4. Ellenőrizd, hogy a téma a fő tartalmat <main> elembe teszi.

Shopify

  1. A kategórialeírást tedd a terméklista elé, ne utána.
  2. A termékleírásnál az első bekezdés mondja meg, mi ez és kinek jó.
  3. A sablon ismétlődő blokkjait (ajánlott termékek, hírlevél) korlátozd.

Unas

  1. A kategóriaszöveg mezőt töltsd ki, és a lényeget tedd az elejére.
  2. A termékadatlapon a hosszú leírás helyett először egy rövid, tényszerű blokk jöjjön.
  3. A sablonban kapcsold ki a felesleges kiegészítő dobozokat.

Shoprenter

  1. Használd a kategória felső leírás mezőjét, az alsót csak kiegészítésnek.
  2. A termékeknél adj meg rendezett tulajdonságokat, ne folyó szövegben sorold fel őket.
  3. A sablon ismétlődő elemeit ritkítsd az aloldalakon.

Egyedi fejlesztés

  1. Tedd a mondanivalót a DOM elejére, a vizuális sorrendet CSS-sel állítsd.
  2. Kerüld a kliensoldalon betöltött fő tartalmat, ha a bot nem futtat JavaScriptet.
  3. Vezess be egy rövid, gépi összefoglaló blokkot minden fontos oldal tetején.
  4. Az ismétlődő jogi szövegeket linkeld, ne másold minden oldalra.

Gyakori hibák

  • A lényeg a lap alján van. A modell addigra elfogyasztotta a keretet, és a konkrétumok kimaradnak.
  • Hosszú süti-sáv és jogi szöveg a HTML elején. Ez tokent eszik, de nulla információt ad rólad.
  • Minden aloldalon ugyanaz a 200 soros lábléc. Az ismétlés zajként viselkedik, és felhígítja az oldal saját üzenetét.
  • Végtelen kategórialista terméknevekből. Ötven terméknév nem mondja meg, mit árulsz.
  • A tartalom JavaScriptből érkezik. Ha a bot nem rendereli, nulla token jut be belőle.
  • Marketing-bevezető konkrétum nélkül. Az első bekezdés az ablak legértékesebb része, kár általánosságokra pazarolni.
  • Ugyanaz a szöveg PDF-ben és HTML-ben is. A duplikáció két helyet foglal, és ugyanazt mondja.

Technikai példa

Gyors becslés arra, mennyi token marad az oldaladból:

# Teljes HTML mérete bájtban
curl -s https://pelda.hu/szolgaltatas | wc -c

# Látható szöveg a tagek nélkül
curl -s https://pelda.hu/szolgaltatas \
  | sed -e 's/<script[^>]*>.*<\/script>//g' -e 's/<[^>]*>//g' \
  | tr -s ' \n' ' ' | wc -c

A második szám osztva 3-mal nagyjából a magyar tokenszám. Ha 420 000 bájt HTML-ből 3 000 karakter szöveg marad, az körülbelül 1 000 token. Ennyiből kell a modellnek megértenie téged.

Így néz ki egy ablakbarát oldalkezdés:

<main>
  <h1>Ipari padlóburkolás Debrecenben</h1>
  <p><strong>Epoxi és poliuretán ipari padlót építünk</strong> csarnokokba,
     üzemekbe és raktárakba, Hajdú-Bihar megyében. 2008 óta dolgozunk,
     400 négyzetméter a legkisebb vállalt méret.</p>
</main>

Ez a két mondat önmagában megválaszolja, hogy mit csinálsz, hol és kinek. Ha csak ennyi fér be, az is elég egy pontos idézethez.

Gyakori kérdések

Ha a modellnek 1 millió tokenes ablaka van, akkor ez már nem probléma?
De igen. Az ablak mérete a modell kapacitása, nem az, amit az oldaladnak adnak belőle. Egy generatív kereső több forrásból dolgozik, és mindegyikből csak részletet emel be. A te oldalad így is néhány ezer tokent kap.
Rövidebbre kell vágnom a szövegeimet?
Nem, a sorrenden múlik a dolog. Hosszú oldal is működik, ha az eleje összefoglalja a lényeget. A részletek maradhatnak lentebb, mert azok a kiegészítő információk.
Hány token egy magyar szó?
Modellenként eltér, de magyar szövegnél egy szó jellemzően 2-4 token. Ez rosszabb arány, mint az angolnál, mert a tokenizálók főleg angol szövegen tanultak. A ragozott alakok több darabra esnek szét.
A képek és a strukturált adatok is fogyasztják az ablakot?
A képek általában nem kerülnek be szöveges idézésnél, az alt szövegük viszont igen. A JSON-LD blokk is tokent fogyaszt, ha a rendszer beemeli. Cserébe sűrű és pontos információt ad, tehát jó befektetés.
Honnan tudom, hogy az oldalamból mi ment át a modellnek?
Közvetlenül nem látod, mert ez a szolgáltató oldalán dől el. Közelítésként kérdezd meg egy chatbottól az oldal URL-jével, hogy mit csinál a cég. Amit visszamond, az nagyjából az, ami bekerült az ablakba.

Források

Kapcsolódó fogalmak

A te oldaladon hogy áll a(z) „Kontextus-ablak”?

Futtass egy GEO-auditot: pontszám, fejlesztői ítélet, a leggyorsabb javítások, és minden tételhez bizonyíték.

Ingyenes GEO-audit indítása