AI-értelmezhetőség Szakszó

Token

Szerző: · 7 perc olvasás · Frissítve:
Token - AI-értelmezhetőség (szakszó) a tudástárban
Token - AI-értelmezhetőség | eClick GEO-audit tudástár

A token a nyelvi modellek legkisebb feldolgozási egysége: egy szó, egy szótöredék, egy írásjel vagy egy szóköz. A modell nem betűket és nem mondatokat olvas, hanem tokenek sorozatát dolgozza fel, és mindig a következő tokent becsüli meg.

Hogyan darabolja fel a szöveget

A darabolást a tokenizer végzi, még a modell előtt. A gyakori szavak egyetlen tokent kapnak. A ritkább szavak több darabra esnek szét.

A magyar szöveg ezért drágább, mint az angol. Az ékezetek és a toldalékok miatt egy szó gyakran 3-4 tokenre bomlik.

  • angol szöveg: nagyjából 4 karakter jut egy tokenre
  • magyar szöveg: nagyjából 2-3 karakter jut egy tokenre
  • egy 3000 karakteres magyar oldalszöveg: durván 1000-1500 token

Mire megy el a keret

Egy LLM (nagy nyelvi modell) egyszerre véges mennyiségű tokent lát. Ezt a keretet hívjuk kontextus-ablaknak. Ebbe fér bele a rendszerüzenet, a felhasználó promptja, az oldalad beolvasott szövege és maga a válasz is.

Egy weboldalnál a HTML is tokeneket fogyaszt. A div-ek, az inline stílusok és a beágyazott scriptek ugyanúgy beleszámítanak. Ha a nyers HTML nagy része markup, a hasznos tartalom a maradékba szorul. Ez a tartalmi zaj (a fő tartalom aránya) gyakorlati következménye.

Mikor számít igazán

Hosszú oldalakon, sok termékkel dolgozó listákon és chatben, ahol több forrás fér egymás mellé. A riportokban rendre azt látjuk, hogy a nagy HTML-méret mögött nem sok szöveg van, hanem sok kód.

Röviden: minden karakter, amit a gép beolvas, tokenbe kerül, és a tokenkeret mindig véges.

Miért fontos

Ami a tokenkereten kívül marad, az nincs

Amikor egy AI beolvassa az oldaladat, nem biztos, hogy az egészet kapja meg. Sok rendszer levágja a szöveget egy adott tokenszám felett. Ha a lényeg a 40. képernyőn van, könnyen kimarad.

Konkrét következmények

  • Csonkolás: a kulcsfontosságú szolgáltatásleírás vagy ár nem kerül be a válaszba.
  • Hígulás: a modell figyelme szétoszlik, ha 90% menü és 10% tartalom jut rá.
  • Költség: aki API-val dolgoztat fel oldalakat, tokenre fizet, és a magyar szöveg drágább.
  • Pontatlanság: hiányos bemenetből nagyobb eséllyel lesz hallucináció.

A RAG (retrieval-augmented generation) alapú rendszerek darabokra vágják a szöveget. A vágás tokenszám szerint történik. Ha az oldalad egy hosszú, tagolatlan szövegfolyam, a darabok félbevágott gondolatokat tartalmaznak.

Kikre vonatkozik

Minden oldalra vonatkozik, amit nyelvi modell olvashat. Ez ma gyakorlatilag az összes publikus weboldal.

Kiemelten számít:

  • nagy terméklistás webshopoknál, ahol egy oldal több száz elemet renderel
  • oldalépítővel készült landing oldalaknál, ahol a markup aránya extrém
  • hosszú blogcikkeknél és tudástáraknál
  • egyoldalas alkalmazásoknál, ahol a hidratációs JSON a HTML-be kerül

Kevésbé számít:

  • statikus, rövid bemutatkozó oldalaknál, ahol a teljes HTML néhány tíz kilobájt
  • staging és jelszóval védett felületeken, amelyek nem érhetők el kívülről
  • noindex alá tett, belső használatú oldalakon

Hogyan ellenőrzöd

  1. Nyisd meg az oldalt, és nézd meg a nyers forrást: view-source: prefix a böngészőben, vagy curl -s URL.
  2. Mérd meg a nyers HTML méretét bájtban. A böngésző devtools Network fülén a dokumentum sorában látod.
  3. Vedd ki a tageket, és mérd meg újra. Így kapod meg a látható szöveg méretét.
  4. Becsüld meg a tokenszámot: magyar szövegnél oszd a karakterszámot 2,5-tel.
  5. Ha pontos számot akarsz, futtasd le a szöveget egy nyilvános tokenizer felületen vagy a tiktoken csomaggal.

Jó jel:

  • a látható szöveg a nyers HTML legalább 10-15%-a
  • a lényegi mondanivaló az első 2000 karakterben megjelenik
  • a H1 és az első bekezdés önmagában megválaszolja, mit csinálsz

Rossz jel:

  • 500 KB feletti HTML néhány bekezdésnyi tartalommal
  • több ezer soros inline script vagy stílusblokk a <head>-ben
  • ugyanaz a menü és lábléc háromszor szerepel a forrásban (mobil, desktop, sticky)

Mit néz ebből a riport

Az audit megméri a nyers HTML méretét, és külön a látható szöveg arányát. Ebből számol egy becsült tokenterhelést. Ha a kód elnyomja a tartalmat, ezt tartalmi zajként jelzi.

Hogyan javítod

WordPress

  1. Nézd meg, melyik oldalépítő generálja a felesleges div-eket. Az Elementor és a WPBakery jellemzően 5-8 szintű beágyazást használ.
  2. Kapcsold be a téma vagy a cache-plugin CSS- és JS-egyesítését, és tedd külön fájlba az inline stílusokat.
  3. Kapcsold ki a nem használt pluginok asset-betöltését az adott oldaltípuson.
  4. A mobil és desktop menüt ne duplikáld külön markupban, oldd meg CSS-sel.

Shopify

  1. A témaszerkesztőben nézd át az app embed blokkokat, és a nem használtakat kapcsold ki.
  2. A mega menü teljes tartalma minden oldalon a HTML-be kerül. Csökkentsd a szintek számát.
  3. A terméksablonban a rejtett variáns-JSON gyakran duplán szerepel. Egy példány elég.

Unas

  1. A sablonbeállításoknál vedd ki a nem használt oldalsáv-modulokat.
  2. A termékleírásokból töröld a beszállítótól átmásolt, ismétlődő HTML-táblázatokat.
  3. A kategórialistákon állítsd kisebbre az egy oldalon megjelenő termékek számát.

Shoprenter

  1. A sablonszerkesztőben nézd át a szűrőblokk kimenetét, mert az sok rejtett elemet generál.
  2. A lábléc-widgetekből hagyd meg a valóban használtakat.
  3. Kapcsold be a tömörítést, hogy a gzip vagy brotli legalább a sávszélességet csökkentse.

Egyedi fejlesztés

  1. Keresd meg a szerveroldali állapot-JSON-t a HTML végén. Csak azt add át, amire a kliens tényleg épít.
  2. A lényegi tartalmat tedd a forrás elejére, a dekoratív blokkokat hátra.
  3. Tartsd szemantikus tagekben a szöveget: main, article, section.
  4. A JSON-LD blokkban csak valós adat legyen, ne az egész termékkatalógus.

Gyakori hibák

  • A karakterszám és a tokenszám összekeverése: magyar szövegnél a kettő között 2-3-szoros a szorzó, így alábecsülöd a terhelést.
  • Angol hüvelykujjszabály használata: a 4 karakter per token arány magyarra nem igaz, mert a toldalékok külön darabokra esnek.
  • A markup figyelmen kívül hagyása: a gép a nyers HTML-t olvassa, nem a rendered nézetet, amit te látsz.
  • A lényeg a lap aljára kerül: csonkolás esetén pont az marad ki, amiért az oldal létezik.
  • Ugyanaz a menü többször a forrásban: mobil, desktop és sticky változatban is kirenderelve, tiszta tokenpazarlás.
  • Tömörítés mint megoldás: a gzip a hálózaton segít, de a modell a kicsomagolt szöveget tokenizálja.
  • Végtelen scroll a kategórián: az első betöltésben látható tartalom kevés, a többi sosem kerül a bemenetbe.

Technikai példa

A HTML és a látható szöveg arányát két paranccsal megméred:

# nyers HTML mérete bájtban
curl -sL https://pelda.hu/szolgaltatasok | wc -c

# a látható szöveg mérete tagek nélkül
curl -sL https://pelda.hu/szolgaltatasok \
  | sed -e 's/<script[^>]*>.*<\/script>//g' -e 's/<[^>]*>//g' \
  | tr -s ' \n' ' ' | wc -c

Ha az első szám 480000, a második pedig 6200, akkor a látható szöveg a HTML 1,3%-a. A becsült tokenszám a látható részre nagyjából 2500, a teljes HTML-re viszont több mint 150000.

Pontos számhoz használd a hivatalos tokenizer könyvtárat:

pip install tiktoken
python3 -c "import tiktoken, sys; enc = tiktoken.get_encoding('o200k_base'); print(len(enc.encode(sys.stdin.read())))" < oldal.txt

A kimenet az adott kódolás szerinti tokenszám. Más modellcsaládok más tokenizert használnak, így a szám modellenként eltérhet 10-20%-kal.

Gyakori kérdések

Hány token egy átlagos magyar weboldal szövege?
Egy 3000 karakteres magyar oldalszöveg durván 1000-1500 token. A nyers HTML ennél sokszor nagyságrenddel több, mert a tagek és a scriptek is tokenekre bomlanak. A becsléshez oszd a karakterszámot 2,5-tel, ez magyar szövegnél jól használható közelítés.
Miért drágább a magyar szöveg tokenben, mint az angol?
A tokenizerek túlnyomórészt angol szövegen tanultak, ezért az angol szavak nagy része egyetlen tokent kap. A magyar szavak ékezetesek és toldalékoltak, így 3-4 darabra esnek szét. Ugyanaz a mondanivaló magyarul jellemzően 1,5-2-szer több tokent fogyaszt.
Kell-e rövidíteni a szövegeket a tokenek miatt?
Nem, a hasznos tartalmat ne vágd. A felesleges markupot, a duplikált menüket és az inline scripteket érdemes csökkenteni. A sorrend is számít: a lényeget tedd az oldal és a forrás elejére, hogy csonkolásnál is bekerüljön.
A tömörítés csökkenti a tokenszámot?
Nem. A gzip és a brotli a hálózati átvitelt gyorsítja, de a feldolgozó rendszer a kicsomagolt HTML-t tokenizálja. Tokenben csak a valódi tartalomcsökkentés és a markup karcsúsítása segít.
Honnan tudom, mennyi fér be a kontextus-ablakba?
Ez modellenként eltér, és a szolgáltató dokumentációjában szerepel. A keretet osztozva használja a rendszerüzenet, a felhasználói kérdés, a beolvasott források és a válasz. Egyetlen oldal ritkán kapja meg a teljes keretet, mert több forrás fér egymás mellé.

Források

Kapcsolódó fogalmak

A te oldaladon hogy áll a(z) „Token”?

Futtass egy GEO-auditot: pontszám, fejlesztői ítélet, a leggyorsabb javítások, és minden tételhez bizonyíték.

Ingyenes GEO-audit indítása