Az LLM (large language model, nagy nyelvi modell) olyan neurális hálón alapuló program, amely hatalmas szövegmennyiségen tanulta meg, hogy egy szövegrészlet után mi a legvalószínűbb folytatás. Nem adatbázis és nem kereső: nem tételeket keres ki, hanem valószínűség alapján generál választ.
Hogyan működik
A modell a szöveget nem szavakban, hanem tokenekben látja. A bemenetet, vagyis a promptot, tokenekre bontja, majd tokenenként jósolja meg a választ. Ezért érzékeny a fogalmazásra: más szórend más folytatást hoz.
Egyszerre véges mennyiségű szöveget lát. Ez a kontextus-ablak, és minden bele akart tartalom ebbe fér csak be:
- a rendszerutasítás,
- a felhasználó kérdése,
- a beolvasott weboldalak szövege,
- a saját, már legenerált válasza.
Honnan tudja, mi van az oldaladon
Két forrásból. Az egyik a tréning-adat, ami egy adott időpontig tartalmaz webes szöveget, és elavulhat. A másik az élő lekérés: a modell futás közben tölt be oldalakat, ez a RAG elve, és erre épül a generatív kereső is.
A gyakorlatban ez azt jelenti, hogy a lekért oldalból általában a kinyert szöveg számít. A vizuális elrendezés, a színek és a képi kontextus nagy része elvész. Ami csak designban van benne, az a modellnek nem létezik.
Miért téved
Az LLM akkor is generál választ, ha nincs elég adata. Ilyenkor a legvalószínűbb, de nem feltétlenül igaz mondatot írja le, ez a hallucináció. A riportokban tipikus eset, hogy a modell kitalál egy telefonszámot vagy egy szolgáltatást, mert az oldalon nem találta meg egyértelműen.
Röviden: az LLM azt mondja el rólad, amit a szövegedből tokenként kiolvas, nem azt, amit te a fejedben tudsz a cégedről.
Technikai példa
Nézd meg, mit lát a modell a nyers HTML-ből, JavaScript futtatása nélkül:
curl -sL -A "Mozilla/5.0 (compatible; GPTBot/1.1; +https://openai.com/gptbot)" \
https://pelda.hu | sed -e 's/<[^>]*>//g' | tr -s '[:space:]' ' ' | head -c 1200
Ha a kimenet menüfeliratokon kívül alig tartalmaz mondatot, a tartalmad nem jut el a modellig.
Egy tömör JSON-LD blokk kevés tokenben ad át sok tényt:
{
"@context": "https://schema.org",
"@type": "Organization",
"name": "Példa Kft.",
"url": "https://pelda.hu",
"description": "Ipari hűtéstechnikai karbantartás élelmiszeripari üzemeknek.",
"areaServed": "Magyarország",
"telephone": "+36-1-234-5678",
"email": "info@pelda.hu"
}
Ez a néhány sor egyértelműsíti azt, amit a látogató a designból amúgy értene.
Gyakori kérdések
Az LLM ugyanaz, mint a Google keresője?
Nem. A kereső indexből ad vissza találatokat rangsorolva, az LLM viszont szöveget generál. A kettő ma keveredik: a generatív keresők lekérik az oldalakat, majd egy modellel foglalják össze őket. A rangsor és az idézés így külön logika mentén dől el.
Kell külön szöveget írnom az AI-nak?
Nem kell külön verzió. Ugyanaz a tiszta, konkrét szöveg működik az embernek és a modellnek is. Annyi a különbség, hogy a modell nem érti a képi utalásokat és a designban rejlő jelentést. Amit fontosnak tartasz, azt mondd ki szövegben.
Miért mond rólam rosszat vagy elavultat a chat?
Többnyire azért, mert a tréning-adata régi, vagy az oldalról nem tudja kiolvasni az aktuális információt. Frissítsd a nyilvános oldalaidat, és szüntesd meg az ellentmondásokat. Ha ugyanaz az adat több helyen máshogy szerepel, a modell találgat.
Hány token fér bele egy modellbe?
Modellenként eltér, és folyamatosan nő. A lényeg nem a pontos szám: a lekért oldalakból sokszor csak egy részlet kerül be a kontextusba. Ezért érdemes a fontos állításokat előre, a szöveg elejére tenni.
Blokkoljam az AI-crawlereket?
Ez üzleti döntés. Ha azt szeretnéd, hogy idézzenek és ajánljanak, a lekérő botokat engedd be. A tréning célú botokat ettől függetlenül tilthatod a robots.txt-ben. Sok oldalon ezt véletlenül, egy plugin miatt állították be rosszul.