A hallucináció az, amikor egy nyelvi modell tényként ad elő olyan állítást, ami sem a forrásaiban, sem a valóságban nem szerepel. Nem szándékos hazugság: a modell a legvalószínűbb szövegfolytatást írja le, nem az igazolhatót.
Hogyan keletkezik
Egy LLM (nagy nyelvi modell) tokenenként becsüli meg a következő szót. Ha az oldaladról nincs elég konkrét adat, a hiányt a hasonló oldalak mintázatából tölti ki. Így lesz a „2015 óta működünk” helyett „több mint 20 éves tapasztalat”, a hiányzó telefonszám helyett pedig egy hibátlanul formázott, de nem létező szám.
Két különböző dolog keveredik itt. Az egyik a modell belső tévedése, amit te nem tudsz befolyásolni. A másik a forráshiány: az oldalad nem mondja ki az adatot, ezért a gép kitalálja. A második a te dolgod.
Miért más ez a generatív keresőknek
A RAG (retrieval-augmented generation) rendszerek éppen a hallucináció ellen dolgoznak: válasz előtt lekérik a valódi oldalt, és abból idéznek. Ha a lekért szövegrész homályos, a modell megint a rések kitöltésébe kezd. A citálhatóság (idézhetőség) ezért közvetlen védelem: a rövid, önálló, számokkal alátámasztott mondatot a modell átveszi, a ködös marketingszöveget átírja.
A riportokban ez visszatérő minta. Ahol az árazásról csak annyi szerepel, hogy „kedvező feltételek”, ott az AI-válaszban rendre konkrét összeg jelenik meg. Senki nem írta le, mégis ott van.
Mikor számít igazán
- Ár, csomagajánlat, akció időtartama
- Nyitvatartás és szállítási határidő
- Szolgáltatási terület, kiszállási körzet
- Jogi, pénzügyi vagy egészségügyi tartalom
- Cégadat: alapítás éve, székhely, adószám
Röviden: a hallucináció ott terem, ahol a forrás hallgat.