A tény-sűrűség azt mutatja meg, hány ellenőrizhető állítás jut egy adott hosszúságú szövegre. Ellenőrizhető állítás minden szám, dátum, név, mérték, határidő, feltétel és folyamatlépés, amit valaki utólag igazolni vagy cáfolni tud.
Hogyan működik
Vedd a szöveg bármelyik 100 szavas részletét. Jelöld meg benne a konkrétumokat. Ami kimarad, az töltelék.
A „több éves tapasztalat” nem tény. A „2011 óta, 14 fős csapattal” igen. A kettő majdnem ugyanolyan hosszú, de csak az egyik hordoz információt. Hivatalos küszöb nincs rá. A gyakorlatban 100 szavanként 3-5 ellenőrizhető állítás már elég ahhoz, hogy egy oldal ne tűnjön üresnek.
Miért más a generatív keresőknek
A nyelvi modellek ritkán olvassák végig az oldalt. Részleteket emelnek ki belőle, és azokból raknak össze választ. Egy RAG (retrieval-augmented generation)-alapú rendszer bekezdés méretű darabokkal dolgozik. Ha egy darabban nincs konkrétum, az a darab használhatatlan.
Ezért függ a citálhatóság (idézhetőség) közvetlenül a tény-sűrűségtől. Idézni állítást lehet, hangulatot nem.
Mikor számít igazán
- szolgáltatás- és termékoldalakon, ahol ár, határidő és terjedelem a kérdés
- bemutatkozó és szakértői tartalomnál, ahol az E-E-A-T bizonyítékokból áll össze
- GYIK- és összehasonlító tartalomnál, amiből az AI szívesen szemezget
Mit néz ebből a riport
Az audit a fő tartalom szövegéből számol arányt. Azt nézi, mennyi benne a szám, a dátum, a név és a mérték. Az eredményt a szöveg hosszához és a vékony tartalom jeleihez viszonyítja. Alacsony értéknél azt jelzi, hogy az oldal nehezen foglalható össze.
Röviden: ha egy bekezdésből kihúzod a mellékneveket és nem marad semmi, az a bekezdés nem tartalom.
Technikai példa
Ugyanaz a mondanivaló, két megfogalmazásban. A második változat gépileg is feldolgozható.
<!-- Alacsony tény-sűrűség -->
<p>Cégünk hosszú évek óta megbízható partnere ügyfeleinknek, prémium
minőségű szolgáltatással és gyors kiszállítással.</p>
<!-- Magas tény-sűrűség -->
<p>2011 óta gyártunk bútort Debrecenben, 14 fős csapattal.
A rendelés leadásától a beépítésig átlagosan 4 hét telik el.
Budapestre és Kelet-Magyarországra szállítunk, 25 kg felett díjmentesen.</p>
<dl>
<dt>Alapítás</dt><dd>2011</dd>
<dt>Gyártási idő</dt><dd>4 hét</dd>
<dt>Garancia</dt><dd>5 év</dd>
</dl>
A dl lista nem kötelező, de a strukturált forma segíti a kivonatolást. Ha az adat amúgy is adatbázisban van, ugyanabból generálhatsz strukturált adatot is.
Durva becslés parancssorból: az alábbi sor megszámolja a számjegyet tartalmazó szavakat a HTML szövegében.
curl -s https://pelda.hu/szolgaltatas \
| sed -e 's/<script[^>]*>.*<\/script>//g' -e 's/<[^>]*>/ /g' \
| tr -s ' ' '\n' | grep -cE '[0-9]'
Ez csak a számokat látja, a neveket és feltételeket nem. Arányszámnak viszont jó: ha 800 szóra 4 találat jut, a szöveg tényszegény.
Gyakori kérdések
Van hivatalos küszöbérték a tény-sűrűségre?
Nincs. Sem a Google, sem az AI-szolgáltatók nem publikálnak ilyen számot. A 100 szavanként 3-5 ellenőrizhető állítás gyakorlati ökölszabály, nem szabvány. Viszonyítási pontnak használd, ne célértéknek.
Attól, hogy hosszabb a szöveg, jobb lesz?
Nem, sőt gyakran rosszabb. A hosszabbítás konkrétum nélkül csökkenti az arányt. Egy 400 szavas, adatokkal teli oldal többet ér, mint egy 1500 szavas általánosság. A hossz önmagában nem rangsorolási tényező.
Mi van, ha nem akarok árat kiírni?
Akkor írj árkategóriát, kiindulási árat vagy elszámolási módot. Az „óradíjas elszámolás, minimum 4 óra” is tény. A teljes hallgatás viszont azt jelenti, hogy az árra vonatkozó kérdéseknél az oldalad nem lesz forrás.
Elég, ha a strukturált adatba teszem a tényeket?
Nem. A
JSON-LD blokk fontos, de a modellek a látható szöveget is olvassák, és a felhasználó is azt látja. A séma és a törzsszöveg tartalma legyen összhangban. Ha eltérnek, az a
cloaking gyanúját kelti.
Hogyan tartom karban a számokat?
Tedd őket egy helyre: egyedi mezőbe, metafieldbe vagy termékparaméterbe. Így egy helyen frissíted őket, és nem marad elavult adat öt aloldalon. Évente egyszer nézd át a dátumokat és a kapacitásadatokat.