Az AI-generált szöveg jelei azok a nyelvi és formai mintázatok, amelyek valószínűsítik, hogy egy oldal szövegét nyelvi modell írta, emberi szerkesztés nélkül. Ezek jelzések, nem bizonyítékok: megbízható AI-detektálás ma nem létezik.
Milyen mintázatokról van szó
- Sablonos nyitómondat: „Ma már elengedhetetlen”, „Egyre többen keresik”, „Nem véletlen, hogy”.
- Egyenletes mondathossz: a mondatok szórása feltűnően kicsi, szinte minden mondat 15-20 szó.
- Hosszú kötőjel sűrűsége: az em dash magyar szövegben ritka, gépi szövegben gyakori.
- Konkrétum hiánya: nincs szám, név, dátum, saját példa, saját mérés.
- Szimmetrikus szerkezet: minden alcím alatt pontosan három felsorolás, azonos hosszban.
Egyik jel sem dönt el semmit önmagában. Együtt viszont jól mutatják a sablonosságot.
Miért nem maga az AI a probléma
Az AI-val írt szöveg nem hiba. A Google útmutatója is ezt mondja: az előállítás módja nem számít, a minőség igen. A baj ott kezdődik, ha a szöveg felcserélhető bármelyik versenytárs szövegével. Ilyenkor hiányzik a saját tudás, és vele a tény-sűrűség is.
Mit lát ebből egy nyelvi modell
A generatív keresők idézhető állításokat gyűjtenek. Egy általános bekezdésből nincs mit kiemelni, ezért az oldal kimarad a válaszból. A riportokban ezt látjuk a leggyakrabban: hosszú, olvasható, mégis teljesen tartalmatlan szolgáltatásleírásokat.
Rosszabb eset, ha a modell kitalált adatot írt a szövegbe, és azt senki nem ellenőrizte. Az ilyen hallucináció éveken át él tovább az oldalon.
Röviden: nem az a kérdés, hogy AI írta-e, hanem hogy van-e benne bármi, amit csak te tudsz leírni.
Technikai példa
Hosszú kötőjelek megszámolása egy oldalon, HTML-tagek nélkül:
curl -s https://pelda.hu/blog/cikk \
| sed 's/<[^>]*>//g' \
| grep -o "$(printf '\u2014')" \
| wc -l
A printf '\u2014' az em dash karaktert állítja elő, így a parancs a nyers számot adja vissza. Egy 800 szavas magyar cikkben 5 fölötti érték már gyanús.
Mondathossz-szórás mérése a böngésző konzoljában:
const t = document.querySelector('article').innerText;
const l = t.split(/[.!?]+/).map(s => s.trim().split(/\s+/).length).filter(n => n > 2);
const avg = l.reduce((a, b) => a + b, 0) / l.length;
const sd = Math.sqrt(l.reduce((a, b) => a + (b - avg) ** 2, 0) / l.length);
console.log({ atlag: avg, szoras: sd });
Ha a szoras 4 alatt van, a szöveg ritmusa gépies. Emberi szövegnél tipikusan 6 és 12 között mozog.
Gyakori kérdések
Büntet a Google az AI-val írt szövegért?
Nem az előállítás módjáért büntet. A Google dokumentációja szerint a hasznos, emberekért készült tartalom számít, függetlenül attól, hogy ember vagy gép írta. A tömeggyártott, keresési rangsorért létrehozott értéktelen szöveg viszont spam-szabálysértés lehet.
Megbízhatóak az AI-detektorok?
Nem. Rendszeresen megjelölnek emberi szöveget is, különösen szakmai és fordított tartalomnál. Használd őket jelzésre, ne ítéletre. Az olvasás mindig többet mond, mint a százalékos pontszám.
Mennyi konkrétum elég egy oldalra?
Nincs hivatalos küszöb, de gyakorlati mérce, hogy minden 150-200 szóra jusson legalább egy konkrét adat. Ez lehet ár, határidő, méret, ügyfélpélda vagy saját mérés. Ezzel nő a
tény-sűrűség és a
idézhetőség is.
Akkor ne használjak AI-t a szövegíráshoz?
Használd nyugodtan vázlatra, szerkezetre és átfogalmazásra. A saját tudást, a példákat és az adatokat te tedd hozzá. A riportokban a legjobb oldalak jellemzően így készülnek: gépi váz, emberi tartalom.