A technikai alapok azok a szerver- és HTML-szintű feltételek, amelyek nélkül egy weboldalt sem a keresőrobotok, sem a nyelvi modellek nem tudnak megbízhatóan beolvasni. Ez a réteg a tartalom alatt helyezkedik el: még azelőtt eldől, hogy bárki elolvasná az első mondatot.
A legtöbb ilyen szabály egyszerű igen-nem kérdés. Vagy 200-as a válasz, vagy nem. Vagy van canonical, vagy nincs. Épp ezért gyorsan ellenőrizhető és gyorsan javítható terület.
Mi tartozik ide
- Elérés és biztonság: HTTPS érvényes tanúsítvánnyal, a kezdőoldal 200-as státuszkódja, stabil válaszidő, egyetlen végleges domain-változat.
- Feltérképezés és indexelés: robots.txt, XML sitemap, Canonical URL címek, noindex, meta robots és X-Robots-Tag jelölések, soft-404 kezelés.
- Dokumentum-váz: doctype, charset, viewport, nyelvi jelölés, favicon, belső linkek, alt szövegek.
- Kódhigiénia: elavult HTML-tagek, inline CSS, nyílt szöveges e-mail cím, W3C-validáció, használaton kívüli shop-plugin, böngészős jó gyakorlatok.
Hogyan működik a gépi olvasás
A robot mindig ugyanabban a sorrendben halad. Először feloldja a domaint, majd HTTP-kérést küld. Utána megnézi a robots.txt tartalmát, és csak ezután tölti le a HTML-t.
Minden lépés kapu. Ha a tanúsítvány lejárt, nincs második esély a tartalomra. Ha a robots.txt tilt, a legszebb szöveg sem jut el sehová. A riportokban ezt látjuk a leggyakrabban: nem a tartalommal van baj, hanem azzal, hogy oda sem ér a robot.
Fontossági sorrend
- Kapu-szabályok: elérhetőség, HTTPS, a kezdőoldal státusza, robots.txt, noindex, domain-átirányítás. Ezek bármelyike nullázza a többit.
- Értelmezés: canonical, sitemap, doctype, charset és viewport, lang attribútum, soft-404.
- Tartalmi kapcsolódás: belső linkek, alt szövegek, favicon.
- Higiénia: elavult tagek, inline CSS, W3C-hibák, nyílt e-mail cím, felesleges shop-plugin.
Előbb mindig felfelé haladj a listán. Alt szövegeket javítani lejárt tanúsítvány mellett értelmetlen munka.
Miért más ez a generatív keresőknek
A klasszikus keresőrobot türelmes. Visszajön holnap, rendereli a JavaScriptet, kijavítja magában a rossz HTML-t. Az AI-crawlerek jóval szigorúbbak.
Sok nyelvi modell nyers HTML-t dolgoz fel, futtatott JavaScript nélkül. Ilyenkor a szerkezet maga a jelentés. A hiányzó lang attribútum, a szétesett címhierarchia vagy a canonical nélküli duplikátum közvetlenül rontja a kinyert információ pontosságát.
Mit néz ebből a riport
Az audit Technikai alapok területe húsz szabályt futtat le a kezdőoldalon és a kiszolgáló válaszán. A riport kapu-szabályként kezeli a HTTPS-t, a státuszkódot, a robots.txt-t és a noindex jelölést: ezek bukása lehúzza a teljes eredményt. A többi szabály pontlevonással jelenik meg, hatás szerint besorolva.
Röviden: a technikai alapok nem rangsoroló tényezők, hanem belépőjegy. Amíg ez nincs rendben, minden más befektetés kisebb hozamot hoz.