Tartalomkészítés.hu

WordPress robots.txt: teljes útmutató

WordPress SEO

A WordPress robots.txt egy egyszerű szöveges fájl a domain gyökerében, amely megmondja a keresőrobotoknak, mely útvonalakat ne kérjenek le. A WordPress alapból virtuális fájlt generál, ezt SEO bővítménnyel vagy fizikai fájllal felülírhatod. A robots.txt a feltérképezést szabályozza, nem az indexelést: oldal eltávolítására a noindex való, nem a Disallow.

Alapfogalmak

Mielőtt bármit átírsz, érdemes tisztázni néhány fogalmat, mert a robots.txt körüli hibák nagy része abból fakad, hogy valaki összekeveri a feltérképezést (crawling) és az indexelést (indexing). A kettő két külön lépés, és a robots.txt csak az elsőre hat közvetlenül.

A robots.txt a Robots Exclusion Protocol része, amelyet a Google és több nagy kereső szabványként kezel. A fájlnak mindig a domain gyökerében kell lennie, például https://pelda.hu/robots.txt címen. Almappában elhelyezett robots.txt-t a robotok nem keresnek, és aldomainenként (például blog.pelda.hu) külön fájl szükséges. Ugyanez igaz a protokollra: a http és a https változat elvileg külön hosztnak számít, ezért ha átirányítás nélkül mindkettő elérhető, mindkettő saját robots.txt-t mutathat.

Feltérképezés kontra indexelés

A feltérképezés azt jelenti, hogy a robot lekéri az oldalt és elolvassa a tartalmát. Az indexelés azt, hogy a kereső eltárolja az oldalt, és megjelenítheti a találatok között. Ha egy URL-t Disallow szabállyal tiltasz, a robot nem olvassa el, de ha más oldalakról erős linkek mutatnak rá, a kereső ettől még felveheti az indexbe, ilyenkor jellemzően leírás nélkül jelenik meg. Ráadásul a tiltott oldalon elhelyezett noindex utasítást a robot nem is látja, hiszen nem kéri le az oldalt.

A fájl építőkövei

  • User-agent: megadja, melyik robotra vonatkozik a csoport. A csillag (*) minden robotot jelent.
  • Disallow: az az útvonal, amelyet a robot ne kérjen le.
  • Allow: kivétel egy tiltott útvonalon belül. A Google és a Bing támogatja.
  • Sitemap: az XML oldaltérkép teljes, abszolút URL-je. Bárhol állhat a fájlban, nem kötődik User-agent csoporthoz.
  • Helyettesítő karakterek: a * tetszőleges karaktersort, a $ az URL végét jelöli.

Virtuális és fizikai robots.txt

A WordPress különlegessége, hogy alapesetben nincs valódi robots.txt fájl a szerveren. Amikor a robot lekéri a címet, a WordPress futás közben állítja elő a tartalmat. Ez a virtuális robots.txt. Ha viszont feltöltesz egy valódi robots.txt fájlt a telepítés gyökerébe, a webszerver azt szolgálja ki, és a WordPress generált változata háttérbe szorul. Ez fontos részlet: ha egy bővítményben szerkeszted a fájlt, de közben ott van egy régi fizikai fájl, a módosításaid nem fognak élni.

Mire nem való a robots.txt

Gyakori tévhit, hogy a robots.txt biztonsági eszköz. Nem az. A fájl nyilvános, bárki elolvashatja, így ha ide írod a rejtett admin útvonalat vagy egy bizalmas mappát, éppen felhívod rá a figyelmet. A jóindulatú robotok betartják, a rosszindulatúak nem. Érzékeny tartalmat jelszóval vagy szerveroldali hozzáférés-korlátozással védj. Az oldalak indexből való kivételére pedig a noindex meta tag vagy az X-Robots-Tag HTTP fejléc a megfelelő eszköz. A tágabb képhez érdemes elolvasni a WordPress SEO: teljes útmutató anyagát is, mert a robots.txt csak egy eleme a technikai beállításoknak.

CélMegfelelő eszközRobots.txt alkalmas rá?
Robot ne pazarolja az időt szűrőoldalakraDisallowIgen
Oldal ne jelenjen meg a találatok közöttnoindexNem
Bizalmas tartalom védelmeJelszó, szerverszabályNem
Oldaltérkép megadásaSitemap sorIgen

Hogyan működik?

A működés megértéséhez érdemes végigkövetni, mi történik, amikor egy keresőrobot először érkezik az oldaladra. Mielőtt bármilyen tartalmi URL-t lekérne, lekéri a /robots.txt címet. A válasz HTTP állapotkódja és tartalma határozza meg, hogyan viselkedik utána.

A WordPress alapértelmezett kimenete

Egy friss WordPress telepítés virtuális robots.txt-je jellemzően így néz ki:

  • User-agent: *
  • Disallow: /wp-admin/
  • Allow: /wp-admin/admin-ajax.php
  • Sitemap: https://pelda.hu/wp-sitemap.xml

Az admin mappa tiltása logikus, ott nincs indexelendő tartalom. Az admin-ajax.php engedélyezése azért kell, mert sok téma és bővítmény ezen keresztül tölt be tartalmat a látogatói oldalon, és ha a robot nem érné el, rosszabbul tudná megjeleníteni az oldalt. A Sitemap sor a WordPress beépített oldaltérképére mutat. Ha SEO bővítményt használsz, az gyakran kikapcsolja a beépített térképet és a sajátját adja meg helyette, ezért a pontos kimenet telepítésenként eltérhet. Mindig a saját élő fájlodat nézd meg, ne egy általános mintát.

A szabályok kiértékelése

A robot először kiválasztja a rá vonatkozó User-agent csoportot. Ha van rá név szerint szóló csoport (például Googlebot), akkor csak azt követi, a csillagos csoportot figyelmen kívül hagyja. Ez sok meglepetés forrása: ha külön csoportot írsz a Googlebotnak, abba minden szükséges tiltást újra bele kell tenned.

A csoporton belül a Google a leghosszabb, azaz legspecifikusabb egyező szabályt alkalmazza. Ha egy Allow és egy Disallow azonos hosszúságban egyezik, a kevésbé korlátozó, vagyis az Allow nyer. Nézz egy saját példát:

  • Disallow: /wp-content/
  • Allow: /wp-content/uploads/

A /wp-content/uploads/2026/09/kep.jpg esetén az Allow szabály hosszabb egyezést ad, tehát a kép lekérhető. A /wp-content/plugins/valami.js viszont tiltott marad. Ez a példa egyúttal jól mutatja, miért veszélyes az egész wp-content tiltása: a bővítmények CSS és JS fájljai nélkül a Google rosszul rendereli az oldalt.

Állapotkódok és gyorsítótár

A Google dokumentációja szerint a robots.txt válaszkódja is számít. Ha a fájl 404-et ad, a robot úgy veszi, hogy nincs korlátozás. Ha szerverhiba (5xx) jön tartósan, a Google óvatosabbá válik, és átmenetileg visszafoghatja a feltérképezést. A robots.txt tartalmát a Google általában legfeljebb nagyjából egy napig gyorsítótárazza, így egy módosítás nem feltétlenül azonnal érvényesül. A Google a fájlból egy méretkorlát (500 KiB) feletti részt figyelmen kívül hagy, de egy WordPress oldalnál ez gyakorlatilag soha nem gond.

A „Keresőmotorok elrejtése” beállítás

A Beállítások menü Olvasás oldalán található jelölőnégyzet régebbi WordPress verziókban a robots.txt-be írt egy teljes tiltást. Újabb verziókban ehelyett noindex jellegű robots meta utasítást tesz az oldalakra. A gyakorlati következmény ugyanaz: ha éles oldalon bekapcsolva marad, az oldal kiesik a keresőből. Fejlesztői oldalon hasznos, élesítéskor viszont az első dolgok egyike, amit ellenőrizni kell.

Mi történik a háttérben, lépésről lépésre

  1. A robot lekéri a /robots.txt címet.
  2. Ha létezik fizikai fájl, a webszerver azt adja vissza.
  3. Ha nincs, a kérés a WordPresshez kerül, amely összeállítja a virtuális tartalmat, a bővítmények pedig szűrőn keresztül módosíthatják.
  4. A robot kiválasztja a csoportot, kiértékeli a szabályokat, majd ennek alapján kéri le az URL-eket.

Fő módszerek

A WordPress robots.txt szerkesztésére három bevett út van: SEO bővítmény, fizikai fájl feltöltése, vagy kódból, szűrővel történő módosítás. Mindháromnak megvan a helye, a választás attól függ, mennyire szeretnéd a felületről kezelni, és ki más fér hozzá az oldalhoz.

1. Szerkesztés SEO bővítménnyel

A legtöbb oldaltulajdonosnak ez a legegyszerűbb. A népszerű SEO bővítmények beépített robots.txt szerkesztőt kínálnak, amely a virtuális fájlt módosítja. A Yoast SEO-ban ez az Eszközök között, a fájlszerkesztőben érhető el, a Rank Mathben az általános beállításoknál, az All in One SEO-ban pedig külön robots.txt modulként. A menüpontok elnevezése verziónként változhat, ezért a részletes lépésekhez nézd meg a megfelelő anyagot: Yoast SEO: teljes útmutató, Rank Math: teljes útmutató, illetve All in One SEO: teljes útmutató.

Előnye, hogy nem kell FTP-hez nyúlnod, és a bővítmény gyakran automatikusan beteszi a saját oldaltérképe címét. Hátránya, hogy ha később bővítményt váltasz, a beállítás vele együtt eltűnhet, és ha valaki közben fizikai fájlt töltött fel, a szerkesztő hatástalan lesz. Néhány bővítmény ilyenkor figyelmeztet, de erre ne építs.

2. Fizikai fájl feltöltése

Készíts egy egyszerű, UTF-8 kódolású szöveges fájlt robots.txt néven, és töltsd fel FTP-n, SFTP-n vagy a tárhely fájlkezelőjén keresztül a WordPress gyökérkönyvtárába, ugyanoda, ahol a wp-config.php is van. Ez a megoldás független minden bővítménytől, verziókövetésbe tehető, és pontosan tudod, mi van benne. A hátránya, hogy a felületről nem látszik, így egy későbbi kolléga könnyen nem tud róla.

3. Módosítás szűrővel

Fejlesztőknek a WordPress biztosít egy robots_txt nevű szűrőt, amellyel a virtuális kimenethez sorokat fűzhetsz egy saját bővítményben vagy a gyerektéma functions.php fájljában. Ez akkor praktikus, ha több oldalt kezelsz egységes szabályokkal, vagy ha a tartalmat környezettől függően (fejlesztői és éles) szeretnéd változtatni.

Döntési szabály: melyiket válaszd?

HelyzetJavasolt módszer
Egy oldal, nem technikai tulajdonosSEO bővítmény szerkesztője
Fejlesztő kezeli, verziókövetés vanFizikai fájl vagy szűrő
Több oldal, közös szabályokSzűrő saját bővítményben
Fejlesztői és éles környezet eltérSzűrő környezetfüggő feltétellel

Egy kidolgozott minta egy webáruházhoz

Vegyünk egy szemléltető WooCommerce boltot, ahol a termékszűrők paraméterekkel rengeteg URL-változatot gyártanak (például ?filter_szin=piros&orderby=price). Egy ésszerű kiindulópont:

  • User-agent: *
  • Disallow: /wp-admin/
  • Allow: /wp-admin/admin-ajax.php
  • Disallow: /kosar/
  • Disallow: /penztar/
  • Disallow: /*?orderby=
  • Disallow: /*filter_
  • Sitemap: https://pelda.hu/sitemap_index.xml

A kosár és pénztár oldalak elérési útja a te boltodban más lehet, ezeket a WooCommerce beállításaiból ellenőrizd. A szűrőparaméterek tiltása csak akkor jó ötlet, ha ezek az oldalak tényleg nem hordoznak keresési értéket. Ha egy szűrt kategória (például „piros női cipő”) önálló céloldal lenne, azt ne tiltsd, hanem adj neki tiszta URL-t.

Bevezetési munkafolyamat

  1. Mentsd el a jelenlegi élő fájl tartalmát.
  2. Írd le, mit akarsz elérni egy-egy szabállyal, és melyik URL-mintára vonatkozik.
  3. Gyűjts öt-tíz valódi URL-t, amelyeknek tiltottnak, és ugyanennyit, amelyeknek engedélyezettnek kell lenniük.
  4. Ellenőrizd a szabályokat ezeken a mintákon, mielőtt élesíted.
  5. Élesítés után böngészőben nyisd meg a /robots.txt címet, és nézd meg, valóban az új tartalom jelenik-e meg.

Gyakori hibák

A robots.txt rövid fájl, mégis kevés olyan beállítás van, amellyel egyetlen sorral ekkora kárt lehet okozni. Az alábbi hibák visszatérően előfordulnak WordPress oldalakon, többségük élesítéskor vagy bővítményváltáskor csúszik be.

Teljes tiltás élesítés után is

A legsúlyosabb hiba a fejlesztés idejére beállított Disallow: / vagy a bekapcsolva felejtett „Keresőmotorok elrejtése” opció. A két sor közti különbség apró: Disallow: üresen semmit nem tilt, Disallow: / mindent. Egy perjelen múlik, hogy az oldal látszik-e a keresőben.

CSS, JavaScript és képek tiltása

Régi tanácsként még ma is kering a /wp-includes/ vagy a /wp-content/ tiltása. A Google renderelve értékeli az oldalakat, ehhez szüksége van a stíluslapokra és szkriptekre. Ha ezeket tiltod, az oldal a robot szemében töröttnek tűnhet, és ez hathat a mobilbarát értékelésre és a tartalom értelmezésére. A wp-content/uploads tiltása pedig a képeidet veszi ki a képkeresésből.

Disallow a noindex helyett

Ha egy oldalt ki akarsz venni a találatok közül, és Disallow-val tiltod, a robot nem látja a noindex utasítást. Az oldal ilyenkor az indexben maradhat. A helyes sorrend: előbb noindex, várd meg, amíg az oldal kiesik, és csak utána, ha egyáltalán szükséges, jöhet a tiltás. A Google 2019 óta azt sem támogatja, hogy a robots.txt-be írt noindex sort figyelembe vegye, ezért az ilyen sorok hatástalanok.

Ütköző fájlok és bővítmények

Egy fizikai fájl és egy bővítményes szerkesztő egyszerre nem tud érvényben lenni. Ha valaki régen feltöltött egy fájlt, majd egy SEO bővítményben dolgozol, a módosításaid nem élnek. Két SEO bővítmény párhuzamos használata szintén zavart okozhat a Sitemap sorokban.

Rossz vagy elavult Sitemap cím

Bővítményváltás után gyakran a régi oldaltérkép címe marad a fájlban, amely 404-et ad vagy átirányít. Relatív útvonal (Sitemap: /sitemap.xml) sem jó, teljes URL kell protokollal együtt.

Kis- és nagybetű, helyettesítő karakterek

Az útvonalak kis- és nagybetű érzékenyek: a /Kosar/ tiltása nem érinti a /kosar/ címet. A $ jel elhagyása is meglepetést okozhat: a Disallow: /*.pdf minden olyan URL-t tilt, amelyben a „.pdf” szerepel, míg a Disallow: /*.pdf$ csak a .pdf végűeket.

Crawl-delay és egyéb nem támogatott sorok

A Crawl-delay utasítást a Google figyelmen kívül hagyja. Más keresők értelmezhetik, de ha a Google robotjának terhelése a gond, arra nem ez a megoldás.

Ellenőrzőlista minden módosítás előtt

  • Nincs a fájlban Disallow: / a csillagos csoportban.
  • A „Keresőmotorok elrejtése” ki van kapcsolva az éles oldalon.
  • CSS, JS és a feltöltött képek nincsenek tiltva.
  • Egyetlen forrás határozza meg a fájlt (fizikai fájl vagy bővítmény, nem mindkettő).
  • A Sitemap sor abszolút, élő, 200-as kódot adó címre mutat.
  • Nincs tiltva olyan oldal, amelyen noindex-et vársz.
  • Ha van Googlebotra szóló külön csoport, abban minden szükséges szabály benne van.
  • Nincs a fájlban bizalmas útvonal, amelyet nem akarsz nyilvánossá tenni.

Határeset: staging aldomain

Ha a fejlesztői másolat a staging.pelda.hu címen fut, a saját robots.txt-je ott tilthat mindent, ez nem érinti az éles domaint. A gond akkor kezdődik, amikor a staging adatbázisát és fájljait egy az egyben átmásolják az élesre, és a tiltás vele jön. Ezért az élesítési lépések közé mindig vedd fel a robots.txt ellenőrzését. Ráadásul a staging robots.txt tiltása önmagában nem garantálja, hogy a fejlesztői oldal ne kerüljön indexbe; jelszavas védelem biztosabb.

Mérés

A robots.txt módosításának hatása nem mindig látszik azonnal, és nem is a forgalomban jelentkezik elsőként. A mérés célja kettős: igazolni, hogy a fájl azt csinálja, amit akartál, és időben észrevenni, ha valami olyat is tilt, amit nem kellett volna.

Google Search Console robots.txt jelentés

A Search Console beállításai között található robots.txt jelentés megmutatja, mely robots.txt fájlokat találta a Google a webhelyedhez, mikor kérte le őket utoljára, és jelzi a feldolgozási hibákat vagy figyelmeztetéseket. Sürgős esetben innen kérheted az újbóli lekérést is, ami hasznos, ha egy hibás tiltást kell gyorsan visszavonni.

URL-ellenőrző eszköz

Egy-egy konkrét címnél az URL-ellenőrzés megmutatja, engedélyezi-e a feltérképezést a robots.txt. Ha a válasz az, hogy a robots.txt blokkolja, és ennek nem kellene így lennie, megvan a hiba forrása. A korábban mintaként összegyűjtött tiltott és engedélyezett URL-eket érdemes itt egyenként végignézni.

Oldalindexelési jelentés

Az indexelési jelentésben külön kategória jelzi a robots.txt által letiltott oldalakat, illetve azokat, amelyek tiltás ellenére indexbe kerültek. Az utóbbi tipikusan azt jelzi, hogy noindex kellett volna oda tiltás helyett. Ha egy módosítás után ezeknek a számoknak a nagyságrendje hirtelen megváltozik, nézz utána, melyik szabály okozza.

Feltérképezési statisztikák

A Search Console feltérképezési statisztikái mutatják a napi kérések számát, a válaszkódok megoszlását és azt is, hogy a robots.txt lekérése sikeres volt-e. Egy szűrőoldalakat tiltó módosítás után azt várod, hogy a robot kevesebb paraméteres URL-t kérjen le, és több időt töltsön a fontos oldalakon. Ezt a változást hetek alatt érdemes nézni, nem napok alatt.

Szervernaplók

Ha hozzáférsz a webszerver naplóihoz, ez a legpontosabb forrás. Szűrj a Googlebot user-agentre (és lehetőleg ellenőrizd, hogy a kérések valóban a Google-től jönnek), majd csoportosítsd a lekért URL-eket mintázat szerint. Így látod, hány kérés ment korábban paraméteres vagy felesleges oldalakra, és ez hogyan változott.

Szemléltető mérési terv

Az alábbi táblázat kitalált számokkal mutatja, hogyan érdemes egy módosítás előtti és utáni állapotot rögzíteni. A saját értékeidet a Search Console-ból és a naplókból töltsd ki.

MutatóElőtte (szemléltető)Utána, 4 hét (szemléltető)Forrás
Paraméteres URL-ekre jutó Googlebot kérés aránya45%10%Szervernapló
Robots.txt által letiltott oldalak száma1203 400Indexelési jelentés
Tiltás ellenére indexelt oldalak1515 vagy kevesebbIndexelési jelentés
Robots.txt lekérés hibája00Feltérképezési statisztikák

A letiltott oldalak számának növekedése itt nem baj, hanem a szándékolt hatás. A figyelmeztető jel az lenne, ha a fontos termék- vagy cikkoldalak közül kerülne be bármi a letiltottak közé.

Rendszeres felülvizsgálat

  1. Havonta nyisd meg az élő /robots.txt címet, és vesd össze a mentett változattal.
  2. Minden bővítmény- vagy témaváltás után ellenőrizd újra.
  3. Negyedévente nézd át az indexelési jelentés tiltott oldalait mintavétellel.
  4. Élesítés és migráció után a robots.txt ellenőrzése az első lépések egyike legyen.

Kapcsolódó részletes útmutatók

A robots.txt a WordPress technikai SEO egyik alapeleme, de önmagában ritkán oldja meg a feltérképezési és indexelési problémákat. Az oldaltérkép, a noindex beállítások, a kanonikus URL-ek és a belső linkelés együtt határozzák meg, mit lát és mit tart értékesnek a kereső. Ezért érdemes a robots.txt beállítását mindig a teljes technikai kép részeként kezelni.

Hogyan haladj tovább

Ha most állítod be először az oldalad SEO alapjait, kezdd az átfogó anyaggal, és csak utána mélyedj el a használt bővítményben. Ha már van SEO bővítményed, a hozzá tartozó útmutatóban megtalálod, hol szerkesztheted a robots.txt-t, hogyan kezeli az oldaltérképet, és hol állíthatsz noindex-et az archívumokra, címkékre vagy szerzői oldalakra. Ez utóbbi különösen fontos, mert sok olyan oldaltípust, amelyet régen robots.txt-vel tiltottak, ma inkább noindex-szel érdemes kezelni.

Melyik útmutató mikor hasznos

Egy gyors összefoglaló döntési sor

Mielőtt bármelyik útmutatóra továbbmész, ezt a rövid döntési sort érdemes megjegyezni, mert a legtöbb robots.txt kérdésre választ ad:

  1. Azt akarod, hogy az oldal ne jelenjen meg a keresőben? Akkor noindex, nem Disallow.
  2. Azt akarod, hogy a robot ne pazarolja az idejét értéktelen URL-változatokra? Akkor Disallow, célzott mintával.
  3. Védeni akarsz valamit? Akkor jelszó vagy szerveroldali korlátozás, nem robots.txt.
  4. Bizonytalan vagy egy szabály hatásában? Akkor előbb valódi URL-mintákon ellenőrizd, és csak utána élesítsd.

Ezzel a négy kérdéssel a WordPress robots.txt beállításainak nagy része gyorsan eldönthető, a bővítményspecifikus részleteket pedig a fenti útmutatókban találod meg.

Csináltassuk meg helyetted

Ha ez sok, mi elvégezzük. Egy munkanapon belül konkrét ajánlatot kapsz.

Ajánlatot kérek