Duplicate content: teljes útmutató
Duplicate content akkor keletkezik, ha ugyanaz vagy szinte ugyanaz a tartalom több URL-en is elérhető, a saját webhelyen belül vagy különböző webhelyeken. A kereső ilyenkor egy változatot választ ki és mutat meg, a többit háttérbe szorítja. Büntetés ritkán jár érte, a valódi kár a szétaprózott jelzés és a rossz URL kiválasztása. A megoldás a kanonikus változat egyértelmű kijelölése.
Alapfogalmak
A duplikált tartalom, angolul duplicate content, olyan szövegtömb, amely több címen ugyanúgy vagy nagyon hasonlóan jelenik meg. A legtöbb esetben nem másolásról van szó, hanem technikai okról: ugyanaz az oldal elérhető http és https alatt, www-vel és anélkül, záró perjellel és anélkül, vagy paraméterekkel ellátott URL-eken. A látogató ezt nem veszi észre, a kereső számára viszont ezek külön címek, amelyekről el kell döntenie, melyik az igazi.
A Google nyilvános dokumentációja kimondja, hogy a duplikált tartalom önmagában nem ok büntetésre. Kivétel, ha a másolás megtévesztő szándékú, például más webhelyek tartalmának tömeges átvétele a forgalom megszerzésére. A mindennapi gyakorlatban a kérdés nem a büntetés, hanem az, hogy a kereső melyik változatot választja, és hová kerülnek a linkek, a jelzések, a kattintások.
A legfontosabb fogalmak
| Fogalom | Jelentés | Miért számít |
|---|---|---|
| Belső duplikáció | Ugyanaz a tartalom a saját webhely több URL-jén | A leggyakoribb eset, szinte mindig technikai eredetű |
| Külső duplikáció | Ugyanaz a tartalom különböző webhelyeken | Átvétel, szindikáció, gyártói leírás, lopott tartalom |
| Közel duplikált tartalom | Csak apró részletben eltérő lapok | Termékváltozatok, városnévvel sokszorosított lapok |
| Kanonikus URL | Az a változat, amelyet a kereső a csoport képviselőjének tekint | Ez jelenik meg a találatok között, ide gyűlnek a jelzések |
| rel="canonical" | Jelölés, amellyel a webhely megmondja, melyik a preferált változat | Erős javaslat a keresőnek, de nem parancs |
Mi nem duplikált tartalom
- Az idézet forrásmegjelöléssel, ha az oldal többi része saját tartalom.
- A közös elemek: fejléc, lábléc, menü, jogi szöveg. Ezeket a kereső sablonrésznek tekinti.
- A különböző nyelvű változat. Egy magyar és egy német oldal nem duplikátum, ezeket hreflang jelöléssel kell összekötni.
- Az azonos témájú, de más kérdésre felelő lapok. Ezek a kannibalizáció körébe tartoznak, nem a duplikációéba.
A duplikáció leggyakoribb forrásai
A legtöbb webhelyen a duplikáció nem a szerkesztőktől, hanem a rendszertől származik. A tartalomkezelő ugyanazt a bejegyzést elérhetővé teszi a saját címén, a kategória alatt és a dátum szerinti archívumban. A webáruház a terméket több kategóriaútvonalon is kiszolgálja. A kampánykövető paraméterek minden hirdetésből új URL-változatot hoznak létre. A fejlesztői vagy tesztkörnyezet, ha nincs lezárva, az éles webhely teljes másolatát teszi elérhetővé egy másik címen. Ezek egyenként ártalmatlannak tűnnek, együtt viszont sok száz ismétlődő címet jelenthetnek.
A szerkesztői oldalról a közel duplikált lapok a jellemzőek: ugyanaz a szolgáltatásleírás minden városra, ugyanaz a bevezető minden alkategóriában, vagy két, évek különbséggel írt cikk ugyanarról a kérdésről.
Hogyan működik?
Amikor a kereső több, azonos vagy nagyon hasonló tartalmú URL-t talál, csoportba rendezi őket, és kiválaszt egyet kanonikusnak. A Google dokumentációja szerint ezt a döntést több jel alapján hozza meg: a rel="canonical" jelölés, az átirányítások, az oldaltérképben szereplő URL, a belső linkek, a https használata és más tényezők együtt számítanak. A csoport többi tagja jellemzően nem jelenik meg a találatok között.
A kanonikus kiválasztás jelei
- 301-es átirányítás: a legerősebb jelzés, a régi cím a látogató és a kereső számára is megszűnik.
- rel="canonical" jelölés: erős javaslat, a lap elérhető marad, de a jelzés a megjelölt változatra mutat.
- Oldaltérkép: gyengébb jelzés, de segít, ha csak a preferált URL-ek szerepelnek benne.
- Belső linkek: ha a webhely következetesen egy változatra mutat, az megerősíti a választást.
Ha ezek a jelek egymásnak ellentmondanak, például a canonical az egyik URL-re mutat, a belső linkek és az oldaltérkép a másikra, a kereső saját maga dönt, és nem feltétlenül úgy, ahogy a webhely szeretné. Ilyenkor a Search Console URL-vizsgáló eszköze megmutatja a felhasználó által megadott és a Google által választott kanonikus URL-t is.
Mi történik a jelzésekkel
Ha ugyanarra a tartalomra öt különböző URL-en érkeznek külső linkek, a jelzések szétszóródnak. A kanonikus kiválasztás után a kereső ezeket jellemzően a kiválasztott változathoz kapcsolja, de ha a választás rossz, vagy a változatok mégsem elég hasonlók, a jelzés egy része elveszhet. Emellett a feltérképezés ideje is az ismétlődő címekre megy el, ami nagy webhelyen lassíthatja az új oldalak felfedezését.
Külső duplikáció és a forrás
Ha a tartalmat egy másik webhely is közli, a kereső nem mindig az eredeti forrást mutatja. A Google a szindikált tartalomra azt javasolja, hogy az átvevő oldal a forrásra hivatkozzon, és ha lehet, zárja ki a saját példányát az indexből. A rel="canonical" jelölés különböző webhelyek között is használható, de a Google leírása szerint szindikációnál nem ez a javasolt megoldás, mert a lapok eltérhetnek egymástól.
Közel duplikált lapok megítélése
A kereső nem csak a betűre azonos lapokat csoportosítja. Ha két oldal fő tartalma csak néhány szóban tér el, például egy városnévben vagy egy termékszínben, a kereső ezeket is egy csoportba sorolhatja. Hogy pontosan milyen mértékű hasonlóság elég ehhez, az nem nyilvános. A gyakorlati szabály: ha egy olvasó a két lapot egymás mellé téve nem tudná megmondani, miben különböznek, a kereső sem fogja.
Fő módszerek
A duplikáció kezelésének első lépése annak eldöntése, hogy a második URL-re egyáltalán szükség van-e. Ha nincs, átirányítás. Ha van, mert a látogatónak kell, akkor kanonikus jelölés vagy noindex. Ha a két lap valójában különböző kérdésre felelne, akkor a megoldás nem technikai, hanem tartalmi: meg kell különböztetni őket.
Döntési szabály
| Helyzet | Megoldás |
|---|---|
| Ugyanaz az oldal több címen (http/https, www, perjel) | 301-es átirányítás egy változatra, egész webhelyre kiterjedően |
| Paraméteres URL (rendezés, követőkód, munkamenet) | rel="canonical" a paraméter nélküli változatra, belső linkek a tiszta URL-re |
| Nyomtatható vagy alternatív nézet | rel="canonical" az alap oldalra |
| Két régi cikk ugyanarról, mindkettő gyenge | Összevonás egy lapba, a másikról 301-es átirányítás |
| Termékváltozatok (szín, méret) külön URL-en, azonos leírással | Egy fő termékoldal kanonikusként, vagy egyedi tartalom, ha a változatra külön keresnek |
| Saját cikk más webhelyen is megjelenik | Forrásmegjelölés és link az eredetire, az átvevőnél lehetőleg noindex |
| Más webhely engedély nélkül átvette a tartalmat | Kapcsolatfelvétel, szükség esetén szerzői jogi eltávolítási kérelem |
Ha két lap összevonása mellett döntesz, a részletes eljárást a content consolidation útmutató írja le. Ha a lapok nem ugyanazok, csak mindkettő sovány, a thin content útmutató döntési szabálya a jobb kiindulópont.
Technikai alapbeállítások
- Egyetlen protokoll és domainváltozat: minden más 301-gyel erre mutat.
- Egységes záró perjel kezelés az egész webhelyen.
- Önhivatkozó canonical minden indexelhető lapon, abszolút URL-lel.
- Az oldaltérképben csak kanonikus URL-ek szerepelnek.
- A belső linkek a kanonikus URL-re mutatnak, nem átirányított vagy paraméteres változatra.
- A szűrő- és rendezőparaméterek ne hozzanak létre indexelhető, belső linkkel elérhető új lapokat, ha nincs rájuk keresési igény.
Tartalmi megkülönböztetés
Ha két lapra valóban szükség van, mert más a keresési szándék, a tartalmuknak is különböznie kell. Egy „futócipő nőknek" és egy „futócipő terepre" kategória lehet teljesen jogos, de ha mindkettő ugyanazt a bevezetőt és ugyanazt a terméklistát mutatja, a kereső nem látja a különbséget. A bevezetőnek, a kiemelt termékeknek és a tanácsoknak a szándékhoz kell igazodniuk.
Kidolgozott példa: webáruház szűrőparaméterekkel
Egy ruházati webáruház kategóriaoldalai a szín, a méret és a rendezés szerint paraméteres URL-eket hoztak létre, és ezekre a szűrőpanel minden kombinációban belső linket tett. A Search Console oldalindexelési jelentésében sok olyan lap jelent meg, amelyet a kereső duplikátumnak tekintett, és a kiválasztott kanonikus néha egy rendezett változat volt, nem az alap kategória. A javítás: minden paraméteres változat rel="canonical" jelölést kapott az alap kategóriára, a rendezés linkjei nem kerültek az oldaltérképbe, és a menü, a morzsamenü, valamint a termékoldalak visszamutató linkjei a tiszta URL-re mutattak. Azok a szűrők, amelyekre valós keresési igény volt, például egy népszerű márka és kategória párosa, saját, egyedi bevezetővel ellátott, indexelhető lapot kaptak.
Második példa: cikk más oldalon
Egy szakmai blog cikkét egy ágazati portál is közölte, engedéllyel. Néhány hét után a portál példánya állt a saját cikk előtt a találatok között. A megoldás: a portál a cikk elejére forrásmegjelölést és linket tett az eredetire, a saját példányát pedig kizárta az indexből. A blog a jövőben néhány napos késleltetéssel engedte az átvételt, így az eredeti cikket a kereső előbb találta meg.
Gyakori hibák
A duplikációval kapcsolatos hibák nagy része abból adódik, hogy a jelzések ellentmondanak egymásnak, vagy hogy a technikai eszközt olyan helyzetre alkalmazzák, amelyre nem való. A kereső ilyenkor figyelmen kívül hagyja a jelölést, és maga dönt.
Tévhit: a duplikált tartalom büntetést hoz
Ez a téma leggyakoribb félreértése. A Google többször és nyilvánosan leírta, hogy a technikai okból ismétlődő tartalomért nem jár büntetés, a kereső egyszerűen kiválaszt egy változatot. A büntetéstől való félelem miatt sok webhely túlreagál: mindent noindexel, vagy tömegesen töröl, és ezzel jó lapokat is kivesz a találatok közül. A valódi kockázat az, hogy a kereső rossz URL-t választ, és a jelzések szétszóródnak.
Ellenpélda: canonical minden lapon a kezdőlapra
Egy hibás sablon miatt a webhely összes oldala a kezdőlapot jelölte meg kanonikusként. A kereső egy ideig valószínűleg figyelmen kívül hagyja a nyilvánvalóan téves jelölést, de a jelzés zavaros, és a belső oldalak kieshetnek. A canonical csak akkor működik, ha a két lap tartalma valóban azonos vagy nagyon hasonló.
További hibák
- Canonical és noindex ugyanazon a lapon. A kettő ellentmondó jelzés: az egyik azt mondja, a jelzés menjen át, a másik, hogy a lap ne legyen indexben.
- Robots.txt tiltás a duplikátumokra. Ha a kereső nem tudja feltérképezni a lapot, a rajta lévő canonical jelölést sem látja.
- Relatív vagy hibás canonical URL. Elgépelt, átirányított vagy 404-es címre mutató jelölés.
- Belső linkek a nem kanonikus változatra. A webhely maga cáfolja a saját jelölését.
- Közel duplikált lapok tömeges gyártása. Városnévvel vagy kulcsszóval sokszorosított lapok, amelyek csak egy szóban térnek el.
Hiba: a migráció utáni duplikáció
Domainváltáskor, új tartalomkezelőre költözéskor vagy URL-szerkezet módosításakor gyakori, hogy a régi címek nem kapnak átirányítást, vagy a régi és az új változat egy ideig párhuzamosan él. Ilyenkor a kereső két teljes webhelyet lát ugyanazzal a tartalommal. A migráció előtt ezért teljes URL-térkép kell a régi és az új címek párosításával, utána pedig ellenőrizni kell, hogy minden régi cím egyetlen lépésben, 301-gyel a megfelelő új címre mutat.
Hiba: nyitva hagyott tesztkörnyezet
A fejlesztői vagy staging webhely, ha jelszó nélkül elérhető és nincs kizárva az indexből, a teljes éles tartalom másolata. A legbiztosabb védelem a jelszavas hozzáférés, mert a noindex jelölés élesítéskor könnyen átkerülhet az éles webhelyre is, ami sokkal nagyobb kárt okoz.
Mérés
A duplikáció mérése a webhely feltérképezésével és a Search Console indexelési adataival kezdődik. A cél kettős: megtalálni, hol ismétlődik a tartalom, és ellenőrizni, hogy a kereső a kívánt változatot választja-e kanonikusnak.
Mit nézz meg és hol
| Mit nézel | Honnan | Mire figyelj |
|---|---|---|
| „Duplikátum, a Google más kanonikus oldalt választott" állapot | Search Console, oldalindexelés | Ha fontos lap szerepel itt, a jelzések ellentmondanak |
| „Duplikátum, a felhasználó nem jelölt ki kanonikus oldalt" | Search Console, oldalindexelés | Hiányzik a canonical, a kereső maga dönt |
| Google által választott kanonikus URL | URL-vizsgáló eszköz | Egyezik-e a te jelöléseddel |
| Azonos cím, leírás vagy törzsszöveg több URL-en | Feltérképező eszköz | Sablonhiba vagy paraméteres ismétlődés |
| Saját szöveg más webhelyen | Egy jellegzetes mondat idézőjeles keresése | Átvétel forrásmegjelölés nélkül |
Ellenőrzőlista
- A webhely egyetlen protokollon és domainváltozaton érhető el.
- Minden indexelhető lapon van önhivatkozó, abszolút canonical.
- A canonical, a belső linkek és az oldaltérkép ugyanarra a változatra mutat.
- A paraméteres URL-ek nem jelennek meg indexelhető lapként, hacsak nincs rájuk igény.
- A Search Console-ban a fontos lapoknál a Google által választott kanonikus egyezik a megadottal.
- A szindikált tartalom az átvevő oldalon hivatkozik az eredetire.
Hogyan keress külső másolatokat
A saját tartalom külső átvételét a legegyszerűbben úgy találod meg, hogy a szöveg egy jellegzetes, hosszabb mondatát idézőjelek között beírod a keresőbe. Ha más webhely is megjelenik, nézd meg, van-e forrásmegjelölés és link. Engedélyezett átvételnél kérd a hivatkozást, engedély nélküli, teljes másolásnál először a webhely üzemeltetőjét érdemes megkeresni. A rendszeres ellenőrzéshez elég néhány fontos lapot kiválasztani, nem kell minden cikket figyelni.
Követés a javítás után
A kanonikus változások feldolgozása időbe telik, mert a kereső a lapokat újra fel kell térképezze. Néhány hét után érdemes megnézni, csökkent-e a duplikátumként jelölt fontos lapok száma, és a fő URL-ek organikus teljesítménye javult-e. Ha egy lapnál a Google továbbra is mást választ, érdemes megvizsgálni, miben tér el a két változat, mert lehet, hogy nem is elég hasonlók ahhoz, hogy a kanonikus jelölés érvényesüljön.
Kapcsolódó részletes útmutatók
Csináltassuk meg helyetted
Ha ez sok, mi elvégezzük. Egy munkanapon belül konkrét ajánlatot kapsz.