Technické SEO

Indexace stránek

Definice

Indexace stránek je proces, při kterém vyhledávač uloží stránku do své databáze (indexu). Jen zaindexovaná stránka se může zobrazit ve výsledcích vyhledávání - dokud v indexu není, pro vyhledávač neexistuje, ať je jakkoli kvalitní. Google přitom nezaručuje, že do indexu zařadí každou stránku.

Index je databáze, ze které vyhledávač skládá výsledky. Když se člověk na něco zeptá, nehledá Google v tu chvíli po internetu - prochází svůj index, tedy to, co si stáhl a zpracoval dřív. Odtud plyne celý význam indexace: bez zápisu v indexu se stránka nemůže zobrazit na žádný dotaz, i kdyby byla nejlepší na trhu.

Cesta stránky do indexu

Než se stránka objeví ve výsledcích, musí projít třemi fázemi:

  1. Objevení. Vyhledávač o adrese musí vědět. Dozví se ji z odkazu na jiné stránce, ze sitemapy, nebo mu ji pošlete sami.
  2. Procházení (crawling). Robot stránku stáhne. Tady rozhoduje dostupnost - návratový kód, rychlost serveru, přístupnost bez přihlášení.
  3. Indexace. Vyhledávač obsah zpracuje, vyhodnotí a rozhodne se, jestli ho uloží.

Ta poslední věta je důležitá. Indexace není automatický důsledek procházení - je to rozhodnutí. Google to v nápovědě říká rovnou: nezaručuje, že se do indexu dostanou všechny stránky.

Stavy v Search Console a co z nich čtu

Nejužitečnější nástroj je v Search Console přehled Indexování stránek. Dva stavy se přitom pletou nejčastěji, přitom znamenají úplně jinou diagnózu:

  • „Objeveno - momentálně neindexováno” - Google adresu zná, ale ještě ji neprošel. Podle jeho vlastního vysvětlení k tomu typicky dochází proto, že by procházení web přetížilo, takže si ho odložil. To je signál o serveru a kapacitě, ne o obsahu.
  • „Procházeno - momentálně neindexováno” - stránku stáhl a rozhodl se ji neuložit. Tady je problém v hodnotě stránky, ne v technice. Google k tomu dodává, že URL není potřeba posílat k procházení znovu.

Další stavy, se kterými se v auditu potkávám nejčastěji: Vyloučeno značkou noindex, Blokováno v souboru robots.txt a Duplicitní stránka bez kanonické verze zvolené uživatelem. U blokace v robots.txt má Google poznámku, kterou je dobré si přečíst dvakrát: blokování procházení nezaručuje, že se stránka do indexu nedostane jinou cestou. Blokovat a doufat, že to funguje jako noindex, tedy nestačí.

Jak ověřit, co je v indexu

Search Console je zdroj pravdy, ale i ta má limity - seznam příkladů URL v každém stavu je omezený na tisíc adres, takže u velkých webů vidíte vzorek, nikoli inventuru.

Operátor site:vasedomena.cz se hodí na rychlou kontrolu jedné stránky. Jako počítadlo je ale nepoužitelný a Google to sám píše: vrací jen vzorek stránek, o kterých ví. Když se někdo diví, že mu „počet zaindexovaných stránek” den ze dne skáče, obvykle se dívá právě na tohle číslo.

Seznam má IndexNow, Google ne

U českých webů se vyplatí vědět, že se oba vyhledávače chovají jinak. Seznam.cz podporuje protokol IndexNow - pošlete mu seznam změněných adres a on o nich okamžitě ví. Ve své nápovědě k tomu uvádí, že přes IndexNow není počet URL omezený, kdežto přes Seznam Webmaster jde poslat 500 adres denně. Zařazení ale negarantuje: odeslání bere jen jako informaci, o procházení a indexaci rozhodují jeho algoritmy, a zaindexované stránky se ve výsledcích objeví do týdne.

Google IndexNow nepodporuje. Protokol dnes používají Bing, Seznam.cz, Yandex, Naver a Yep. Pro Google zbývá sitemapa, odkazy a žádost v Search Console.

Prakticky z toho plyne jedna věc, kterou je dobré říct nahlas: zapnutí IndexNow indexaci v Googlu nezrychlí. Smysl má u webů, kde návštěvnost ze Seznamu a Bingu něco znamená - a u obsahu, který rychle stárne.

Žádost o indexaci není fronta na přednost

V Search Console jde přes Kontrolu URL požádat o indexaci konkrétní adresy. Je to užitečné u nové nebo právě opravené stránky, ale ne jako opakovaný rituál: u stavu „Procházeno - momentálně neindexováno” Google výslovně píše, že adresu není potřeba posílat znovu. Rozhodnutí neuložit stránku se dalším kliknutím nezmění.

Co s tím stavem funguje, je změna zadání. Doplnit stránce vlastní důvod existence, odkázat na ni z relevantní stránky webu, sloučit ji s podobnou. Teprve pak má smysl žádat znovu.

Nejčastější příčiny problémů z praxe

  • Zapomenutý noindex z vývoje. Nejčastější nález vůbec. Web se spustí a značka zůstane na šablonách, na které nikdo nemyslel.
  • Parametrické a filtrované adresy. V e-shopu z pěti filtrů vzniknou desítky tisíc kombinací. Vyhledávač na nich spálí kapacitu procházení a na důležité stránky mu zbyde méně.
  • Tenké stránky bez vlastní hodnoty. Kategorie s jedním produktem, štítky s jedním článkem, stránky, které se od sebe liší jedním slovem.
  • Redesign bez přesměrování. Staré adresy zmizí, nové se musí objevit a zaindexovat od začátku - a mezitím je z návštěvnosti díra.
  • Obsah dostupný jen po interakci. Stránka, na kterou nevede žádný odkaz a načte se až po kliknutí nebo scrollování, se hůř objevuje.

Zaindexováno neznamená vyhledatelné

Poslední věc, která bývá zdrojem zklamání: index je vstupenka, ne výsledek. Stránka může být v indexu a nemít jediný dotaz, na kterém by se dostala dost vysoko, aby ji někdo viděl. Indexace je proto podmínka, kterou je potřeba splnit a pak přestat řešit - dokud se něco nerozbije.

A obráceně: mít v indexu všechno není cíl. U větších webů dává větší smysl dvě stě stránek, které mají důvod existovat, než dvacet tisíc filtrovaných kombinací. Když s klientem řešíme indexaci, druhá polovina práce bývá o tom, co z indexu naopak dostat pryč.

Časté dotazy
Jak indexovat stránky na Google?

Postup má tři části: odstranit překážky (noindex, blokaci v robots.txt, přihlášení), postarat se o objevení stránky (odkaz z už zaindexované stránky webu a záznam v sitemapě) a v Search Console požádat o indexaci přes Kontrolu URL. Žádná z těch věcí ale zařazení nezaručuje - Google výslovně píše, že do indexu nemusí zařadit každou stránku.

Jak zapnout indexování?

Indexování se nikde nezapíná, není to přepínač na webu. Vyhledávače indexují automaticky, co najdou a co jim projde přes vlastní filtry. Jde jen o to nebránit jim v tom - nemít na stránce značku noindex, nemít ji blokovanou v robots.txt a nechat ji přístupnou bez přihlášení.

Související pojmy
Z teorie do praxe

Proberte to se mnou.

Problémy s indexací nevzniknou jednou a navždy - přijdou s každým redesignem, novou šablonou i novou sekcí webu. V měsíční správě kontroluju, co vyhledávače z webu vidí, a chytám to dřív, než se to projeví na návštěvnosti.

Napište mi

Nebo se podívejte na službu SEO správa →