Stránka, která není v indexu, se neumísťuje špatně — neumísťuje se vůbec. Tento text vysvětluje, proč jsou crawl budget, objevení a indexace tři oddělené fáze, a jak modul Indexing Hub v novém panelu Semalt dělá z této slepé skvrny něco měřitelného.

Většina SEO projektů v Praze i jinde v Česku začíná u obsahu, klíčových slov a odkazů. Je to pochopitelné, protože právě tam je vidět odvedená práce. Pravidelně se však přehlíží fáze, která tomu všemu předchází: otázka, zda vyhledávač dané stránky vůbec zná a zda je přijal do svého indexu. Dokud zůstává tato otázka nezodpovězená, je každá další optimalizace prací na objektu, který pro vyhledávání neexistuje.

Problém se netýká jen velkých portálů. E-shop s osmi tisíci produktovými stránkami, realitní kancelář s tisíci nabídkami, odborné nakladatelství s letitým archivem — všude vznikají objemy adres, které rostou rychleji, než je někdo dobrovolně zaznamená. Protože indexace zůstává v běžném provozu neviditelná, projeví se zpoždění až ve chvíli, kdy organická návštěvnost stagnuje měsíce navzdory tomu, že redakce poctivě publikovala. Kdo hledá celkový přehled o platformě, najde jej na stránce popisující nový panel Semalt; zde jde záměrně jen o kapitolu věnovanou indexaci.

O čem tento text není. Nejde o hodnoticí faktory ani o obsahovou strategii. Věnujeme se výhradně technické dohledatelnosti: objevení, stažení, přijetí — a nástrojům, kterými se tyto tři děje dají sledovat.
Základy · Technické SEO

Crawl budget, objevení a indexace nejsou totéž

Nejčastějším myšlenkovým zkratem v otázkách indexace je předpoklad, že jde o jediný děj. Ve skutečnosti jde o tři navazující fáze, z nichž každá má vlastní logiku. Potíž v první fázi nelze opravit zásahem ve třetí — a obráceně to platí stejně.

Objevení adresy, její skutečné stažení robotem a rozhodnutí o zařazení do indexu jsou organizačně oddělené kroky. Kdo má toto rozdělení v hlavě, položí si při problému s viditelností hned správnou první otázku: ve které fázi to vlastně vázne?

Fáze Co se v ní děje Typická blokace Správné protiopatření
Objevení Vyhledávač se dozví, že URL existuje — z interních odkazů, sitemapy, cizích odkazů nebo z aktivního oznámení. Osiřelá stránka, chybějící záznam v sitemapě, hloubka prokliku za desátou úrovní. Interní prolinkování, čistá sitemapa, aktivní odeslání.
Procházení Robot adresu skutečně stáhne. Množství stažení za dané období se hovorově nazývá crawl budget. Pomalá odezva serveru, chyby 5xx při zátěži, miliony bezcenných parametrických variant. Infrastruktura, stavové kódy, úklid variant URL.
Indexace Stažená stránka je vyhodnocena a přijata — nebo právě ne. Toto rozhodnutí je obsahové, nikoli mechanické. Tenký obsah, duplicita, chybějící vlastní přínos, rozporuplná kanonizace. Obsahová podstata, jasné kanonické adresy, konzistentní signály.

Crawl budget přitom není číslo na faktuře, ale výsledek výkonu serveru, dosavadní kvality odpovědí a odhadu, jak se danou doménou vyplatí zabývat. Server, který při špičkách odpovídá chybami nebo potřebuje tři sekundy k prvnímu bajtu, dostane přiděleno méně stažení — vyhledávač se sám přibrzdí, aby web nezatěžoval.

Tip z praxe. Než sáhnete po jakémkoli nástroji na odesílání adres, určete fázi. Pokud URL není v žádné sitemapě a nikde na ni nevede odkaz, jde o případ objevení. Pokud je stahována, ale zahazována, jde o případ obsahu. Obojí vyžaduje zcela jinou práci.
Diagnostika · Vzorce příčin

Šest důvodů, proč stránky zůstávají venku

Při auditech se příčiny opakují pozoruhodně spolehlivě. Následujících šest vzorců pokrývá většinu toho, co je v praxi vidět — seřazeno podle fáze, ve které působí.

Objevení

Osiřelé stránky

Adresa existuje a je dostupná, ale nevede na ni odkaz z žádné jiné stránky téhož webu. Nemá tedy žádnou přístupovou cestu.

  • Vzniká při přestavbě kategorií a rušení filtrů
  • Kampaňové stránky po skončení akce vyřazené z navigace
  • Zůstává online, ale ztrácí veškerou dohledatelnost
Objevení

Slabé interní prolinkování

Jemnější případ než osiřelá stránka: formálně odkazovaná, prakticky nedosažitelná. Hloubka prokliku se čte jako signál významu.

  • Produkt visí na čtrnácté stránce stránkování
  • Dvanáct prokliků od titulní strany
  • Pro návštěvníka i pro robota fakticky neviditelný
Indexace

Duplicitní obsah

E-shopy vytvářejí duplicity téměř samy od sebe. Vyhledávač pak jednu variantu vybere — nemusí to být ta vaše preferovaná.

  • Týž produkt ve třech cestách kategorií
  • Parametry řazení, filtrování a relací
  • Tiskové náhledy, varianty s lomítkem i bez něj
Indexace

Chybné kanonické adresy

Značka canonical je proti duplicitám správný nástroj, bývá však často obrácena sama proti sobě.

  • Všechny stránky stránkování míří na stranu jedna
  • Cíl přesměrovává, nese noindex nebo neexistuje
  • Canonical je doporučení, nikoli příkaz
Procházení

robots.txt versus noindex

Dva mechanismy, které se soustavně zaměňují — s nákladnými následky při spuštění nové verze webu.

  • Zakázané URL se nestahují, jejich noindex zůstane nepřečten
  • Vyřazení z indexu vyžaduje průchodnost plus noindex
  • Noindex z testovacího prostředí ponechaný po spuštění stojí týdny
Procházení

Pomalé doručování

Doba odezvy přímo omezuje počet stažení za jednotku času. U malých webů bez následků, u velkých rozhodující.

  • Dvě stě milisekund proti dvěma sekundám je násobek průchodnosti
  • Při třiceti tisících URL rozhoduje o dnech nebo měsících
  • Chyby serveru se promítají do chování na celé doméně

Kdo má velký objem stránek a nemá pod kontrolou odezvu serveru, měl by začít právě tam, ještě než začne uvažovat o nástrojích na odesílání. V tomto pořadí leží rozdíl mezi účinným opatřením a spotřebovaným rozpočtem — technické základy stojí právem na začátku.

Nástroj · Indexing Hub

Indexing Hub a jeho tvrdé limity

Indexing Hub je ta část panelu, ve které se sbíhá odesílání adres, zpracování sitemap a následné pozorování. Pro plánování jsou rozhodující jeho limity, protože určují, co je v jakém čase reálné. Znát tato čísla otevřeně má větší cenu než jakýkoli slib.

1 000
URL denně na účet
10 000
URL v jedné dávce
3
úrovně vnoření sitemap
1 000
sitemap na jednu úlohu
2 / 20
souběžně / ve frontě

Nejzajímavější je to nejmenší číslo. Tisíc URL denně zní jako hodně, dokud si člověk představuje firemní web o šedesáti stránkách. U katalogu v řádu desetitisíců jde o rozpočet, který je nutné plánovat jako reklamní budget. A právě v tom je skutečný přínos: limit vynucuje rozhodnutí o tom, které stránky jsou důležité — rozhodnutí, které by mělo padnout tak jako tak a kterému se v běžném provozu rádo uhýbá.

Parametr Hodnota Praktický význam
Denní rozpočet sledovače URL 1 000 URL denně na účet Skutečná hranice průchodnosti. Tisíc pečlivě vybraných adres porazí tisíc náhodných.
Hromadné odeslání až 10 000 URL v jedné dávce Celý seznam předáte jedním úkonem místo ručního dělení. Odbavování se dál řídí denním limitem.
Zdroj sitemapy nahrání souboru nebo adresa Zkontrolovat lze i sitemapu, která ještě není veřejně odkazovaná — třeba před spuštěním nové verze.
Rekurzivní zpracování do 3 úrovní hloubky Index sitemapy odkazující na další index sitemapy se rozbalí. Hlubší vnoření je nutné postavit plošeji.
Sitemap na úlohu až 1 000 Pokryje i rozsáhlé sady segmentované podle kategorií nebo jazyků v jednom průchodu.
Souběžné úlohy nejvýše 2 Dvě domény nebo dvě sady sitemap paralelně, vše ostatní čeká.
Fronta nejvýše 20 úloh Stačí agentuře s několika klienty, není to však neomezený dávkový provoz.
Protokol u každé URL časové razítko, stav, detail chyby Umožňuje doložit, zda byla adresa stažena a s jakým výsledkem.
Moduly · Odesílání

Dvě cesty dovnitř: dávka a sitemapa

Hub nabízí dva vstupní body, které se v praxi doplňují. Jeden vychází ze seznamu konkrétních adres, druhý z existující struktury sitemap. Oba ústí do téhož sledovače a sdílejí stejný denní rozpočet.

Indexing Hub · Modul 1

Hromadné odesílání URL

Pro situace, kdy je krátkodobě velké množství adres nových nebo změněných.

až 10 000 URL v dávce
  • Jeden úkon místo mnoha. Kompletní seznam se předá najednou; ruční dělení na denní porce odpadá.
  • Brzdou zůstává denní limit. Dávka deseti tisíc adres se neodbaví za jeden den, ale postupně v rámci tisícovky denně.
  • Pořadí je rozhodnutí. Protože je rozpočet těsný, určuje seřazení seznamu obchodní výnos prvního týdne.
  • Vyplatí se při výjimkách, ne v běžném provozu. Nová verze webu s jinou strukturou URL, migrace domény, sezonní kategorie, nově zařazený sortiment nebo dodatečně odstraněná blokace.
10 000
URL v jednom předání
1 000
skutečná denní průchodnost
3
živé čítače na běh
Indexing Hub · Modul 2

Zpracování sitemap

Pro rozsáhlé fondy, které už jsou uspořádané do struktury index sitemap.

3 úrovně · 1 000 sitemap na úlohu
  • Nahrání nebo adresa. Soubor lze nahrát, nebo zadat jeho URL — praktické, když má být nová struktura prověřena ještě před spuštěním.
  • Rekurzivně do tří úrovní. Index sitemapa odkazující na další index sitemapy se rozbalí. Kdo vnořuje hlouběji, udělá lépe, když strukturu zploští.
  • Až 1 000 sitemap na úlohu. Projdou v jednom běhu i sady segmentované podle jazyků, poboček nebo typů obsahu.
  • Dvě úlohy souběžně, dvacet čeká. Pro provoz s více klienty to stačí, pořadí je ale třeba nastavit vědomě: klient se spuštěním v pátek patří před rutinní údržbu.
3
úrovně vnoření
1 000
sitemap na úlohu
2
souběžné úlohy
20
míst ve frontě

Samotné odeslání probíhá v obou případech přes rozhraní IndexNow směrem k robotům GoogleBot a BingBot. Kdo se chce podívat, jak modul Indexing Hub od Semaltu zapadá do souhry s ostatními částmi panelu, najde popis v přehledu platformy.

Postup · IndexNow a protokol

Push místo čekání — a co pak stojí v protokolu

IndexNow jako aktivní oznámení

Klasicky funguje indexace na principu pull: vyhledávač si sám rozhodne, kdy se zastaví. U zřídka aktualizované domény to může u hlouběji uložených stránek trvat týdny. IndexNow obrací směr — web aktivně oznamuje, že se na konkrétní adrese něco změnilo.

Zisk leží především v čase u změn. Opravený popis produktu, aktualizovaná cena, přepracovaný poradenský článek, čerstvě vydaná kategorie: místo naděje, že příští pravidelná návštěva změnu zachytí, se podnět ohlásí. Pro sezonní obory je to rozdíl mezi včasnou viditelností a viditelností po sezoně.

Odeslání URL není totéž co zaindexování. Oznámení je podnět, nikoli závazek. Vyhledávač dál sám rozhoduje, zda adresu stáhne a zda ji poté přijme do indexu. Tenkou stránku, duplicitní variantu nebo stránku s noindex nezaindexuje sebe rychlejší oznámení. Kdo po hromadném odeslání očekává stoprocentní přijetí, bude zklamán — ne kvůli chybě nástroje, ale proto, že tak celý postup není postaven.

Střízlivě řečeno přináší push dvě věci. Zkracuje dobu do objevení a nahrazuje nezodpověditelnou otázku, zda vyhledávač o stránce vůbec ví, zodpověditelnou otázkou, proč se rozhodl ji nepřijmout. To je podstatný pokrok, i když zní nenápadně.

Protokol návštěv robotů jako diagnostický nástroj

Z diagnostického hlediska nejcennější částí hubu není odesílání, ale protokol u každé URL. U každé odeslané adresy se zaznamenává, kdy ji robot navštívil, jakým stavem to skončilo a jaké detaily chyby přitom vznikly. K tomu přibývají živé čítače odeslaných, nalezených a neúspěšných adres, takže probíhající operaci není nutné sledovat naslepo.

Užitek vzniká kombinací těch tří údajů. Časové razítko odpovídá na otázku, zda vůbec došlo ke stažení. Stav odděluje technické případy od obsahových. Detail chyby udává směr opravy.

  • Žádná návštěva navzdory odeslání. Ohlášeno, ale nestaženo. Zkontrolujte robots.txt, vytížení serveru a zda není doména obecně přibrzděna.
  • Návštěva s chybou serveru. Robot dorazil a narazil na 5xx. Infrastrukturní téma, které se promítá do procházení celé domény, nejen této jediné stránky.
  • Návštěva se stavem 404 nebo 410. Většinou zastaralá sitemapa nebo interní odkaz na odstraněný obsah. Uklidit, nikoli odesílat znovu.
  • Návštěva s přesměrováním. Odeslán byl mezistupeň. Předávejte zásadně cílovou adresu přesměrování.
  • Úspěšná návštěva bez přijetí. Technická část je hotová. Příčina leží v obsahu, v kanonizaci nebo v chybějícím interním prolinkování.
Z domněnky se stává doložený stav. Tato systematika ukončuje diskusi, která v mnoha projektech vázne — tvrzení, že Google prostě určitou stránku nemá rád. S časovým razítkem a stavovým kódem z toho vznikne seznam úkolů.
Plánování · Modelový výpočet

40 000 URL při tisícovce denně

Následující scénář je zkonstruovaný, aby byl řád veličin názorný. Jde o příkladový výpočet, nikoli o naměřenou zkušenost z konkrétního projektu.

E-shop vede v sitemapě 40 000 adres. Při denním rozpočtu 1 000 URL to početně dává 40 dní, pokud se limit denně vyčerpává beze zbytku a nic se nemusí dodělávat. V praxi přibývají opravné běhy, takže reálnějších je šest až osm týdnů. Dávka až deseti tisíc adres tuto dobu nezkrátí — ušetří jen ruční dělení seznamu.

40 000
URL v sitemapě
40
dní při slepém odesílání
5 400
skutečně relevantních URL
6
dní na obchodně zásadní část

Šest týdnů je na sezonní kampaň příliš dlouho. Důsledkem není nástroj odmítnout, ale seznam seřadit. Věrohodné rozdělení týchž 40 000 adres by vypadalo takto:

  • Zhruba 12 000 variant a parametrických stránek. Kombinace barev a velikostí, filtry, řazení. Patří ke kanonizaci, nikoli k odeslání. Spotřeba rozpočtu: nulová.
  • Zhruba 6 000 trvale nedostupných položek. Potřebují rozhodnutí o přesměrování nebo odstranění, nikoli odeslání.
  • Zhruba 400 kategoriových a poradenských stránek. Nesou lví podíl obratu a jdou první — méně než půl dne rozpočtu.
  • Zhruba 5 000 produktových stránek s hledaností a skladem. Následují během pěti dnů a pokrývají běžící obchod.
  • Zhruba 16 000 stránek dlouhého chvostu. Běží potom na pozadí, bez termínu a bez tlaku na očekávání.

Ze čtyřiceti dnů slepého odesílání se tak stane necelých šest dnů pro vše, co obchodně rozhoduje. Rozdíl neleží v technice, ale v pořadí. Tato úvaha má v českém prostředí ještě jeden rozměr: objemy hledání jsou v malé jazykové doméně nižší, takže o hodnotě stránky rozhoduje spíš vyhovění konkrétnímu záměru než čistá hledanost. Kdo si vedle toho položí data o viditelnosti, srovná priority podle skutečných zobrazení; příslušné přehledy téže platformy leží ve stejném účtu a není nutné je exportovat zvlášť.

Údržba · Sitemapy

Hygiena sitemap a použitelný postup

Sitemapa není inventurní soupis všech existujících adres, ale doporučení. Každý záznam v ní je tvrzením: tato stránka si zaslouží indexaci. Pokud soubor ze třiceti procent tvoří přesměrování, chybové stránky a adresy s noindex, klesá důvěra v celý soubor — a tím i jeho užitek pro stránky, které v něm právem jsou.

Patří dovnitř

Indexovatelné cílové stránky

Výhradně kanonické adresy se stavem 200 v konečném zápisu, včetně správného protokolu a hostitele.

  • Poctivé údaje lastmod místo denně přepisovaných dat
  • Segmentace podle kategorií, produktů, redakce a poboček
  • Index sitemapa jako střecha — odpovídá rekurzivnímu zpracování
Patří ven

Vše neindexovatelné

Každá adresa, která bude stejně odmítnuta, rozmělňuje výpověď souboru a spotřebovává pozornost.

  • Stránky s noindex, adresy zakázané v robots.txt, přesměrování
  • Parametrické a filtrované varianty, výsledky interního vyhledávání
  • Košík, zákaznická sekce, testovací hostitelé, chybové stránky

Z toho všeho vyplývá pořadí, které se ve většině projektů osvědčuje a které záměrně začíná úklidem, nikoli odesíláním. Nejdřív se sitemapa vyčistí. Následně se zpracuje — nahráním souboru nebo zadáním adresy podle toho, zda už je soubor veřejně dostupný. Z výsledku vznikne první obraz situace: kolik adres bylo nalezeno, kolik jich selhalo, kde se hromadí stavové kódy.

Tento seznam chyb se odbaví dřív, než se začne utrácet rozpočet na odesílání. Teprve poté začíná prioritizované předávání, obchodně zásadní stránky napřed. Zhruba po týdnu poskytuje protokol dost datových bodů pro vlastní analýzu: navštíveno a přijato, navštíveno a zahozeno, vůbec nestaženo. Třetí skupina ukazuje na technické příčiny, druhá na obsahové. Obojí vede ke konkrétním úkolům a cyklus začíná znovu — nyní na lepším datovém základě.

Měsíční srovnání. Krátké porovnání obsahu sitemapy se skutečným stavem webu stojí málo času a brání tomu, aby po letech vznikl soubor, kterému už nikdo nevěří. Zpracování sitemap v panelu Semalt se pro tento rutinní běh hodí stejně jako pro velký první průchod.

Časté dotazy

Jak rychle se odeslaná URL zaindexuje?

Na to neexistuje slibitelná lhůta a každé číslo, které vám někdo uvede, je odhad. Odeslání zpravidla zkracuje dobu do objevení a do prvního stažení. Zda a kdy bude následovat zařazení do indexu, rozhoduje vyhledávač podle obsahu. Protokol vám alespoň ukáže, zda ke stažení došlo — to je polovina odpovědi.

Stačí tisíc URL denně pro středně velký e-shop?

Pro běžný provoz téměř vždy. Nové položky a změněné stránky se i u aktivních e-shopů drží výrazně pod touto hranicí. Těsné je to jen při prvním zavedení velkých fondů, při spuštění nové verze webu a při migracích. Právě tehdy se vyplatí předchozí třídění, protože relevantní podíl katalogu se dá zkušeností zredukovat na zlomek celkového objemu.

Funguje to i pro vyhledávání na Seznamu?

Odesílání přes IndexNow v Indexing Hubu míří na roboty GoogleBot a BingBot, protokol tedy zaznamenává jejich návštěvy. Pro české weby to znamená, že modul pokrývá jednu část trhu, nikoli celý. Technické předpoklady, které si přitom vyčistíte — dostupnost, stavové kódy, kanonizace, poctivá sitemapa — ovšem prospívají dohledatelnosti obecně, protože nejsou vázané na jediný vyhledávač.

Co se stane, když tutéž URL odešlu vícekrát?

Spotřebujete denní rozpočet, aniž byste něco získali. Opakované odesílání nezměněné stránky žádné rozhodnutí neurychlí. Opětovné předání má smysl jen tehdy, když se na obsahu, v kanonizaci nebo u technické blokace skutečně něco změnilo — například po odstranění nechtěného noindex.

Kolik úloh se sitemapami může běžet souběžně?

Dvě zároveň, dalších dvacet může čekat ve frontě. Malé agentuře s několika klienty to v normálním provozu stačí, vyžaduje to však vědomé pořadí. Naplánujte časově kritické případy, jako je spuštění nové verze webu, před rutinní údržbu, jinak vám velký průchod zablokuje ten naléhavý.

Závěr: viditelnost začíná u dohledatelnosti

Indexace je podceňovaným úzkým hrdlem proto, že v případě úspěchu zůstává neviditelná a v případě chyby nevypadá jako chyba. Neexistuje varovné hlášení ani červený proužek, jen stránky bez zobrazení. Kdo tuto oblast aktivně neměří, pracuje na textech a odkazech, zatímco příčina leží o fázi dřív.

Indexing Hub na tom nic nemění kouzlem. Mění to tím, že spojuje tři věci: jasný limit průchodnosti, který nutí k prioritizaci; aktivní způsob oznamování, který zkracuje dobu do objevení; a protokol, který nahrazuje domněnky časovými razítky a stavovými kódy. Limity k tomu obrazu výslovně patří — tisíc adres denně je konečné číslo, dvě souběžné úlohy jsou konečné číslo a odeslání zůstává odesláním.

Právě tato střízlivost dělá z celé oblasti něco plánovatelného. Kdo ví, že 40 000 adres potřebuje při plném rozpočtu zhruba 40 dní, plánuje jinak než někdo, kdo zmáčkne tlačítko a doufá. Pokud si chcete ověřit, kolik vašich stránek je skutečně podchyceno, můžete otevřít dashboard Semaltu a začít průchodem sitemapy; první obraz situace bývá poučnější, než člověk čeká.