Stránka, která není v indexu, se neumísťuje špatně — neumísťuje se vůbec. Tento text vysvětluje, proč jsou crawl budget, objevení a indexace tři oddělené fáze, a jak modul Indexing Hub v novém panelu Semalt dělá z této slepé skvrny něco měřitelného.
Většina SEO projektů v Praze i jinde v Česku začíná u obsahu, klíčových slov a odkazů. Je to pochopitelné, protože právě tam je vidět odvedená práce. Pravidelně se však přehlíží fáze, která tomu všemu předchází: otázka, zda vyhledávač dané stránky vůbec zná a zda je přijal do svého indexu. Dokud zůstává tato otázka nezodpovězená, je každá další optimalizace prací na objektu, který pro vyhledávání neexistuje.
Problém se netýká jen velkých portálů. E-shop s osmi tisíci produktovými stránkami, realitní kancelář s tisíci nabídkami, odborné nakladatelství s letitým archivem — všude vznikají objemy adres, které rostou rychleji, než je někdo dobrovolně zaznamená. Protože indexace zůstává v běžném provozu neviditelná, projeví se zpoždění až ve chvíli, kdy organická návštěvnost stagnuje měsíce navzdory tomu, že redakce poctivě publikovala. Kdo hledá celkový přehled o platformě, najde jej na stránce popisující nový panel Semalt; zde jde záměrně jen o kapitolu věnovanou indexaci.
Crawl budget, objevení a indexace nejsou totéž
Nejčastějším myšlenkovým zkratem v otázkách indexace je předpoklad, že jde o jediný děj. Ve skutečnosti jde o tři navazující fáze, z nichž každá má vlastní logiku. Potíž v první fázi nelze opravit zásahem ve třetí — a obráceně to platí stejně.
Objevení adresy, její skutečné stažení robotem a rozhodnutí o zařazení do indexu jsou organizačně oddělené kroky. Kdo má toto rozdělení v hlavě, položí si při problému s viditelností hned správnou první otázku: ve které fázi to vlastně vázne?
| Fáze | Co se v ní děje | Typická blokace | Správné protiopatření |
|---|---|---|---|
| Objevení | Vyhledávač se dozví, že URL existuje — z interních odkazů, sitemapy, cizích odkazů nebo z aktivního oznámení. | Osiřelá stránka, chybějící záznam v sitemapě, hloubka prokliku za desátou úrovní. | Interní prolinkování, čistá sitemapa, aktivní odeslání. |
| Procházení | Robot adresu skutečně stáhne. Množství stažení za dané období se hovorově nazývá crawl budget. | Pomalá odezva serveru, chyby 5xx při zátěži, miliony bezcenných parametrických variant. | Infrastruktura, stavové kódy, úklid variant URL. |
| Indexace | Stažená stránka je vyhodnocena a přijata — nebo právě ne. Toto rozhodnutí je obsahové, nikoli mechanické. | Tenký obsah, duplicita, chybějící vlastní přínos, rozporuplná kanonizace. | Obsahová podstata, jasné kanonické adresy, konzistentní signály. |
Crawl budget přitom není číslo na faktuře, ale výsledek výkonu serveru, dosavadní kvality odpovědí a odhadu, jak se danou doménou vyplatí zabývat. Server, který při špičkách odpovídá chybami nebo potřebuje tři sekundy k prvnímu bajtu, dostane přiděleno méně stažení — vyhledávač se sám přibrzdí, aby web nezatěžoval.
Šest důvodů, proč stránky zůstávají venku
Při auditech se příčiny opakují pozoruhodně spolehlivě. Následujících šest vzorců pokrývá většinu toho, co je v praxi vidět — seřazeno podle fáze, ve které působí.
Osiřelé stránky
Adresa existuje a je dostupná, ale nevede na ni odkaz z žádné jiné stránky téhož webu. Nemá tedy žádnou přístupovou cestu.
- Vzniká při přestavbě kategorií a rušení filtrů
- Kampaňové stránky po skončení akce vyřazené z navigace
- Zůstává online, ale ztrácí veškerou dohledatelnost
Slabé interní prolinkování
Jemnější případ než osiřelá stránka: formálně odkazovaná, prakticky nedosažitelná. Hloubka prokliku se čte jako signál významu.
- Produkt visí na čtrnácté stránce stránkování
- Dvanáct prokliků od titulní strany
- Pro návštěvníka i pro robota fakticky neviditelný
Duplicitní obsah
E-shopy vytvářejí duplicity téměř samy od sebe. Vyhledávač pak jednu variantu vybere — nemusí to být ta vaše preferovaná.
- Týž produkt ve třech cestách kategorií
- Parametry řazení, filtrování a relací
- Tiskové náhledy, varianty s lomítkem i bez něj
Chybné kanonické adresy
Značka canonical je proti duplicitám správný nástroj, bývá však často obrácena sama proti sobě.
- Všechny stránky stránkování míří na stranu jedna
- Cíl přesměrovává, nese noindex nebo neexistuje
- Canonical je doporučení, nikoli příkaz
robots.txt versus noindex
Dva mechanismy, které se soustavně zaměňují — s nákladnými následky při spuštění nové verze webu.
- Zakázané URL se nestahují, jejich noindex zůstane nepřečten
- Vyřazení z indexu vyžaduje průchodnost plus noindex
- Noindex z testovacího prostředí ponechaný po spuštění stojí týdny
Pomalé doručování
Doba odezvy přímo omezuje počet stažení za jednotku času. U malých webů bez následků, u velkých rozhodující.
- Dvě stě milisekund proti dvěma sekundám je násobek průchodnosti
- Při třiceti tisících URL rozhoduje o dnech nebo měsících
- Chyby serveru se promítají do chování na celé doméně
Kdo má velký objem stránek a nemá pod kontrolou odezvu serveru, měl by začít právě tam, ještě než začne uvažovat o nástrojích na odesílání. V tomto pořadí leží rozdíl mezi účinným opatřením a spotřebovaným rozpočtem — technické základy stojí právem na začátku.
Indexing Hub a jeho tvrdé limity
Indexing Hub je ta část panelu, ve které se sbíhá odesílání adres, zpracování sitemap a následné pozorování. Pro plánování jsou rozhodující jeho limity, protože určují, co je v jakém čase reálné. Znát tato čísla otevřeně má větší cenu než jakýkoli slib.
Nejzajímavější je to nejmenší číslo. Tisíc URL denně zní jako hodně, dokud si člověk představuje firemní web o šedesáti stránkách. U katalogu v řádu desetitisíců jde o rozpočet, který je nutné plánovat jako reklamní budget. A právě v tom je skutečný přínos: limit vynucuje rozhodnutí o tom, které stránky jsou důležité — rozhodnutí, které by mělo padnout tak jako tak a kterému se v běžném provozu rádo uhýbá.
| Parametr | Hodnota | Praktický význam |
|---|---|---|
| Denní rozpočet sledovače URL | 1 000 URL denně na účet | Skutečná hranice průchodnosti. Tisíc pečlivě vybraných adres porazí tisíc náhodných. |
| Hromadné odeslání | až 10 000 URL v jedné dávce | Celý seznam předáte jedním úkonem místo ručního dělení. Odbavování se dál řídí denním limitem. |
| Zdroj sitemapy | nahrání souboru nebo adresa | Zkontrolovat lze i sitemapu, která ještě není veřejně odkazovaná — třeba před spuštěním nové verze. |
| Rekurzivní zpracování | do 3 úrovní hloubky | Index sitemapy odkazující na další index sitemapy se rozbalí. Hlubší vnoření je nutné postavit plošeji. |
| Sitemap na úlohu | až 1 000 | Pokryje i rozsáhlé sady segmentované podle kategorií nebo jazyků v jednom průchodu. |
| Souběžné úlohy | nejvýše 2 | Dvě domény nebo dvě sady sitemap paralelně, vše ostatní čeká. |
| Fronta | nejvýše 20 úloh | Stačí agentuře s několika klienty, není to však neomezený dávkový provoz. |
| Protokol u každé URL | časové razítko, stav, detail chyby | Umožňuje doložit, zda byla adresa stažena a s jakým výsledkem. |
Dvě cesty dovnitř: dávka a sitemapa
Hub nabízí dva vstupní body, které se v praxi doplňují. Jeden vychází ze seznamu konkrétních adres, druhý z existující struktury sitemap. Oba ústí do téhož sledovače a sdílejí stejný denní rozpočet.
Hromadné odesílání URL
Pro situace, kdy je krátkodobě velké množství adres nových nebo změněných.
- Jeden úkon místo mnoha. Kompletní seznam se předá najednou; ruční dělení na denní porce odpadá.
- Brzdou zůstává denní limit. Dávka deseti tisíc adres se neodbaví za jeden den, ale postupně v rámci tisícovky denně.
- Pořadí je rozhodnutí. Protože je rozpočet těsný, určuje seřazení seznamu obchodní výnos prvního týdne.
- Vyplatí se při výjimkách, ne v běžném provozu. Nová verze webu s jinou strukturou URL, migrace domény, sezonní kategorie, nově zařazený sortiment nebo dodatečně odstraněná blokace.
Zpracování sitemap
Pro rozsáhlé fondy, které už jsou uspořádané do struktury index sitemap.
- Nahrání nebo adresa. Soubor lze nahrát, nebo zadat jeho URL — praktické, když má být nová struktura prověřena ještě před spuštěním.
- Rekurzivně do tří úrovní. Index sitemapa odkazující na další index sitemapy se rozbalí. Kdo vnořuje hlouběji, udělá lépe, když strukturu zploští.
- Až 1 000 sitemap na úlohu. Projdou v jednom běhu i sady segmentované podle jazyků, poboček nebo typů obsahu.
- Dvě úlohy souběžně, dvacet čeká. Pro provoz s více klienty to stačí, pořadí je ale třeba nastavit vědomě: klient se spuštěním v pátek patří před rutinní údržbu.
Samotné odeslání probíhá v obou případech přes rozhraní IndexNow směrem k robotům GoogleBot a BingBot. Kdo se chce podívat, jak modul Indexing Hub od Semaltu zapadá do souhry s ostatními částmi panelu, najde popis v přehledu platformy.
Push místo čekání — a co pak stojí v protokolu
IndexNow jako aktivní oznámení
Klasicky funguje indexace na principu pull: vyhledávač si sám rozhodne, kdy se zastaví. U zřídka aktualizované domény to může u hlouběji uložených stránek trvat týdny. IndexNow obrací směr — web aktivně oznamuje, že se na konkrétní adrese něco změnilo.
Zisk leží především v čase u změn. Opravený popis produktu, aktualizovaná cena, přepracovaný poradenský článek, čerstvě vydaná kategorie: místo naděje, že příští pravidelná návštěva změnu zachytí, se podnět ohlásí. Pro sezonní obory je to rozdíl mezi včasnou viditelností a viditelností po sezoně.
Střízlivě řečeno přináší push dvě věci. Zkracuje dobu do objevení a nahrazuje nezodpověditelnou otázku, zda vyhledávač o stránce vůbec ví, zodpověditelnou otázkou, proč se rozhodl ji nepřijmout. To je podstatný pokrok, i když zní nenápadně.
Protokol návštěv robotů jako diagnostický nástroj
Z diagnostického hlediska nejcennější částí hubu není odesílání, ale protokol u každé URL. U každé odeslané adresy se zaznamenává, kdy ji robot navštívil, jakým stavem to skončilo a jaké detaily chyby přitom vznikly. K tomu přibývají živé čítače odeslaných, nalezených a neúspěšných adres, takže probíhající operaci není nutné sledovat naslepo.
Užitek vzniká kombinací těch tří údajů. Časové razítko odpovídá na otázku, zda vůbec došlo ke stažení. Stav odděluje technické případy od obsahových. Detail chyby udává směr opravy.
- Žádná návštěva navzdory odeslání. Ohlášeno, ale nestaženo. Zkontrolujte robots.txt, vytížení serveru a zda není doména obecně přibrzděna.
- Návštěva s chybou serveru. Robot dorazil a narazil na 5xx. Infrastrukturní téma, které se promítá do procházení celé domény, nejen této jediné stránky.
- Návštěva se stavem 404 nebo 410. Většinou zastaralá sitemapa nebo interní odkaz na odstraněný obsah. Uklidit, nikoli odesílat znovu.
- Návštěva s přesměrováním. Odeslán byl mezistupeň. Předávejte zásadně cílovou adresu přesměrování.
- Úspěšná návštěva bez přijetí. Technická část je hotová. Příčina leží v obsahu, v kanonizaci nebo v chybějícím interním prolinkování.
40 000 URL při tisícovce denně
Následující scénář je zkonstruovaný, aby byl řád veličin názorný. Jde o příkladový výpočet, nikoli o naměřenou zkušenost z konkrétního projektu.
E-shop vede v sitemapě 40 000 adres. Při denním rozpočtu 1 000 URL to početně dává 40 dní, pokud se limit denně vyčerpává beze zbytku a nic se nemusí dodělávat. V praxi přibývají opravné běhy, takže reálnějších je šest až osm týdnů. Dávka až deseti tisíc adres tuto dobu nezkrátí — ušetří jen ruční dělení seznamu.
Šest týdnů je na sezonní kampaň příliš dlouho. Důsledkem není nástroj odmítnout, ale seznam seřadit. Věrohodné rozdělení týchž 40 000 adres by vypadalo takto:
- Zhruba 12 000 variant a parametrických stránek. Kombinace barev a velikostí, filtry, řazení. Patří ke kanonizaci, nikoli k odeslání. Spotřeba rozpočtu: nulová.
- Zhruba 6 000 trvale nedostupných položek. Potřebují rozhodnutí o přesměrování nebo odstranění, nikoli odeslání.
- Zhruba 400 kategoriových a poradenských stránek. Nesou lví podíl obratu a jdou první — méně než půl dne rozpočtu.
- Zhruba 5 000 produktových stránek s hledaností a skladem. Následují během pěti dnů a pokrývají běžící obchod.
- Zhruba 16 000 stránek dlouhého chvostu. Běží potom na pozadí, bez termínu a bez tlaku na očekávání.
Ze čtyřiceti dnů slepého odesílání se tak stane necelých šest dnů pro vše, co obchodně rozhoduje. Rozdíl neleží v technice, ale v pořadí. Tato úvaha má v českém prostředí ještě jeden rozměr: objemy hledání jsou v malé jazykové doméně nižší, takže o hodnotě stránky rozhoduje spíš vyhovění konkrétnímu záměru než čistá hledanost. Kdo si vedle toho položí data o viditelnosti, srovná priority podle skutečných zobrazení; příslušné přehledy téže platformy leží ve stejném účtu a není nutné je exportovat zvlášť.
Hygiena sitemap a použitelný postup
Sitemapa není inventurní soupis všech existujících adres, ale doporučení. Každý záznam v ní je tvrzením: tato stránka si zaslouží indexaci. Pokud soubor ze třiceti procent tvoří přesměrování, chybové stránky a adresy s noindex, klesá důvěra v celý soubor — a tím i jeho užitek pro stránky, které v něm právem jsou.
Indexovatelné cílové stránky
Výhradně kanonické adresy se stavem 200 v konečném zápisu, včetně správného protokolu a hostitele.
- Poctivé údaje lastmod místo denně přepisovaných dat
- Segmentace podle kategorií, produktů, redakce a poboček
- Index sitemapa jako střecha — odpovídá rekurzivnímu zpracování
Vše neindexovatelné
Každá adresa, která bude stejně odmítnuta, rozmělňuje výpověď souboru a spotřebovává pozornost.
- Stránky s noindex, adresy zakázané v robots.txt, přesměrování
- Parametrické a filtrované varianty, výsledky interního vyhledávání
- Košík, zákaznická sekce, testovací hostitelé, chybové stránky
Z toho všeho vyplývá pořadí, které se ve většině projektů osvědčuje a které záměrně začíná úklidem, nikoli odesíláním. Nejdřív se sitemapa vyčistí. Následně se zpracuje — nahráním souboru nebo zadáním adresy podle toho, zda už je soubor veřejně dostupný. Z výsledku vznikne první obraz situace: kolik adres bylo nalezeno, kolik jich selhalo, kde se hromadí stavové kódy.
Tento seznam chyb se odbaví dřív, než se začne utrácet rozpočet na odesílání. Teprve poté začíná prioritizované předávání, obchodně zásadní stránky napřed. Zhruba po týdnu poskytuje protokol dost datových bodů pro vlastní analýzu: navštíveno a přijato, navštíveno a zahozeno, vůbec nestaženo. Třetí skupina ukazuje na technické příčiny, druhá na obsahové. Obojí vede ke konkrétním úkolům a cyklus začíná znovu — nyní na lepším datovém základě.
Časté dotazy
Jak rychle se odeslaná URL zaindexuje?
Na to neexistuje slibitelná lhůta a každé číslo, které vám někdo uvede, je odhad. Odeslání zpravidla zkracuje dobu do objevení a do prvního stažení. Zda a kdy bude následovat zařazení do indexu, rozhoduje vyhledávač podle obsahu. Protokol vám alespoň ukáže, zda ke stažení došlo — to je polovina odpovědi.
Stačí tisíc URL denně pro středně velký e-shop?
Pro běžný provoz téměř vždy. Nové položky a změněné stránky se i u aktivních e-shopů drží výrazně pod touto hranicí. Těsné je to jen při prvním zavedení velkých fondů, při spuštění nové verze webu a při migracích. Právě tehdy se vyplatí předchozí třídění, protože relevantní podíl katalogu se dá zkušeností zredukovat na zlomek celkového objemu.
Funguje to i pro vyhledávání na Seznamu?
Odesílání přes IndexNow v Indexing Hubu míří na roboty GoogleBot a BingBot, protokol tedy zaznamenává jejich návštěvy. Pro české weby to znamená, že modul pokrývá jednu část trhu, nikoli celý. Technické předpoklady, které si přitom vyčistíte — dostupnost, stavové kódy, kanonizace, poctivá sitemapa — ovšem prospívají dohledatelnosti obecně, protože nejsou vázané na jediný vyhledávač.
Co se stane, když tutéž URL odešlu vícekrát?
Spotřebujete denní rozpočet, aniž byste něco získali. Opakované odesílání nezměněné stránky žádné rozhodnutí neurychlí. Opětovné předání má smysl jen tehdy, když se na obsahu, v kanonizaci nebo u technické blokace skutečně něco změnilo — například po odstranění nechtěného noindex.
Kolik úloh se sitemapami může běžet souběžně?
Dvě zároveň, dalších dvacet může čekat ve frontě. Malé agentuře s několika klienty to v normálním provozu stačí, vyžaduje to však vědomé pořadí. Naplánujte časově kritické případy, jako je spuštění nové verze webu, před rutinní údržbu, jinak vám velký průchod zablokuje ten naléhavý.
Závěr: viditelnost začíná u dohledatelnosti
Indexace je podceňovaným úzkým hrdlem proto, že v případě úspěchu zůstává neviditelná a v případě chyby nevypadá jako chyba. Neexistuje varovné hlášení ani červený proužek, jen stránky bez zobrazení. Kdo tuto oblast aktivně neměří, pracuje na textech a odkazech, zatímco příčina leží o fázi dřív.
Indexing Hub na tom nic nemění kouzlem. Mění to tím, že spojuje tři věci: jasný limit průchodnosti, který nutí k prioritizaci; aktivní způsob oznamování, který zkracuje dobu do objevení; a protokol, který nahrazuje domněnky časovými razítky a stavovými kódy. Limity k tomu obrazu výslovně patří — tisíc adres denně je konečné číslo, dvě souběžné úlohy jsou konečné číslo a odeslání zůstává odesláním.
Právě tato střízlivost dělá z celé oblasti něco plánovatelného. Kdo ví, že 40 000 adres potřebuje při plném rozpočtu zhruba 40 dní, plánuje jinak než někdo, kdo zmáčkne tlačítko a doufá. Pokud si chcete ověřit, kolik vašich stránek je skutečně podchyceno, můžete otevřít dashboard Semaltu a začít průchodem sitemapy; první obraz situace bývá poučnější, než člověk čeká.