Crawlen is het proces waarbij een zoekmachine, via een crawler (ook wel bot of spider genoemd, zoals Googlebot), automatisch webpagina’s bezoekt en de inhoud analyseert.
Hoe een crawler het web verkent
A crawler start bij bekende URL’s en volgt vervolgens elke link die het tegenkomt naar nieuwe pagina’s, waardoor het web stap voor stap in kaart wordt gebracht. Wat een crawler tegenkomt en begrijpt op een pagina, bepaalt of en hoe die pagina uiteindelijk in de zoekresultaten kan verschijnen.
Sturing geven aan crawlers
Twee bestanden bepalen grotendeels hoe crawlers een website benaderen:
- Robots.txt: geeft aan welke delen van de site wel of niet gecrawld mogen worden.
- XML-sitemap: geeft aan welke pagina’s bestaan en welke prioriteit ze hebben.
Crawlbudget
Grote websites krijgen te maken met een crawlbudget: het aantal pagina’s dat een crawler binnen een bepaalde periode bezoekt. Een onoverzichtelijke sitestructuur, veel dode links of onnodige duplicate pagina’s verspillen dat budget aan onbelangrijke content, ten koste van de pagina’s die er echt toe doen.
Twijfel je of jouw website optimaal gecrawld wordt? Get in touch or Schedule a strategy meeting.
« Back to Glossary Index