Wat is Robots.txt en wanneer moeten bedrijven zich er zorgen over maken?
Je hebt een sitemap, hebt deze naar Google gestuurd, en je website begint geïndexeerd te worden. Maar op een dag ontdek je dat de beheerpagina (admin), interne betaalpagina of stagingpagina van je website ook op Google verschijnt. Klanten typen de naam van het bedrijf in – en zien zelfs de onvoltooide testpagina.
Of juist andersom: je plaatst een nieuw blogbericht, wacht twee weken en het verschijnt nog steeds niet op Google. Als je het technische team vraagt, zeggen ze: "Het robots.txt bestand blokkeert Google van het crawlen van de hele website."
Beide situaties hebben te maken met een klein bestand waar webbeheerders zelden aandacht aan besteden: robots.txt.
Dit artikel legt uit wat robots.txt is, hoe het werkt, wanneer je het moet aanpassen, en veelvoorkomende fouten die bedrijven moeten vermijden – allemaal in eenvoudige taal, met praktische voorbeelden.
Wat is Robots.txt? Een uitleg voor webbeheerders
Als een sitemap de plattegrond van een gebouw is – die Google vertelt welke kamers er zijn – dan is robots.txt het "Verboden Toegang" bord – dat Google vertelt welke kamers niet betreden mogen worden.
Technisch gezien: robots.txt is een klein tekstbestand, dat zich in de root directory van de website bevindt (bijvoorbeeld: https://example.com/robots.txt). Dit bestand bevat regels die de bots van zoekmachines – zoals Googlebot – vertellen:
- Welke pagina's wel gecrawld mogen worden
- Welke pagina's niet gecrawld mogen worden
- Waar de sitemap zich bevindt
Je kunt de robots.txt van elke website bekijken door op je browser te typen: domeinnaam.com/robots.txt.
💡 Belangrijk: robots.txt is slechts een beleefde aanvraag, geen absolute verbod. Gerenommeerde bots zoals Googlebot zullen zich eraan houden, maar slechte bots (spam, scrapers) kunnen het negeren. Als je echte beveiliging nodig hebt, gebruik dan wachtwoorden of een firewall – vertrouw niet op robots.txt.
Hoe ziet een Robots.txt bestand eruit?
Je hoeft dit bestand niet helemaal zelf te schrijven. Maar om het te begrijpen als je ernaar kijkt, hier is een eenvoudig robots.txt bestand:
User-agent: *
Disallow: /admin/
Disallow: /thanh-toan/
Disallow: /staging/
Allow: /
Sitemap: https://example.com/sitemap.xml
Uitleg van elke regel:
| Regel | Betekenis |
|---|---|
User-agent: * | Toepassen op alle bots (Google, Bing, etc.) |
Disallow: /admin/ | Bots niet toestaan de map /admin/ te betreden |
Disallow: /thanh-toan/ | Bots niet toestaan de betaalpagina te betreden |
Disallow: /staging/ | Bots niet toestaan de stagingversie te betreden |
Allow: / | Bots toestaan de rest van de website te crawlen |
Sitemap: https://... | De bot vertellen waar de sitemap zich bevindt |
Hier is een complexer voorbeeld – geschikt voor een bedrijfswebsite met een blog, dienstenpagina's en een administratief gedeelte:
# Toestaan dat alle bots openbare inhoud crawlen
User-agent: *
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
Disallow: /search?
Disallow: /*?ref=
Disallow: /*?utm_
# Googlebot toestaan om CSS en JS te crawlen (nodig om de pagina's te renderen)
User-agent: Googlebot
Allow: /wp-content/uploads/
Allow: /wp-includes/
Sitemap: https://example.com/sitemap.xml
📝 Opmerking voor ontwikkelaars: Het teken
*in het pad is een wildcard —/*?utm_betekent dat alle URL's die de parameter?utm_bevatten worden geblokkeerd. Het teken$aan het einde van het pad wordt gebruikt om precies overeen te komen met het einde van de URL. Bijvoorbeeld:Disallow: /*.pdf$blokkeert alle PDF-bestanden.
---
Hoe werkt Robots.txt in het SEO-proces?
Om de positie van robots.txt te begrijpen, laten we terugkijken naar het proces dat Google volgt om een website in zoekresultaten op te nemen:
Crawl → Index → Rank
(Scannen) (Opslaan) (Rangschikken)
Robots.txt werkt in de eerste stap - Crawl.
Voordat Googlebot begint met het scannen van enige pagina op uw website, controleert het eerst robots.txt. Als een URL in Disallow staat vermeld, negeert Googlebot die pagina - het scant het niet, het leest de inhoud niet.
Googlebot wil https://example.com/admin/settings crawlen
→ Controleert robots.txt
→ Ziet Disallow: /admin/
→ Negeert, scant niet
Googlebot wil https://example.com/dich-vu/ crawlen
→ Controleert robots.txt
→ Wordt niet geblokkeerd
→ Scant normaal → Index → Mogelijk in zoekresultaten
Robots.txt en sitemap: een ondersteunend duo
| Bestand | Rol |
|---|---|
| Sitemap | "Dit is de lijst met pagina's waarvan ik wil dat Google ze kent" |
| Robots.txt | "Dit zijn de pagina's waarvan ik niet wil dat Google ze scant" |
Deze twee bestanden zijn niet tegenstrijdig - ze werken samen. De sitemap wijst de weg, robots.txt plaatst barrières. Door ze correct te combineren, beheert u wat Google ziet en wat het negeert op uw website.
Waarvoor wordt robots.txt gebruikt? 4 gangbare gevallen
1. Verberg beheerders- en interne pagina's voor Google
Adminpagina's, CMS backend-pagina's, staging-pagina's, testpagina's - ze moeten allemaal niet in Google verschijnen. Robots.txt helpt u Google te vertellen: "Ga hier niet naartoe."
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /staging/
2. Voorkom verspilling van "crawl budget"
Google scant niet oneindig. Elke website heeft een "crawl budget" - het aantal pagina's dat Googlebot zal scannen tijdens elk bezoek. Als een website veel onbelangrijke pagina's heeft (interne zoekpagina's, filterpagina's, paginering-pagina's), kan Googlebot bezig zijn met het scannen van deze pagina's in plaats van belangrijke servicepagina's of blogposts.
Disallow: /search?
Disallow: /tag/
Disallow: /page/
💡 Crawl budget is voornamelijk belangrijk voor grote websites (duizenden pagina's). Kleine bedrijfswebsites hoeven zich hier meestal geen grote zorgen over te maken, maar het netjes houden van robots.txt blijft een goede gewoonte.
3. Blokkeer dubbele inhoud
Als een website meerdere URL's heeft die naar dezelfde inhoud leiden (bijvoorbeeld URL's met trackingparameters ?utm_source=facebook, of een printversie ?print=true), kunt u deze dubbele URL's blokkeren:
Disallow: /*?utm_
Disallow: /*?ref=
Disallow: /*?print=
4. Wijs de weg naar de sitemap
Robots.txt is de eerste plaats die Googlebot controleert wanneer het een website bezoekt. Door het sitemap-pad hier te plaatsen, vindt Google de sitemap sneller - zelfs als u deze nog niet via Search Console heeft verzonden.
Sitemap: https://example.com/sitemap.xml
Wanneer moeten bedrijven zich zorgen maken over robots.txt?
U hoeft niet altijd robots.txt aan te passen. Maar er zijn momenten waarop het controleren van dit bestand verplicht is:
Wanneer de website nieuw wordt geïmplementeerd (go-live)
Dit is het belangrijkste moment. Veel websites worden volledig geblokkeerd voor crawling omdat de ontwikkelaars zijn vergeten de regel Disallow: / te verwijderen - de regel die ze tijdens de staging-fase hebben geplaatst zodat Google de onvoltooide versie niet indexeert.
Controleer bij go-live:
| Categorie | Hoe te controleren |
|---|---|
| robots.txt-bestand aanwezig | Open https://ten-mien.com/robots.txt in de browser |
| Niet de hele website geblokkeerd | Zorg ervoor dat er GEEN regel Disallow: / is |
| Sitemap gedeclareerd | Zorg ervoor dat er WEL een regel Sitemap: https://ten-mien.com/sitemap.xml is |
| Belangrijke pagina's niet geblokkeerd | Controleer of de service-, blog- en contactpagina's niet onder Disallow vallen |
✅ Als uw website na weken nog steeds niet door Google wordt geïndexeerd
Als u een sitemap heeft, deze via Search Console heeft ingediend, maar Google deze nog steeds niet indexeert, is robots.txt de eerste verdachte om te controleren.
Bij het toevoegen van gebieden die verborgen moeten worden (ledenpagina's, interne pagina's)
Als uw website een accountbeheerpagina, een ledengebied of interne pagina's toevoegt, werk dan uw robots.txt bij om deze gebieden te blokkeren.
Bij het wijzigen van het websiteplatform of een redesign
Elk platform (WordPress, Webflow, custom code) creëert een andere URL-structuur. Bij migratie kan de oude robots.txt per ongeluk nieuwe pagina's blokkeren of de te blokkeren pagina's missen.
Wanneer Search Console de foutmelding "Blocked by robots.txt" geeft
Google Search Console heeft een rapport genaamd Indexing dat aangeeft welke pagina's worden geblokkeerd door robots.txt. Als u ziet dat belangrijke pagina's worden geblokkeerd, is dit het moment waarop u het bestand onmiddellijk moet aanpassen.
5 veelvoorkomende robots.txt-fouten en hoe deze te verhelpen
Fout 1: De hele website blokkeren - de ernstigste fout
Symptomen: Geen enkele pagina wordt door Google geïndexeerd. Search Console meldt tal van pagina's als "Blocked by robots.txt".
Oorzaak: Het robots.txt-bestand bevat:
User-agent:
Disallow: /
Deze twee regels betekenen: "Verbied alle bots om welke pagina dan ook te bezoeken." Dit gebeurt vaak wanneer ontwikkelaars deze regel plaatsen tijdens het maken van een staging-omgeving en vergeten deze te verwijderen bij de livegang.
Oplossing: Wijzig naar:
User-agent: *
Disallow:
Sitemap: https://ten-mien.com/sitemap.xml
Disallow: (niets na de dubbele punt) = toestaat om alles te crawlen.
⚠️ Dit is de nummer 1 fout die we zien bij nieuwe bedrijfswebsites. Na het oplossen hiervan kan het Google een paar dagen tot weken duren om opnieuw te crawlen. Dien de sitemap opnieuw in via Search Console om dit proces te versnellen.
---
Fout 2: CSS en JavaScript blokkeren
Symptomen: De website wordt normaal weergegeven in de browser, maar wanneer u de "URL Inspection" tool in Search Console gebruikt, ziet Google dat de pagina's een gebroken lay-out hebben of lege inhoud bevatten.
Oorzaak: Robots.txt blokkeert de mappen die CSS en JS bevatten:
Disallow: /wp-content/
Disallow: /wp-includes/
Google heeft CSS en JS nodig om te begrijpen hoe de pagina eruitziet (dit wordt "rendering" genoemd). Als deze geblokkeerd zijn, kan Google de pagina niet renderen → begrijpt de inhoud niet → beïnvloedt de ranking.
Oplossing:
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Allow: /wp-content/
Allow: /wp-includes/
📝 Opmerking voor ontwikkelaars: Sinds 2014 raadt Google expliciet aan: blokkeer geen CSS, JS en afbeeldingen in robots.txt. Googlebot heeft deze bronnen nodig om de pagina correct te renderen. Gebruik de URL Inspection tool in Search Console om te controleren hoe Google uw pagina rendert.
Fout 3: Belangrijke pagina's per ongeluk blokkeren
Symptomen: Servicepagina's, productpagina's of blogposts verschijnen niet op Google, ook al staan ze in de sitemap.
Oorzaak: De regel in robots.txt is te breed. Bijvoorbeeld:
Disallow: /dich-vu
Deze regel blokkeert niet alleen /dich-vu/, maar ook /dich-vu-thiet-ke-web/, /dich-vu-seo/ en elke URL die begint met /dich-vu.
Oplossing: Voeg een / toe aan het einde van het pad om de map nauwkeurig te blokkeren:
Disallow: /dich-vu-noi-bo/
Of gebruik Allow om de benodigde pagina te beschermen:
Disallow: /dich-vu-noi-bo/
Allow: /dich-vu/
Allow: /dich-vu-thiet-ke-web/
📝 Opmerking voor ontwikkelaars: De volgorde van
AllowenDisallowis belangrijk. Googlebot gebruikt de meest specifieke regel (most specific path). Bij gelijke lengte heeftAllowvoorrang opDisallow. Test altijd met de Robots Test Tool in Search Console voordat je implementeert.
Fout 4: Geen robots.txt bestand
Symptoom: Typ jouw-domein.com/robots.txt → geeft 404-fout terug.
Oorzaak: De website is handmatig gemaakt en de ontwikkelaar heeft dit bestand niet aangemaakt. Of het bestand is per ongeluk verwijderd tijdens het implementeren.
Impact: Minder ernstig dan fout 1 – zonder robots.txt, crawlt Google standaard alles. Maar dit betekent wel:
- Google crawlt ook admin-pagina's, testpagina's, interne pagina's
- Je hebt geen manier om naar de sitemap te verwijzen via robots.txt
- Gebrek aan basale controle
Oplossing: Maak een robots.txt bestand aan in de hoofdmap. Minimale inhoud:
User-agent: *
Disallow: /admin/
Disallow: /search?
Sitemap: https://jouw-domein.com/sitemap.xml
---
Fout 5: robots.txt gebruiken om pagina's te verbergen voor Google (verkeerd begrepen doel)
Symptoom: Je blokkeert een pagina met Disallow, maar de pagina verschijnt nog steeds in Google – hoewel zonder content-snippet.
Oorzaak: Robots.txt blokkeert crawling, niet indexing. Als de pagina al eerder geïndexeerd was, of er een backlink vanaf een andere website naar toe wijst, kan Google de URL in de zoekresultaten houden – alleen wordt de content niet weergegeven.
Correcte oplossing:
| Doel | Wat te gebruiken |
|---|---|
| Niet willen dat Google crawlt (scant) | Disallow in robots.txt |
| Niet willen dat Google indexeert (weergeeft) | tag in HTML |
| Niet allebei willen | noindex gebruiken in HTML (en niet blokkeren in robots.txt) |
⚠️ Dit is het punt dat het meest verkeerd begrepen wordt: Als je zowel het crawlen blokkeert (robots.txt) als
noindexinstelt (HTML), zal Google de noindex-tag niet zien omdat de pagina niet gecrawld wordt – en de pagina kan dan toch geïndexeerd worden. Oplossing: gebruiknoindexin HTML en verwijder deDisallowregel voor die pagina in robots.txt.
Voorbeeld robots.txt voor een bedrijfswebsite
Hieronder staat een voorbeeld van een robots.txt bestand dat geschikt is voor de meeste MKB-bedrijfswebsites:
# =============================================
# Robots.txt voor bedrijfswebsite
# Bijgewerkt: 2026-04-20
# =============================================
# Van toepassing op alle bots
User-agent: *
# Blokkeer beheer- en interne gebieden
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /dashboard/
Disallow: /staging/
# Blokkeer interne zoekpagina's (om verspilling van crawl budget te voorkomen)
Disallow: /search?
Disallow: /*?s=
# Blokkeer URL's met trackingparameters (om dubbele content te voorkomen)
Disallow: /*?utm_
Disallow: /*?ref=
Disallow: /*?fbclid=
# Blokkeer winkelwagen / afrekenpagina's (indien aanwezig)
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
# Sta CSS, JS, afbeeldingen toe (Google heeft deze nodig om pagina's te renderen)
Allow: /wp-content/uploads/
Allow: /wp-content/themes/
Allow: /wp-includes/
# Verwijzing naar de sitemap
Sitemap: https://jouw-domein.com/sitemap.xml
📝 Opmerking voor ontwikkelaars: Het robots.txt-bestand moet zich in de root van de domeinnaam bevinden —
https://example.com/robots.txt. Niet/blog/robots.txtof een andere submap. Elke subdomein heeft een aparte robots.txt nodig (bijvoorbeeld:blog.example.com/robots.txt, gescheiden vanexample.com/robots.txt).
Hoe u de robots.txt van uw website controleert
Methode 1: Direct controleren in de browser
Typ https://uw-domeinnaam.com/robots.txt in de adresbalk. U ziet de inhoud van het bestand in tekstvorm. Als u een 404-fout krijgt, betekent dit dat de website nog geen robots.txt heeft.
Methode 2: Google Search Console gebruiken
- Log in op Google Search Console
- Ga naar Instellingen → Crawling → robots.txt
- Bekijk het robots.txt-bestand dat Google leest
- Controleer of een specifieke URL is geblokkeerd
Methode 3: Controleren in het Indexeringsrapport
In Search Console → Pagina's (of Indexering) → Zoek naar "Geblokkeerd door robots.txt". Als er belangrijke pagina's in deze lijst staan, moet u direct uw robots.txt aanpassen.
💡 Het is raadzaam om uw robots.txt minimaal per kwartaal te controleren, of telkens wanneer uw website grote wijzigingen ondergaat (nieuwe pagina's, structuurwijzigingen, platformmigraties).
Overzichtstabel: Wat robots.txt wel en niet moet blokkeren
| ✅ MOET blokkeren | ❌ MOET NIET blokkeren |
|---|---|
Beheerpagina's (/admin/, /wp-admin/) | Homepage, servicepagina's, contactpagina |
| Staging / testpagina's | Blogposts, artikelen |
Interne zoekpagina's (/search?) | CSS- en JavaScript-bestanden |
URL's met trackingparameters (?utm_, ?fbclid=) | Afbeeldingen (Google Images genereert ook verkeer) |
| Winkelwagenpagina's, betaalpagina's, persoonlijke accountpagina's | Sitemap |
| Pagina's met dubbele inhoud (filters, sorteren, paginering) | FAQ-pagina's, case studies |
---
Veelgestelde vragen over robots.txt
Wat is het verschil tussen robots.txt en sitemap?
Een sitemap zegt: "Dit zijn de pagina's waarvan ik wil dat Google ze kent." Robots.txt zegt: "Dit zijn de pagina's die ik niet wil dat Google scant." De twee bestanden vullen elkaar aan — de sitemap geeft de weg aan, robots.txt plaatst de barrières.
Als er geen robots.txt is, kan Google dan mijn website crawlen?
Ja. Zonder robots.txt crawlt Google standaard alle pagina's — zelfs die u liever niet wilt. Daarom is het belangrijk om dit bestand te hebben.
Ik gebruik WordPress, waar vind ik robots.txt?
WordPress maakt een virtuele (virtuele) robots.txt aan. Als u een SEO-plugin gebruikt zoals Yoast of Rank Math, kunt u robots.txt direct in de plugin aanpassen zonder toegang tot de server.
Heeft robots.txt invloed op de websnelheid?
Nee. Dit bestand is slechts een paar KB groot. Het heeft geen invloed op de laadsnelheid van pagina's.
Ik heb een pagina geblokkeerd met robots.txt, waarom verschijnt de pagina toch in Google?
Omdat robots.txt alleen crawling blokkeert, niet indexering. Als u wilt dat een pagina volledig verdwijnt uit Google, gebruik dan de -tag in de HTML — en blokkeer die pagina niet in robots.txt (zodat Google de noindex-tag kan lezen).
Hoe lang duurt het voordat Google de wijzigingen in robots.txt doorvoert?
Google controleert robots.txt doorgaans binnen 24-48 uur opnieuw. U kunt naar Search Console → Instellingen → Crawling gaan om Google te vragen het sneller opnieuw te controleren.
Conclusie
Robots.txt is een klein bestand — meestal slechts een paar regels — maar het heeft directe invloed op of Google uw website wel of niet kan zien.
Te onthouden punten:
- Robots.txt is the "Restricted Area" sign: tells Google which pages not to crawl
- Check as soon as the website goes live: errors that block the entire website are the most common and serious
- Don't use robots.txt to hide pages from Google: it blocks crawling, not indexing
- Always allow CSS and JS: Google needs to render the page to understand the content
- Combine with sitemap and Search Console: to fully control Google's crawling and indexing of the website
Check your website's foundation
Robots.txt is just one of many technical factors that affect SEO. If you're wondering, "Is my website set up correctly?" - the answer lies in the platform you're using.
GTG CRM helps you get a website with a standard robots.txt, automatic sitemap, and a technical structure ready for Google - you don't need to worry about editing each file or line of code.
Turn what you've just read into tangible results — apply it now with GTG CRM, for free.
Apply now
