Je hebt een sitemap, hebt deze naar Google gestuurd, en je website wordt ook geïndexeerd. Maar op een dag ontdek je dat de beheerpagina (admin), interne betaalpagina of stagingpagina van je website ook op Google verschijnen. Klanten typen de naam van het bedrijf - en zien zelfs de nog niet voltooide testpagina.
Of andersom: je plaatst een nieuwe blogpost, wacht twee weken en ziet deze nog steeds niet op Google. Je vraagt de technische afdeling, en ze zeggen: "Het robots.txt-bestand blokkeert Google van het crawlen van de hele website."
Beide situaties hebben te maken met een klein bestand waar webbeheerders weinig aandacht aan besteden: robots.txt.
Dit artikel legt uit wat robots.txt is, hoe het werkt, wanneer je het moet aanpassen en welke veelvoorkomende fouten bedrijven moeten vermijden - allemaal in eenvoudige taal, met praktische voorbeelden.
Wat is robots.txt? Een uitleg voor webbeheerders
Als een sitemap de plattegrond van een gebouw is - die Google vertelt welke kamers er zijn - dan is robots.txt het "Toegang Verboden"-bord - dat Google vertelt welke kamers niet betreden mogen worden.
Technisch gezien: robots.txt is een klein tekstbestand dat zich in de hoofdmap van de website bevindt (bijvoorbeeld: https://example.com/robots.txt). Dit bestand bevat regels die zoekmachinerobots - zoals Googlebot - vertellen:
- Welke pagina's wel gecrawld (gescand) mogen worden
- Welke pagina's niet gecrawld mogen worden
- Waar de sitemap zich bevindt
Je kunt de robots.txt van elke website bekijken door te typen: domeinnaam.nl/robots.txt in je browser.
💡 Belangrijk: robots.txt is slechts een beleefd verzoek, geen absolute verbodsbepaling. Gerenommeerde bots zoals Googlebot zullen zich eraan houden, maar slechte bots (spam, scrapers) kunnen het negeren. Als je echt beveiliging nodig hebt, gebruik dan wachtwoorden of een firewall - vertrouw niet alleen op robots.txt.
Hoe ziet een robots.txt-bestand eruit?
Je hoeft dit bestand niet helemaal zelf te schrijven. Maar om te begrijpen wat je ziet, is hier een eenvoudig robots.txt-bestand:
User-agent: *
Disallow: /admin/
Disallow: /betaling/
Disallow: /staging/
Allow: /
Sitemap: https://example.com/sitemap.xml
Uitleg per regel:
| Regel | Betekenis |
|---|---|
User-agent: * | Van toepassing op alle bots (Google, Bing, etc.) |
Disallow: /admin/ | Sta bot niet toe de map /admin/ te betreden |
Disallow: /betaling/ | Sta bot niet toe de betaalpagina te betreden |
Disallow: /staging/ | Sta bot niet toe de stagingversie te betreden |
Allow: / | Sta bot toe de rest van de website te crawlen |
Sitemap: https://... | Vertel bot waar de sitemap zich bevindt |
Hier is een complexer voorbeeld - geschikt voor een bedrijfswebsite met een blog, dienstenpagina's en een beheergedeelte:
# Sta alle bots toe om publieke inhoud te crawlen
User-agent: *
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /winkelmandje/
Disallow: /afrekenen/
Disallow: /mijn-account/
Disallow: /zoeken?
Disallow: /*?ref=
Disallow: /*?utm_
# Sta Googlebot toe om CSS en JS te crawlen (nodig om de pagina te renderen)
User-agent: Googlebot
Allow: /wp-content/uploads/
Allow: /wp-includes/
Sitemap: https://example.com/sitemap.xml
📝 Noot voor developers: Het `*`-teken in een pad is een wildcard — `/`*?utm_` betekent dat alle URL's worden geblokkeerd die de parameter `?utm_` bevatten. Het `$`-teken aan het einde van een pad wordt gebruikt om precies overeen te komen met het einde van de URL. Bijvoorbeeld: `Disallow: /*.pdf$` blokkeert alle PDF-bestanden.
Hoe werkt robots.txt in het SEO-proces?
Om de plaats van robots.txt te begrijpen, kijken we naar het proces waarmee Google een website in de zoekresultaten opneemt:
Crawlen → Indexeren → Ranken
(Scannen) (Opslaan) (Sorteren)
Robots.txt werkt tijdens de eerste stap - Crawlen.
Voordat Googlebot begint met het scannen van een pagina op je website, controleert het eerst robots.txt. Als een URL in Disallow staat, negeert Googlebot die pagina - hij scant en leest de inhoud niet.
Googlebot wil https://example.com/admin/settings crawlen
→ Controleert robots.txt
→ Ziet Disallow: /admin/
→ Negeert, crawlt niet
Googlebot wil https://example.com/diensten/ crawlen
→ Controleert robots.txt
→ Wordt niet geblokkeerd
→ Crawlt normaal → Indexeert → Mogelijk in zoekresultaten
Robots.txt en sitemap: een aanvullend duo
| Bestand | Rol |
|---|---|
| Sitemap | "Dit is de lijst met pagina's waarvan ik wil dat Google ze kent" |
| Robots.txt | "Dit zijn de pagina's waarvan ik niet wil dat Google ze scant" |
Deze twee bestanden zijn niet tegenstrijdig - ze werken samen. De sitemap wijst de weg, robots.txt plaatst de barrières. Als je ze correct combineert, controleer je wat Google wel en niet ziet op je website.
Waarvoor wordt robots.txt gebruikt? 4 veelvoorkomende gevallen
1. Beheerpagina's en interne content verbergen voor Google
Adminpagina's, CMS backend-pagina's, stagingpagina's, testpagina's - ze mogen allemaal niet op Google verschijnen. Robots.txt helpt je Google te vertellen: "Ga hier niet heen."
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /staging/
2. Verspilling van "crawl budget" voorkomen
Google crawlt niet onbeperkt. Elke website heeft een "crawl budget" - het aantal pagina's dat Googlebot tijdens elk bezoek scant. Als je website veel onbelangrijke pagina's heeft (interne zoekpagina's, filterpagina's, paginatiepagina's), kan Googlebot bezig zijn met het scannen van deze pagina's in plaats van belangrijke diensten- of blogpagina's.
Disallow: /zoeken?
Disallow: /tag/
Disallow: /pagina/
💡 Crawl budget is vooral belangrijk voor grote websites (duizenden pagina's). Kleinere bedrijfswebsites hoeven zich er meestal niet al te veel zorgen over te maken, maar het is nog steeds een goede gewoonte om robots.txt overzichtelijk te houden.
3. Dubbele inhoud blokkeren
Als je website meerdere URL's heeft die naar dezelfde inhoud leiden (bijvoorbeeld een URL met trackingparameters ?utm_source=facebook, of een printversie ?print=true), kun je deze dubbele URL's blokkeren:
Disallow: /*?utm_
Disallow: /*?ref=
Disallow: /*?print=
4. Verwijzen naar de sitemap
Robots.txt is de eerste plek waar Googlebot naar kijkt als hij een website bezoekt. Door hier het sitemapadres te plaatsen, kan Google de sitemap sneller vinden - zelfs als je deze nog niet via Search Console hebt ingediend.
Sitemap: https://example.com/sitemap.xml
Wanneer moeten bedrijven aandacht besteden aan robots.txt?
Niet altijd hoef je robots.txt aan te passen. Maar er zijn momenten waarop het controleren van dit bestand verplicht is:
Wanneer de website nieuw wordt gelanceerd (go-live)
Dit is het belangrijkste moment. Veel websites worden volledig geblokkeerd van crawlen omdat de ontwikkelaar vergat de regel Disallow: / te verwijderen - een regel die ze tijdens het stagingproces hebben geplaatst om te voorkomen dat Google de onvoltooide versie indexeert.
Controle bij go-live:
| Categorie | Hoe te controleren |
|---|---|
| robots.txt-bestand bestaat | Open https://domeinnaam.nl/robots.txt in je browser |
| Hele website niet geblokkeerd | Zorg ervoor dat er GEEN regel Disallow: / aanwezig is |
| Sitemap wordt vermeld | Zorg ervoor dat er een regel Sitemap: https://domeinnaam.nl/sitemap.xml is |
| Belangrijke pagina's worden niet geblokkeerd | Controleer of diensten-, blog- en contactpagina's niet onder Disallow vallen |
✅ Wanneer de website na weken nog niet door Google wordt geïndexeerd
Als je een sitemap hebt en deze hebt ingediend via Search Console, maar Google indexeert nog steeds niet - dan is robots.txt de eerste verdachte die gecontroleerd moet worden.
Wanneer een te verbergen gebied wordt toegevoegd (ledenpagina's, interne pagina's)
Als je website accountbeheerpagina's, ledengebieden of interne pagina's toevoegt - update dan robots.txt om deze gebieden te blokkeren.
Bij het wijzigen van de website-engine of een redesign
Elke engine (WordPress, Webflow, custom code) creëert een andere URL-structuur. Bij migratie kan een oude robots.txt per ongeluk de nieuwe pagina's blokkeren of de te blokkeren pagina's missen.
Wanneer Search Console een fout "Blocked by robots.txt" rapporteert
Google Search Console heeft een Indexing-rapport dat aangeeft welke pagina's door robots.txt worden geblokkeerd. Als je ziet dat belangrijke pagina's worden geblokkeerd - is het tijd om het bestand direct aan te passen.
5 veelvoorkomende robots.txt-fouten en hoe ze op te lossen
Fout 1: Hele website geblokkeerd - de ernstigste fout
Symptomen: Geen enkele pagina wordt door Google geïndexeerd. Search Console rapporteert talloze pagina's als "Blocked by robots.txt".
Oorzaak: Het robots.txt-bestand bevat:
User-agent:
Disallow: /
Deze twee regels betekenen: "Verbied alle bots om enige pagina te betreden." Dit gebeurt meestal wanneer ontwikkelaars deze regel instellen tijdens de stagingfase en vergeten deze te verwijderen bij de go-live.
Oplossing: Wijzig naar:
User-agent: *
Disallow:
Sitemap: https://domeinnaam.nl/sitemap.xml
Disallow: (zonder iets erachter) = alles crawlen toestaan.
⚠️ Dit is de nummer 1 fout die we zien bij nieuwe bedrijfswebsites. Na correctie kan het enkele dagen tot weken duren voordat Google opnieuw crawlt. Dien je sitemap opnieuw in via Search Console om dit proces te versnellen.
Fout 2: CSS en JavaScript geblokkeerd
Symptomen: De website wordt normaal weergegeven in de browser, maar wanneer je de "URL Inspection"-tool in Search Console gebruikt, ziet Google dat de pagina's met een kapot uiterlijk of lege inhoud worden weergegeven.
Oorzaak: Robots.txt blokkeert de mappen die CSS en JS bevatten:
Disallow: /wp-content/
Disallow: /wp-includes/
Google moet CSS en JS lezen om te begrijpen hoe de pagina eruitziet (dit wordt "rendering" genoemd). Als het geblokkeerd wordt, kan Google de pagina niet renderen → de inhoud niet begrijpen → dit heeft invloed op de ranking.
Oplossing:
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Allow: /wp-content/
Allow: /wp-includes/
📝 Noot voor developers: Sinds 2014 raadt Google expliciet aan: blokkeer geen CSS, JS en afbeeldingen in robots.txt. Googlebot heeft deze resources nodig om de pagina correct te renderen. Gebruik de URL Inspection tool in Search Console om te controleren hoe Google je pagina's rendert.
Fout 3: Belangrijke pagina's per ongeluk geblokkeerd
Symptomen: Dienstenpagina's, productpagina's of blogposts verschijnen niet op Google - ook al staan ze wel in de sitemap.
Oorzaak: Een te brede regel in robots.txt. Bijvoorbeeld:
Disallow: /diensten
Deze regel blokkeert niet alleen /diensten/, maar ook /diensten-webdesign/, /diensten-seo/, en elke URL die begint met /diensten.
Oplossing: Voeg een / toe aan het einde van het pad om de map precies te blokkeren:
Disallow: /interne-diensten/
Of gebruik Allow om de benodigde pagina's te beschermen:
Disallow: /interne-diensten/
Allow: /diensten/
Allow: /diensten-webdesign/
📝 Noot voor developers: De volgorde van `Allow` en `Disallow` is van belang. Googlebot gebruikt de meest specifieke regel (most specific path). Bij gelijke lengte heeft `Allow` voorrang op `Disallow`. Test altijd met de [Robots Testing Tool](https://support.google.com/webmasters/answer/6062598) in Search Console voordat je live gaat.
Fout 4: Geen robots.txt-bestand
Symptomen: Typ domeinnaam.nl/robots.txt → resulteert in een 404-fout.
Oorzaak: De website is handmatig gebouwd en de ontwikkelaar heeft dit bestand niet aangemaakt. Of het bestand is per ongeluk verwijderd tijdens de deployment.
Impact: Minder ernstig dan fout 1 - als er geen robots.txt is, crawlt Google standaard alles. Maar dit betekent:
- Google crawlt de adminpagina's, testpagina's en interne pagina's
- Je hebt geen manier om via robots.txt naar de sitemap te verwijzen
- Basiscontrole ontbreekt
Oplossing: Maak een robots.txt-bestand aan in de hoofdmap. Minimale inhoud:
User-agent: *
Disallow: /admin/
Disallow: /zoeken?
Sitemap: https://domeinnaam.nl/sitemap.xml
Fout 5: Robots.txt gebruiken om pagina's te verbergen voor Google (verkeerd doel begrepen)
Symptomen: Je blokkeert een pagina met Disallow, maar de pagina verschijnt toch op Google - hoewel zonder content snippet.
Oorzaak: Robots.txt blokkeert crawlen, niet indexeren. Als de pagina al eerder was geïndexeerd, of als er een backlink van een andere website naar verwijst, kan Google de URL in de zoekresultaten bewaren - het toont simpelweg de inhoud niet.
Correcte oplossing:
| Doel | Wat te gebruiken |
|---|---|
| Niet door Google laten crawlen (scannen) | Disallow in robots.txt |
| Niet door Google laten indexeren (weergeven) | <meta name="robots" content="noindex"> tag in de HTML |
| Beide niet | Gebruik `noindex` in de HTML (en niet blokkeren in robots.txt) |
⚠️ Dit is het meest verkeerd begrepen punt: Als je zowel het crawlen blokkeert (robots.txt) als `noindex` instelt (HTML), zal Google de noindex-tag niet zien omdat de pagina niet wordt gecrawld — en de pagina kan toch worden geïndexeerd. Oplossing: gebruik `noindex` in de HTML en verwijder de `Disallow`-regel voor die pagina in robots.txt.
Voorbeeld robots.txt voor bedrijfswebsites
Hier is een voorbeeld robots.txt-bestand dat geschikt is voor de meeste MKB-bedrijfswebsites:
# =============================================
# Robots.txt voor bedrijfswebsite
# Bijgewerkt: 2026-04-20
# =============================================
# Van toepassing op alle bots
User-agent: *
# Blokkeer beheer- en interne gebieden
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /dashboard/
Disallow: /staging/
# Blokkeer interne zoekpagina's (om verspilling van crawl budget te voorkomen)
Disallow: /zoeken?
Disallow: /*?s=
# Blokkeer URL's met tracking parameters (om dubbele inhoud te voorkomen)
Disallow: /*?utm_
Disallow: /*?ref=
Disallow: /*?fbclid=
# Blokkeer winkelmandje/betaalpagina's (indien aanwezig)
Disallow: /winkelmandje/
Disallow: /afrekenen/
Disallow: /mijn-account/
# Sta CSS, JS, afbeeldingen toe (Google heeft ze nodig om pagina's te renderen)
Allow: /wp-content/uploads/
Allow: /wp-content/themes/
Allow: /wp-includes/
# Verwijzing naar sitemap
Sitemap: https://domeinnaam.nl/sitemap.xml
📝 Noot voor developers: Het robots.txt-bestand moet zich in de root van het domein bevinden — `https://example.com/robots.txt`. Niet in `/blog/robots.txt` of een andere subdirectory. Elke subdomain heeft een eigen robots.txt nodig (bijvoorbeeld: `blog.example.com/robots.txt` is gescheiden van `example.com/robots.txt`).
Hoe controleer je de robots.txt van jouw website
Methode 1: Direct controleren in de browser
Typ https://jouw-domeinnaam.nl/robots.txt in de adresbalk. Je ziet de inhoud van het bestand als tekst. Als je een 404-fout ziet - dan heeft de website nog geen robots.txt-bestand.
Methode 2: Gebruik Google Search Console
- Log in op Google Search Console
- Ga naar Instellingen → Crawlen → robots.txt
- Bekijk het robots.txt-bestand dat Google leest
- Controleer of een specifieke URL wordt geblokkeerd
Methode 3: Controleer in het Indexing-rapport
In Search Console → Pagina's (of Indexering) → Zoek naar de sectie "Blocked by robots.txt". Als er belangrijke pagina's in deze lijst staan, moet je robots.txt direct aanpassen.
💡 Het is raadzaam om robots.txt minimaal per kwartaal te controleren of telkens wanneer de website grote veranderingen ondergaat (pagina's toevoegen, structuur wijzigen, platform migreren).
Samenvatting: Wat moet je blokkeren en wat niet in robots.txt
| ✅ MOETEN blokkeren | ❌ NIET MOETEN blokkeren |
|---|---|
Beheerpagina's (/admin/, /wp-admin/) | Homepage, dienstenpagina's, contactpagina |
| Staging / testpagina's | Blogposts, artikelen |
Interne zoekpagina's (/search?) | CSS- en JavaScript-bestanden |
URL's met tracking parameters (?utm_, ?fbclid=) | Afbeeldingen (Google Images genereert ook verkeer) |
| Winkelmandje, betaal-, persoonlijke accountpagina's | Sitemap |
| Dubbele inhoudpagina's (filter, sorteren, paginatie) | FAQ-pagina's, case studies |
Veelgestelde vragen over robots.txt
Wat is het verschil tussen robots.txt en sitemap?
Een sitemap zegt: "Dit zijn de pagina's waarvan ik wil dat Google ze kent." Robots.txt zegt: "Dit zijn de pagina's waarvan ik niet wil dat Google ze scant." Beide bestanden vullen elkaar aan - de sitemap wijst de weg naar binnen, robots.txt plaatst de barrières.
Kan Google mijn website crawlen als er geen robots.txt is?
Ja. Zonder robots.txt crawlt Google standaard alle pagina's - inclusief de pagina's die je niet wilt. Daarom is het goed om dit bestand te hebben.
Ik gebruik WordPress, waar vind ik robots.txt?
WordPress genereert zelf een virtueel robots.txt-bestand. Als je een SEO-plugin zoals Yoast of Rank Math gebruikt, kun je robots.txt direct in de plugin aanpassen zonder toegang tot de server te hebben.
Heeft robots.txt invloed op de websnelheid?
Nee. Dit bestand is slechts enkele KB groot. Het heeft geen invloed op de laadtijd van de pagina.
Ik heb een pagina geblokkeerd met robots.txt, waarom verschijnt deze nog steeds op Google?
Omdat robots.txt alleen crawlen blokkeert, niet indexeren. Als een pagina al eerder was geïndexeerd, of als er een backlink van een andere website naar verwijst, kan Google de URL in de zoekresultaten bewaren - het toont simpelweg de inhoud niet. Om de pagina volledig van Google te laten verdwijnen, gebruik je de <meta name="robots" content="noindex"> tag in de HTML - en blokkeer de pagina niet in robots.txt (zodat Google de noindex-tag kan lezen).
Hoe lang duurt het voordat Google mijn aangepaste robots.txt heeft verwerkt?
Google controleert robots.txt doorgaans binnen 24-48 uur opnieuw. Je kunt in Search Console → Instellingen → Crawlen klikken op "Google vragen opnieuw te crawlen" om dit proces te versnellen.
Conclusie
Robots.txt is een klein bestand - vaak slechts enkele regels - maar het heeft directe invloed op of Google je website wel of niet ziet.
Belangrijke punten om te onthouden:
- Robots.txt is het "Toegang Verboden"-bord: het vertelt Google welke pagina's niet gescand mogen worden
- Controleer direct na go-live: het blokkeren van de hele website is de meest voorkomende en ernstigste fout
- Gebruik robots.txt niet om pagina's te verbergen voor Google: het blokkeert crawlen, niet indexeren
- Sta altijd CSS en JS toe: Google heeft rendering nodig om de inhoud te begrijpen
- Combineer met sitemap en Search Console: voor volledige controle over hoe Google je website crawlt en indexeert
Controleer de engine van je website
Robots.txt is slechts een van de vele technische factoren die van invloed zijn op SEO. Vraag je je af: "Is mijn website correct geconfigureerd?" - het antwoord ligt in de engine die je gebruikt.
GTG CRM helpt je met een website met een standaard robots.txt, automatische sitemaps en een technisch correcte structuur die klaar is voor Google - je hoeft je geen zorgen te maken over het aanpassen van individuele bestanden of coderegels.
Verander wat je zojuist hebt gelezen in concrete resultaten - pas het direct toe met GTG CRM, gratis.
Nu toepassen