Wat is robots.txt en wanneer moeten bedrijven zich er zorgen over maken?
Je hebt een sitemap, hebt deze naar Google gestuurd, en je website wordt al geïndexeerd. Maar op een dag ontdek je dat de beheerpagina (admin), interne betaalpagina of stagingpagina van je website ook op Google verschijnt. Klanten typen de naam van je bedrijf in – en zien zelfs de nog niet voltooide testpagina.
Of andersom: je plaatst een nieuwe blogpost, wacht twee weken, en nog steeds zie je deze niet op Google. Je vraagt de technische dienst, en ze zeggen: "Het robots.txt-bestand blokkeert Google om de hele website te crawlen."
Beide situaties hebben te maken met een klein bestand waar webbeheerders weinig aandacht aan besteden: robots.txt.
Dit artikel legt uit wat robots.txt is, hoe het werkt, wanneer je het moet aanpassen, en veelvoorkomende fouten die bedrijven moeten vermijden - allemaal in eenvoudige taal, met praktische voorbeelden.
Wat is robots.txt? Uitleg voor webbeheerders
Als een sitemap de plattegrond van een gebouw is – die Google vertelt welke kamers er zijn – dan is robots.txt een "verboden terrein"-bord – dat Google vertelt welke kamers het niet mag betreden.
Technisch gezien: robots.txt is een klein tekstbestand dat zich in de hoofdmap van de website bevindt (bijvoorbeeld: https://example.com/robots.txt). Dit bestand bevat regels die zoekmachinebots – zoals Googlebot – vertellen:
- Welke pagina's wel gecrawld mogen worden
- Welke pagina's niet gecrawld mogen worden
- Waar de sitemap zich bevindt
Je kunt de robots.txt van elke website bekijken door te typen: domeinnaam.com/robots.txt in je browser.
💡 Belangrijk: robots.txt is slechts een beleefde aanvraag, geen absolute verbodsbepaling. Gerenommeerde bots zoals Googlebot zullen zich eraan houden, maar slechte bots (spam, scrapers) kunnen het negeren. Als je echte beveiliging nodig hebt, gebruik dan wachtwoorden of een firewall – vertrouw niet op robots.txt.
Hoe ziet een robots.txt-bestand eruit?
Je hoeft dit bestand niet helemaal zelf te schrijven. Maar om te begrijpen wat je ziet, hier is een eenvoudig robots.txt-bestand:
User-agent: *
Disallow: /admin/
Disallow: /thanh-toan/
Disallow: /staging/
Allow: /
Sitemap: https://example.com/sitemap.xml
Uitleg per regel:
| Regel | Betekenis |
|---|---|
User-agent: * | Geldt voor alle bots (Google, Bing, etc.) |
Disallow: /admin/ | Bots mogen de map /admin/ niet betreden |
Disallow: /thanh-toan/ | Bots mogen de betaalpagina niet betreden |
Disallow: /staging/ | Bots mogen de stagingversie niet betreden |
Allow: / | Bots mogen de rest van de website crawlen |
Sitemap: https://... | Vertelt bots waar de sitemap zich bevindt |
Hieronder een complexer voorbeeld – geschikt voor een bedrijfswebsite met een blog, servicepagina's en een beheergedeelte:
# Sta alle bots toe om publieke inhoud te crawlen
User-agent: *
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
Disallow: /search?
Disallow: /*?ref=
Disallow: /*?utm_
# Sta Googlebot toe om CSS en JS te crawlen (nodig om de pagina te renderen)
User-agent: Googlebot
Allow: /wp-content/uploads/
Allow: /wp-includes/
Sitemap: https://example.com/sitemap.xml
📝 Noot voor developers: Het
-teken in een pad is een wildcard –/*?utm_betekent dat alle URL's met de parameter?utm_worden geblokkeerd. Het$-teken aan het einde van een pad wordt gebruikt om exact het einde van de URL te matchen. Bijvoorbeeld:Disallow: /*.pdf$blokkeert alle PDF-bestanden.
---
Hoe werkt robots.txt in het SEO-proces?
Om de plaats van robots.txt te begrijpen, laten we het proces bekijken waarin Google je website in de zoekresultaten opneemt:
Crawl → Index → Rank
(Scannen) (Opslaan) (Rangschikken)
Robots.txt werkt tijdens de eerste stap - Crawl.
Voordat Googlebot begint met het scannen van een pagina op je website, controleert het eerst robots.txt. Als een URL is opgenomen in Disallow, negeert Googlebot die pagina – het scant deze niet, het leest de inhoud niet.
Googlebot wil https://example.com/admin/settings crawlen
→ Controleert robots.txt
→ Ziet Disallow: /admin/
→ Negeert, crawlt niet
Googlebot wil https://example.com/dich-vu/ crawlen
→ Controleert robots.txt
→ Wordt niet geblokkeerd
→ Crawlt normaal → Index → Kan in de zoekresultaten verschijnen
Robots.txt en sitemap: een aanvullend duo
| Bestand | Rol |
|---|---|
| Sitemap | "Dit is de lijst met pagina's waarvan ik wil dat Google ze kent" |
| Robots.txt | "Dit zijn de pagina's waarvan ik niet wil dat Google ze scant" |
Deze twee bestanden spreken elkaar niet tegen – ze werken samen. De sitemap wijst de weg, robots.txt plaatst de barrières. Correct gecombineerd, heb je controle over wat Google ziet en wat het negeert op je website.
Waar wordt robots.txt voor gebruikt? 4 veelvoorkomende gevallen
1. Beheer- en interne pagina's verbergen voor Google
Adminpagina's, CMS backend-pagina's, stagingpagina's, testpagina's – ze mogen allemaal niet op Google verschijnen. Robots.txt helpt je Google te vertellen: "Ga hier niet heen."
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /staging/
2. Verspilling van "crawl budget" voorkomen
Google crawlt niet oneindig. Elke website heeft een "crawl budget" – het aantal pagina's dat Googlebot zal scannen tijdens een bezoek. Als je website veel onbelangrijke pagina's heeft (interne zoekpagina's, filterpagina's, paginering), kan Googlebot bezig zijn met het scannen van deze pagina's in plaats van belangrijke servicepagina's of blogposts.
Disallow: /search?
Disallow: /tag/
Disallow: /page/
💡 Crawl budget is voornamelijk belangrijk voor grote websites (duizenden pagina's). Kleine websites hoeven zich meestal geen grote zorgen te maken, maar een opgeruimde robots.txt is nog steeds een goede gewoonte.
3. Dubbele inhoud blokkeren
Als je website meerdere URL's heeft die naar dezelfde inhoud leiden (bijvoorbeeld URL's met trackingparameters ?utm_source=facebook, of een printversie ?print=true), kun je deze dubbele URL's blokkeren:
Disallow: /*?utm_
Disallow: /*?ref=
Disallow: /*?print=
4. Wijzen naar de sitemap
Robots.txt is de eerste plaats waar Googlebot controleert als het je website bezoekt. Door het sitemapadres hier te plaatsen, vindt Google de sitemap sneller – zelfs als je deze nog niet via Search Console hebt ingediend.
Sitemap: https://example.com/sitemap.xml
Wanneer moeten bedrijven zich zorgen maken over robots.txt?
Je hoeft niet altijd je robots.txt aan te passen. Maar er zijn momenten dat het controleren van dit bestand verplicht is:
Wanneer de website live gaat (go-live)
Dit is het belangrijkste moment. Veel websites worden volledig geblokkeerd voor crawling omdat de ontwikkelaars vergeten de regel Disallow: / te verwijderen – een regel die ze tijdens de stagingfase hebben geplaatst om te voorkomen dat Google de onvoltooide versie indexeert.
Controleer bij go-live:
| Categorie | Hoe te controleren |
|---|---|
| Robots.txt-bestand bestaat | Open https://mijndomein.com/robots.txt in je browser |
| Website niet volledig geblokkeerd | Zorg dat er GEEN regel Disallow: / is |
| Sitemap is gedeclareerd | Zorg dat er WEL een regel Sitemap: https://mijndomein.com/sitemap.xml is |
| Belangrijke pagina's niet geblokkeerd | Controleer of serviced pagina's, blog, contactpagina niet onder Disallow vallen |
✅ Wanneer de website na weken nog niet door Google wordt geïndexeerd
Als je een sitemap hebt, deze naar Search Console hebt gestuurd, maar Google indexeert nog steeds niet – robots.txt is de eerste verdachte om te controleren.
Wanneer er een sectie moet worden verborgen (ledenpagina, interne pagina's)
Als je website accountbeheerpagina's, ledengebieden of interne pagina's toevoegt – update dan robots.txt om deze secties te blokkeren.
Wanneer het websiteplatform wordt gewijzigd of de website opnieuw wordt ontworpen
Elk platform (WordPress, Webflow, custom code) creëert een andere URL-structuur. Bij migratie kan de oude robots.txt per ongeluk de nieuwe pagina's blokkeren of de te blokkeren pagina's missen.
Wanneer Search Console een fout "Blocked by robots.txt" rapporteert
Google Search Console heeft een Indexing-rapport dat aangeeft welke pagina's zijn geblokkeerd door robots.txt. Als je belangrijke pagina's geblokkeerd ziet – dan is het tijd om het bestand onmiddellijk aan te passen.
5 veelvoorkomende robots.txt-fouten en hoe je ze oplost
Fout 1: De hele website blokkeren – de meest ernstige fout
Symptomen: Geen enkele pagina wordt door Google geïndexeerd. Search Console rapporteert talloze pagina's "Blocked by robots.txt".
Oorzaak: Het robots.txt-bestand bevat:
User-agent:
Disallow: /
Deze twee regels betekenen: "Verbied alle bots om toegang te krijgen tot welke pagina dan ook." Dit gebeurt vaak wanneer ontwikkelaars deze regel plaatsen tijdens de staging en vergeten deze te verwijderen bij go-live.
Oplossing: Pas aan naar:
User-agent: *
Disallow:
Sitemap: https://mijndomein.com/sitemap.xml
Disallow: (niets na de dubbele punt) = sta alle crawling toe.
⚠️ Dit is de #1 fout die we zien bij nieuwe bedrijfswebsites. Na de correctie kan het Google enkele dagen tot weken duren om opnieuw te crawlen. Dien de sitemap opnieuw in via Search Console om het proces te versnellen.
---
Fout 2: CSS en JavaScript blokkeren
Symptomen: De website wordt normaal weergegeven in de browser, maar wanneer je de "URL Inspection"-tool in Search Console gebruikt, ziet Google dat de pagina's niet goed worden weergegeven of leeg zijn.
Oorzaak: Robots.txt blokkeert de mappen met CSS en JS:
Disallow: /wp-content/
Disallow: /wp-includes/
Google moet CSS en JS lezen om te begrijpen hoe de pagina eruitziet (dit heet "rendering"). Als dit geblokkeerd is, kan Google de pagina niet renderen → begrijpt de inhoud niet → beïnvloedt de ranking.
Oplossing:
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Allow: /wp-content/
Allow: /wp-includes/
📝 Noot voor developers: Sinds 2014 raadt Google expliciet aan: blokkeer CSS, JS en afbeeldingen niet in robots.txt. Googlebot heeft deze resources nodig om de pagina correct te renderen. Gebruik de URL Inspection tool in Search Console om te controleren hoe Google je pagina's rendert.
Fout 3: Belangrijke pagina's per ongeluk blokkeren
Symptomen: Servicepagina's, productpagina's of blogposts verschijnen niet op Google – ook al staan ze in de sitemap.
Oorzaak: Een te brede regel in robots.txt. Bijvoorbeeld:
Disallow: /dich-vu
Deze regel blokkeert niet alleen /dich-vu/, maar ook /dich-vu-thiet-ke-web/, /dich-vu-seo/, en elke URL die begint met /dich-vu.
Oplossing: Voeg een / toe aan het einde van het pad om de map exact te blokkeren:
Disallow: /dich-vu-noi-bo/
Of gebruik Allow om de benodigde pagina's te beschermen:
Disallow: /dich-vu-noi-bo/
Allow: /dich-vu/
Allow: /dich-vu-thiet-ke-web/
📝 Noot voor developers: De volgorde van
AllowenDisallowis belangrijk. Googlebot gebruikt de meest specifieke regel (most specific path). Bij gelijke lengte heeftAllowvoorrang opDisallow. Test altijd met de Robots Testing Tool in Search Console voordat je implementeert.
Fout 4: Geen robots.txt-bestand
Symptomen: Typ mijndomein.com/robots.txt → resulteert in een 404-fout.
Oorzaak: De website is handmatig gemaakt en de ontwikkelaar heeft dit bestand niet aangemaakt. Of het bestand is per ongeluk verwijderd tijdens de implementatie.
Impact: Niet zo ernstig als fout 1 – als er geen robots.txt is, crawlt Google standaard alles. Maar dit betekent:
- Google crawlt de adminpagina's, testpagina's, interne pagina's
- Je hebt geen manier om de sitemap via robots.txt te wijzen
- Basiscontrole ontbreekt
Oplossing: Maak een robots.txt-bestand aan in de hoofdmap. Minimale inhoud:
User-agent: *
Disallow: /admin/
Disallow: /search?
Sitemap: https://mijndomein.com/sitemap.xml
---
Fout 5: Robots.txt gebruiken om pagina's voor Google te verbergen (verkeerde interpretatie)
Symptomen: Je blokkeert een pagina met Disallow, maar de pagina verschijnt nog steeds op Google – hoewel zonder inhoudssnippet.
Oorzaak: Robots.txt blokkeert crawling, niet indexeren. Als de pagina al eerder was geïndexeerd, of er een backlink van een andere website naar verwijst, kan Google de URL in de zoekresultaten behouden – zonder de inhoud weer te geven.
Juiste oplossing:
| Doel | Wat te gebruiken |
|---|---|
| Niet laten crawlen door Google | Disallow in robots.txt |
| Niet laten indexeren (weergeven) | <meta name="robots" content="noindex"> tag in HTML |
| Beide niet | Gebruik noindex in HTML (en blokkeer niet in robots.txt) |
⚠️ Dit is het meest misbegrepen punt: Als je zowel crawling blokkeert (robots.txt) als
noindexplaatst (HTML), zal Google de noindex-tag niet zien omdat de pagina niet wordt gecrawld – en de pagina kan nog steeds worden geïndexeerd. Oplossing: gebruiknoindexin HTML en verwijder deDisallow-regel voor die pagina uit robots.txt.
Voorbeeld robots.txt voor bedrijfswebsites
Hier is een voorbeeld robots.txt-bestand dat geschikt is voor de meeste MKB-bedrijfswebsites:
# =============================================
# Robots.txt voor bedrijfswebsites
# Bijgewerkt: 2026-04-20
# =============================================
# Geldt voor alle bots
User-agent: *
# Blokkeer beheer- en interne secties
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /dashboard/
Disallow: /staging/
# Blokkeer interne zoekpagina's (om crawl budget te besparen)
Disallow: /search?
Disallow: /*?s=
# Blokkeer URL's met trackingparameters (om dubbele inhoud te voorkomen)
Disallow: /*?utm_
Disallow: /*?ref=
Disallow: /*?fbclid=
# Blokkeer winkelwagen / betaalpagina's (indien van toepassing)
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
# Sta CSS, JS, afbeeldingen toe (Google heeft dit nodig om pagina's te renderen)
Allow: /wp-content/uploads/
Allow: /wp-content/themes/
Allow: /wp-includes/
# Wijs naar de sitemap
Sitemap: https://mijndomein.com/sitemap.xml
📝 Noot voor developers: Het robots.txt-bestand moet zich in de root van het domein bevinden –
https://example.com/robots.txt. Niet in/blog/robots.txtof een andere submap. Elke subdomain heeft een aparte robots.txt nodig (bijvoorbeeld:blog.example.com/robots.txtis gescheiden vanexample.com/robots.txt).
Hoe controleer je de robots.txt van je website
Methode 1: Direct controleren in de browser
Typ https://jouwdomein.com/robots.txt in de adresbalk. Je ziet de inhoud van het bestand in tekstformaat. Als je een 404-fout ziet – heeft de website nog geen robots.txt.
Methode 2: Gebruik Google Search Console
- Log in op Google Search Console
- Ga naar Settings → Crawling → robots.txt
- Bekijk het robots.txt-bestand dat Google leest
- Controleer of een specifieke URL wordt geblokkeerd
Methode 3: Controleren in de Indexing-rapporten
In Search Console → Pages (of Indexing) → Zoek naar het gedeelte "Blocked by robots.txt". Als belangrijke pagina's in deze lijst staan, moet je robots.txt onmiddellijk aanpassen.
💡 Het is raadzaam om robots.txt minimaal per kwartaal te controleren, of telkens wanneer de website grote veranderingen ondergaat (pagina's toevoegen, structuur wijzigen, platform migreren).
Samenvatting: Wat robots.txt wel en niet moet blokkeren
| ✅ WEL blokkeren | ❌ NIET blokkeren |
|---|---|
Beheerpagina's (/admin/, /wp-admin/) | Homepage, servicepagina's, contactpagina |
| Staging / testpagina's | Blogposts, artikelen |
Interne zoekpagina's (/search?) | CSS- en JavaScript-bestanden |
URL's met trackingparameters (?utm_, ?fbclid=) | Afbeeldingen (Google Images genereert ook verkeer) |
| Winkelwagen, betaalpagina's, persoonlijke accounts | Sitemap |
| Dubbele inhoudspagina's (filters, sorteren, paginering) | FAQ-pagina's, case studies |
---
Veelgestelde vragen over robots.txt
Hoe verschillen robots.txt en sitemap?
Een sitemap zegt: "Dit zijn de pagina's waarvan ik wil dat Google ze kent." Robots.txt zegt: "Dit zijn de pagina's waarvan ik niet wil dat Google ze scant." Beide bestanden vullen elkaar aan – de sitemap wijst de weg naar binnen, robots.txt plaatst de barrières.
Kan Google mijn website crawlen als er geen robots.txt is?
Ja. Zonder robots.txt crawlt Google standaard alle pagina's – inclusief de pagina's die je niet wilt. Daarom is het belangrijk om dit bestand te hebben.
Ik gebruik WordPress, waar staat robots.txt?
WordPress genereert een virtueel robots.txt-bestand. Als je een SEO-plugin zoals Yoast of Rank Math gebruikt, kun je robots.txt direct in de plugin aanpassen zonder servertoegang.
Beïnvloedt robots.txt de websnelheid?
Nee. Dit bestand is slechts enkele KB groot. Het heeft geen invloed op de laadsnelheid van de pagina.
Ik heb een pagina geblokkeerd met robots.txt, waarom staat deze nog steeds op Google?
Omdat robots.txt alleen crawling blokkeert, niet indexeren. Als je wilt dat een pagina volledig verdwijnt uit Google, gebruik dan de <meta name="robots" content="noindex"> tag in de HTML – en blokkeer die pagina niet in robots.txt (zodat Google de noindex-tag kan lezen).
Hoe lang duurt het voordat Google robots.txt bijwerkt na aanpassing?
Google controleert robots.txt meestal binnen 24-48 uur opnieuw. Je kunt naar Search Console → Settings → Crawling gaan om Google te vragen het sneller te controleren.
Conclusie
Robots.txt is een klein bestand – vaak maar een paar regels – maar het heeft directe invloed op of Google je website ziet of niet.
Wat je moet onthouden:
- Robots.txt is een "verboden terrein"-bord: het vertelt Google welke pagina's niet gescand mogen worden
- Controleer direct bij go-live: de fout van het volledig blokkeren van de website is een veelvoorkomende en ernstige fout
- Gebruik robots.txt niet om pagina's voor Google te verbergen: het blokkeert crawling, niet indexeren
- Sta altijd CSS en JS toe: Google heeft rendering nodig om de inhoud te begrijpen
- Combineer met sitemap en Search Console: om volledige controle te hebben over het crawl- en indexeerproces van Google
Controleer het websiteplatform dat je gebruikt
Robots.txt is slechts een van de vele technische factoren die SEO beïnvloeden. Vraag je je af: "Is mijn website correct ingesteld?" – het antwoord ligt in het platform dat je gebruikt.
GTG CRM helpt je een website te bouwen met een correct robots.txt-bestand, automatische sitemaps en een technische structuur die klaar is voor Google – je hoeft je geen zorgen te maken over het aanpassen van individuele bestanden of code.
Maak van wat je hebt gelezen realiteit – pas het direct toe met GTG CRM, gratis.
Pas nu toe