Was ist die robots.txt und wann sollten Unternehmen sich darum kümmern?

Sie haben eine Sitemap, haben sie bei Google eingereicht, und Ihre Website wird bereits indiziert. Doch eines Tages stellen Sie fest, dass die Admin-Seite, die interne Zahlungsseite oder die Staging-Seite Ihrer Website bei Google erscheint. Wenn Kunden den Namen Ihres Unternehmens googeln, sehen sie sogar die unvollendete Testseite.

Oder umgekehrt: Sie veröffentlichen einen neuen Blogbeitrag und warten zwei Wochen, aber er erscheint immer noch nicht bei Google. Wenn Sie die technische Abteilung fragen, sagen sie: "Die robots.txt-Datei blockiert Google daran, die gesamte Website zu crawlen."

Beide Situationen hängen mit einer kleinen Datei zusammen, die von den meisten Webmastern übersehen wird: robots.txt.

Dieser Artikel erklärt, was robots.txt ist, wie sie funktioniert, wann Sie sie bearbeiten müssen und welche häufigen Fehler Unternehmen vermeiden sollten – alles in einfacher Sprache mit praktischen Beispielen.

Was ist robots.txt? Erklärung für Webmaster

Wenn die Sitemap eine Gebäudeplanskizze ist – die Google zeigt, welche Räume es gibt –, dann ist robots.txt das Schild "Restricted Area" – das Google sagt, welche Räume nicht betreten werden dürfen.

Technisch ausgedrückt: robots.txt ist eine kleine Textdatei, die sich im Stammverzeichnis der Website befindet (z. B.: https://example.com/robots.txt). Diese Datei enthält Regeln, die Suchmaschinen-Bots wie Googlebot mitteilen:

  • Welche Seiten gecrawlt werden dürfen
  • Welche Seiten nicht gecrawlt werden dürfen
  • Wo sich die Sitemap befindet

Sie können die robots.txt jeder Website anzeigen lassen, indem Sie domain.com/robots.txt in Ihren Browser eingeben.

💡 Wichtig: robots.txt ist nur eine höfliche Bitte, kein absolutes Verbot. Seriöse Bots wie Googlebot halten sich daran, aber schlechte Bots (Spam, Scraper) können sie ignorieren. Wenn Sie wirklich Sicherheit benötigen, verwenden Sie Passwörter oder eine Firewall – verlassen Sie sich nicht auf robots.txt.

Wie sieht eine robots.txt-Datei aus?

Sie müssen diese Datei nicht von Grund auf selbst schreiben. Aber um zu verstehen, was Sie beim Betrachten sehen, hier ist eine einfache robots.txt-Datei:

User-agent: *
Disallow: /admin/
Disallow: /thanh-toan/
Disallow: /staging/
Allow: /

Sitemap: https://example.com/sitemap.xml

Erklärung jeder Zeile:

ZeileBedeutung
User-agent: *Gilt für alle Bots (Google, Bing, etc.)
Disallow: /admin/Bots dürfen das Verzeichnis /admin/ nicht betreten
Disallow: /thanh-toan/Bots dürfen die Zahlungsseite nicht betreten
Disallow: /staging/Bots dürfen die Staging-Version nicht betreten
Allow: /Bots dürfen den Rest vollständig crawlen
Sitemap: https://...Teilt dem Bot mit, wo sich die Sitemap befindet

Hier ist ein komplexeres Beispiel – geeignet für eine Unternehmenswebsite mit einem Blog, einer Dienstleistungsseite und einem Verwaltungsbereich:

# Erlaube allen Bots, öffentliche Inhalte zu crawlen
User-agent: *
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
Disallow: /search?
Disallow: /*?ref=
Disallow: /*?utm_

# Erlaube Googlebot, CSS und JS zu crawlen (notwendig für das Rendern der Seite)
User-agent: Googlebot
Allow: /wp-content/uploads/
Allow: /wp-includes/

Sitemap: https://example.com/sitemap.xml

📝 Hinweis für Entwickler: Das Zeichen * im Pfad ist ein Platzhalter – /*?utm_ bedeutet, dass alle URLs blockiert werden, die den Parameter ?utm_ enthalten. Das Zeichen $ am Ende des Pfades wird verwendet, um das Ende der URL exakt abzugleichen. Beispiel: Disallow: /*.pdf$ blockiert alle PDF-Dateien.

---

Wie funktioniert die robots.txt im SEO-Prozess?

Um die Rolle von robots.txt zu verstehen, schauen wir uns den Prozess an, mit dem Google eine Website in die Suchergebnisse aufnimmt:

Crawl → Index → Rank
(Crawlen) (Indizieren) (Ranken)

Robots.txt wirkt im ersten Schritt – Crawling.

Bevor Googlebot beginnt, eine Seite auf Ihrer Website zu crawlen, prüft er zuerst die robots.txt. Wenn eine URL in Disallow aufgeführt ist, ignoriert Googlebot diese Seite – er crawlt und liest den Inhalt nicht.

Googlebot möchte https://example.com/admin/settings crawlen
→ Prüft robots.txt
→ Findet Disallow: /admin/
→ Ignoriert, crawlt nicht

Googlebot möchte https://example.com/dich-vu/ crawlen
→ Prüft robots.txt
→ Keine Blockierung
→ Crawlt normal → Indiziert → Kann in Suchergebnissen erscheinen

Robots.txt und Sitemap: Ein unterstützendes Duo

DateiRolle
Sitemap"Hier ist die Liste der Seiten, die ich Google wissen lassen möchte"
Robots.txt"Hier sind die Seiten, die ich Google nicht crawlen lassen möchte"

Diese beiden Dateien widersprechen sich nicht – sie arbeiten zusammen. Die Sitemap weist den Weg, die robots.txt stellt Barrieren auf. Wenn sie richtig kombiniert werden, kontrollieren Sie, was Google auf Ihrer Website sieht und was nicht.

Wofür wird robots.txt verwendet? 4 gängige Fälle

1. Verstecken von Admin- und internen Seiten vor Google

Admin-Seiten, Backend-CMS-Seiten, Staging-Seiten, Testseiten – all diese sollten nicht bei Google erscheinen. Robots.txt hilft Ihnen zu sagen: "Gehen Sie hier nicht hin."

Disallow: /admin/
Disallow: /wp-admin/
Disallow: /staging/

2. Vermeidung von "Crawl-Budget"-Verschwendung

Google crawlt nicht unbegrenzt. Jede Website hat ein "Crawl-Budget" – die Anzahl der Seiten, die Googlebot bei jedem Besuch crawlen wird. Wenn Ihre Website viele unwichtige Seiten hat (interne Suchseiten, Filterseiten, Paginierungsseiten), könnte Googlebot damit beschäftigt sein, diese anstatt wichtiger Dienstleistungs- oder Blogseiten zu crawlen.

Disallow: /search?
Disallow: /tag/
Disallow: /page/

💡 Crawl-Budget ist hauptsächlich für große Websites (Tausende von Seiten) wichtig. Kleinere Unternehmenswebsites müssen sich normalerweise keine allzu großen Sorgen machen, aber eine ordentliche robots.txt beizubehalten, ist dennoch eine gute Gewohnheit.

3. Blockieren doppelter Inhalte

Wenn Ihre Website mehrere URLs hat, die zum selben Inhalt führen (z. B. eine URL mit einem Tracking-Parameter ?utm_source=facebook oder eine Druckversion ?print=true), können Sie diese doppelten URLs blockieren:

Disallow: /*?utm_
Disallow: /*?ref=
Disallow: /*?print=

4. Hinweise auf die Sitemap geben

Robots.txt ist der erste Ort, den Googlebot prüft, wenn er eine Website besucht. Das Hinzufügen des Sitemap-Pfades hier hilft Google, die Sitemap schneller zu finden – auch wenn Sie sie noch nicht über die Search Console eingereicht haben.

Sitemap: https://example.com/sitemap.xml

Wann sollten sich Unternehmen mit robots.txt beschäftigen?

Sie müssen die robots.txt nicht immer ändern. Aber es gibt Zeiten, in denen die Überprüfung dieser Datei zwingend erforderlich ist:

Wenn die Website neu gestartet wird (Go-Live)

Dies ist die kritischste Zeit. Viele Websites werden vollständig vom Crawling blockiert, weil die Entwickler vergessen, die Zeile Disallow: / zu entfernen – eine Zeile, die sie während der Staging-Phase eingefügt haben, damit Google die unfertige Version nicht indexiert.

Prüfung beim Go-Live:

KategoriePrüfmethode
robots.txt-Datei existiertÖffnen Sie https://domain.com/robots.txt im Browser
Die gesamte Website ist nicht blockiertStellen Sie sicher, dass KEINE Zeile Disallow: / vorhanden ist
Sitemap ist deklariertStellen Sie sicher, dass eine Zeile Sitemap: https://domain.com/sitemap.xml vorhanden ist
Wichtige Seiten sind nicht blockiertÜberprüfen Sie, ob Dienstleistungs-, Blog- und Kontaktseiten nicht in Disallow aufgeführt sind

✅ Wenn die Website nach mehreren Wochen nicht bei Google indexiert wird

Wenn Sie eine Sitemap haben, diese über die Search Console eingereicht haben, aber Google sie immer noch nicht indexiert – ist robots.txt der erste Verdächtige, den Sie überprüfen müssen.

Beim Hinzufügen von zu versteckenden Bereichen (Mitgliederbereiche, interne Seiten)

Wenn Ihre Website einen Bereich für die Verwaltung von Konten, einen Mitgliederbereich oder interne Seiten hinzufügt – aktualisieren Sie robots.txt, um diese Bereiche zu blockieren.

Bei Änderung der Website-Plattform oder Neugestaltung

Jede Plattform (WordPress, Webflow, benutzerdefinierter Code) erzeugt eine andere URL-Struktur. Bei der Migration kann die alte robots.txt fälschlicherweise neue Seiten blockieren oder Seiten, die blockiert werden sollen, übersehen.

Wenn die Search Console Fehler meldet "Blocked by robots.txt"

Die Google Search Console verfügt über einen Bericht Indexing, der anzeigt, welche Seiten von robots.txt blockiert werden. Wenn wichtige Seiten blockiert werden – ist es Zeit, die Datei sofort zu bearbeiten.

5 häufige robots.txt-Fehler und ihre Behebung

Fehler 1: Blockieren der gesamten Website – der schwerwiegendste Fehler

Symptom: Keine Seite wird von Google indexiert. Die Search Console meldet viele Seiten "Blocked by robots.txt".

Ursache: Die robots.txt-Datei enthält:

User-agent: 
Disallow: /

Diese beiden Zeilen bedeuten: "Verbiete allen Bots, irgendwelche Seiten zu betreten." Dies geschieht normalerweise, wenn Entwickler diese Regel während der Staging-Phase einfügen und vergessen, sie beim Go-Live zu entfernen.

Behebung: Ändern Sie zu:

User-agent: *
Disallow:

Sitemap: https://domain.com/sitemap.xml

Disallow: (ohne etwas nach dem Doppelpunkt) = Erlaube das Crawlen aller Seiten.

⚠️ Dies ist der häufigste Fehler Nr. 1, den wir bei neuen Unternehmenswebsites sehen. Nach der Korrektur kann es einige Tage bis Wochen dauern, bis Google erneut crawlt. Reichen Sie Ihre Sitemap erneut über die Search Console ein, um den Prozess zu beschleunigen.

---

Fehler 2: Blockieren von CSS und JavaScript

Symptom: Die Website wird im Browser normal angezeigt, aber wenn Sie das "URL Inspection"-Tool in der Search Console verwenden, sieht Google, dass die Seite ein fehlerhaftes Layout hat oder leer ist.

Ursache: Robots.txt blockiert Verzeichnisse, die CSS und JS enthalten:

Disallow: /wp-content/
Disallow: /wp-includes/

Google muss CSS und JS lesen, um zu verstehen, wie die Seite aussieht (dies nennt man "Rendering"). Wenn es blockiert ist, kann Google die Seite nicht rendern → versteht den Inhalt nicht → beeinträchtigt das Ranking.

Behebung:

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Allow: /wp-content/
Allow: /wp-includes/

📝 Hinweis für Entwickler: Seit 2014 empfiehlt Google ausdrücklich: Blockieren Sie CSS, JS und Bilder nicht in robots.txt. Googlebot benötigt diese Ressourcen, um Seiten korrekt zu rendern. Verwenden Sie das URL Inspection Tool in der Search Console, um zu überprüfen, wie Google Ihre Seite rendert.

Fehler 3: Fälschliches Blockieren wichtiger Seiten

Symptom: Dienstleistungsseiten, Produktseiten oder Blogbeiträge erscheinen nicht bei Google – obwohl die Sitemap sie auflistet.

Ursache: Die Regel in robots.txt ist zu breit. Beispiel:

Disallow: /dich-vu

Diese Zeile blockiert nicht nur /dich-vu/, sondern auch /dich-vu-thiet-ke-web/, /dich-vu-seo/ und jede URL, die mit /dich-vu beginnt.

Behebung: Fügen Sie einen Schrägstrich / am Ende des Pfades hinzu, um das Verzeichnis genau zu blockieren:

Disallow: /dich-vu-noi-bo/

Oder verwenden Sie Allow, um benötigte Seiten zu schützen:

Disallow: /dich-vu-noi-bo/
Allow: /dich-vu/
Allow: /dich-vu-thiet-ke-web/

📝 Hinweis für Entwickler: Die Reihenfolge von Allow und Disallow hat Auswirkungen. Googlebot verwendet die spezifischste Regel (most specific path). Bei gleicher Länge hat Allow Vorrang vor Disallow. Testen Sie immer mit dem Robots Testing Tool in der Search Console, bevor Sie es bereitstellen.

Fehler 4: Keine robots.txt-Datei vorhanden

Symptom: Eingabe von domain.com/robots.txt → gibt einen 404-Fehler zurück.

Ursache: Die Website wurde manuell erstellt und der Entwickler hat diese Datei nicht erstellt. Oder die Datei wurde beim Deployment versehentlich gelöscht.

Auswirkung: Weniger kritisch als Fehler 1 – wenn keine robots.txt vorhanden ist, crawlt Google standardmäßig alles. Aber das bedeutet:

  • Google crawlt Admin-Seiten, Testseiten, interne Seiten
  • Sie haben keine Möglichkeit, die Sitemap über robots.txt anzugeben
  • Es fehlt grundlegende Kontrolle

Behebung: Erstellen Sie eine Datei robots.txt im Stammverzeichnis. Mindestinhalt:

User-agent: *
Disallow: /admin/
Disallow: /search?

Sitemap: https://domain.com/sitemap.xml

---

Fehler 5: Verwenden von robots.txt, um Seiten vor Google zu verbergen (falsches Verständnis des Zwecks)

Symptom: Sie blockieren eine Seite mit Disallow, aber die Seite erscheint immer noch bei Google – wenn auch ohne Inhalts-Snippet.

Ursache: Robots.txt blockiert das Crawling, nicht das Indizieren. Wenn die Seite bereits indexiert war oder einen Backlink von einer anderen Website hat, kann Google die URL in den Suchergebnissen behalten – nur ohne den Inhalt anzuzeigen.

Richtige Behebung:

ZielWas verwenden
Google soll nicht crawlen (scannen)Disallow in robots.txt
Google soll nicht indexieren (anzeigen)-Tag im HTML
Weder nochnoindex im HTML verwenden (und nicht in robots.txt blockieren)

⚠️ Dies ist der häufigste Punkt des Missverständnisses: Wenn Sie sowohl das Crawling blockieren (robots.txt) als auch noindex (HTML) setzen, sieht Google das noindex-Tag nicht, weil es die Seite nicht crawlen kann – und die Seite kann trotzdem indexiert werden. Lösung: Verwenden Sie noindex im HTML und entfernen Sie die Disallow-Regel für diese Seite in robots.txt.

Beispiel robots.txt für Unternehmenswebsites

Hier ist eine Beispiel-robots.txt-Datei, die für die meisten KMU-Unternehmenswebsites geeignet ist:

# =============================================
# robots.txt für Unternehmenswebsite
# Aktualisiert: 2026-04-20
# =============================================

# Gilt für alle Bots
User-agent: *

# Blockieren von Admin- und internen Bereichen
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /dashboard/
Disallow: /staging/

# Blockieren von internen Suchseiten (verhindert Crawl-Budget-Verschwendung)
Disallow: /search?
Disallow: /*?s=

# Blockieren von URLs mit Tracking-Parametern (verhindert doppelte Inhalte)
Disallow: /*?utm_
Disallow: /*?ref=
Disallow: /*?fbclid=

# Blockieren von Warenkorb-/Kassen-/Konto-Seiten (falls vorhanden)
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/

# Erlaube CSS, JS, Bilder (Google benötigt sie zum Rendern der Seite)
Allow: /wp-content/uploads/
Allow: /wp-content/themes/
Allow: /wp-includes/

# Hinweise auf die Sitemap geben
Sitemap: https://domain.com/sitemap.xml

📝 Hinweis für Entwickler: Die robots.txt-Datei muss im Root-Domain-Verzeichnis liegen – https://example.com/robots.txt. Nicht /blog/robots.txt oder ein anderes Unterverzeichnis. Jede Subdomain benötigt eine eigene robots.txt (z. B. blog.example.com/robots.txt getrennt von example.com/robots.txt).

So überprüfen Sie die robots.txt Ihrer Website

Methode 1: Direkte Überprüfung im Browser

Geben Sie https://ihre-domain.com/robots.txt in die Adressleiste ein. Sie sehen den Inhalt der Datei im Textformat. Wenn Sie einen 404-Fehler erhalten – hat Ihre Website noch keine robots.txt.

Methode 2: Verwenden der Google Search Console

  1. Melden Sie sich bei der Google Search Console an
  2. Gehen Sie zu EinstellungenCrawlingrobots.txt
  3. Sehen Sie die robots.txt-Datei, die Google liest
  4. Prüfen Sie, ob eine bestimmte URL blockiert ist

Methode 3: Überprüfung im Indexierungsbericht

In der Search Console → Seiten (oder Indexing) → Suchen Sie den Abschnitt "Blocked by robots.txt". Wenn sich wichtige Seiten in dieser Liste befinden, müssen Sie robots.txt sofort bearbeiten.

💡 Es ist ratsam, die robots.txt mindestens einmal pro Quartal zu überprüfen oder immer dann, wenn größere Änderungen an der Website vorgenommen werden (Seiten hinzugefügt, Struktur geändert, Plattform migriert).

Zusammenfassungstabelle: Was Sie in robots.txt blockieren und nicht blockieren sollten

✅ SOLLTE blockiert werden❌ SOLLTE NICHT blockiert werden
Admin-Seiten (/admin/, /wp-admin/)Startseite, Dienstleistungsseiten, Kontaktseiten
Staging / Test-SeitenBlogbeiträge, Artikel
Interne Suchseiten (/search?)CSS- und JavaScript-Dateien
URLs mit Tracking-Parametern (?utm_, ?fbclid=)Bilder (Google Bilder bringt auch Traffic)
Warenkorb-, Kassen-, persönliche Konto-SeitenSitemap
Seiten mit doppelten Inhalten (Filter, Sortierung, Paginierung)FAQ-Seiten, Fallstudien

---

Häufig gestellte Fragen zu robots.txt

Was ist der Unterschied zwischen robots.txt und Sitemap?

Sitemap sagt: "Das sind die Seiten, die ich Google wissen lassen möchte." Robots.txt sagt: "Das sind die Seiten, die ich nicht von Google gecrawlt haben möchte." Beide Dateien ergänzen sich – die Sitemap weist den Weg, robots.txt stellt Barrieren auf.

Wenn ich keine robots.txt habe, kann Google meine Website dann crawlen?

Ja. Ohne robots.txt crawlt Google standardmäßig alle Seiten – auch die, die Sie nicht möchten. Deshalb ist es ratsam, diese Datei zu haben.

Ich benutze WordPress, wo finde ich robots.txt?

WordPress erstellt eine virtuelle robots.txt-Datei. Wenn Sie ein SEO-Plugin wie Yoast oder Rank Math verwenden, können Sie robots.txt direkt im Plugin bearbeiten, ohne auf den Server zugreifen zu müssen.

Beeinflusst robots.txt die Website-Geschwindigkeit?

Nein. Diese Datei ist nur wenige KB groß. Sie hat keinen Einfluss auf die Ladezeit.

Ich habe eine Seite mit robots.txt blockiert, aber sie erscheint immer noch bei Google?

Weil robots.txt nur das Crawling blockiert, nicht die Indexierung. Wenn die Seite bereits zuvor indexiert wurde oder einen Backlink von einer anderen Website hat, kann Google die URL in den Suchergebnissen beibehalten – nur wird der Inhalt nicht angezeigt.

Nachdem ich robots.txt geändert habe, wie lange dauert es, bis Google es aktualisiert?

Google prüft die robots.txt normalerweise innerhalb von 24-48 Stunden erneut. Sie können zur Search Console → Einstellungen → Crawling gehen und Google bitten, die Überprüfung früher durchzuführen.

Fazit

Robots.txt ist eine kleine Datei – oft nur wenige Zeilen – die aber direkten Einfluss darauf hat, ob Google Ihre Website sieht oder nicht.

Zu merkende Punkte:

  1. Robots.txt ist das Schild "Restricted Area": teilt Google mit, welche Seiten nicht gescannt werden dürfen
  2. Überprüfen Sie sofort beim Go-Live: der Fehler, die gesamte Website zu blockieren, ist der häufigste und schwerwiegendste
  3. Verwenden Sie robots.txt nicht, um Seiten vor Google zu verbergen: sie blockiert das Crawling, nicht die Indexierung
  4. Erlaube immer CSS und JS: Google benötigt sie, um die Seite zu rendern und den Inhalt zu verstehen
  5. Kombiniere mit Sitemap und Search Console: um die vollständige Kontrolle über das Crawling und die Indexierung Ihrer Website zu haben

Überprüfen Sie die Plattform Ihrer Website

Robots.txt ist nur einer von vielen technischen Faktoren, die SEO beeinflussen. Wenn Sie sich fragen: "Ist meine Website richtig konfiguriert?" – die Antwort liegt in der Plattform, die Sie verwenden.

GTG CRM hilft Ihnen, eine Website mit einer standardmäßigen robots.txt, automatischer Sitemap und einer technischen Struktur zu erhalten, die für Google bereit ist – Sie müssen sich nicht um die Bearbeitung einzelner Dateien oder Codezeilen kümmern.

Machen Sie das Gelesene zu realen Ergebnissen – wenden Sie es jetzt mit GTG CRM an, kostenlos.

Jetzt anwenden