Sie haben eine Sitemap, sie wurde an Google gesendet, und Ihre Website beginnt zu indexieren. Aber eines Tages stellen Sie fest, dass die Admin-Seite, die interne Zahlungsseite oder die Staging-Seite Ihrer Website auch bei Google auftauchen. Kunden geben den Firmennamen ein – und sehen sogar die unfertige Testseite.

Oder umgekehrt: Sie veröffentlichen einen neuen Blogbeitrag, warten zwei Wochen, und er erscheint immer noch nicht bei Google. Wenn Sie die technische Abteilung fragen, sagen sie: „Die robots.txt-Datei blockiert Google daran, die gesamte Website zu crawlen.“

Beide Situationen hängen mit einer kleinen Datei zusammen, auf die sich Webmaster selten konzentrieren: robots.txt.

Dieser Artikel erklärt, was robots.txt ist, wie sie funktioniert, wann Sie sie ändern müssen und welche häufigen Fehler Unternehmen vermeiden sollten – alles in einfacher Sprache mit praktischen Beispielen.

Was ist robots.txt? Erklärung für Webmaster

Wenn die Sitemap die Gebäudeskizze ist – die Google zeigt, welche Räume es gibt –, dann ist die robots.txt das „Betreten verboten“-Schild, das Google sagt, welche Räume nicht betreten werden dürfen.

Technisch ausgedrückt: robots.txt ist eine kleine Textdatei, die sich im Stammverzeichnis Ihrer Website befindet (z. B. https://example.com/robots.txt). Diese Datei enthält Regeln, die Suchmaschinen-Bots – wie Googlebot – mitteilen:

  • Welche Seiten gecrawlt werden dürfen (durchsucht)
  • Welche Seiten nicht gecrawlt werden dürfen
  • Wo sich die Sitemap befindet

Sie können die robots.txt jeder Website anzeigen, indem Sie domain.com/robots.txt in Ihren Browser eingeben.

💡 Wichtig: robots.txt ist nur eine höfliche Anfrage, kein absolutes Verbot. Seriöse Bots wie Googlebot werden sie befolgen, aber böswillige Bots (Spam, Scraper) können sie ignorieren. Wenn Sie echte Sicherheit benötigen, verwenden Sie Passwörter oder eine Firewall – verlassen Sie sich nicht auf robots.txt.

Wie sieht eine robots.txt-Datei aus?

Sie müssen diese Datei nicht von Grund auf neu schreiben. Aber um zu verstehen, was Sie sehen, hier ist eine einfache robots.txt-Datei:

User-agent: *
Disallow: /admin/
Disallow: /thanh-toan/
Disallow: /staging/
Allow: /

Sitemap: https://example.com/sitemap.xml

Erklärung jeder Zeile:

ZeileBedeutung
User-agent: *Gilt für alle Bots (Google, Bing, etc.)
Disallow: /admin/Verhindert, dass Bots das Verzeichnis /admin/ aufrufen
Disallow: /thanh-toan/Verhindert, dass Bots die Zahlungsseite aufrufen
Disallow: /staging/Verhindert, dass Bots die Staging-Version aufrufen
Allow: /Erlaubt Bots, den Rest der Website zu crawlen
Sitemap: https://...Teilt dem Bot mit, wo sich die Sitemap befindet

Hier ist ein komplexeres Beispiel – geeignet für eine Unternehmenswebsite mit einem Blog, einer Dienstleistungsseite und einem Verwaltungsbereich:

# Erlaubt allen Bots, öffentliche Inhalte zu crawlen
User-agent: *
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
Disallow: /search?
Disallow: /*?ref=
Disallow: /*?utm_

# Erlaubt Googlebot, CSS und JS zu crawlen (notwendig für die Seitenrendern)
User-agent: Googlebot
Allow: /wp-content/uploads/
Allow: /wp-includes/

Sitemap: https://example.com/sitemap.xml
📝 Hinweis für Entwickler: Das Zeichen `` im Pfad ist ein Platzhalter – `/?utm_` bedeutet, dass alle URLs blockiert werden, die den Parameter `?utm_` enthalten. Das Zeichen `$` am Ende des Pfads wird verwendet, um das URL-Ende exakt abzugleichen. Zum Beispiel: `Disallow: /*.pdf$` blockiert alle PDF-Dateien.

Wie funktioniert robots.txt im SEO-Prozess?

Um die Rolle von robots.txt zu verstehen, werfen wir einen Blick auf den Prozess, wie Google Ihre Website in die Suchergebnisse aufnimmt:

Crawl → Index → Rank
(Durchsuchen) (Speichern) (Rangieren)

Robots.txt funktioniert in der ersten Phase – dem Crawling.

Bevor Googlebot beginnt, eine Seite auf Ihrer Website zu crawlen, prüft er zuerst robots.txt. Wenn eine URL in Disallow aufgeführt ist, ignoriert Googlebot diese Seite – er crawlt und liest den Inhalt nicht.

Googlebot möchte https://example.com/admin/settings crawlen
→ Prüft robots.txt
→ Findet Disallow: /admin/
→ Ignoriert, crawlt nicht

Googlebot möchte https://example.com/dich-vu/ crawlen
→ Prüft robots.txt
→ Nicht blockiert
→ Crawlt normal → Indexiert → Möglicherweise in Suchergebnissen

Robots.txt und Sitemap: ein ergänzendes Duo

DateiRolle
Sitemap„Das ist die Liste der Seiten, von denen ich möchte, dass Google sie kennt.“
Robots.txt„Das sind die Seiten, von denen ich nicht möchte, dass Google sie crawlt.“

Diese beiden Dateien stehen nicht im Widerspruch zueinander – sie arbeiten zusammen. Die Sitemap weist den Weg, robots.txt setzt Barrieren. Richtig kombiniert steuern Sie, was Google auf Ihrer Website sieht und was es ignoriert.

Wofür wird robots.txt verwendet? 4 gängige Fälle

1. Administrator- und interne Seiten vor Google verbergen

Admin-Seiten, Backend-CMS-Seiten, Staging-Seiten, Test-Seiten – all diese sollten nicht auf Google erscheinen. Robots.txt hilft Ihnen, Google zu sagen: „Geh hier nicht rein.“

Disallow: /admin/
Disallow: /wp-admin/
Disallow: /staging/

2. Vermeidung von verschwendetem „Crawl-Budget“

Google crawlt nicht unendlich. Jede Website hat ein „Crawl-Budget“ – die Anzahl der Seiten, die Googlebot bei jedem Besuch crawlen wird. Wenn eine Website viele unwichtige Seiten hat (interne Suchseiten, Filterseiten, Paginierungsseiten), kann Googlebot damit beschäftigt sein, diese zu crawlen, anstatt wichtige Service-Seiten oder Blog-Beiträge.

Disallow: /search?
Disallow: /tag/
Disallow: /page/
💡 Das Crawl-Budget ist hauptsächlich für große Websites (Tausende von Seiten) wichtig. Kleine Unternehmenswebsites müssen sich normalerweise keine großen Sorgen machen, aber eine übersichtliche robots.txt ist dennoch eine gute Gewohnheit.

3. Blockieren doppelter Inhalte

Wenn Ihre Website mehrere URLs hat, die zum selben Inhalt führen (z. B. URLs mit Tracking-Parametern ?utm_source=facebook oder einer Druckversion ?print=true), können Sie diese doppelten URLs blockieren:

Disallow: /*?utm_
Disallow: /*?ref=
Disallow: /*?print=

4. Pfad zur Sitemap angeben

Robots.txt ist die erste Stelle, die Googlebot überprüft, wenn er auf eine Website kommt. Die Angabe des Sitemap-Pfads hier hilft Google, die Sitemap schneller zu finden – auch wenn Sie sie noch nicht über die Search Console übermittelt haben.

Sitemap: https://example.com/sitemap.xml

Wann sollten Unternehmen auf robots.txt achten?

Sie müssen robots.txt nicht immer bearbeiten. Aber es gibt Zeiten, in denen die Überprüfung dieser Datei zwingend erforderlich ist:

Wenn die Website neu gestartet wird (Go-Live)

Dies ist die wichtigste Zeit. Viele Websites werden vollständig vom Crawling blockiert, weil die Entwickler vergessen, die Zeile Disallow: / zu entfernen – eine Zeile, die sie während des Staging-Prozesses eingefügt haben, damit Google die unfertige Version nicht indexiert.

Prüfung beim Go-Live:

KategoriePrüfungsmethode
Robots.txt-Datei vorhandenÖffnen Sie https://domain-name.com/robots.txt im Browser
Nicht die gesamte Website blockierenStellen Sie sicher, dass KEINE Zeile Disallow: / vorhanden ist
Sitemap-Deklaration vorhandenStellen Sie sicher, dass eine Zeile Sitemap: https://domain-name.com/sitemap.xml vorhanden ist
Wichtige Seiten nicht blockiertPrüfen Sie, ob Service-, Blog- oder Kontaktseiten nicht unter Disallow aufgeführt sind

✅ Wenn die Website nach mehreren Wochen nicht von Google indexiert wird

Wenn Sie bereits eine Sitemap haben, diese über die Search Console eingereicht haben, aber Google sie immer noch nicht indexiert – ist die robots.txt der erste Verdächtige, den Sie überprüfen sollten.

Beim Hinzufügen von zu versteckenden Bereichen (Mitgliederbereiche, interne Seiten)

Wenn Ihre Website Verwaltungsseiten für Konten, Mitgliederbereiche oder interne Seiten ergänzt – aktualisieren Sie Ihre robots.txt, um diese Bereiche zu blockieren.

Beim Wechsel der Website-Plattform oder beim Redesign

Jede Plattform (WordPress, Webflow, benutzerdefinierter Code) erstellt eine unterschiedliche URL-Struktur. Beim Migrieren kann die alte robots.txt fälschlicherweise neue Seiten blockieren oder vergessene zu blockierende Seiten übersehen.

Wenn die Search Console die Fehlermeldung "Von robots.txt blockiert" anzeigt

Die Google Search Console verfügt über einen Bericht namens Indexierung, der angibt, welche Seiten von der robots.txt blockiert werden. Wenn Sie feststellen, dass wichtige Seiten blockiert werden – dann ist es an der Zeit, die Datei sofort zu bearbeiten.

5 häufige robots.txt-Fehler und wie man sie behebt

Fehler 1: Die gesamte Website blockieren – der schwerwiegendste Fehler

Anzeichen: Keine einzige Seite wird von Google indexiert. Die Search Console meldet eine große Anzahl von Seiten, die "von robots.txt blockiert" sind.

Ursache: Die robots.txt-Datei enthält:

User-agent: 
Disallow: /

Diese beiden Zeilen bedeuten: "Verbieten Sie allen Bots den Zugriff auf jede Seite." Dies geschieht häufig, wenn Entwickler diese Regel während der Staging-Phase festlegen und vergessen, sie beim Live-Schalten zu entfernen.

Korrektur: Ändern Sie sie in:

User-agent: *
Disallow:

Sitemap: https://ten-mien.com/sitemap.xml

Disallow: (nichts nach dem Doppelpunkt) = Erlaubt das Crawlen von allem.

⚠️ Dies ist der häufigste Fehler, den wir bei neuen Unternehmenswebsites sehen. Nachdem Sie dies behoben haben, kann es einige Tage bis Wochen dauern, bis Google die Seite erneut crawlt. Reichen Sie Ihre Sitemap erneut über die Search Console ein, um den Prozess zu beschleunigen.

Fehler 2: CSS und JavaScript blockieren

Anzeichen: Die Website wird im Browser normal angezeigt, aber bei Verwendung des "URL-Inspektion"-Tools in der Search Console sieht Google, dass die Seite defekt ist oder leerer Inhalt angezeigt wird.

Ursache: Die robots.txt blockiert Verzeichnisse, die CSS und JS enthalten:

Disallow: /wp-content/
Disallow: /wp-includes/

Google muss CSS und JS lesen können, um zu verstehen, wie eine Seite aussieht (dies wird als "Rendering" bezeichnet). Wenn es blockiert wird, kann Google die Seite nicht rendern → versteht den Inhalt nicht → beeinflusst das Ranking.

Korrektur:

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Allow: /wp-content/
Allow: /wp-includes/
📝 Hinweis für Entwickler: Seit 2014 empfiehlt Google ausdrücklich: Blockieren Sie CSS, JS und Bilder nicht in der robots.txt. Googlebot benötigt diese Ressourcen, um die Seite korrekt zu rendern. Verwenden Sie das URL-Inspektionstool in der Search Console, um zu überprüfen, wie Google Ihre Seite rendert.

Fehler 3: Wichtige Seiten versehentlich blockieren

Anzeichen: Dienstleistungsseiten, Produktseiten oder Blogbeiträge erscheinen nicht in Google – obwohl sie in der Sitemap aufgeführt sind.

Ursache: Eine Regel in der robots.txt ist zu allgemein. Zum Beispiel:

Disallow: /dich-vu

Diese Zeile blockiert nicht nur /dich-vu/, sondern auch /dich-vu-thiet-ke-web/, /dich-vu-seo/ und jede URL, die mit /dich-vu beginnt.

Korrektur: Fügen Sie einen Schrägstrich / am Ende des Pfads hinzu, um das Verzeichnis genau zu blockieren:

Disallow: /dich-vu-noi-bo/

Oder verwenden Sie Allow, um die benötigte Seite zu schützen:

Disallow: /dich-vu-noi-bo/
Allow: /dich-vu/
Allow: /dich-vu-thiet-ke-web/
📝 Hinweis für Entwickler: Die Reihenfolge von `Allow` und `Disallow` ist wichtig. Googlebot verwendet die spezifischste Regel (most specific path). Bei gleicher Länge wird `Allow` gegenüber `Disallow` bevorzugt. Testen Sie immer mit dem Robots Testing Tool in der Search Console, bevor Sie es bereitstellen.

Fehler 4: Keine robots.txt-Datei vorhanden

Erscheinung: Geben Sie ten-mien.com/robots.txt ein → gibt Fehler 404 zurück.

Ursache: Die Website wurde manuell erstellt und der Entwickler hat diese Datei nicht erstellt. Oder die Datei wurde beim Bereitstellen versehentlich gelöscht.

Auswirkung: Nicht so schwerwiegend wie Fehler 1 - Wenn keine robots.txt vorhanden ist, crawlt Google standardmäßig alles. Das bedeutet aber:

  • Google wird die Admin-Seite, Test-Seiten und interne Seiten crawlen
  • Sie haben keine Möglichkeit, über robots.txt auf die Sitemap zu verweisen
  • Grundlegende Kontrolle fehlt

Behebung: Erstellen Sie eine Datei robots.txt im Stammverzeichnis. Minimaler Inhalt:

User-agent: *
Disallow: /admin/
Disallow: /search?

Sitemap: https://ten-mien.com/sitemap.xml

Fehler 5: robots.txt verwenden, um Seiten vor Google zu verbergen (Zweck missverstanden)

Erscheinung: Sie blockieren eine Seite mit Disallow, aber die Seite erscheint weiterhin in Google - wenn auch ohne Inhalts-Snippet.

Ursache: Robots.txt blockiert das Crawling, nicht das Indexieren. Wenn die Seite bereits indiziert wurde oder Backlinks von anderen Websites auf sie verweisen, kann Google die URL in den Suchergebnissen behalten - nur ohne Inhaltsanzeige.

Richtige Behebung:

ZielWas zu verwenden ist
Google soll nicht crawlen (scannen)Disallow in robots.txt
Google soll nicht indexieren (anzeigen)Tag im HTML
Beides nichtnoindex im HTML verwenden (und nicht in robots.txt blockieren)
⚠️ Dies ist der am häufigsten missverstandene Punkt: Wenn Sie sowohl das Crawling blockieren (robots.txt) als auch `noindex` setzen (HTML), wird Google das noindex-Tag nicht sehen, da die Seite nicht gecrawlt wird — und die Seite kann trotzdem indexiert werden. Lösung: `noindex` im HTML verwenden und die `Disallow`-Regel für diese Seite in robots.txt entfernen.

Beispiel robots.txt für Unternehmenswebsites

Hier ist eine Beispiel-robots.txt-Datei, die für die meisten KMU-Unternehmenswebsites geeignet ist:

# =============================================
# Robots.txt für Unternehmenswebsite
# Aktualisiert: 2026-04-20
# =============================================

# Gilt für alle Bots
User-agent: *

# Blockiere den Admin- und internen Bereich
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /dashboard/
Disallow: /staging/

# Blockiere interne Suchseiten (um Crawling-Budgetverschwendung zu vermeiden)
Disallow: /search?
Disallow: /*?s=

# Blockiere URLs mit Tracking-Parametern (um doppelte Inhalte zu vermeiden)
Disallow: /*?utm_
Disallow: /*?ref=
Disallow: /*?fbclid=

# Blockiere Warenkorb- / Checkout-Seiten (falls vorhanden)
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/

# Erlaube CSS, JS, Bilder (Google benötigt sie zum Rendern der Seite)
Allow: /wp-content/uploads/
Allow: /wp-content/themes/
Allow: /wp-includes/

# Verweis auf die Sitemap
Sitemap: https://ten-mien.com/sitemap.xml
📝 Hinweis für Entwickler: Die robots.txt-Datei muss im Stammverzeichnis der Domain liegen — `https://example.com/robots.txt`. Nicht unter `/blog/robots.txt` oder einem anderen Unterverzeichnis. Jedes Subdomain benötigt eine eigene robots.txt (z.B. `blog.example.com/robots.txt` ist getrennt von `example.com/robots.txt`).

So überprüfen Sie die robots.txt Ihrer Website

Methode 1: Direkte Überprüfung im Browser

Geben Sie https://ten-mien-cua-ban.com/robots.txt in die Adressleiste ein. Sie sehen den Inhalt der Datei im Textformat. Wenn Sie einen 404-Fehler erhalten — die Website hat noch keine robots.txt.

Methode 2: Verwenden von Google Search Console

  1. Melden Sie sich bei Google Search Console an
  2. Navigieren Sie zu EinstellungenCrawlingrobots.txt
  3. Sehen Sie sich die robots.txt-Datei an, die Google liest
  4. Prüfen Sie, ob eine bestimmte URL blockiert ist

Methode 3: Überprüfung im Indexierungsbericht

In Search Console → Seiten (oder Indexierung) → Suchen Sie nach "Blockiert durch robots.txt". Wenn sich wichtige Seiten in dieser Liste befinden, müssen Sie die robots.txt umgehend korrigieren.

💡 Es wird empfohlen, die robots.txt mindestens einmal pro Quartal oder jedes Mal, wenn es größere Änderungen an der Website gibt (neue Seiten, Strukturänderungen, Plattformmigrationen), zu überprüfen.

Zusammenfassende Tabelle: Was sollte und was sollte nicht in robots.txt blockiert werden

✅ SOLLTE blockiert werden❌ SOLLTE NICHT blockiert werden
Admin-Seiten (/admin/, /wp-admin/)Startseite, Dienstleistungsseiten, Kontaktseite
Staging-/TestseitenBlogbeiträge, Artikel
Interne Suchseiten (/search?)CSS- und JavaScript-Dateien
URLs mit Tracking-Parametern (?utm_, ?fbclid=)Bilder (Google Bilder bringt auch Traffic)
Warenkorb, Checkout, persönliche KontoseitenSitemap
Seiten mit doppeltem Inhalt (Filter, Sortierung, Paginierung)FAQ-Seiten, Fallstudien

Häufig gestellte Fragen zu robots.txt

Was ist der Unterschied zwischen robots.txt und sitemap?

Eine Sitemap sagt: "Dies sind die Seiten, die ich Google bekannt machen möchte." Robots.txt sagt: "Dies sind die Seiten, die ich nicht von Google crawlen lassen möchte." Die beiden Dateien ergänzen sich – die Sitemap weist den Weg, robots.txt stellt Barrieren auf.

Wenn keine robots.txt vorhanden ist, kann Google dann die Website crawlen?

Ja. Ohne robots.txt crawlt Google standardmäßig alle Seiten – auch solche, die Sie nicht möchten. Deshalb ist es wichtig, eine solche Datei zu haben.

Ich benutze WordPress, wo befindet sich die robots.txt?

WordPress erstellt eine virtuelle robots.txt. Wenn Sie SEO-Plugins wie Yoast oder Rank Math verwenden, können Sie die robots.txt direkt im Plugin bearbeiten, ohne auf den Server zugreifen zu müssen.

Beeinflusst robots.txt die Website-Geschwindigkeit?

Nein. Diese Datei ist nur wenige KB groß. Sie hat keinen Einfluss auf die Ladezeit der Seite.

Ich habe eine Seite mit robots.txt blockiert, warum erscheint sie trotzdem in Google?

Da robots.txt nur das Crawling blockiert, nicht aber die Indexierung. Wenn Sie möchten, dass eine Seite vollständig aus Google verschwindet, verwenden Sie das Tag im HTML – und blockieren Sie diese Seite nicht in robots.txt (damit Google das noindex-Tag lesen kann).

Nachdem ich robots.txt geändert habe, wie lange dauert es, bis Google die Änderungen übernimmt?

Google überprüft robots.txt in der Regel innerhalb von 24-48 Stunden erneut. Sie können in der Search Console → Einstellungen → Crawling die erneute Überprüfung durch Google früher anfordern.

Fazit

Robots.txt ist eine kleine Datei – oft nur wenige Zeilen – die aber direkten Einfluss darauf hat, ob Google Ihre Website findet oder nicht.

Zu merkende Punkte:

  1. Robots.txt ist ein Schild "Betreten verboten": es teilt Google mit, welche Seiten nicht gecrawlt werden sollen
  2. Sofort überprüfen, wenn die Website live geht: Fehler, die die gesamte Website blockieren, sind die häufigsten und schwerwiegendsten
  3. Robots.txt nicht zum Ausblenden von Seiten aus Google verwenden: es blockiert das Crawling, nicht die Indexierung
  4. Immer CSS und JS erlauben: Google benötigt sie, um die Seite zu rendern und den Inhalt zu verstehen
  5. Mit Sitemap und Search Console kombinieren: um das Crawling und die Indexierung Ihrer Website durch Google vollständig zu steuern

Überprüfen Sie Ihre Website-Plattform

Die robots.txt ist nur einer von vielen technischen Faktoren, die sich auf SEO auswirken. Wenn Sie sich fragen: "Ist meine Website richtig konfiguriert?" – dann liegt die Antwort in der von Ihnen verwendeten Plattform.

GTG CRM bietet Ihnen eine Website mit einer standardmäßigen robots.txt, automatischen Sitemaps und einer für Google optimierten technischen Struktur – Sie müssen sich nicht um einzelne Dateien oder Codezeilen kümmern.

Machen Sie das Gelesene zu konkreten Ergebnissen – jetzt mit GTG CRM, kostenlos.

Jetzt anwenden