Sie haben eine Sitemap, sie an Google gesendet, Ihre Website wird bereits indiziert. Doch eines Tages stellen Sie fest, dass Ihre Verwaltungsseite (admin), interne Zahlungsseiten oder Staging-Seiten Ihrer Website auch auf Google erscheinen. Kunden geben den Firmennamen ein - und sehen sogar unfertige Testseiten.
Oder umgekehrt: Sie veröffentlichen einen neuen Blogbeitrag, warten zwei Wochen und er erscheint immer noch nicht auf Google. Sie fragen die technische Abteilung, und sie sagen: "Die Datei robots.txt blockiert Google beim Crawlen der gesamten Website."
Beide Situationen hängen mit einer kleinen Datei zusammen, die Webmaster selten beachten: robots.txt.
Dieser Artikel erklärt, was robots.txt ist, wie sie funktioniert, wann Sie sie bearbeiten müssen und welche häufigen Fehler Unternehmen vermeiden sollten - alles in einfacher Sprache und mit praktischen Beispielen.
Was ist robots.txt? Erklärung für Webmaster
Wenn die Sitemap die Baupläne eines Gebäudes ist - die Google zeigt, welche Räume es gibt -, dann ist robots.txt das Schild "Restricted Area" - die Google sagt, welche Räume nicht betreten werden dürfen.
Technisch ausgedrückt: robots.txt ist eine kleine Textdatei, die sich im Stammverzeichnis der Website befindet (z. B. https://example.com/robots.txt). Diese Datei enthält Regeln, die Suchmaschinen-Bots - wie Googlebot - mitteilen:
- Welche Seiten gecrawlt (durchsucht) werden dürfen
- Welche Seiten nicht gecrawlt werden dürfen
- Wo sich die Sitemap befindet
Sie können die robots.txt einer beliebigen Website einsehen, indem Sie im Browser Folgendes eingeben: domainname.com/robots.txt.
💡 Wichtig: robots.txt ist nur eine höfliche Bitte, kein absolutes Verbot. Seriöse Bots wie Googlebot werden sie befolgen, aber schlechte Bots (Spam, Scraper) können sie ignorieren. Wenn Sie tatsächliche Sicherheit benötigen, verwenden Sie Passwörter oder eine Firewall - verlassen Sie sich nicht auf robots.txt.
Wie sieht eine robots.txt-Datei aus?
Sie müssen diese Datei nicht von Grund auf neu schreiben. Aber um sie zu verstehen, wenn Sie sie sehen, hier ist eine einfache robots.txt-Datei:
User-agent: *
Disallow: /admin/
Disallow: /thanh-toan/
Disallow: /staging/
Allow: /
Sitemap: https://example.com/sitemap.xml
Erklärung jeder Zeile:
| Zeile | Bedeutung |
|---|---|
User-agent: * | Gilt für alle Bots (Google, Bing usw.) |
Disallow: /admin/ | Bots dürfen das Verzeichnis /admin/ nicht betreten |
Disallow: /thanh-toan/ | Bots dürfen die Zahlungsseite nicht betreten |
Disallow: /staging/ | Bots dürfen die Staging-Version nicht betreten |
Allow: / | Bots dürfen den Rest der Website crawlen |
Sitemap: https://... | Teilt dem Bot mit, wo sich die Sitemap befindet |
Hier ist ein komplexeres Beispiel - geeignet für eine Unternehmenswebsite mit einem Blog, Dienstleistungsseiten und einem Verwaltungsbereich:
# Erlaubt allen Bots, öffentliche Inhalte zu crawlen
User-agent: *
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
Disallow: /search?
Disallow: /*?ref=
Disallow: /*?utm_
# Erlaubt Googlebot, CSS und JS zu crawlen (notwendig zum Rendern der Seite)
User-agent: Googlebot
Allow: /wp-content/uploads/
Allow: /wp-includes/
Sitemap: https://example.com/sitemap.xml
📝 Hinweis für Entwickler: Das Zeichen * im Pfad ist ein Platzhalter — `/?utm_` bedeutet, dass alle URLs mit dem Parameter `?utm_` blockiert werden. Das Zeichen `$` am Ende des Pfades wird verwendet, um genau mit dem Ende der URL übereinzustimmen. Beispiel: `Disallow: /*.pdf$` blockiert alle PDF-Dateien.
Wie funktioniert die robots.txt-Datei im SEO-Prozess?
Um die Position von robots.txt zu verstehen, werfen wir einen Blick auf den Prozess, wie Google eine Website in die Suchergebnisse aufnimmt:
Crawl → Index → Rank
(Durchsuchen) (Speichern) (Ranken)
Robots.txt funktioniert in der ersten Phase - Crawl.
Bevor Googlebot beginnt, eine Seite auf Ihrer Website zu durchsuchen, prüft er zuerst die robots.txt. Wenn eine URL in Disallow aufgeführt ist, ignoriert Googlebot diese Seite - er durchsucht sie nicht, er liest den Inhalt nicht.
Googlebot möchte https://example.com/admin/settings crawlen
→ Prüft robots.txt
→ Findet Disallow: /admin/
→ Ignoriert, crawlt nicht
Googlebot möchte https://example.com/dich-vu/ crawlen
→ Prüft robots.txt
→ Nicht blockiert
→ Crawlt normal → Index → Kann in den Suchergebnissen erscheinen
Robots.txt und Sitemap: Ein unterstützendes Duo
| Datei | Rolle |
|---|---|
| Sitemap | "Dies ist die Liste der Seiten, von denen ich möchte, dass Google sie kennt" |
| Robots.txt | "Dies sind die Seiten, die ich nicht von Google durchsuchen lassen möchte" |
Diese beiden Dateien widersprechen sich nicht - sie arbeiten zusammen. Die Sitemap weist den Weg, robots.txt errichtet Barrieren. Wenn sie richtig kombiniert werden, kontrollieren Sie, was Google auf Ihrer Website sieht und was es ignoriert.
Wofür wird robots.txt verwendet? 4 gängige Szenarien
1. Verbergen von Verwaltungs- und internen Seiten vor Google
Admin-Seiten, Backend-CMS-Seiten, Staging-Seiten, Test-Seiten - all diese sollten nicht auf Google erscheinen. Robots.txt hilft Ihnen, Google zu sagen: "Gehen Sie hier nicht hin."
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /staging/
2. Vermeidung von "Crawl-Budget"-Verschwendung
Google crawlt nicht unbegrenzt. Jede Website hat ein "Crawl-Budget" - die Anzahl der Seiten, die Googlebot bei jedem Besuch durchsuchen wird. Wenn Ihre Website viele unwichtige Seiten hat (interne Suchseiten, Filterseiten, Paginierungsseiten), kann Googlebot damit beschäftigt sein, diese Seiten zu durchsuchen, anstatt wichtige Dienstleistungs- oder Blogseiten.
Disallow: /search?
Disallow: /tag/
Disallow: /page/
💡 Crawl-Budget ist hauptsächlich für große Websites (Tausende von Seiten) wichtig. Kleinere Unternehmenswebsites müssen sich normalerweise keine allzu großen Sorgen machen, aber eine übersichtliche robots.txt zu pflegen, ist trotzdem eine gute Gewohnheit.
3. Blockieren von doppelten Inhalten
Wenn mehrere URLs zu denselben Inhalten führen (z. B. URLs mit Tracking-Parametern ?utm_source=facebook oder einer Druckversion ?print=true), können Sie diese doppelten URLs blockieren:
Disallow: /*?utm_
Disallow: /*?ref=
Disallow: /*?print=
4. Angabe des Pfads zur Sitemap
Robots.txt ist die erste Stelle, die Googlebot prüft, wenn er auf eine Website kommt. Das Platzieren des Sitemap-Pfads hier hilft Google, die Sitemap schneller zu finden - auch wenn Sie sie noch nicht über die Search Console gesendet haben.
Sitemap: https://example.com/sitemap.xml
Wann sollten Unternehmen auf robots.txt achten?
Sie müssen nicht immer Ihre robots.txt bearbeiten. Aber es gibt Zeiten, in denen die Überprüfung dieser Datei zwingend erforderlich ist:
Wenn die Website neu gestartet wird (Go-Live)
Dies ist der wichtigste Zeitpunkt. Viele Websites werden vollständig vom Crawling blockiert, weil die Entwickler vergessen, die Zeile Disallow: / zu entfernen - eine Zeile, die sie während des Staging gesetzt haben, damit Google die unfertige Version nicht indiziert.
Prüfung beim Go-Live:
| Kategorie | Prüfmethode |
|---|---|
| robots.txt-Datei existiert | Öffnen Sie https://ihre-domain.com/robots.txt im Browser |
| Gesamte Website nicht blockiert | Stellen Sie sicher, dass KEINE Zeile Disallow: / vorhanden ist |
| Sitemap deklariert | Stellen Sie sicher, dass die Zeile Sitemap: https://ihre-domain.com/sitemap.xml vorhanden ist |
| Wichtige Seiten nicht blockiert | Prüfen Sie, ob die Seiten für Dienstleistungen, Blogs, Kontakt nicht unter Disallow fallen |
✅ Wenn die Website nach mehreren Wochen nicht von Google indiziert wird
Wenn Sie eine Sitemap haben, diese über die Search Console gesendet haben, aber Google sie immer noch nicht indiziert - ist robots.txt der erste verdächtige Kandidat, den Sie überprüfen müssen.
Wenn ein Bereich zum Verbergen hinzugefügt wird (Mitgliederbereich, interner Bereich)
Wenn die Website um eine Kontoverwaltungsseite, einen Mitgliederbereich oder eine interne Seite erweitert wird - aktualisieren Sie robots.txt, um diese Bereiche zu blockieren.
Bei Änderung der Website-Plattform oder Neugestaltung
Jede Plattform (WordPress, Webflow, benutzerdefinierter Code) erstellt eine andere URL-Struktur. Bei Migrationen kann die alte robots.txt fälschlicherweise neue Seiten blockieren oder benötigte zu blockierende Seiten übersehen.
Wenn die Search Console die Fehlermeldung "Blocked by robots.txt" meldet
Google Search Console verfügt über einen Bericht Indexing, der angibt, welche Seiten von robots.txt blockiert werden. Wenn Sie feststellen, dass wichtige Seiten blockiert werden - ist es an der Zeit, die Datei sofort zu bearbeiten.
5 häufige robots.txt-Fehler und deren Behebung
Fehler 1: Blockieren der gesamten Website - der schwerwiegendste Fehler
Symptome: Keine Seite wird von Google indiziert. Die Search Console meldet viele Seiten "Blocked by robots.txt".
Ursache: Die robots.txt-Datei enthält:
User-agent:
Disallow: /
Diese beiden Zeilen bedeuten: "Verbieten Sie allen Bots, jede Seite zu betreten." Dies geschieht oft, wenn Entwickler diese Regel während des Staging setzen und vergessen, sie beim Go-Live zu entfernen.
Behebung: Ändern Sie in:
User-agent: *
Disallow:
Sitemap: https://ihre-domain.com/sitemap.xml
Disallow: (ohne etwas dahinter) = erlauben Sie das Crawlen aller Seiten.
⚠️ Dies ist der häufigste Fehler, den wir bei neuen Unternehmenswebsites sehen. Nach der Korrektur kann es einige Tage bis Wochen dauern, bis Google erneut crawlt. Senden Sie Ihre Sitemap erneut über die Search Console, um den Prozess zu beschleunigen.
Fehler 2: Blockieren von CSS und JavaScript
Symptome: Die Website wird im Browser normal angezeigt, aber wenn Sie das Tool "URL-Inspektion" in der Search Console verwenden, sieht Google, dass das Layout beschädigt ist oder der Inhalt leer ist.
Ursache: Robots.txt blockiert Verzeichnisse, die CSS und JS enthalten:
Disallow: /wp-content/
Disallow: /wp-includes/
Google muss CSS und JS lesen, um zu verstehen, wie die Seite aussieht (dies wird als "Rendering" bezeichnet). Wenn diese blockiert sind, kann Google die Seite nicht rendern -> versteht den Inhalt nicht -> beeinflusst das Ranking.
Behebung:
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Allow: /wp-content/
Allow: /wp-includes/
📝 Hinweis für Entwickler: Seit 2014 empfiehlt Google ausdrücklich: Blockieren Sie CSS, JS und Bilder nicht in robots.txt. Googlebot benötigt diese Ressourcen, um die Seite richtig zu rendern. Verwenden Sie das URL-Inspektionstool in der Search Console, um zu sehen, wie Google Ihre Seite rendert.
Fehler 3: Fälschliches Blockieren wichtiger Seiten
Symptome: Dienstleistungsseiten, Produktseiten oder Blogbeiträge erscheinen nicht auf Google - obwohl die Sitemap sie auflistet.
Ursache: Eine Regel in robots.txt ist zu allgemein. Beispiel:
Disallow: /dich-vu
Diese Zeile blockiert nicht nur /dich-vu/, sondern auch /dich-vu-thiet-ke-web/, /dich-vu-seo/ und jede URL, die mit /dich-vu beginnt.
Behebung: Fügen Sie einen / am Ende des Pfads hinzu, um das Verzeichnis genau zu blockieren:
Disallow: /dich-vu-noi-bo/
Oder verwenden Sie Allow, um benötigte Seiten zu schützen:
Disallow: /dich-vu-noi-bo/
Allow: /dich-vu/
Allow: /dich-vu-thiet-ke-web/
📝 Hinweis für Entwickler: Die Reihenfolge vonAllowundDisallowist wichtig. Googlebot verwendet die spezifischste Regel (most specific path). Bei gleicher Länge hatAllowVorrang vorDisallow. Testen Sie immer mit dem [Robots Testing Tool](https://support.google.com/webmasters/answer/6062598) in der Search Console, bevor Sie sie bereitstellen.
Fehler 4: Keine robots.txt-Datei
Symptome: Eingabe von domain.com/robots.txt → gibt einen 404-Fehler zurück.
Ursache: Die Website wurde manuell erstellt und der Entwickler hat diese Datei nicht erstellt. Oder die Datei wurde beim Bereitstellen versehentlich gelöscht.
Auswirkung: Nicht so schwerwiegend wie Fehler 1 - wenn keine robots.txt vorhanden ist, crawlt Google standardmäßig alles. Aber das bedeutet:
- Google crawlt Admin-Seiten, Test-Seiten, interne Seiten
- Sie haben keine Möglichkeit, die Sitemap über robots.txt anzugeben
- Es fehlt grundlegende Kontrolle
Behebung: Erstellen Sie eine robots.txt-Datei im Stammverzeichnis. Minimaler Inhalt:
User-agent: *
Disallow: /admin/
Disallow: /search?
Sitemap: https://ihre-domain.com/sitemap.xml
Fehler 5: robots.txt zur Verbergung von Seiten vor Google verwenden (falsches Verständnis)
Symptome: Sie blockieren eine Seite mit Disallow, aber die Seite erscheint trotzdem auf Google - wenn auch ohne Snippet-Inhalt.
Ursache: Robots.txt blockiert das Crawling, nicht das Indexing. Wenn die Seite bereits indiziert wurde oder einen Backlink von einer anderen Website hat, kann Google die URL in den Suchergebnissen behalten - nur der Inhalt wird nicht angezeigt.
Richtige Behebung:
| Ziel | Was verwenden |
|---|---|
| Google soll nicht crawlen (durchsuchen) | Disallow in robots.txt |
| Google soll nicht indizieren (anzeigen) | -Tag im HTML |
| Beides nicht | Verwenden Sie noindex im HTML (und blockieren Sie nicht in robots.txt) |
⚠️ Dies ist der häufigste Punkt des Missverständnisses: Wenn Sie sowohl das Crawling blockieren (robots.txt) als auchnoindex(HTML) setzen, wird Google das noindex-Tag nicht sehen, da es die Seite nicht crawlen kann - und die Seite kann trotzdem indiziert werden. Lösung: Verwenden Sienoindexim HTML und entfernen Sie dieDisallow-Regel für diese Seite in robots.txt.
Beispiel robots.txt für Unternehmenswebsites
Hier ist eine Beispiel-robots.txt-Datei, die für die meisten KMU-Unternehmenswebsites geeignet ist:
# =============================================
# robots.txt für Unternehmenswebsite
# Aktualisiert: 2026-04-20
# =============================================
# Gilt für alle Bots
User-agent: *
# Blockieren von Verwaltungs- und internen Bereichen
Disallow: /admin/
Disallow: /wp-admin/
Disallow: /dashboard/
Disallow: /staging/
# Blockieren interner Suchseiten (um Crawl-Budget-Verschwendung zu vermeiden)
Disallow: /search?
Disallow: /*?s=
# Blockieren von URLs mit Tracking-Parametern (um doppelte Inhalte zu vermeiden)
Disallow: /*?utm_
Disallow: /*?ref=
Disallow: /*?fbclid=
# Blockieren von Warenkorb- / Checkout-Seiten (falls vorhanden)
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
# Zulassen von CSS, JS, Bildern (Google benötigt sie zum Rendern der Seite)
Allow: /wp-content/uploads/
Allow: /wp-content/themes/
Allow: /wp-includes/
# Angabe des Pfads zur Sitemap
Sitemap: https://ihre-domain.com/sitemap.xml
📝 Hinweis für Entwickler: Die robots.txt-Datei muss im Stammverzeichnis der Domain liegen - `https://example.com/robots.txt`. Nicht unter `/blog/robots.txt` oder einem anderen Unterverzeichnis. Jede Subdomain benötigt eine eigene robots.txt (z. B. `blog.example.com/robots.txt` getrennt von `example.com/robots.txt`).
So überprüfen Sie die robots.txt Ihrer Website
Methode 1: Direkte Überprüfung im Browser
Geben Sie https://ihre-domain.com/robots.txt in die Adressleiste ein. Sie sehen den Inhalt der Datei im Textformat. Wenn Sie einen 404-Fehler sehen, hat Ihre Website keine robots.txt-Datei.
Methode 2: Verwendung der Google Search Console
- Melden Sie sich bei der Google Search Console an
- Gehen Sie zu Einstellungen → Crawling → robots.txt
- Sehen Sie die robots.txt-Datei, die Google liest
- Prüfen Sie, ob eine bestimmte URL blockiert ist
Methode 3: Überprüfung im Indexierungsbericht
In der Search Console → Seiten (oder Indexierung) → Suchen Sie den Abschnitt "Blocked by robots.txt". Wenn sich wichtige Seiten in dieser Liste befinden, müssen Sie Ihre robots.txt sofort bearbeiten.
💡 Es wird empfohlen, robots.txt mindestens einmal pro Quartal oder bei größeren Website-Änderungen (Hinzufügen von Seiten, Strukturänderungen, Migration der Plattform) zu überprüfen.
Zusammenfassung: Was sollte in robots.txt blockiert und was nicht blockiert werden?
| ✅ SOLLTE blockiert werden | ❌ SOLLTE NICHT blockiert werden |
|---|---|
Admin-Seiten (/admin/, /wp-admin/) | Startseite, Dienstleistungsseiten, Kontaktseiten |
| Staging / Test-Seiten | Blogbeiträge, Artikel |
Interne Suchseiten (/search?) | CSS- und JavaScript-Dateien |
URLs mit Tracking-Parametern (?utm_, ?fbclid=) | Bilder (Google Bilder bringt auch Traffic) |
| Warenkorb-, Checkout-, persönliche Konto-Seiten | Sitemap |
| Seiten mit doppelten Inhalten (Filter, Sortierung, Paginierung) | FAQ-Seiten, Fallstudien |
Häufig gestellte Fragen zu robots.txt
Was ist der Unterschied zwischen robots.txt und Sitemap?
Sitemap sagt: "Dies sind die Seiten, von denen ich möchte, dass Google sie kennt." Robots.txt sagt: "Dies sind die Seiten, die ich nicht von Google durchsuchen lassen möchte." Beide Dateien ergänzen sich - die Sitemap weist den Weg, robots.txt errichtet Barrieren.
Wenn keine robots.txt vorhanden ist, kann Google meine Website dann crawlen?
Ja. Wenn keine robots.txt vorhanden ist, crawlt Google standardmäßig jede Seite - einschließlich der Seiten, die Sie nicht möchten. Deshalb ist es gut, diese Datei zu haben.
Ich verwende WordPress, wo befindet sich robots.txt?
WordPress erstellt eine virtuelle robots.txt. Wenn Sie ein SEO-Plugin wie Yoast oder Rank Math verwenden, können Sie robots.txt direkt im Plugin bearbeiten, ohne auf den Server zugreifen zu müssen.
Beeinflusst robots.txt die Website-Geschwindigkeit?
Nein. Diese Datei ist nur wenige KB groß. Sie hat keinen Einfluss auf die Ladegeschwindigkeit der Seite.
Ich habe eine Seite mit robots.txt blockiert, aber sie erscheint trotzdem auf Google?
Da robots.txt nur das Crawling blockiert, nicht das Indexing. Wenn die Seite bereits indiziert wurde oder einen Backlink von einer anderen Website hat, kann Google die URL in den Suchergebnissen behalten - nur der Inhalt wird nicht angezeigt. Um eine Seite vollständig aus Google zu entfernen, verwenden Sie das -Tag im HTML - und blockieren Sie diese Seite nicht in robots.txt (damit Google das noindex-Tag lesen kann).
Wie lange dauert es, bis Google meine geänderte robots.txt aktualisiert?
Google überprüft robots.txt normalerweise innerhalb von 24-48 Stunden erneut. Sie können in der Search Console → Einstellungen → Crawling die erneute Überprüfung durch Google anfordern, um dies zu beschleunigen.
Fazit
Robots.txt ist eine kleine Datei - oft nur wenige Zeilen -, die jedoch direkten Einfluss darauf hat, ob Google Ihre Website sieht oder nicht.
Zu merkende Punkte:
- Robots.txt ist das Schild "Restricted Area": teilt Google mit, welche Seiten nicht durchsucht werden dürfen
- Überprüfen Sie dies sofort beim Go-Live der Website: der Fehler, die gesamte Website zu blockieren, ist der häufigste und schwerwiegendste
- Verwenden Sie robots.txt nicht zum Verbergen von Seiten vor Google: sie blockiert das Crawling, nicht das Indexing
- Erlauben Sie immer CSS und JS: Google benötigt sie zum Rendern der Seite, um den Inhalt zu verstehen
- Kombinieren Sie sie mit Sitemap und Search Console: um die vollständige Kontrolle über das Crawling und Indexing Ihrer Website durch Google zu haben
Überprüfen Sie die Plattform Ihrer Website
Robots.txt ist nur einer von vielen technischen Faktoren, die SEO beeinflussen. Wenn Sie sich fragen: "Ist meine Website richtig konfiguriert?" - die Antwort liegt in der Plattform, die Sie verwenden.
GTG CRM hilft Ihnen, eine Website mit standardmäßiger robots.txt, automatisierter Sitemap und einer für Google optimierten technischen Struktur zu erstellen - Sie müssen sich nicht um die Bearbeitung einzelner Dateien oder Codezeilen kümmern.
Verwandeln Sie das Gelesene in praktische Ergebnisse - wenden Sie es jetzt mit GTG CRM kostenlos an.
Jetzt anwenden