Die robots.txt ist eine Textdatei mit vielleicht zehn Zeilen, und trotzdem hat sie schon ganze Websites aus Google entfernt – durch ein einziges falsches „Disallow: /“. Dieser Leitfaden erklärt, was die Datei wirklich tut, gibt Vorlagen für die gängigen Plattformen und zeigt, wie man KI-Crawler steuert.
Was robots.txt kann – und was nicht
Sie sagt Crawlern, welche Pfade sie nicht abrufen sollen. Sie verhindert nicht die Indexierung: Eine per robots.txt gesperrte Seite kann trotzdem in Google erscheinen, wenn andere darauf verlinken – nur ohne Beschreibung. Wer eine Seite aus dem Index halten will, braucht ein noindex-Meta-Tag, und die Seite darf nicht gesperrt sein, sonst sieht Google das Tag nie.
Die Syntax in fünf Zeilen
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://example.com/sitemap_index.xml User-agent– für welchen Bot die folgenden Regeln gelten;*für alle.Disallow– Pfadpräfix, das nicht gecrawlt werden soll. Leer = alles erlaubt.Allow– Ausnahme innerhalb eines gesperrten Pfads.Sitemap– absolute URL, darf mehrfach vorkommen.- Wildcards:
*beliebige Zeichen,$Ende der URL:Disallow: /*.pdf$
Vorlagen
WordPress
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /?s=
Disallow: /*?replytocom=
Sitemap: https://example.com/sitemap_index.xml Shopify
Shopify erzeugt die Datei selbst; Anpassungen über robots.txt.liquid. Typisch: Warenkorb, Checkout, Suche und Filter-Parameter sperren – das ist bereits Standard.
Next.js / statische Sites
User-agent: *
Disallow: /api/
Disallow: /_next/static/chunks/
Sitemap: https://example.com/sitemap.xml Der robots.txt-Generator baut diese Vorlagen mit Ihren Pfaden und prüft die Syntax.
KI-Crawler steuern
GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl), Google-Extended (Gemini-Training) respektieren robots.txt. Blockieren heißt: kein Training mit Ihren Inhalten, aber auch keine Nennung in KI-Antworten. Für die meisten Content-Sites ist Erlauben die bessere Wahl – Sichtbarkeit in KI-Suchen wird wichtiger als der Schutz vor Training.
User-agent: GPTBot
Disallow: / Die drei Fehler, die eine Site aus Google werfen
- Disallow: / aus der Staging-Umgebung mit live genommen.
- CSS und JS gesperrt – Google kann die Seite nicht rendern und wertet sie als leer.
- Datei liegt falsch – nur
example.com/robots.txtzählt, nicht ein Unterordner.
Nach jeder Änderung: Search Console → Einstellungen → robots.txt-Bericht prüfen und mit dem HTTP-Header-Checker sicherstellen, dass die Datei mit Status 200 ausgeliefert wird.
Häufige Fragen
Brauche ich überhaupt eine robots.txt?
Ohne Datei ist alles erlaubt – das ist für kleine Sites in Ordnung. Sinnvoll ist sie für die Sitemap-Zeile und zum Sperren von Suche, Filtern und Admin-Pfaden.
Wie schnell wirkt eine Änderung?
Google liest die Datei etwa täglich; Änderungen greifen innerhalb von 24 Stunden.
Kostenlos, läuft im Browser, nichts wird hochgeladen, keine Anmeldung.
Weiterlesen
Mehr aus SEO- & Website-Tools.


