...
Kontakt Kontakt

robots.txt schreiben: Anleitung mit Beispielen für WordPress, Shopify und Next.js

How to Write a robots.txt File (With Examples for WordPress, Shopify & Next.js) How to Write a robots.txt File (With Examples for WordPress, Shopify & Next.js)

Die robots.txt ist eine Textdatei mit vielleicht zehn Zeilen, und trotzdem hat sie schon ganze Websites aus Google entfernt – durch ein einziges falsches „Disallow: /“. Dieser Leitfaden erklärt, was die Datei wirklich tut, gibt Vorlagen für die gängigen Plattformen und zeigt, wie man KI-Crawler steuert.

Was robots.txt kann – und was nicht

Sie sagt Crawlern, welche Pfade sie nicht abrufen sollen. Sie verhindert nicht die Indexierung: Eine per robots.txt gesperrte Seite kann trotzdem in Google erscheinen, wenn andere darauf verlinken – nur ohne Beschreibung. Wer eine Seite aus dem Index halten will, braucht ein noindex-Meta-Tag, und die Seite darf nicht gesperrt sein, sonst sieht Google das Tag nie.

Die Syntax in fünf Zeilen

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://example.com/sitemap_index.xml
  • User-agent – für welchen Bot die folgenden Regeln gelten; * für alle.
  • Disallow – Pfadpräfix, das nicht gecrawlt werden soll. Leer = alles erlaubt.
  • Allow – Ausnahme innerhalb eines gesperrten Pfads.
  • Sitemap – absolute URL, darf mehrfach vorkommen.
  • Wildcards: * beliebige Zeichen, $ Ende der URL: Disallow: /*.pdf$

Vorlagen

WordPress

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /?s=
Disallow: /*?replytocom=
Sitemap: https://example.com/sitemap_index.xml

Shopify

Shopify erzeugt die Datei selbst; Anpassungen über robots.txt.liquid. Typisch: Warenkorb, Checkout, Suche und Filter-Parameter sperren – das ist bereits Standard.

Advertisement

Next.js / statische Sites

User-agent: *
Disallow: /api/
Disallow: /_next/static/chunks/
Sitemap: https://example.com/sitemap.xml

Der robots.txt-Generator baut diese Vorlagen mit Ihren Pfaden und prüft die Syntax.

KI-Crawler steuern

GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl), Google-Extended (Gemini-Training) respektieren robots.txt. Blockieren heißt: kein Training mit Ihren Inhalten, aber auch keine Nennung in KI-Antworten. Für die meisten Content-Sites ist Erlauben die bessere Wahl – Sichtbarkeit in KI-Suchen wird wichtiger als der Schutz vor Training.

User-agent: GPTBot
Disallow: /

Die drei Fehler, die eine Site aus Google werfen

  1. Disallow: / aus der Staging-Umgebung mit live genommen.
  2. CSS und JS gesperrt – Google kann die Seite nicht rendern und wertet sie als leer.
  3. Datei liegt falsch – nur example.com/robots.txt zählt, nicht ein Unterordner.

Nach jeder Änderung: Search Console → Einstellungen → robots.txt-Bericht prüfen und mit dem HTTP-Header-Checker sicherstellen, dass die Datei mit Status 200 ausgeliefert wird.

Häufige Fragen

Brauche ich überhaupt eine robots.txt?

Ohne Datei ist alles erlaubt – das ist für kleine Sites in Ordnung. Sinnvoll ist sie für die Sitemap-Zeile und zum Sperren von Suche, Filtern und Admin-Pfaden.

Wie schnell wirkt eine Änderung?

Google liest die Datei etwa täglich; Änderungen greifen innerhalb von 24 Stunden.

Jetzt ausprobieren: robots.txt-Generator

Kostenlos, läuft im Browser, nichts wird hochgeladen, keine Anmeldung.

Tool öffnen →
Add a comment Add a comment

Leave a Reply

Your email address will not be published. Required fields are marked *

Submit Comment

Advertisement
Seraphinite AcceleratorOptimized by Seraphinite Accelerator
Turns on site high speed to be attractive for people and search engines.