Robots.txt-Generator

Erstellen Sie in Sekunden eine gültige robots.txt-Datei: User-Agent, gesperrte und erlaubte Pfade sowie Sitemap-URL eintragen, dann kopieren oder herunterladen.

Eine robots.txt ist eine kurze Textdatei im Stammverzeichnis Ihrer Website, die Suchmaschinen-Crawlern sagt, welche Bereiche sie nicht crawlen sollen. Sie gehört zu den ersten Dateien, die der Googlebot abruft, und eine einzige falsche Zeile kann Ihre ganze Website verstecken. Dieser Generator baut die Datei aus wenigen einfachen Feldern, sodass die Syntax immer stimmt.

So erstellen Sie Ihre Datei

  1. User-Agent: Lassen Sie * stehen, damit die Regeln für alle Crawler gelten, oder tragen Sie einen bestimmten Bot ein, etwa Googlebot oder Bingbot.
  2. Disallow-Pfade: ein Pfad pro Zeile für Bereiche, die Crawler nicht besuchen sollen, zum Beispiel /admin/ oder /cart/.
  3. Allow-Pfade: Ausnahmen innerhalb eines gesperrten Ordners, zum Beispiel /admin/admin-ajax.php.
  4. Crawl-delay: optional, in Sekunden (siehe Hinweis unten).
  5. Sitemap-URL: die vollständige Adresse Ihrer XML-Sitemap.
  6. Klicken Sie auf Generate robots.txt und dann auf Copy oder Download.

Laden Sie die Datei in die oberste Ebene Ihrer Domain hoch, sodass sie unter https://ihredomain.de/robots.txt erreichbar ist. Crawler suchen sie nirgendwo sonst, und jede Subdomain braucht ihre eigene Datei.

Beispiel: ein typischer Onlineshop

User-agent: *
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /search
Allow: /search/help

Sitemap: https://example.com/sitemap.xml

Warenkorb, Kasse und Kundenkonto sehen für jeden Besucher anders aus und haben in Suchergebnissen keinen Wert, und interne Suchseiten können endlos viele URL-Kombinationen erzeugen, die Crawl-Zeit verschwenden. Alles andere, einschließlich Produkt- und Kategorieseiten, bleibt offen.

Fünf Fehler, die Sie vermeiden sollten

  1. Disallow: / sperrt alles. Auf Testumgebungen ist das üblich und wird manchmal versehentlich auf die Live-Seite übernommen. Verschwinden Ihre Seiten plötzlich aus Google, prüfen Sie das zuerst.
  2. robots.txt entfernt keine Seiten aus Google. Eine gesperrte Seite kann trotzdem indexiert werden, wenn andere Websites darauf verlinken, nur ohne Beschreibung. Um eine Seite aus den Ergebnissen herauszuhalten, lassen Sie sie crawlen und setzen ein noindex-Meta-Tag.
  3. Sperren Sie kein CSS und JavaScript. Google rendert Seiten wie ein Browser. Kann es Ihre Stylesheets und Skripte nicht laden, hält es die Seite womöglich für fehlerhaft oder nicht mobilfreundlich.
  4. Pfade unterscheiden Groß- und Kleinschreibung. /Admin/ und /admin/ sind zwei verschiedene Regeln.
  5. Sie ist keine Sicherheitsmaßnahme. Die Datei ist öffentlich, und schlecht programmierte Bots ignorieren sie. Schützen Sie private Bereiche mit einem Login, nicht mit robots.txt.

Ein Hinweis zu Crawl-delay

Bing und einige andere Crawler halten sich an Crawl-delay, aber der Googlebot ignoriert es. Google passt seine Crawl-Rate automatisch daran an, wie schnell Ihr Server antwortet. Setzen Sie eine Verzögerung nur, wenn ein bestimmter Bot Ihren Server überlastet.

Nach dem Hochladen prüfen

Öffnen Sie Ihre robots.txt im Browser, um zu bestätigen, dass sie live ist. Prüfen Sie dann im robots.txt-Bericht der Google Search Console (Einstellungen → robots.txt), welche Version Google abgerufen hat und ob Fehler gefunden wurden. Testen Sie eine wichtige Seite mit dem URL-Prüftool, um sicherzugehen, dass sie nicht gesperrt ist.

Sie nutzen WordPress? Der WordPress robots.txt Generator startet mit WordPress-spezifischen Regeln. Prüfen Sie mit dem XML Sitemap Generator, ob die angegebene Sitemap gültig ist, und lesen Sie für weitere Beispiele den (englischen) Artikel How to Create the Perfect Robots.txt File for SEO.

Frequently Asked Questions

Im Stammverzeichnis Ihrer Domain, sodass sie unter https://ihredomain.de/robots.txt erreichbar ist. Crawler prüfen nur genau diesen Ort, und jede Subdomain braucht eine eigene Datei.

Nicht zuverlässig. Sie verhindert das Crawlen, aber eine gesperrte Seite kann trotzdem indexiert werden, wenn andere Seiten darauf verlinken. Nutzen Sie ein noindex-Meta-Tag auf einer crawlbaren Seite, um sie aus den Suchergebnissen herauszuhalten.

Nein. Der Googlebot ignoriert Crawl-delay und legt seine Crawl-Rate anhand der Serverantwort selbst fest. Bing und einige andere Crawler beachten es.

Nein. Google braucht sie, um Ihre Seiten richtig darzustellen. Werden sie gesperrt, hält Google Ihre Seiten möglicherweise für fehlerhaft oder nicht mobilfreundlich.

Pflicht ist sie nicht. Ohne Datei crawlen Bots einfach alles, was sie finden. Sinnvoll ist sie trotzdem, um auf Ihre Sitemap zu verweisen und Crawler von Warenkorb, Login und internen Suchseiten fernzuhalten.