Robots.txt-Generator
Erstelle eine robots.txt mit Crawl-Regeln für Suchmaschinen und Bots.
Über dieses Tool
robots.txt steuert Crawling, nicht Indexierung, und die zwei zu verwechseln ist der folgenreichste Fehler in technischem SEO. Einen Pfad zu disallowen sagt einem Crawler, ihn nicht zu holen - aber wenn andere Sites auf diese Seite verlinken, kann Google die URL trotzdem in Ergebnissen listen und sie ohne Description zeigen, weil der Inhalt nie gelesen werden durfte. Schlimmer: eine Seite, die du blockiert hast, kann gar nicht gelesen werden, ein noindex-Tag darauf wird also nie gesehen und nie befolgt. Die korrekte Paarung ist daher kontraintuitiv: um eine Seite aus Suchergebnissen zu halten, Crawling erlauben und noindex nutzen; um Crawl-Budget auf Seiten zu sparen, die dich nicht interessieren, disallow. Die Datei lebt an der Domain-Root, ist öffentlich von jedem lesbar und wird freiwillig beachtet - wohlerzogene Crawler respektieren sie, während böswillige Scraper sie komplett ignorieren. Es ist eine Crawl-Anweisung, nie eine Sicherheitsmaßnahme. Das baut die Syntax in deinem Browser.
So verwendest du dieses Tool
- Den User-Agent wählen* gilt für jeden Crawler. Benenne einen konkreten - Googlebot, Bingbot - nur, wenn er andere Regeln braucht.
- Deine Disallow-Regeln hinzufügenPfade, die du nicht gecrawlt haben willst: Admin-Bereiche, interne Suchergebnisse, doppelte Parameter-URLs.
- Deine Sitemap-URL hinzufügenDie absolute URL deiner sitemap.xml. So entdecken Crawler deine Seiten effizient.
- Auf deine Domain-Root hochladenSie muss genau unter yoursite.com/robots.txt erreichbar sein - kein anderer Ort wird geprüft.
Warum es nutzen
- Erzeugt korrekte Direktiven-Syntax, wo ein Tippfehler still das Verhalten ändert statt zu errorn.
- Unterstützt Regeln pro Crawler für Fälle, in denen verschiedene Bots unterschiedliche Behandlung brauchen.
- Enthält die Sitemap-Deklaration, die nützlichste Zeile in den meisten robots.txt-Dateien.
- Läuft in deinem Browser ohne Konto.
- Die Ausgabe ist Klartext, den du direkt in deine Site-Root einfügen kannst.
Häufige Anwendungen
- Crawler aus Admin- und Login-Pfaden halten.
- Verhindern, dass interne Suchergebnisseiten Crawl-Budget verbrauchen.
- Den Sitemap-Ort deklarieren, damit Crawler deine Seiten finden.
- Parameter-URLs blockieren, die vorhandenen Inhalt duplizieren.
- Andere Regeln für einen konkreten Bot setzen, der zu viel crawlt.
Tipps für bessere Ergebnisse
- Nimm immer deine Sitemap-URL auf. Es ist die wertvollste einzelne Zeile in der Datei.
- Um eine Seite aus Suchergebnissen zu halten, disallow sie NICHT - erlaube Crawling und füge einen noindex-Tag hinzu, sonst kann der Crawler das noindex nie sehen.
- Teste in Google Search Consoles robots.txt-Tester vor dem Deploy. Ein falsch gesetzter Schrägstrich kann deine ganze Site blocken.
- Denk daran, die Datei ist öffentlich. "/secret-admin-panel/" zu listen, wirbt genau dafür, wo es ist.
- Disallow: / blockt alles. Prüfe sorgfältig darauf - es ist die schädlichste einzelne Zeile, die eine Site versehentlich ausliefern kann.
Fehler, die du vermeiden solltest
- Eine Seite zu disallowen, um sie aus Suchergebnissen zu halten, was verhindert, dass der Crawler den noindex-Tag sieht, der es wirklich tun würde.
- "Disallow: /" aus einer Staging-Umgebung in Produktion zu shippen, was die ganze Site deindexiert.
- CSS und JavaScript zu blocken, was Google hindert, die Seite so zu rendern, wie Nutzer sie sehen, und Rankings schaden kann.
- robots.txt als Sicherheit zu behandeln. Sie ist öffentlich, beratend und wird von allem Böswilligen ignoriert.
- Die Sitemap-Zeile zu vergessen, wodurch Seitenentdeckung langsamer ist als nötig.
- Die Datei irgendwo anders als an der Domain-Root zu platzieren, wo niemand danach sucht.
Häufig gestellte Fragen
Nicht genau - es sagt wohlerzogenen Crawlern, bestimmte Pfade nicht zu CRAWLEN, aber eine Seite kann trotzdem gelegentlich in Suchergebnissen erscheinen, ohne gecrawlt zu werden (z. B. wenn sie anderswo verlinkt ist). Für garantierten Ausschluss aus Suchergebnissen nutze einen noindex-Meta-Tag oder HTTP-Header auf der konkreten Seite.
An die Root deiner Domain, sodass sie unter yoursite.com/robots.txt erreichbar ist - Suchmaschinen suchen genau an diesem Ort danach.
Ja. Regeln sind pro User-Agent gruppiert, Googlebot kann also andere Rechte haben als Bingbot oder ein konkreter Scraper. Nutze * für das Default, das für alles andere gilt.
Erlaube Crawling und füge einen noindex-Meta-Tag oder HTTP-Header hinzu. Das ist das Gegenteil von dem, was Leute erwarten: wenn du die Seite disallowst, holt der Crawler sie nie, sieht das noindex nie, und die URL kann trotzdem aus externen Links in Ergebnissen erscheinen.
Nein, und sie als eine zu behandeln ist gefährlich. Die Datei ist öffentlich lesbar, einen privaten Pfad zu listen wirbt also seinen Ort. Compliance ist freiwillig - böswillige Scraper ignorieren sie komplett. Nutze Authentifizierung für alles, das wirklich Schutz braucht.
Nein. Google rendert Seiten, um sie zu verstehen, und Stylesheets oder Skripte zu blocken bedeutet, es sieht eine kaputte Version deiner Site. Das war einmal gängiger Rat und ist jetzt aktiv schädlich.
Ja. Robots Txt Generator ist für die normale Nutzung kostenlos, ohne Konto, und ToolBox setzt kein Wasserzeichen auf dein Ergebnis.
Die meisten Tools in dieser Kategorie laufen in deinem Browser, sodass die Datei auf deinem Gerät bleibt. Wenn ein Tool einen temporären Server-Auftrag braucht, werden Dateien nur für diesen Auftrag verarbeitet und nicht als dauerhaftes Archiv gespeichert.
Andere suchen auch nach
- robots txt generator kostenlos
- robots txt beispiel
- google am crawlen einer seite hindern
- robots txt vs noindex
- disallow regeln seo
- robots txt tester
- sitemap in robots txt einfügen