Robots.txt prüfen & validieren
Kurze Antwort
Prüfen Sie Ihre robots.txt: die Regeln, die Sitemap-Zeile, ob eine Seite gecrawlt werden darf und welche KI-Crawler sie lesen dürfen.
Was es macht
Ruft Ihre `/robots.txt` ab und parst jede Direktive – User-agent-Gruppen, Allow-/Disallow-Regeln, Sitemap und Crawl-delay. Prüft, ob die von Ihnen eingegebene URL erlaubt ist, unter Verwendung derselben Longest-Match-Priorität, die echte Crawler nutzen, und markiert ein pauschales `Disallow: /`, eine fehlende Sitemap-Direktive und eine übergroße Datei. Außerdem listet es die wichtigsten KI-Crawler und Steuerungs-Token auf, zeigt, ob jeder diese URL abrufen darf, und erklärt, wofür jeder gedacht ist: KI-Modelltraining, KI-Suchantworten oder das Öffnen einer Seite, wenn ein:e Nutzer:in danach fragt.
Warum es wichtig ist
Ein einziges versehentliches `Disallow: /` kann Suchmaschinen davon abhalten, eine ganze Website zu crawlen, und es passiert leicht aus Versehen aus einem Staging-Setup heraus. KI-Crawler werfen eine zweite Frage auf: Einen Trainings-Crawler zu blockieren, entfernt Sie nicht aus KI-Suchantworten, aber einen Such-Crawler zu blockieren kann das – es lohnt sich also zu wissen, welches Token was tut.
Wie es funktioniert
-
Die zu testende URL eingeben
-
Wir rufen `/robots.txt` ab und parsen jede Direktive
-
Prüfen, ob diese URL für Crawler im Allgemeinen und für jeden KI-Crawler erlaubt ist, unter Verwendung der Prioritätsregeln, die echte Crawler nutzen
-
Eine vollständige Website-Sperre, eine blockierte URL und eine fehlende Sitemap-Direktive markieren und jeden KI-Crawler erklären
Beispiel-Ein- und Ausgabe
url: https://rankproof.eu/tools
https://rankproof.eu/robots.txt: 200 OK Dateigröße: 412 B · User-Agent-Gruppen: 2 · Crawl-delay: nicht gesetzt diese Seite ist crawlbar OK Sitemap-Direktive vorhanden OK KI-Crawler — alle dürfen diese Seite lesen: GPTBot Allowed OpenAI: sammelt Seiten, um KI-Modelle zu trainieren. OAI-SearchBot Allowed OpenAI: indexiert Seiten, damit seine KI-Suche sie zeigen und zitieren kann. ChatGPT-User Allowed OpenAI: öffnet eine Seite, wenn ein:e Nutzer:in den Assistenten danach fragt. Google-Extended Allowed Google: kein eigener Crawler — eine Regel für die KI-Nutzung gecrawlter Seiten. …
Wer es nutzt
-
Technical SEO
Vor dem Launch die Produktions-robots.txt prüfen, damit eine "alles sperren"-Regel aus dem Staging nie live geht.
-
Website-Betreiber:in
Entscheiden, welche KI-Crawler erlaubt werden: KI-Suche-Crawler offen halten und gleichzeitig wählen, ob Ihre Seiten KI-Modelle trainieren dürfen.
-
Content-Manager:in
Wenn ein Bereich aus der Google Search Console verschwindet, zuerst prüfen, ob robots.txt ihn blockiert.
Häufig gestellte Fragen
Was ist robots.txt?
Eine reine Textdatei an Ihrer Domain-Root, die Crawlern sagt, welche URLs sie anfordern dürfen und welche nicht. Sie ist in RFC 9309 (2022) standardisiert.
Kann ich KI-Crawler separat blockieren?
Ja – jeder hat sein eigenes User-Agent-Token, etwa `GPTBot` oder `ClaudeBot`. Mehrere KI-Unternehmen betreiben getrennte Crawler für Modelltraining und für die Suche, sodass Sie das Training blockieren und trotzdem in deren KI-Suchantworten sichtbar bleiben können.
Was ist Google-Extended?
Ein Steuerungs-Token, kein eigener Crawler. Google crawlt so oder so mit seinen üblichen Crawlern; ein Disallow für `Google-Extended` sagt Google, Ihre Inhalte nicht für das Training von Gemini-Modellen oder zur Fundierung von Antworten in Gemini-Apps zu nutzen. Es hat keinen Einfluss auf die Google-Suche oder das Ranking.
Halten sich alle KI-Crawler an robots.txt?
Die großen KI-Unternehmen sagen, dass ihre Crawler das tun. Manche Abrufer, die auf Nutzeranfrage handeln, etwa ChatGPT-User und Perplexity-User, wenden robots.txt-Regeln möglicherweise nicht an, und der Bericht markiert diese.
Was ist der Unterschied zwischen robots.txt und noindex?
robots.txt verhindert das Crawlen. `noindex` erlaubt das Crawlen, verhindert aber die Indexierung. Sperren Sie eine Seite in robots.txt, kann Google ihr noindex-Tag nicht sehen – ein häufiger Fehler.
Sollte ich eine Sitemap-Direktive einfügen?
Ja – `Sitemap: https://example.com/sitemap.xml` hilft jedem Crawler, Ihre Sitemap zu finden, einschließlich Bing und anderer Suchmaschinen.
Respektiert Google robots.txt immer?
Fürs Crawlen ja. Aber eine blockierte URL kann trotzdem in den Suchergebnissen erscheinen, wenn andere Seiten darauf verlinken – ohne Snippet. Nutzen Sie noindex, um eine Seite ganz herauszuhalten.