Zum Inhalt springen

Robots.txt prüfen & validieren

Kurze Antwort

Prüfen Sie Ihre robots.txt: die Regeln, die Sitemap-Zeile, ob eine Seite gecrawlt werden darf und welche KI-Crawler sie lesen dürfen.

Kostenlos · Ohne Anmeldung · Abruf über unseren Server
Wir rufen die URL über unseren Server ab, um die Prüfung auszuführen. Ergebnisse werden nicht gespeichert.

Was es macht

Ruft Ihre `/robots.txt` ab und parst jede Direktive – User-agent-Gruppen, Allow-/Disallow-Regeln, Sitemap und Crawl-delay. Prüft, ob die von Ihnen eingegebene URL erlaubt ist, unter Verwendung derselben Longest-Match-Priorität, die echte Crawler nutzen, und markiert ein pauschales `Disallow: /`, eine fehlende Sitemap-Direktive und eine übergroße Datei. Außerdem listet es die wichtigsten KI-Crawler und Steuerungs-Token auf, zeigt, ob jeder diese URL abrufen darf, und erklärt, wofür jeder gedacht ist: KI-Modelltraining, KI-Suchantworten oder das Öffnen einer Seite, wenn ein:e Nutzer:in danach fragt.

Warum es wichtig ist

Ein einziges versehentliches `Disallow: /` kann Suchmaschinen davon abhalten, eine ganze Website zu crawlen, und es passiert leicht aus Versehen aus einem Staging-Setup heraus. KI-Crawler werfen eine zweite Frage auf: Einen Trainings-Crawler zu blockieren, entfernt Sie nicht aus KI-Suchantworten, aber einen Such-Crawler zu blockieren kann das – es lohnt sich also zu wissen, welches Token was tut.

Wie es funktioniert

  1. Die zu testende URL eingeben

  2. Wir rufen `/robots.txt` ab und parsen jede Direktive

  3. Prüfen, ob diese URL für Crawler im Allgemeinen und für jeden KI-Crawler erlaubt ist, unter Verwendung der Prioritätsregeln, die echte Crawler nutzen

  4. Eine vollständige Website-Sperre, eine blockierte URL und eine fehlende Sitemap-Direktive markieren und jeden KI-Crawler erklären

Beispiel-Ein- und Ausgabe

EINGABE
url: https://rankproof.eu/tools
AUSGABE
https://rankproof.eu/robots.txt: 200 OK
Dateigröße: 412 B · User-Agent-Gruppen: 2 · Crawl-delay: nicht gesetzt
diese Seite ist crawlbar                    OK
Sitemap-Direktive vorhanden                 OK

KI-Crawler — alle dürfen diese Seite lesen:
  GPTBot            Allowed   OpenAI: sammelt Seiten, um KI-Modelle zu trainieren.
  OAI-SearchBot     Allowed   OpenAI: indexiert Seiten, damit seine KI-Suche sie zeigen und zitieren kann.
  ChatGPT-User      Allowed   OpenAI: öffnet eine Seite, wenn ein:e Nutzer:in den Assistenten danach fragt.
  Google-Extended   Allowed   Google: kein eigener Crawler — eine Regel für die KI-Nutzung gecrawlter Seiten.
  …

Wer es nutzt

  • Technical SEO

    Vor dem Launch die Produktions-robots.txt prüfen, damit eine "alles sperren"-Regel aus dem Staging nie live geht.

  • Website-Betreiber:in

    Entscheiden, welche KI-Crawler erlaubt werden: KI-Suche-Crawler offen halten und gleichzeitig wählen, ob Ihre Seiten KI-Modelle trainieren dürfen.

  • Content-Manager:in

    Wenn ein Bereich aus der Google Search Console verschwindet, zuerst prüfen, ob robots.txt ihn blockiert.

Häufig gestellte Fragen

Was ist robots.txt?

Eine reine Textdatei an Ihrer Domain-Root, die Crawlern sagt, welche URLs sie anfordern dürfen und welche nicht. Sie ist in RFC 9309 (2022) standardisiert.

Kann ich KI-Crawler separat blockieren?

Ja – jeder hat sein eigenes User-Agent-Token, etwa `GPTBot` oder `ClaudeBot`. Mehrere KI-Unternehmen betreiben getrennte Crawler für Modelltraining und für die Suche, sodass Sie das Training blockieren und trotzdem in deren KI-Suchantworten sichtbar bleiben können.

Was ist Google-Extended?

Ein Steuerungs-Token, kein eigener Crawler. Google crawlt so oder so mit seinen üblichen Crawlern; ein Disallow für `Google-Extended` sagt Google, Ihre Inhalte nicht für das Training von Gemini-Modellen oder zur Fundierung von Antworten in Gemini-Apps zu nutzen. Es hat keinen Einfluss auf die Google-Suche oder das Ranking.

Halten sich alle KI-Crawler an robots.txt?

Die großen KI-Unternehmen sagen, dass ihre Crawler das tun. Manche Abrufer, die auf Nutzeranfrage handeln, etwa ChatGPT-User und Perplexity-User, wenden robots.txt-Regeln möglicherweise nicht an, und der Bericht markiert diese.

Was ist der Unterschied zwischen robots.txt und noindex?

robots.txt verhindert das Crawlen. `noindex` erlaubt das Crawlen, verhindert aber die Indexierung. Sperren Sie eine Seite in robots.txt, kann Google ihr noindex-Tag nicht sehen – ein häufiger Fehler.

Sollte ich eine Sitemap-Direktive einfügen?

Ja – `Sitemap: https://example.com/sitemap.xml` hilft jedem Crawler, Ihre Sitemap zu finden, einschließlich Bing und anderer Suchmaschinen.

Respektiert Google robots.txt immer?

Fürs Crawlen ja. Aber eine blockierte URL kann trotzdem in den Suchergebnissen erscheinen, wenn andere Seiten darauf verlinken – ohne Snippet. Nutzen Sie noindex, um eine Seite ganz herauszuhalten.