# Robots.txt prüfen & validieren

https://rankproof.eu/de/tools/seo-robots-txt

## Kurze Antwort

Prüfen Sie Ihre robots.txt: die Regeln, die Sitemap-Zeile, ob eine Seite gecrawlt werden darf und welche KI-Crawler sie lesen dürfen.

## Was es macht

Ruft Ihre `/robots.txt` ab und parst jede Direktive – User-agent-Gruppen, Allow-/Disallow-Regeln, Sitemap und Crawl-delay. Prüft, ob die von Ihnen eingegebene URL erlaubt ist, unter Verwendung derselben Longest-Match-Priorität, die echte Crawler nutzen, und markiert ein pauschales `Disallow: /`, eine fehlende Sitemap-Direktive und eine übergroße Datei. Außerdem listet es die wichtigsten KI-Crawler und Steuerungs-Token auf, zeigt, ob jeder diese URL abrufen darf, und erklärt, wofür jeder gedacht ist: KI-Modelltraining, KI-Suchantworten oder das Öffnen einer Seite, wenn ein:e Nutzer:in danach fragt.

## Wie es funktioniert

1. Die zu testende URL eingeben
2. Wir rufen `/robots.txt` ab und parsen jede Direktive
3. Prüfen, ob diese URL für Crawler im Allgemeinen und für jeden KI-Crawler erlaubt ist, unter Verwendung der Prioritätsregeln, die echte Crawler nutzen
4. Eine vollständige Website-Sperre, eine blockierte URL und eine fehlende Sitemap-Direktive markieren und jeden KI-Crawler erklären

## Beispiel-Ein- und Ausgabe

EINGABE

```text
url: https://rankproof.eu/tools
```

AUSGABE

```text
https://rankproof.eu/robots.txt: 200 OK
Dateigröße: 412 B · User-Agent-Gruppen: 2 · Crawl-delay: nicht gesetzt
diese Seite ist crawlbar                    OK
Sitemap-Direktive vorhanden                 OK

KI-Crawler — alle dürfen diese Seite lesen:
  GPTBot            Allowed   OpenAI: sammelt Seiten, um KI-Modelle zu trainieren.
  OAI-SearchBot     Allowed   OpenAI: indexiert Seiten, damit seine KI-Suche sie zeigen und zitieren kann.
  ChatGPT-User      Allowed   OpenAI: öffnet eine Seite, wenn ein:e Nutzer:in den Assistenten danach fragt.
  Google-Extended   Allowed   Google: kein eigener Crawler — eine Regel für die KI-Nutzung gecrawlter Seiten.
  …
```

## Warum es wichtig ist

Ein einziges versehentliches `Disallow: /` kann Suchmaschinen davon abhalten, eine ganze Website zu crawlen, und es passiert leicht aus Versehen aus einem Staging-Setup heraus. KI-Crawler werfen eine zweite Frage auf: Einen Trainings-Crawler zu blockieren, entfernt Sie nicht aus KI-Suchantworten, aber einen Such-Crawler zu blockieren kann das – es lohnt sich also zu wissen, welches Token was tut.

## Wer es nutzt

- **Technical SEO**: Vor dem Launch die Produktions-robots.txt prüfen, damit eine "alles sperren"-Regel aus dem Staging nie live geht.
- **Website-Betreiber:in**: Entscheiden, welche KI-Crawler erlaubt werden: KI-Suche-Crawler offen halten und gleichzeitig wählen, ob Ihre Seiten KI-Modelle trainieren dürfen.
- **Content-Manager:in**: Wenn ein Bereich aus der Google Search Console verschwindet, zuerst prüfen, ob robots.txt ihn blockiert.

## Häufig gestellte Fragen

### Was ist robots.txt?

Eine reine Textdatei an Ihrer Domain-Root, die Crawlern sagt, welche URLs sie anfordern dürfen und welche nicht. Sie ist in RFC 9309 (2022) standardisiert.

### Kann ich KI-Crawler separat blockieren?

Ja – jeder hat sein eigenes User-Agent-Token, etwa `GPTBot` oder `ClaudeBot`. Mehrere KI-Unternehmen betreiben getrennte Crawler für Modelltraining und für die Suche, sodass Sie das Training blockieren und trotzdem in deren KI-Suchantworten sichtbar bleiben können.

### Was ist Google-Extended?

Ein Steuerungs-Token, kein eigener Crawler. Google crawlt so oder so mit seinen üblichen Crawlern; ein Disallow für `Google-Extended` sagt Google, Ihre Inhalte nicht für das Training von Gemini-Modellen oder zur Fundierung von Antworten in Gemini-Apps zu nutzen. Es hat keinen Einfluss auf die Google-Suche oder das Ranking.

### Halten sich alle KI-Crawler an robots.txt?

Die großen KI-Unternehmen sagen, dass ihre Crawler das tun. Manche Abrufer, die auf Nutzeranfrage handeln, etwa ChatGPT-User und Perplexity-User, wenden robots.txt-Regeln möglicherweise nicht an, und der Bericht markiert diese.

### Was ist der Unterschied zwischen robots.txt und noindex?

robots.txt verhindert das Crawlen. `noindex` erlaubt das Crawlen, verhindert aber die Indexierung. Sperren Sie eine Seite in robots.txt, kann Google ihr noindex-Tag nicht sehen – ein häufiger Fehler.

### Sollte ich eine Sitemap-Direktive einfügen?

Ja – `Sitemap: https://example.com/sitemap.xml` hilft jedem Crawler, Ihre Sitemap zu finden, einschließlich Bing und anderer Suchmaschinen.

### Respektiert Google robots.txt immer?

Fürs Crawlen ja. Aber eine blockierte URL kann trotzdem in den Suchergebnissen erscheinen, wenn andere Seiten darauf verlinken – ohne Snippet. Nutzen Sie noindex, um eine Seite ganz herauszuhalten.

## Verwandte Tools in SEO-Analyse

- [Title- & Meta-Description-Prüfer](https://rankproof.eu/de/tools/seo-meta-title)
- [Überschriften-Checker](https://rankproof.eu/de/tools/seo-heading-tags)
- [Bild-Alt-Text-Prüfer](https://rankproof.eu/de/tools/seo-image-alt)
- [Canonical-URL-Prüfer](https://rankproof.eu/de/tools/seo-canonical-url)
- [robots.txt-Generator](https://rankproof.eu/de/tools/seo-robots-txt-generator)
- [Sitemap-Prüfer](https://rankproof.eu/de/tools/seo-sitemap)
