# Vérificateur et validateur robots.txt

https://rankproof.eu/fr/tools/seo-robots-txt

## Réponse courte

Vérifiez votre robots.txt : ses règles, la ligne sitemap, si une page peut être explorée et quels robots d'IA peuvent la lire.

## Ce que ça fait

Récupère votre `/robots.txt` et analyse chaque directive — groupes User-agent, règles Allow/Disallow, Sitemap et Crawl-delay. Vérifie si l'URL que vous avez saisie est autorisée, en utilisant le même ordre de priorité par correspondance la plus longue que les robots réels, et signale un `Disallow: /` général, une directive sitemap manquante et un fichier surdimensionné. Il liste aussi les principaux robots IA et jetons de contrôle, indique si chacun peut récupérer cette URL et explique à quoi sert chacun : entraîner des modèles d'IA, alimenter des réponses de recherche IA, ou ouvrir une page quand un utilisateur le demande.

## Comment ça fonctionne

1. Saisissez l'URL que vous voulez tester
2. Nous récupérons `/robots.txt` et analysons chaque directive
3. Vérifiez si cette URL est autorisée pour les robots en général et pour chaque robot IA, en utilisant les règles de priorité que suivent les robots réels
4. Signalez un blocage de tout le site, une URL bloquée et une directive sitemap manquante, et expliquez chaque robot IA

## Exemple d'entrée et de sortie

ENTRÉE

```text
url: https://rankproof.eu/tools
```

SORTIE

```text
https://rankproof.eu/robots.txt : 200 OK
taille du fichier : 412 o · groupes user-agent : 2 · crawl-delay : non défini
cette page est explorable                   OK
directive sitemap présente                  OK

Robots IA — tous peuvent lire cette page :
  GPTBot            Allowed   OpenAI : collecte des pages pour entraîner des modèles d'IA.
  OAI-SearchBot     Allowed   OpenAI : indexe les pages pour que sa recherche IA puisse les montrer et les citer.
  ChatGPT-User      Allowed   OpenAI : ouvre une page quand un utilisateur interroge l'assistant à son sujet.
  Google-Extended   Allowed   Google : pas un robot distinct — une règle pour l'usage IA des pages qu'il explore.
  …
```

## Pourquoi c'est important

Un seul `Disallow: /` malencontreux peut empêcher les moteurs de recherche d'explorer tout un site, et il est facile de le publier par accident depuis une configuration de préproduction. Les robots IA ajoutent une seconde question : bloquer un robot d'entraînement ne vous retire pas des réponses de recherche IA, mais bloquer un robot de recherche le peut — mieux vaut donc savoir ce que fait chaque jeton.

## Qui l'utilise

- **SEO technique**: Avant le lancement, vérifiez le robots.txt de production pour qu'une règle « tout bloquer » de préproduction ne se retrouve jamais en ligne.
- **Propriétaire de site**: Décidez quels robots IA autoriser : gardez les robots de recherche IA ouverts tout en choisissant si vos pages peuvent entraîner des modèles d'IA.
- **Responsable de contenu**: Quand une section disparaît de Google Search Console, vérifiez d'abord si robots.txt la bloque.

## Questions fréquentes

### Qu'est-ce que robots.txt ?

Un fichier texte brut à la racine de votre domaine qui indique aux robots quelles URL ils peuvent ou non demander. Il est normalisé dans la RFC 9309 (2022).

### Puis-je bloquer les robots IA séparément ?

Oui — chacun possède son propre jeton user-agent, comme `GPTBot` ou `ClaudeBot`. Plusieurs entreprises d'IA exploitent des robots distincts pour l'entraînement de modèles et pour la recherche, afin que vous puissiez bloquer l'entraînement tout en restant visible dans leurs réponses de recherche IA.

### Qu'est-ce que Google-Extended ?

Un jeton de contrôle, pas un robot distinct. Google explore de toute façon avec ses robots habituels ; interdire `Google-Extended` indique à Google de ne pas utiliser votre contenu pour entraîner les modèles Gemini ni pour appuyer les réponses dans les applications Gemini. Cela n'affecte ni la Recherche Google ni le classement.

### Tous les robots IA respectent-ils robots.txt ?

Les grandes entreprises d'IA affirment que leurs robots le font. Certains outils qui agissent sur demande d'un utilisateur, comme ChatGPT-User et Perplexity-User, peuvent ne pas appliquer les règles de robots.txt, et le rapport les signale.

### Quelle est la différence entre robots.txt et noindex ?

robots.txt empêche l'exploration. `noindex` autorise l'exploration mais empêche l'indexation. Si vous bloquez une page dans robots.txt, Google ne peut pas voir sa balise noindex — une erreur courante.

### Dois-je inclure une directive sitemap ?

Oui — `Sitemap: https://example.com/sitemap.xml` aide chaque robot à trouver votre sitemap, y compris Bing et d'autres moteurs de recherche.

### Google respecte-t-il toujours robots.txt ?

Pour l'exploration, oui. Mais une URL bloquée peut quand même apparaître dans les résultats de recherche si d'autres pages y renvoient — sans extrait. Utilisez noindex pour exclure une page.

## Outils connexes dans Analyse SEO

- [Vérificateur de titre et méta description](https://rankproof.eu/fr/tools/seo-meta-title)
- [Vérificateur de balises de titre](https://rankproof.eu/fr/tools/seo-heading-tags)
- [Vérificateur d'alt text d'images](https://rankproof.eu/fr/tools/seo-image-alt)
- [Vérificateur d'URL canonique](https://rankproof.eu/fr/tools/seo-canonical-url)
- [Générateur de robots.txt](https://rankproof.eu/fr/tools/seo-robots-txt-generator)
- [Vérificateur de sitemap](https://rankproof.eu/fr/tools/seo-sitemap)
