Saltar al contenido

Comprobador y validador de robots.txt

Respuesta breve

Comprueba tu robots.txt: sus reglas, la línea del sitemap, si una página se puede rastrear y qué rastreadores de IA pueden leerla.

Gratis · Sin registro · Obtenido por nuestro servidor
Obtenemos la URL desde nuestro servidor para hacer la comprobación. Los resultados no se guardan.

Qué hace

Obtiene tu `/robots.txt` y analiza todas sus directivas — grupos de User-agent, reglas Allow/Disallow, Sitemap y Crawl-delay. Comprueba si la URL que has introducido está permitida, usando el mismo criterio de precedencia por coincidencia más larga que usan los rastreadores reales, y marca un `Disallow: /` general, una directiva de sitemap ausente y un archivo con un tamaño excesivo. También enumera los principales rastreadores y tokens de control de IA, muestra si cada uno puede obtener esa URL y explica para qué sirve cada uno: entrenar modelos de IA, respuestas de búsqueda con IA o abrir una página cuando un usuario lo solicita.

Por qué importa

Un simple `Disallow: /` puede impedir que los buscadores rastreen todo un sitio, y es fácil publicarlo por accidente desde una configuración de staging. Los rastreadores de IA añaden una segunda cuestión: bloquear un rastreador de entrenamiento no te elimina de las respuestas de búsqueda con IA, pero bloquear un rastreador de búsqueda sí puede hacerlo — así que conviene saber qué hace cada token.

Cómo funciona

  1. Introduce la URL que quieres probar

  2. Obtenemos `/robots.txt` y analizamos todas sus directivas

  3. Comprobamos si esa URL está permitida para los rastreadores en general y para cada rastreador de IA, usando las reglas de precedencia que usan los rastreadores reales

  4. Marcamos un bloqueo de todo el sitio, una URL bloqueada y una directiva de sitemap ausente, y explicamos cada rastreador de IA

Ejemplo de entrada y salida

ENTRADA
url: https://rankproof.eu/tools
SALIDA
https://rankproof.eu/robots.txt: 200 OK
tamaño del archivo: 412 B · grupos de user-agent: 2 · crawl-delay: no definido
esta página se puede rastrear              OK
directiva sitemap presente                 OK

Rastreadores de IA — todos pueden leer esta página:
  GPTBot            Permitido   OpenAI: recopila páginas para entrenar modelos de IA.
  OAI-SearchBot     Permitido   OpenAI: indexa páginas para que su búsqueda de IA pueda mostrarlas y citarlas.
  ChatGPT-User      Permitido   OpenAI: abre una página cuando un usuario le pregunta al asistente sobre ella.
  Google-Extended   Permitido   Google: no es un rastreador aparte, sino una regla para el uso con IA de las páginas que rastrea.
  …

Quién lo usa

  • SEO técnico

    Antes del lanzamiento, comprueba el robots.txt de producción para que una regla de "bloquear todo" de staging nunca llegue a producción.

  • Propietario del sitio

    Decide qué rastreadores de IA permitir: mantén abiertos los rastreadores de búsqueda con IA mientras eliges si tus páginas pueden entrenar modelos de IA.

  • Gestor de contenidos

    Cuando una sección desaparece de Google Search Console, comprueba primero si robots.txt la bloquea.

Preguntas frecuentes

¿Qué es robots.txt?

Un archivo de texto plano en la raíz de tu dominio que indica a los rastreadores qué URL pueden o no solicitar. Está estandarizado en el RFC 9309 (2022).

¿Puedo bloquear rastreadores de IA por separado?

Sí — cada uno tiene su propio token de user-agent, como `GPTBot` o `ClaudeBot`. Varias empresas de IA usan rastreadores distintos para entrenamiento de modelos y para búsqueda, así que puedes bloquear el entrenamiento y seguir apareciendo en sus respuestas de búsqueda con IA.

¿Qué es Google-Extended?

Un token de control, no un rastreador aparte. Google rastrea igualmente con sus rastreadores habituales; bloquear `Google-Extended` le indica a Google que no use tu contenido para entrenar los modelos Gemini ni para fundamentar respuestas en las apps de Gemini. No afecta a Google Search ni al posicionamiento.

¿Todos los rastreadores de IA respetan robots.txt?

Las principales empresas de IA dicen que sus rastreadores lo hacen. Algunos captadores que actúan por petición de un usuario, como ChatGPT-User y Perplexity-User, pueden no aplicar las reglas de robots.txt, y el informe los señala.

¿Cuál es la diferencia entre robots.txt y noindex?

robots.txt impide el rastreo. `noindex` permite el rastreo pero impide la indexación. Si bloqueas una página en robots.txt, Google no puede ver su etiqueta noindex — un error habitual.

¿Debería incluir una directiva de sitemap?

Sí — `Sitemap: https://example.com/sitemap.xml` ayuda a todos los rastreadores a encontrar tu sitemap, incluidos Bing y otros buscadores.

¿Google siempre respeta robots.txt?

Para el rastreo, sí. Pero una URL bloqueada aún puede aparecer en los resultados de búsqueda si otras páginas la enlazan, sin fragmento. Usa noindex para mantener una página fuera.