Saltar al contenido

Generador de robots.txt

Respuesta breve

Crea un archivo robots.txt con rutas bloqueadas, sitemaps y una opción para cada rastreador de IA.

Gratis · Sin registro · Se ejecuta en tu navegador
Rastreo

Empieza cada ruta con /, por ejemplo /admin/ o /cart/. Usa * como comodín y $ para indicar el final de una URL.

Google ignora Crawl-delay; Bing lo tiene en cuenta.

Rastreadores de IA

Los rastreadores para búsquedas y respuestas de IA deciden si tus páginas se pueden mostrar o citar ahí. Los rastreadores de entrenamiento recopilan páginas para entrenar modelos; bloquearlos no elimina tu sitio de la búsqueda con IA.

Búsqueda y respuestas de IA
  • OAI-SearchBotOpenAI: indexa páginas para que su búsqueda con IA pueda mostrarlas y citarlas.
  • ChatGPT-UserOpenAI: abre una página cuando un usuario pregunta al asistente por ella. Según su operador, el robots.txt puede no aplicarse a estas solicitudes.
  • Claude-SearchBotAnthropic: indexa páginas para que su búsqueda con IA pueda mostrarlas y citarlas.
  • Claude-UserAnthropic: abre una página cuando un usuario pregunta al asistente por ella.
  • PerplexityBotPerplexity: indexa páginas para que su búsqueda con IA pueda mostrarlas y citarlas.
  • Perplexity-UserPerplexity: abre una página cuando un usuario pregunta al asistente por ella. Según su operador, el robots.txt puede no aplicarse a estas solicitudes.
Entrenamiento de modelos
  • GPTBotOpenAI: recopila páginas para entrenar modelos de IA.
  • ClaudeBotAnthropic: recopila páginas para entrenar modelos de IA.
  • CCBotRastreador de un archivo abierto de la web; muchos modelos de IA se entrenan con su conjunto de datos público.
Otros usos de IA
  • Google-ExtendedGoogle: no es un rastreador aparte — una regla que indica si las páginas que ya rastrea pueden usarse para sus modelos de IA.
  • Applebot-ExtendedApple: no es un rastreador aparte — una regla que indica si las páginas que ya rastrea pueden usarse para sus modelos de IA.
  • meta-externalagentMeta: rastrea páginas para sus propios productos; el contenido también puede usarse para entrenar modelos de IA.
  • AmazonbotAmazon: rastrea páginas para sus propios productos; el contenido también puede usarse para entrenar modelos de IA.

Lista de rastreadores de IA comprobada por última vez el 17/09/2026.

Tu robots.txt

User-agent: *
Allow: /

Lo que el archivo permite en la página de inicio

  • GPTBotPermitido
  • OAI-SearchBotPermitido
  • ChatGPT-UserPermitido
  • ClaudeBotPermitido
  • Claude-SearchBotPermitido
  • Claude-UserPermitido
  • PerplexityBotPermitido
  • Perplexity-UserPermitido
  • Google-ExtendedPermitido
  • Applebot-ExtendedPermitido
  • meta-externalagentPermitido
  • AmazonbotPermitido
  • CCBotPermitido

Guarda el archivo como robots.txt en la raíz de tu dominio (por ejemplo https://example.com/robots.txt) y prueba después el archivo en producción. Abrir el comprobador de robots.txt

El archivo se crea en tu navegador.

Qué hace

Crea un archivo robots.txt con las rutas que hay que mantener fuera del alcance de los rastreadores, líneas de sitemap, un Crawl-delay opcional y una opción de permitir o bloquear para cada rastreador de IA conocido, agrupados en búsqueda con IA, entrenamiento de modelos y otros usos de IA. Después lee el archivo y muestra qué puede obtener cada rastreador de IA.

Por qué importa

robots.txt indica a los rastreadores qué URLs pueden obtener. Las empresas de IA usan rastreadores distintos para la búsqueda, para obtener una página sobre la que pregunta un usuario y para el entrenamiento de modelos, así que puedes seguir siendo visible en la búsqueda con IA y a la vez excluirte del entrenamiento. Bloquear un rastreador de entrenamiento como GPTBot no elimina un sitio de la búsqueda de ChatGPT. robots.txt es una petición, no un control de acceso, y algunos rastreadores que actúan en nombre de un usuario dicen que pueden no seguirlo.

Cómo funciona

  1. Elige si quieres permitir el rastreo o bloquear todo el sitio

  2. Indica las rutas que hay que mantener fuera del alcance de los rastreadores y las URLs de tu sitemap

  3. Permite o bloquea cada rastreador de IA, o parte de un ajuste predefinido

  4. Copia o descarga el archivo, guárdalo como /robots.txt y prueba el archivo en producción con el comprobador de robots.txt

Ejemplo de entrada y salida

ENTRADA
rastreo: permitido · rutas bloqueadas: /admin/, /cart/
ajuste de IA: permitir búsqueda con IA, bloquear el resto
sitemap: https://example.com/sitemap.xml
SALIDA
User-agent: *
Disallow: /admin/
Disallow: /cart/

User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: Amazonbot
User-agent: CCBot
Disallow: /

Sitemap: https://example.com/sitemap.xml

Quién lo usa

  • Dueño de un sitio

    Mantenerse en los resultados de búsqueda con IA a la vez que se excluye del entrenamiento de modelos.

  • Especialista en SEO

    Mantener a los rastreadores fuera del carrito, la búsqueda interna y las páginas de administración sin bloquear el resto del sitio.

  • Desarrollador web

    Crear un archivo que bloquee todo para un sitio de pruebas.

Preguntas frecuentes

¿Dónde pongo robots.txt?

En la raíz de tu dominio, por ejemplo https://example.com/robots.txt. Cada subdominio necesita su propio archivo.

¿Bloquear una página en robots.txt la elimina de Google?

No. robots.txt controla el rastreo, no la indexación. Una URL bloqueada puede seguir apareciendo en los resultados si otras páginas enlazan a ella; usa noindex o protección con contraseña para mantener una página fuera.

¿Qué rastreadores de IA puedo controlar?

Los tokens de rastreador que documentan OpenAI, Anthropic, Perplexity, Google, Apple, Meta y Amazon, además de CCBot, el rastreador de un archivo web abierto. Los operadores añaden y retiran tokens, así que la lista se revisa con regularidad; la fecha se muestra debajo.

¿Por qué los rastreadores de IA permitidos no tienen su propio grupo?

Un rastreador con su propio grupo ignora las reglas para todos los rastreadores (User-agent: *). Dejar fuera a los rastreadores permitidos mantiene también en vigor tus rutas bloqueadas para ellos.

¿Google tiene en cuenta Crawl-delay?

No, Google lo ignora. Bing sí lo tiene en cuenta.