Vai al contenuto

Generatore di robots.txt

Risposta breve

Crea un file robots.txt con percorsi bloccati, sitemap e una scelta per ogni crawler AI.

Gratuito · Senza registrazione · Funziona nel browser
Scansione

Inizia ogni percorso con /, ad es. /admin/ o /cart/. Usa * come carattere jolly e $ per indicare la fine di un URL.

Google ignora Crawl-delay; Bing lo legge.

Crawler AI

I crawler per la ricerca e le risposte AI decidono se le tue pagine possono essere mostrate o citate lì. I crawler per l'addestramento raccolgono pagine per l'addestramento dei modelli; bloccarli non rimuove il tuo sito dalla ricerca AI.

Ricerca e risposte AI
  • OAI-SearchBotOpenAI: indicizza le pagine perché la sua ricerca IA possa mostrarle e citarle.
  • ChatGPT-UserOpenAI: apre una pagina quando un utente chiede all'assistente di consultarla. Secondo il gestore, il robots.txt potrebbe non valere per queste richieste.
  • Claude-SearchBotAnthropic: indicizza le pagine perché la sua ricerca IA possa mostrarle e citarle.
  • Claude-UserAnthropic: apre una pagina quando un utente chiede all'assistente di consultarla.
  • PerplexityBotPerplexity: indicizza le pagine perché la sua ricerca IA possa mostrarle e citarle.
  • Perplexity-UserPerplexity: apre una pagina quando un utente chiede all'assistente di consultarla. Secondo il gestore, il robots.txt potrebbe non valere per queste richieste.
Addestramento modelli
  • GPTBotOpenAI: raccoglie pagine per addestrare modelli di IA.
  • ClaudeBotAnthropic: raccoglie pagine per addestrare modelli di IA.
  • CCBotCrawler di un archivio aperto del web; molti modelli di IA sono addestrati sul suo dataset pubblico.
Altri usi AI
  • Google-ExtendedGoogle: non è un crawler a sé — una regola che stabilisce se le pagine già scansionate possono essere usate per i suoi modelli di IA.
  • Applebot-ExtendedApple: non è un crawler a sé — una regola che stabilisce se le pagine già scansionate possono essere usate per i suoi modelli di IA.
  • meta-externalagentMeta: scansiona pagine per i propri prodotti; i contenuti possono essere usati anche per addestrare modelli di IA.
  • AmazonbotAmazon: scansiona pagine per i propri prodotti; i contenuti possono essere usati anche per addestrare modelli di IA.

Elenco dei crawler AI controllato l'ultima volta il 17/09/2026.

Il tuo robots.txt

User-agent: *
Allow: /

Cosa consente il file sulla home page

  • GPTBotConsentito
  • OAI-SearchBotConsentito
  • ChatGPT-UserConsentito
  • ClaudeBotConsentito
  • Claude-SearchBotConsentito
  • Claude-UserConsentito
  • PerplexityBotConsentito
  • Perplexity-UserConsentito
  • Google-ExtendedConsentito
  • Applebot-ExtendedConsentito
  • meta-externalagentConsentito
  • AmazonbotConsentito
  • CCBotConsentito

Salva il file come robots.txt nella radice del tuo dominio (ad esempio https://example.com/robots.txt), poi testa il file live. Apri il controllo robots.txt

Il file viene creato nel tuo browser.

Cosa fa

Crea un file robots.txt con i percorsi da tenere fuori dalla portata dei crawler, righe di sitemap, un Crawl-delay opzionale, e una scelta di consenti o blocca per ogni crawler AI conosciuto, raggruppati in ricerca AI, addestramento modelli e altri usi AI. Poi rilegge il file e mostra cosa ogni crawler AI può recuperare.

Perché è importante

robots.txt indica ai crawler quali URL possono recuperare. Le aziende AI usano crawler separati per la ricerca, per recuperare una pagina che un utente chiede, e per l'addestramento dei modelli, così puoi restare visibile nella ricerca AI escludendoti dall'addestramento. Bloccare un crawler di addestramento come GPTBot non rimuove un sito dalla ricerca di ChatGPT. robots.txt è una richiesta, non un controllo degli accessi, e alcuni sistemi che agiscono per conto di un utente dichiarano di poter non seguirlo.

Come funziona

  1. Scegli se consentire la scansione o bloccare l'intero sito

  2. Elenca i percorsi da tenere fuori dalla portata dei crawler e gli URL delle tue sitemap

  3. Consenti o blocca ogni crawler AI, oppure parti da un preset

  4. Copia o scarica il file, salvalo come /robots.txt e testa il file live con il controllo robots.txt

Esempio di input e output

INPUT
scansione: consentita · percorsi bloccati: /admin/, /cart/
preset AI: consenti ricerca AI, blocca il resto
sitemap: https://example.com/sitemap.xml
OUTPUT
User-agent: *
Disallow: /admin/
Disallow: /cart/

User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: Amazonbot
User-agent: CCBot
Disallow: /

Sitemap: https://example.com/sitemap.xml

Chi lo usa

  • Titolare del sito

    Resta nei risultati della ricerca AI escludendoti dall'addestramento dei modelli.

  • Specialista SEO

    Tieni i crawler fuori dal carrello, dalla ricerca interna e dalle pagine di amministrazione senza bloccare il resto del sito.

  • Sviluppatore web

    Crea un file che blocca tutto per un sito di staging.

Domande frequenti

Dove metto robots.txt?

Nella radice del tuo dominio, ad esempio https://example.com/robots.txt. Ogni sottodominio ha bisogno del proprio file.

Bloccare una pagina in robots.txt la rimuove da Google?

No. robots.txt controlla la scansione, non l'indicizzazione. Un URL bloccato può comunque comparire nei risultati se altre pagine lo collegano; usa noindex o la protezione con password per tenere fuori una pagina.

Quali crawler AI posso controllare?

I token dei crawler documentati da OpenAI, Anthropic, Perplexity, Google, Apple, Meta e Amazon, oltre a CCBot, il crawler di un archivio web aperto. Gli operatori aggiungono e ritirano token, quindi l'elenco viene controllato regolarmente; la data è mostrata sotto di esso.

Perché i crawler AI consentiti non hanno un proprio gruppo?

Un crawler con un proprio gruppo ignora le regole per tutti i crawler (User-agent: *). Lasciare fuori i crawler consentiti mantiene valide anche per loro le regole sui percorsi bloccati.

Google legge Crawl-delay?

No, Google lo ignora. Bing lo legge.