# Verifica e validatore robots.txt

https://rankproof.eu/it/tools/seo-robots-txt

## Risposta breve

Controlla il tuo robots.txt: le regole, la riga della sitemap, se una pagina può essere scansionata e quali crawler di IA possono leggerla.

## Cosa fa

Recupera il tuo `/robots.txt` e analizza ogni direttiva — gruppi User-agent, regole Allow/Disallow, Sitemap e Crawl-delay. Controlla se l'URL che hai inserito è consentito, usando la stessa precedenza per corrispondenza più lunga usata dai crawler reali, e segnala un `Disallow: /` generale, una direttiva sitemap mancante e un file di dimensioni eccessive. Elenca inoltre i principali crawler e token di controllo AI, mostra se ciascuno può recuperare quell'URL e spiega a cosa serve ognuno: addestrare modelli AI, risposte di ricerca AI, o aprire una pagina quando un utente lo chiede.

## Come funziona

1. Inserisci l'URL che vuoi testare
2. Recuperiamo `/robots.txt` e analizziamo ogni direttiva
3. Controlliamo se quell'URL è consentito per i crawler in generale e per ogni crawler AI, usando le regole di precedenza usate dai crawler reali
4. Segnaliamo un blocco dell'intero sito, un URL bloccato e una direttiva sitemap mancante, e spieghiamo ogni crawler AI

## Esempio di input e output

INPUT

```text
url: https://rankproof.eu/tools
```

OUTPUT

```text
https://rankproof.eu/robots.txt: 200 OK
dimensione file: 412 B · gruppi user-agent: 2 · crawl-delay: non impostato
questa pagina è scansionabile               OK
direttiva sitemap presente                  OK

Crawler AI — tutti possono leggere questa pagina:
  GPTBot            Allowed   OpenAI: raccoglie pagine per addestrare modelli AI.
  OAI-SearchBot     Allowed   OpenAI: indicizza le pagine così la sua ricerca AI può mostrarle e citarle.
  ChatGPT-User      Allowed   OpenAI: apre una pagina quando un utente chiede all'assistente al riguardo.
  Google-Extended   Allowed   Google: non è un crawler separato — è una regola per l'uso AI delle pagine che esegue già la scansione.
  …
```

## Perché è importante

Un solo `Disallow: /` fuori posto può impedire ai motori di ricerca di eseguire la scansione di un intero sito, ed è facile pubblicarlo per errore da una configurazione di staging. I crawler AI aggiungono una seconda domanda: bloccare un crawler di addestramento non ti rimuove dalle risposte di ricerca AI, ma bloccare un crawler di ricerca sì — quindi conviene sapere cosa fa ogni token.

## Chi lo usa

- **SEO tecnico**: Prima del lancio, controlla il robots.txt di produzione così una regola "blocca tutto" di staging non va mai in produzione.
- **Titolare del sito**: Decidi quali crawler AI consentire: mantieni aperti i crawler di ricerca AI mentre scegli se le tue pagine possono addestrare modelli AI.
- **Content manager**: Quando una sezione scompare da Google Search Console, controlla prima se robots.txt la blocca.

## Domande frequenti

### Cos'è robots.txt?

Un file di testo semplice alla radice del tuo dominio che dice ai crawler quali URL possono o non possono richiedere. È standardizzato nella RFC 9309 (2022).

### Posso bloccare i crawler AI separatamente?

Sì — ognuno ha il proprio token user-agent, come `GPTBot` o `ClaudeBot`. Diverse aziende AI gestiscono crawler separati per l'addestramento dei modelli e per la ricerca, così puoi bloccare l'addestramento restando visibile nelle loro risposte di ricerca AI.

### Cos'è Google-Extended?

Un token di controllo, non un crawler separato. Google esegue comunque la scansione con i suoi crawler abituali; disabilitare `Google-Extended` dice a Google di non usare i tuoi contenuti per addestrare i modelli Gemini o per basare le risposte nelle app Gemini. Non influisce su Google Search né sul posizionamento.

### Tutti i crawler AI rispettano robots.txt?

Le principali aziende AI dicono che i loro crawler lo fanno. Alcuni fetcher che agiscono su richiesta di un utente, come ChatGPT-User e Perplexity-User, potrebbero non applicare le regole di robots.txt, e il report li segnala.

### Qual è la differenza tra robots.txt e noindex?

robots.txt impedisce la scansione. `noindex` consente la scansione ma impedisce l'indicizzazione. Se blocchi una pagina in robots.txt, Google non può vedere il suo tag noindex — un errore comune.

### Dovrei includere una direttiva sitemap?

Sì — `Sitemap: https://example.com/sitemap.xml` aiuta ogni crawler a trovare la tua sitemap, inclusi Bing e altri motori di ricerca.

### Google rispetta sempre robots.txt?

Per la scansione, sì. Ma un URL bloccato può comunque comparire nei risultati di ricerca se altre pagine lo collegano — senza uno snippet. Usa noindex per tenere fuori una pagina.

## Strumenti correlati in Analisi SEO

- [Verificatore di title e meta description](https://rankproof.eu/it/tools/seo-meta-title)
- [Controllo tag di intestazione](https://rankproof.eu/it/tools/seo-heading-tags)
- [Verificatore Alt Text Immagini](https://rankproof.eu/it/tools/seo-image-alt)
- [Verificatore URL Canonical](https://rankproof.eu/it/tools/seo-canonical-url)
- [Generatore di Robots.txt](https://rankproof.eu/it/tools/seo-robots-txt-generator)
- [Verifica Sitemap](https://rankproof.eu/it/tools/seo-sitemap)
