Verifica e validatore robots.txt
Risposta breve
Controlla il tuo robots.txt: le regole, la riga della sitemap, se una pagina può essere scansionata e quali crawler di IA possono leggerla.
Cosa fa
Recupera il tuo `/robots.txt` e analizza ogni direttiva — gruppi User-agent, regole Allow/Disallow, Sitemap e Crawl-delay. Controlla se l'URL che hai inserito è consentito, usando la stessa precedenza per corrispondenza più lunga usata dai crawler reali, e segnala un `Disallow: /` generale, una direttiva sitemap mancante e un file di dimensioni eccessive. Elenca inoltre i principali crawler e token di controllo AI, mostra se ciascuno può recuperare quell'URL e spiega a cosa serve ognuno: addestrare modelli AI, risposte di ricerca AI, o aprire una pagina quando un utente lo chiede.
Perché è importante
Un solo `Disallow: /` fuori posto può impedire ai motori di ricerca di eseguire la scansione di un intero sito, ed è facile pubblicarlo per errore da una configurazione di staging. I crawler AI aggiungono una seconda domanda: bloccare un crawler di addestramento non ti rimuove dalle risposte di ricerca AI, ma bloccare un crawler di ricerca sì — quindi conviene sapere cosa fa ogni token.
Come funziona
-
Inserisci l'URL che vuoi testare
-
Recuperiamo `/robots.txt` e analizziamo ogni direttiva
-
Controlliamo se quell'URL è consentito per i crawler in generale e per ogni crawler AI, usando le regole di precedenza usate dai crawler reali
-
Segnaliamo un blocco dell'intero sito, un URL bloccato e una direttiva sitemap mancante, e spieghiamo ogni crawler AI
Esempio di input e output
url: https://rankproof.eu/tools
https://rankproof.eu/robots.txt: 200 OK dimensione file: 412 B · gruppi user-agent: 2 · crawl-delay: non impostato questa pagina è scansionabile OK direttiva sitemap presente OK Crawler AI — tutti possono leggere questa pagina: GPTBot Allowed OpenAI: raccoglie pagine per addestrare modelli AI. OAI-SearchBot Allowed OpenAI: indicizza le pagine così la sua ricerca AI può mostrarle e citarle. ChatGPT-User Allowed OpenAI: apre una pagina quando un utente chiede all'assistente al riguardo. Google-Extended Allowed Google: non è un crawler separato — è una regola per l'uso AI delle pagine che esegue già la scansione. …
Chi lo usa
-
SEO tecnico
Prima del lancio, controlla il robots.txt di produzione così una regola "blocca tutto" di staging non va mai in produzione.
-
Titolare del sito
Decidi quali crawler AI consentire: mantieni aperti i crawler di ricerca AI mentre scegli se le tue pagine possono addestrare modelli AI.
-
Content manager
Quando una sezione scompare da Google Search Console, controlla prima se robots.txt la blocca.
Domande frequenti
Cos'è robots.txt?
Un file di testo semplice alla radice del tuo dominio che dice ai crawler quali URL possono o non possono richiedere. È standardizzato nella RFC 9309 (2022).
Posso bloccare i crawler AI separatamente?
Sì — ognuno ha il proprio token user-agent, come `GPTBot` o `ClaudeBot`. Diverse aziende AI gestiscono crawler separati per l'addestramento dei modelli e per la ricerca, così puoi bloccare l'addestramento restando visibile nelle loro risposte di ricerca AI.
Cos'è Google-Extended?
Un token di controllo, non un crawler separato. Google esegue comunque la scansione con i suoi crawler abituali; disabilitare `Google-Extended` dice a Google di non usare i tuoi contenuti per addestrare i modelli Gemini o per basare le risposte nelle app Gemini. Non influisce su Google Search né sul posizionamento.
Tutti i crawler AI rispettano robots.txt?
Le principali aziende AI dicono che i loro crawler lo fanno. Alcuni fetcher che agiscono su richiesta di un utente, come ChatGPT-User e Perplexity-User, potrebbero non applicare le regole di robots.txt, e il report li segnala.
Qual è la differenza tra robots.txt e noindex?
robots.txt impedisce la scansione. `noindex` consente la scansione ma impedisce l'indicizzazione. Se blocchi una pagina in robots.txt, Google non può vedere il suo tag noindex — un errore comune.
Dovrei includere una direttiva sitemap?
Sì — `Sitemap: https://example.com/sitemap.xml` aiuta ogni crawler a trovare la tua sitemap, inclusi Bing e altri motori di ricerca.
Google rispetta sempre robots.txt?
Per la scansione, sì. Ma un URL bloccato può comunque comparire nei risultati di ricerca se altre pagine lo collegano — senza uno snippet. Usa noindex per tenere fuori una pagina.