Μετάβαση στο περιεχόμενο

Έλεγχος & επικύρωση robots.txt

Σύντομη απάντηση

Ελέγξτε το robots.txt σας: τους κανόνες, τη γραμμή sitemap, αν μια σελίδα επιτρέπεται να ανιχνευθεί και ποιοι AI crawlers μπορούν να τη διαβάσουν.

Δωρεάν · Χωρίς εγγραφή · Ανάκτηση από τον server μας
Ανακτούμε το URL από τον server μας για τον έλεγχο. Τα αποτελέσματα δεν αποθηκεύονται.

Τι Κάνει

Ανακτά το `/robots.txt` σας και αναλύει κάθε οδηγία — ομάδες User-agent, κανόνες Allow/Disallow, Sitemap και Crawl-delay. Ελέγχει αν το URL που εισαγάγατε επιτρέπεται, χρησιμοποιώντας την ίδια προτεραιότητα «μεγαλύτερου ταιριάσματος» που χρησιμοποιούν οι πραγματικοί crawlers, και επισημαίνει ένα γενικό `Disallow: /`, μια απούσα οδηγία sitemap και ένα υπερμεγέθες αρχείο. Παραθέτει επίσης τους κύριους crawlers τεχνητής νοημοσύνης και τα tokens ελέγχου, δείχνει αν καθένας μπορεί να ανακτήσει αυτό το URL και εξηγεί τον σκοπό καθενός: εκπαίδευση μοντέλων AI, απαντήσεις αναζήτησης AI ή άνοιγμα μιας σελίδας όταν το ζητά ένας χρήστης.

Γιατί Έχει Σημασία

Ένα μεμονωμένο αδέσποτο `Disallow: /` μπορεί να σταματήσει τις μηχανές αναζήτησης από το να ανιχνεύσουν ολόκληρο τον ιστότοπο, και είναι εύκολο να δημοσιευτεί κατά λάθος από μια ρύθμιση staging. Οι crawlers AI προσθέτουν ένα δεύτερο ερώτημα: ο αποκλεισμός ενός crawler εκπαίδευσης δεν σας αφαιρεί από τις απαντήσεις αναζήτησης AI, αλλά ο αποκλεισμός ενός crawler αναζήτησης μπορεί — οπότε αξίζει να γνωρίζετε ποιο token κάνει τι.

Πώς Λειτουργεί

  1. Εισαγάγετε το URL που θέλετε να ελέγξετε

  2. Ανακτούμε το `/robots.txt` και αναλύουμε κάθε οδηγία

  3. Ελέγχουμε αν αυτό το URL επιτρέπεται γενικά για crawlers και για κάθε crawler AI, χρησιμοποιώντας τους κανόνες προτεραιότητας που χρησιμοποιούν οι πραγματικοί crawlers

  4. Επισημαίνουμε πλήρη αποκλεισμό ολόκληρου του ιστότοπου, αποκλεισμένο URL και απούσα οδηγία sitemap, και εξηγούμε κάθε crawler AI

Δείγμα εισόδου + εξόδου

ΕΙΣΟΔΟΣ
url: https://rankproof.eu/tools
ΕΞΟΔΟΣ
https://rankproof.eu/robots.txt: 200 OK
μέγεθος αρχείου: 412 B · ομάδες user-agent: 2 · crawl-delay: μη ορισμένο
αυτή η σελίδα είναι ανιχνεύσιμη            OK
οδηγία sitemap υπάρχει                     OK

Ανιχνευτές AI — όλοι μπορούν να διαβάσουν αυτή τη σελίδα:
  GPTBot            Επιτρέπεται OpenAI: συλλέγει σελίδες για την εκπαίδευση μοντέλων AI.
  OAI-SearchBot     Επιτρέπεται OpenAI: κάνει ευρετηρίαση σελίδων ώστε η αναζήτηση AI να μπορεί να τις εμφανίζει και να τις αναφέρει.
  ChatGPT-User      Επιτρέπεται OpenAI: ανοίγει μια σελίδα όταν ένας χρήστης ρωτά τον βοηθό σχετικά με αυτήν.
  Google-Extended   Επιτρέπεται Google: δεν είναι ξεχωριστός crawler — κανόνας για τη χρήση από AI των σελίδων που ανιχνεύει.
  …

Ποιοι το Χρησιμοποιούν

  • Τεχνικό SEO

    Πριν από την κυκλοφορία, ελέγξτε το robots.txt παραγωγής ώστε ένας κανόνας «αποκλεισμός όλων» από το staging να μην μπει ποτέ live.

  • Ιδιοκτήτης ιστότοπου

    Αποφασίστε ποιους crawlers AI θα επιτρέψετε: κρατήστε ανοιχτούς τους crawlers αναζήτησης AI ενώ επιλέγετε αν οι σελίδες σας μπορούν να εκπαιδεύσουν μοντέλα AI.

  • Υπεύθυνος περιεχομένου

    Όταν μια ενότητα εξαφανίζεται από το Google Search Console, ελέγξτε πρώτα αν το robots.txt την αποκλείει.

Συχνές Ερωτήσεις

Τι είναι το robots.txt;

Ένα απλό αρχείο κειμένου στη ρίζα του domain σας που λέει στους crawlers ποια URL μπορούν ή δεν μπορούν να ζητήσουν. Είναι τυποποιημένο στο RFC 9309 (2022).

Μπορώ να αποκλείσω crawlers AI ξεχωριστά;

Ναι — καθένας έχει το δικό του token user-agent, όπως `GPTBot` ή `ClaudeBot`. Αρκετές εταιρείες AI λειτουργούν ξεχωριστούς crawlers για εκπαίδευση μοντέλων και για αναζήτηση, οπότε μπορείτε να αποκλείσετε την εκπαίδευση παραμένοντας ορατοί στις απαντήσεις αναζήτησης AI τους.

Τι είναι το Google-Extended;

Ένα token ελέγχου, όχι ξεχωριστός crawler. Η Google ανιχνεύει με τους συνηθισμένους crawlers της ούτως ή άλλως· η απενεργοποίηση του `Google-Extended` λέει στην Google να μη χρησιμοποιήσει το περιεχόμενό σας για εκπαίδευση μοντέλων Gemini ή για θεμελίωση απαντήσεων στις εφαρμογές Gemini. Δεν επηρεάζει την Αναζήτηση Google ούτε τις κατατάξεις.

Όλοι οι crawlers AI ακολουθούν το robots.txt;

Οι μεγάλες εταιρείες AI δηλώνουν ότι οι crawlers τους το κάνουν. Ορισμένοι fetchers που ενεργούν κατόπιν αιτήματος χρήστη, όπως οι ChatGPT-User και Perplexity-User, ενδέχεται να μην εφαρμόζουν τους κανόνες robots.txt, και η αναφορά τους επισημαίνει.

Ποια είναι η διαφορά μεταξύ robots.txt και noindex;

Το robots.txt αποτρέπει την ανίχνευση. Το `noindex` επιτρέπει την ανίχνευση αλλά αποτρέπει την ευρετηρίαση. Αν αποκλείσετε μια σελίδα στο robots.txt, η Google δεν μπορεί να δει την ετικέτα noindex της — ένα συνηθισμένο λάθος.

Πρέπει να συμπεριλάβω οδηγία sitemap;

Ναι — η `Sitemap: https://example.com/sitemap.xml` βοηθά κάθε crawler να βρει το sitemap σας, συμπεριλαμβανομένων του Bing και άλλων μηχανών αναζήτησης.

Η Google σέβεται πάντα το robots.txt;

Για την ανίχνευση, ναι. Ένα αποκλεισμένο URL μπορεί όμως να εμφανιστεί ακόμη στα αποτελέσματα αναζήτησης αν άλλες σελίδες συνδέονται σε αυτό — χωρίς απόσπασμα. Χρησιμοποιήστε noindex για να κρατήσετε μια σελίδα εκτός.