MACHINE 404 / Η απόφαση
Η απόφασηGPTBot, ClaudeBot, PerplexityBot: να τα επιτρέψω ή να τα μπλοκάρω;
Τα περισσότερα site δεν πήραν ποτέ αυτή την απόφαση, οπότε την πήρε γι' αυτά η σιωπή. Τι κάνει πραγματικά κάθε crawler, τι χάνετε σε κάθε περίπτωση, και η μία γραμμή συντακτικού στο robots.txt που ανοίγει σιωπηλά τα ιδιωτικά σας μονοπάτια ακριβώς στα bots που προσπαθούσατε να ελέγξετε.
Ποιος είναι στην πόρτα
Το GPTBot είναι ο crawler της OpenAI. Το OAI-SearchBot είναι αυτό που χτίζει ό,τι μπορεί να δείξει η αναζήτηση του ChatGPT. Το ChatGPT-User είναι ζωντανή ανάκτηση, τη στιγμή που κάποιος ρωτά για τη σελίδα σας. Τα ClaudeBot, Claude-Web και Claude-SearchBot είναι της Anthropic. Το PerplexityBot της Perplexity. Το CCBot είναι το Common Crawl, που τροφοδοτεί πολλά μοντέλα και όχι μία εταιρεία. Το Bytespider είναι της ByteDance.
Δεν είναι εναλλάξιμα, και αυτό έχει σημασία: το να μπλοκάρετε τον crawler που χτίζει το σύνολο εκπαίδευσης είναι άλλη απόφαση από το να μπλοκάρετε αυτόν που φέρνει τη σελίδα σας επειδή μόλις ρώτησε ένας πελάτης για εσάς.
🚨 Η παγίδα του robots.txt στην οποία πέφτουν σχεδόν όλοι
Μια ονομαστική ομάδα User-agent κάνει αυτόν τον crawler να αγνοήσει εντελώς την ομάδα με το αστεράκι. Άρα αν το αρχείο σας απαγορεύει τα admin μονοπάτια στο User-agent: * και μετά προσθέτετε από κάτω ένα ευγενικό User-agent: GPTBot / Allow: /, μόλις είπατε στο GPTBot ότι καμία από αυτές τις απαγορεύσεις δεν το αφορά. Κάθε Disallow πρέπει να επαναληφθεί μέσα στην ονομαστική ομάδα, αλλιώς το bot για το οποίο προσέχατε είναι το ένα bot με πλήρη πρόσβαση.
Το Google-Extended δεν είναι αυτό που νομίζουν οι περισσότεροι
Δεν είναι crawler. Είναι έλεγχος για το αν το περιεχόμενό σας χρησιμοποιείται για το Gemini και τη σχετική τεκμηρίωση. Το μπλοκάρισμά του δεν σας βγάζει από την αναζήτηση της Google και δεν σας βγάζει από τα AI Overviews, που χτίζονται πάνω στο κανονικό ευρετήριο. Ο κόσμος το μπλοκάρει πιστεύοντας ότι εξαιρείται από τις AI απαντήσεις της Google, και δεν εξαιρείται.
Άρα: επιτρέπω ή μπλοκάρω;
Αν πουλάτε κάτι και θέλετε να σας προτείνουν, επιτρέψτε, και επιτρέψτε συνειδητά ονομάζοντάς τα αντί για σιωπή. Η σιωπή δεν είναι απόφαση, απλώς αφήνει το αποτέλεσμα στις προεπιλογές κάποιου άλλου. Αν το περιεχόμενο είναι το προϊόν σας, ένα αρχείο, μια συνδρομητική βιβλιοθήκη, έρευνα, τότε ο υπολογισμός αλλάζει και το να μπλοκάρετε τα crawlers εκπαίδευσης επιτρέποντας τα ζωντανά είναι συνεπής θέση.
Και να ξέρετε τι είναι το robots.txt: παράκληση, όχι κλειδαριά. Το τηρούν οι εταιρείες που δημοσιεύουν τα ονόματα των crawlers τους και το αγνοεί ό,τι δεν το κάνει. Αν χρειάζεται να σταματήσετε κάτι, αυτό γίνεται στον διακομιστή, όχι σε ένα αρχείο κειμένου.
Κάτι ακόμα που δεν φαίνεται απ' έξω
Το robots.txt σας μπορεί να λέει καλώς ήρθατε ενώ ο host σας λέει όχι. Έχουμε μετρήσει site των οποίων το αρχείο προσκαλεί ονομαστικά ένα AI crawler και ο διακομιστής απαντά με άρνηση, που είναι το χειρότερο και από τα δύο: φαίνεστε ανοιχτοί και συμπεριφέρεστε κλειστά, και κανείς δεν σας το λέει. Η σάρωση ελέγχει το αρχείο και την πραγματική απάντηση, γιατί μόνο το ένα από τα δύο είναι η αλήθεια.
Δείτε πρώτα τον δικό σας αριθμό. Είναι δωρεάν.
Γράψτε τη διεύθυνσή σας και ο πίνακας γεμίζει με τα δικά σας δεδομένα, όπως τα διαβάζει ένας agent. Χωρίς email, χωρίς κλήση, περίπου δέκα δευτερόλεπτα.
Σάρωσε το site μου Δείτε τις τιμές