Parseur + simulateur robots (RFC 9309) : le verdict d'un vrai crawler, avant de publier
Agent SEO Parseur + simulateur robots (RFC 9309) est une fonctionnalité du module SEO technique & Agent SEO de Clustraly. Le simulateur robots RFC 9309 de l'Agent SEO Clustraly lit votre robots.txt comme un vrai crawler et rend un verdict autorisé ou bloqué fidèle à la norme.
Le moteur de décision de l'Agent SEO applique la RFC 9309 à la lettre : groupes fusionnés, correspondance la plus longue, wildcards * et $. Vous voyez la règle qui tranche ; vous décidez ce que vous publiez.
Sachez si Googlebot ou GPTBot passe, avant de publier
Vous demandez « ce robot peut-il crawler cette URL ? » et le simulateur répond autorisé ou bloqué, exactement comme le ferait un crawler conforme. Fini la lecture à l'œil d'un robots.txt : vous obtenez le verdict et la règle qui l'a décidé.
- Verdict autorisé ou bloqué, par URL et par bot
- Règle décisive et groupe user-agent affichés
- Évalué contre le robots.txt réellement publié
Un parseur qui lit vos groupes comme la norme l'exige
Le parseur reconnaît les groupes et les wildcards * et $, et ignore les commentaires sans jamais casser l'état d'un groupe. Il sélectionne le jeton user-agent le plus long qui vous cible — sinon le groupe * — puis fusionne tous les groupes partageant ce jeton, comme l'impose la RFC 9309 §2.2.1.
- Groupes et wildcards * et $ pris en charge
- Commentaires ignorés sans perdre le fil du groupe
- Fusion des groupes d'un même user-agent (§2.2.1)
La règle la plus précise gagne, comme chez les vrais crawlers
Le verdict suit la correspondance la plus longue : la règle la plus spécifique tranche. À longueur égale, Allow l'emporte sur Disallow, et un « Disallow: » vide autorise tout. C'est la mécanique que les moteurs appliquent, reproduite fidèlement, sans interprétation maison.
- Correspondance la plus longue = règle décisive
- Égalité : Allow prime sur Disallow
- « Disallow: » vide = tout autorisé
Un motif piégé ne laissera jamais passer un blocage réel
Chaque motif est compilé en expression régulière : * devient n'importe quoi, $ ancre la fin. Si le moteur d'expressions échoue sur un motif à backtracking, la réponse est traitée comme bloquée, jamais autorisée par défaut. Le doute penche toujours du côté sûr : vous ne publiez pas une porte ouverte par accident.
- * et $ compilés en regex fidèle
- Échec d'analyse = bloqué (fail-closed)
- Jamais de fail-open sur un motif douteux
Le même verdict au test, à l'audit et à la publication
Ce moteur de décision alimente le testeur URL × Bot et l'auditeur de régression : la même logique juge l'URL isolée que vous saisissez et la grille d'URLs réelles rejouée avant chaque publication. Aucun écart entre ce que vous testez et ce que le serveur contrôle.
- Testeur URL × Bot et auditeur sur le même moteur
- Verdict identique en test et à la publication
- Audit rejoué côté serveur avant tout envoi
Le simulateur montre, vous décidez
Le simulateur ne publie rien : il vous montre, robot par robot, ce qu'un crawler conforme lirait dans votre robots.txt. La règle décisive est sous vos yeux ; la décision de publier reste la vôtre.
Questions fréquentes
Qu'est-ce que la RFC 9309 et pourquoi la respecter ?
Le simulateur teste-t-il mon fichier publié ou un brouillon ?
Que se passe-t-il si un motif du robots.txt est mal formé ?
Quels robots puis-je simuler ?
Publiez un robots.txt dont vous connaissez déjà chaque verdict
Avec le parseur + simulateur robots (RFC 9309), vous ne devinez plus comment un crawler lira vos règles : vous le voyez. Chaque URL, chaque robot, la règle qui tranche et un moteur qui penche vers le blocage au moindre doute. L'Agent SEO propose, vous validez en connaissance de cause.