Auditeur robots.txt de l'Agent SEO : des règles dures et une matrice de régression qui verrouillent votre crawlabilité
Agent SEO Auditeur robots.txt (règles dures + matrice de régression) est une fonctionnalité du module SEO technique & Agent SEO de Clustraly. L'auditeur robots.txt applique des règles inviolables puis rejoue une matrice URL × bot sur vos vraies pages ; une seule erreur bloque la publication.
Chaque robots.txt proposé passe un audit à règles inviolables et une matrice de test sur vos vraies URLs face aux principaux crawlers. Si une page indispensable devient inaccessible ou qu'une zone privée fuit, rien n'est publié. L'IA propose, vous décidez.
Rien ne part en ligne si votre crawlabilité casse
Un robots.txt mal réglé peut fermer votre blog à Google ou ouvrir /admin aux robots. L'auditeur se place entre la proposition de l'agent et la mise en ligne : il valide le fichier exact, avant que vous ne décidiez.
Une seule erreur suffit à bloquer toute la proposition. Vous ne publiez jamais un robots.txt que l'audit n'a pas validé.
- Audit exécuté avant toute proposition et avant toute publication
- Une erreur bloque l'ensemble, pas de publication partielle
- Vous gardez la décision finale, l'agent ne publie rien seul
Six vérifications dures qui ne pardonnent aucune faute
L'audit exige au moins un groupe, un fichier sous 500 Ko, au moins une ligne Sitemap et toutes en URL absolue. Il refuse le blocage de la racine « / » pour un robot inconnu, tout chemin sensible listé, et toute règle qui bloquerait le paramètre lang= même déguisée en %-encoding, décodé avant contrôle.
- Racine « / » jamais fermée au groupe générique (User-agent: *)
- Sitemap présent et toujours en URL absolue http(s)
- Chemins sensibles et blocages de lang= refusés
- Taille bornée à 500 Ko, au moins un groupe valide
Vos vraies pages testées contre les crawlers qui comptent
L'auditeur ne teste pas des exemples théoriques : il croise de vraies URLs de votre site — accueil, blog, article récent, CSS du thème actif, image média, sitemap, llms.txt — avec les crawlers majeurs comme Googlebot, Bingbot, GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Twitterbot et AhrefsBot.
Les cas qui n'existent pas chez vous sont ignorés : catégorie et langue secondaire ne sont testées que si vous en avez. La matrice colle à votre site réel, pas à un site générique.
- URLs prélevées sur votre contenu et vos assets réels
- Huit crawlers majeurs : moteurs, IA, social et SEO
- Cas absents (catégorie, 2e langue) écartés automatiquement
Ni régression de crawl, ni fuite de zone privée
Deux fautes sont traquées. La régression : un robot indispensable ne peut plus atteindre une URL qui devait rester ouverte. La fuite : une adresse censée être fermée — /admin, /api, /search, une URL à paramètres utm_ — reste accessible.
Chaque URL porte une attente claire, autorisée ou bloquée, et le verdict est rendu par la même logique de décision que le testeur URL × Bot. Le moindre écart devient une erreur.
- Régression détectée : page utile devenue inaccessible
- Fuite détectée : /admin, /api, /search ou ?utm_ ouverts
- Même moteur de décision que le testeur URL × Bot
Audité à la proposition, ré-audité à la publication
Quand l'agent applique un ajustement autorisé, l'audit dur est rejoué ; s'il échoue, le brouillon déterministe et sûr est restauré. Au moment où vous cliquez pour publier, l'audit tourne à nouveau côté serveur, sur le contenu exact.
Cette frontière de confiance ne se contourne pas : un appel direct au serveur subit le même contrôle qu'un clic dans l'interface. Ce qui passe est vraiment sûr.
- Ajustement risqué : brouillon sûr restauré automatiquement
- Ré-audit côté serveur au moment du clic Publier
- Contrôle identique depuis l'UI ou depuis un POST direct
L'IA propose, l'audit tranche, vous décidez
L'Agent SEO compose un robots.txt déterministe et vous en explique chaque effet. L'auditeur, lui, ne négocie pas : il applique des règles dures et une matrice de régression sur vos vraies pages. Vous validez en connaissance de cause, jamais à l'aveugle.
Questions fréquentes
Que se passe-t-il si l'audit trouve une seule erreur ?
L'audit teste-t-il de vraies URLs de mon site ?
Puis-je contourner l'audit en publiant directement ?
Quelles fautes l'auditeur considère-t-il comme bloquantes ?
Publiez un robots.txt dont vous êtes sûr
Laissez l'Agent SEO composer, laissez l'auditeur vérifier, gardez la décision. Chaque robots.txt proposé passe des règles dures et une matrice de régression sur vos vraies pages avant d'arriver sous vos yeux. Vous validez ce qui protège votre référencement, vous écartez le reste.