Indexée malgré le blocage du fichier robots.txt : que faire ?

Une page bloquée par le fichier robots.txt mais tout de même indexée par Google est un signal d’alerte technique : la directive Disallow ne contrôle que l’exploration, jamais l’indexation. Ce statut « Indexée malgré le blocage par le fichier robots.txt » apparaît dans Google Search Console lorsque Googlebot découvre l’URL par un autre canal que le crawl direct — typiquement un backlink externe, un lien interne non maîtrisé ou un sitemap. Voici la méthode exacte pour diagnostiquer, corriger et désindexer ces pages, plateforme par plateforme.
L’essentiel

robots.txtbloque le crawl, pas l’indexation : une page peut être indexée sans être explorée si elle reçoit des liens externes.- La seule solution fiable est la balise
meta noindexou l’en-tête HTTPX-Robots-Tag: noindex, jamaisrobots.txtseul. - Les liens internes pointant vers des pages bloquées annulent votre directive : supprimez-les ou ajoutez
rel="nofollow". - L’outil de suppression d’URL dans Google Search Console est une mesure temporaire, pas une solution définitive.
La méthode : distinguer blocage du crawl et blocage de l’indexation
La confusion entre Disallow et noindex est la cause racine de ce statut. Un fichier robots.txt avec User-agent: * et Disallow: /admin/ empêche Googlebot d’explorer la page, mais ne l’empêche pas de l’indexer si l’URL est découverte par un autre moyen. La balise meta noindex dans le <head> de la page est le seul signal qui interdit l’indexation après exploration.
| Directive | Effet sur le crawl | Effet sur l’indexation |
|---|---|---|
Disallow dans robots.txt | Bloque l’exploration de l’URL | Aucun — la page peut être indexée via backlinks |
meta name="robots" content="noindex" | Aucun — la page est explorée | Empêche l’indexation après exploration |
X-Robots-Tag: noindex (en-tête HTTP) | Aucun — la page est explorée | Empêche l’indexation, y compris pour les PDF et images |
rel="nofollow" sur un lien | Empêche le suivi du lien par Googlebot | Aucun — la page peut être indexée via d’autres liens |
Votre site présente l’un de ces symptômes ? Demandez un diagnostic complet pour identifier toutes les URL concernées.
Les causes d’indexation malgré le blocage robots.txt
Google indexe une page bloquée par robots.txt lorsque l’URL est découverte par un canal alternatif au crawl direct. Les causes sont identifiables et corrigeables.
- Backlinks externes : un lien depuis un autre site vers l’URL bloquée permet à Google de l’indexer sans jamais l’explorer.
- Liens internes non maîtrisés : un lien depuis une page de votre site vers une URL bloquée annule votre directive
Disallow. - Sitemap XML : si l’URL bloquée est listée dans votre sitemap, Google peut tenter de l’explorer et l’indexer malgré le blocage.
- Ressources non-HTML : les PDF, images et vidéos bloqués par
robots.txtsont indexés via l’en-tête HTTP, pas via la balise meta. - JavaScript rendu : Googlebot exécute le JavaScript et peut découvrir des URL générées dynamiquement, même si elles sont bloquées dans
robots.txt.
La prestation : diagnostic et correction du statut « Indexée malgré le blocage »
La résolution suit un protocole précis : identification des URL concernées, analyse des canaux de découverte, puis application de la directive noindex adaptée au type de contenu. Voici le détail de la méthode.
| Mission | Description | Importance |
|---|---|---|
| Audit Google Search Console | Extraction du rapport « Pages » et filtrage du statut « Indexée malgré le blocage par le fichier robots.txt » | Identifie l’ampleur exacte du problème |
| Analyse des canaux de découverte | Vérification des backlinks externes, liens internes et sitemap pointant vers les URL bloquées | Détermine la cause racine de l’indexation |
| Application de la directive noindex | Ajout de meta noindex pour HTML, X-Robots-Tag pour PDF/images, ou suppression des URL du sitemap | Empêche l’indexation future |
| Nettoyage des liens internes | Suppression ou ajout de rel="nofollow" sur les liens internes pointant vers les pages bloquées | Élimine le canal de découverte interne |
| Demande de désindexation | Utilisation de l’outil de suppression d’URL dans Google Search Console pour les URL déjà indexées | Accélère la sortie de l’index |
| Vérification post-correction | Contrôle du statut dans GSC après 2 à 4 semaines | Confirme la désindexation effective |
Procédure de désindexation : robots.txt + noindex combinés
La combinaison robots.txt + noindex est la seule méthode fiable pour désindexer une page. Le robots.txt bloque le crawl, le noindex empêche l’indexation si la page est découverte par un autre canal.
- Étape 1 : Identifiez les URL concernées via le rapport « Pages » de Google Search Console, filtre « Indexée malgré le blocage par le fichier robots.txt ».
- Étape 2 : Retirez la directive
Disallowdurobots.txtpour ces URL spécifiques, afin de permettre à Googlebot de lire la balisenoindex. - Étape 3 : Ajoutez
<meta name="robots" content="noindex, nofollow">dans le<head>de chaque page HTML concernée. - Étape 4 : Pour les PDF et images, configurez l’en-tête HTTP
X-Robots-Tag: noindexsur le serveur. - Étape 5 : Supprimez ces URL de votre sitemap XML et ajoutez
rel="nofollow"sur les liens internes qui y pointent. - Étape 6 : Soumettez les URL à l’outil de suppression d’URL de Google Search Console pour accélérer la désindexation.
Correction par plateforme : WordPress, Joomla et autres CMS
Chaque CMS a ses spécificités pour appliquer la directive noindex. La méthode varie selon la génération des pages et la gestion des en-têtes HTTP.
| Plateforme | Méthode d’application | Point de vigilance |
|---|---|---|
| WordPress | Plugin SEO (Yoast, Rank Math) ou ajout manuel dans le header.php du thème | Vérifier que le plugin ne génère pas de conflit avec le robots.txt virtuel |
| Joomla | Paramètres globaux → Onglet « Métadonnées » → « Robots » → « noindex, nofollow » | Appliquer par article ou par catégorie, pas globalement |
| PrestaShop | Préférences → Trafic et SEO → « Meta robots » sur chaque fiche produit | Les pages de catégories héritent parfois de la config globale |
| Site statique (HTML) | Ajout manuel de la balise meta noindex dans chaque fichier | Attention aux templates inclus côté serveur (SSI, PHP includes) |
| PDF / images | Configuration du serveur (Apache, Nginx) pour envoyer X-Robots-Tag: noindex | La balise meta ne fonctionne pas sur les fichiers non-HTML |
Checklist : signaux qui doivent alerter
Certains signaux indiquent que votre robots.txt est mal configuré ou que des pages bloquées sont indexées. Vérifiez ces points lors de votre prochain audit.
- Statut « Indexée malgré le blocage par le fichier robots.txt » dans Google Search Console, rapport « Pages ».
- Pages sensibles (admin, panier, comptes utilisateurs) visibles dans les résultats de recherche avec l’opérateur
site:votresite.com. - Fichiers PDF ou images indexés alors qu’ils sont bloqués par
Disallowdansrobots.txt. - Liens internes vers des URL bloquées, détectés via un crawl avec un outil comme Screaming Frog.
- URL bloquées présentes dans votre sitemap XML soumis à Google Search Console.
- Augmentation soudaine du nombre de pages indexées après une modification du
robots.txt.
Bonnes pratiques pour la gestion du robots.txt et des directives d’indexation
La gestion du robots.txt et des directives d’indexation suit des règles simples. Elles évitent les conflits entre Disallow et noindex, et préviennent l’indexation de pages sensibles.
- N’utilisez jamais
robots.txtpour bloquer l’indexation de pages sensibles : utiliseznoindex. - Ne placez pas de directive
Disallowsur une page qui contient une balisenoindex: Googlebot ne pourra pas lire la balise. - Listez uniquement les URL réellement sensibles dans
robots.txt, pas les pages que vous souhaitez simplement déprioritiser. - Utilisez
X-Robots-Tag: noindexpour les fichiers non-HTML (PDF, images, vidéos) au lieu derobots.txt. - Auditez régulièrement votre
robots.txtet votre sitemap pour détecter les incohérences. - Supprimez les liens internes vers les pages bloquées ou ajoutez
rel="nofollow".
FAQ : Indexée malgré le blocage du fichier robots.txt
Pourquoi Google indexe-t-il une page bloquée par robots.txt ?
Google indexe une page bloquée par robots.txt lorsqu’il la découvre via un backlink externe, un lien interne ou un sitemap. Le fichier robots.txt bloque le crawl, pas l’indexation : Google peut ajouter l’URL à son index sans jamais l’explorer.
Quelle est la différence entre Disallow et noindex ?
Disallow dans robots.txt empêche Googlebot d’explorer l’URL. noindex (balise meta ou en-tête HTTP) empêche l’indexation après exploration. Pour désindexer une page, il faut noindex, pas Disallow.
Comment désindexer une page bloquée par robots.txt ?
Retirez la directive Disallow du robots.txt, ajoutez <meta name="robots" content="noindex"> dans le <head>, supprimez les liens internes et soumettez l’URL à l’outil de suppression d’URL de Google Search Console.
L’outil de suppression d’URL de Google Search Console est-il permanent ?
Non, la suppression est temporaire (environ 6 mois). Pour une désindexation définitive, appliquez noindex sur la page et supprimez les liens internes qui y pointent.
Comment vérifier si une page est indexée malgré le blocage ?
Utilisez le rapport « Pages » de Google Search Console et filtrez par statut « Indexée malgré le blocage par le fichier robots.txt ». Vous pouvez aussi utiliser l’opérateur site:votresite.com/url-bloquee dans Google.
À propos de l’auteur
José Perez est consultant SEO indépendant depuis 2007, fort de 17 ans d’expérience en référencement naturel. Il est l’auteur d’un livre de référence sur le SEO e-commerce. Il intervient sur les problématiques techniques d’indexation, de crawl et de migration pour des sites WordPress, PrestaShop et autres CMS. Son approche combine audit approfondi, correction des directives d’indexation et suivi des performances dans Google Search Console.
Questions fréquentes
Pourquoi Google indexe-t-il une page bloquée par robots.txt ?
Google peut indexer une page bloquée par robots.txt si elle est découverte via des liens externes ou internes, car robots.txt ne contrôle que l'exploration, pas l'indexation.
Quelle est la différence entre Disallow et noindex ?
Disallow dans robots.txt empêche l'exploration d'une page, tandis que la balise meta noindex ou l'en-tête HTTP X-Robots-Tag: noindex empêche son indexation, même si elle est explorée.
Comment désindexer une page bloquée par robots.txt ?
Pour désindexer une page bloquée par robots.txt, il faut utiliser la balise meta noindex ou l'en-tête HTTP X-Robots-Tag: noindex, puis demander une suppression via Google Search Console.
L'outil de suppression d'URL de Google Search Console est-il permanent ?
L'outil de suppression d'URL de Google Search Console est temporaire. Pour une désindexation permanente, il est essentiel d'implémenter une directive noindex sur la page concernée.
Comment vérifier si une page est indexée malgré le blocage ?
Vous pouvez vérifier l'indexation d'une page via l'outil d'inspection d'URL de Google Search Console, qui indiquera son statut d'indexation et les raisons d'un éventuel blocage.
Résultats vérifiables
La preuve par les chiffres
Voici l'évolution réelle du trafic organique de sites que j'accompagne, mesurée par Semrush. Pas de promesses : des courbes.
+1,2M
de visites organiques mensuelles générées
×3
de croissance sur un site déjà établi
0 €
de publicité : 100 % trafic organique
Captures Semrush disponibles sur demande, données anonymisées par respect de mes clients.
Analyse personnalisée, sans engagement, réponse sous 24/48h avec 3–5 quick wins concrets.
Déjà 150 entrepreneurs nous ont fait confiance
🔒 Vos données ne sont jamais partagées avec des tiers






