Parce que robots.txt bloque l'exploration : Googlebot ne peut pas accéder à la page, ne lit donc jamais la balise ou l'en-tête noindex, et l'URL peut rester dans les résultats si d'autres pages la citent. Pour désindexer, il faut autoriser l'exploration de la page afin que le noindex soit lu, puis attendre le prochain passage du robot.

Pourquoi robots.txt et noindex ne font pas le même travail ?

Un fichier robots.txt indique aux robots d'exploration quelles URL ils peuvent atteindre sur un site. Sa fonction première est de gérer la charge serveur et d'éviter l'exploration de pages sans intérêt, pas de retirer une page des résultats de recherche (documentation Google, Introduction to robots.txt).

Le noindex fonctionne différemment : c'est une règle transmise soit par une balise <meta name="robots" content="noindex"> dans le <head>, soit par un en-tête HTTP. Quand Googlebot explore la page et rencontre cette règle, Google retire l'URL des résultats, même si d'autres sites la lient (documentation Google, Block Search indexing with noindex).

La différence tient donc à un point de passage : le noindex doit être lu par le robot. Si robots.txt empêche l'accès à la page, la règle noindex n'est jamais lue. Google peut alors conserver l'URL dans ses résultats si des liens externes pointent vers elle.

Que se passe-t-il concrètement quand une URL est bloquée ?

Prenons un exemple hypothétique, purement illustratif. Une boutique en ligne suisse francophone décide de retirer une ancienne page de catégorie promotionnelle. L'équipe ajoute Disallow: /promo-2024/ dans robots.txt et place en parallèle une balise noindex dans le code de la page. Six semaines plus tard, l'URL apparaît toujours dans les résultats.

Le scénario est cohérent avec le mécanisme documenté : le robot ne peut pas explorer /promo-2024/, donc il ne voit pas le noindex. L'URL peut rester indexée parce que d'autres pages la citent avec un texte descriptif. Le noindex, lui, n'a jamais eu l'occasion d'agir.

Ce cas illustre une confusion fréquente : robots.txt contrôle l'accès, noindex contrôle l'indexation. Les deux règles ne se cumulent pas dans le sens attendu ; elles se neutralisent quand robots.txt passe en premier.

Comment diagnostiquer une désindexation qui ne se produit pas ?

La méthode tient en quatre vérifications successives, sans outil propriétaire ni accès serveur obligatoire.

  1. Vérifier la règle robots.txt applicable. Consultez le fichier à la racine du domaine et identifiez la directive qui couvre l'URL concernée. Une règle Disallow sur un dossier parent suffit à bloquer toutes les URL qu'il contient.
  2. Confirmer l'accessibilité de la page. Si la page est bloquée, le robot ne peut pas la lire. Testez avec l'inspection d'URL dans la Search Console : l'outil indique si l'exploration est autorisée ou bloquée par robots.txt.
  3. Contrôler la présence effective du noindex. Une fois l'exploration autorisée, vérifiez que la balise ou l'en-tête est bien présent dans la réponse HTML, et non injecté côté client après chargement.
  4. Observer le délai. La désindexation n'est pas instantanée : elle dépend du prochain passage du robot et du traitement de la règle. Un délai de plusieurs semaines est normal.

Si la page reste indexée après ces étapes, il faut aussi vérifier qu'aucune autre URL ne reprend le même contenu, et que le noindex n'est pas contredit par une directive plus permissive ailleurs.

Quelles erreurs de configuration faut-il éviter ?

Situation Effet probable Action recommandée
robots.txt bloque + noindex présent Le noindex n'est jamais lu, l'URL peut rester indexée Retirer le blocage robots.txt, conserver le noindex
robots.txt bloque seul L'URL peut rester indexée sans description Ajouter un noindex après avoir autorisé l'exploration
noindex seul, page accessible La désindexation peut aboutir au prochain passage Vérifier la présence effective de la balise ou de l'en-tête
noindex injecté en JavaScript Le robot peut ne pas le voir immédiatement Servir la règle dans le HTML initial ou l'en-tête HTTP

Ce tableau ne remplace pas un test sur votre propre configuration : les moteurs autres que Google peuvent interpréter noindex différemment. Pour un site e-commerce, la question rejoint celle des facettes : quelles URL laisser explorer dépend de l'objectif d'indexation, pas seulement du volume de pages.

Pourquoi la portée géographique change-t-elle la donne ?

Les règles décrites ici proviennent de la documentation Google Search Central, qui s'applique aux résultats Google dans les marchés francophones (France, Belgique, Suisse) comme ailleurs. En revanche, les obligations légales de retrait de contenu, les règles fiscales ou les régimes de protection des données varient selon le pays : ne transposez pas une procédure américaine ou une obligation européenne à un autre contexte sans vérification locale.

Pour un site multirégional, la question de l'exploration se combine avec celle des fonctionnalités par pays. Si vous testez des variantes régionales, la méthode de vérification par région reste utile : résultats Google selon le pays rappelle que l'affichage peut différer sans que l'indexation change.

Que retenir pour agir sans casser l'exploration ?

La règle pratique est simple : pour désindexer une URL, autorisez son exploration et laissez le noindex faire son travail. Utilisez robots.txt pour économiser du budget d'exploration ou protéger des ressources, pas pour retirer une page des résultats. Vérifiez ensuite l'accessibilité, la présence de la règle et le délai de traitement. En cas de doute, l'inspection d'URL fournit un diagnostic plus fiable qu'une supposition.

SEARCH ENGINE TRENDS

À vous de transformer l'idée en action.

Tous les articles