Un protocole reproductible avec contrôle XML, trois horloges et observations réelles de notre publication.

Dans cet article
Un sitemap accepté signifie que Google a pu traiter ce fichier. Il ne certifie pas que chaque URL est explorée, indexée ou visible sur une requête. Pour diagnostiquer une page absente, il faut rapprocher quatre preuves : le fichier réellement publié, la dernière lecture enregistrée, l’état individuel dans l’index et la récupération actuelle de la page.
Ce guide propose un protocole reproductible pour un blog ou une boutique. Il complète notre guide sur robots.txt et noindex : ici, le problème est de séparer une ancienne observation Google d’une erreur encore présente en production.
Construire un relevé qui permet de décider
Prenez six URL représentatives : accueil, rubrique, article récent, article ancien, fiche produit et page anglaise. Pour un blog sans fiche produit, remplacez-la par une ressource utile. Ce nombre constitue un échantillon de diagnostic, pas une estimation du taux d’indexation du site.
Pour chacune, notez l’URL exacte, la date de publication, le code HTTP final, la canonical déclarée, la présence de noindex, la date de dernière exploration et le résultat du test en direct. Gardez les exports bruts privés : ils peuvent contenir des identifiants du compte ou des informations inutiles au lecteur.
| Observation | Ce qu’elle établit | Décision suivante |
|---|---|---|
| Sitemap récupéré en 200 | Le fichier est accessible depuis ce point de contrôle | Vérifier XML, URL et dates |
| Sitemap accepté dans Search Console | Google a traité la soumission | Comparer la dernière lecture au déploiement |
| Test en direct réussi | L’outil Google récupère la page maintenant | Examiner séparément l’état dans l’index |
| URL indiquée sur Google | L’inspection connaît une version indexée | Examiner les impressions et la période |
| Aucun clic | Aucune visite organique mesurée dans cette vue | Ne pas conclure automatiquement à une désindexation |
Vérifier le sitemap publié plutôt que sa copie locale
Téléchargez le fichier sur le domaine de production. Évitez de contrôler uniquement un dossier de build : le dernier déploiement peut avoir échoué ou viser un autre domaine.
curl --fail --silent --show-error https://example.com/sitemap.xml -o sitemap.xml
Ce script standard Python relève les URL et les doublons d’un sitemap de type urlset. Il ne traite pas un sitemap index : dans ce cas, contrôlez ses fichiers enfants.
import collections
import xml.etree.ElementTree as ET
root = ET.parse("sitemap.xml").getroot()
ns = {"s": "http://www.sitemaps.org/schemas/sitemap/0.9"}
if root.tag != "{http://www.sitemaps.org/schemas/sitemap/0.9}urlset":
raise SystemExit("Lire les sitemaps enfants de cet index.")
urls = [node.text for node in root.findall("s:url/s:loc", ns)]
counts = collections.Counter(urls)
print("URL:", len(urls))
print("Doublons:", [url for url, count in counts.items() if count > 1])
Comparez quelques URL avec leur canonical HTML et avec les liens de navigation. Une URL redirigée vers une autre langue ou un autre produit demande une correction de destination, pas une nouvelle soumission identique. Contrôlez aussi la réponse GET : un serveur peut répondre différemment à HEAD.
La documentation des sitemaps Google recommande les URL absolues destinées aux résultats et un lastmod correspondant à une modification significative. Changer toutes les dates à chaque build détruit l’information que le fichier devait fournir.
Relire les trois horloges
La date du déploiement, la dernière lecture du sitemap et la dernière exploration d’une page peuvent différer. Si votre lot de nouveaux articles est publié après la lecture affichée, le compteur découvert appartient à un état antérieur. Il ne prouve pas que les URL ajoutées ont été rejetées.
Exemple réellement observé sur Search Engine Trends le 3 octobre 2026 : le sitemap public contenait 547 URL. Search Console affichait une lecture du 2 octobre et 383 pages découvertes. Le rapport collectif d’indexation était encore en traitement. Ces chiffres ne donnent donc pas un taux fiable de rejet des nouvelles pages. L’accueil, les ressources anglaises et un article Q4 anglais étaient individuellement indiqués comme indexés lors du contrôle.
Ce relevé décrit ce site à cet instant ; il ne constitue pas un délai d’indexation promis pour une autre boutique. Il montre pourquoi un compteur de sitemap doit toujours être accompagné de sa date.
Lire correctement l’inspection individuelle
Ouvrez d’abord l’onglet correspondant à l’index Google et attendez la fin du chargement. Ensuite, lancez le test en direct pour une URL représentative. Relevez les lignes exploration autorisée, récupération réussie, indexation autorisée et canonical déclarée.
Le guide officiel de l’inspection distingue ces deux observations. Le test actuel ne détermine pas la canonical finalement retenue et ne vérifie pas toutes les conditions de qualité ou de sécurité. Une réussite technique rend la page récupérable ; elle ne produit pas un classement.
Si la récupération échoue, corrigez précisément DNS, certificat, réponse serveur ou règle robots selon le résultat. Si la récupération réussit mais que l’URL reste inconnue dans l’index, vérifiez ses liens entrants internes et sa présence dans le sitemap avant d’examiner la qualité du contenu. Ne modifiez pas l’URL au hasard : vous créeriez une seconde page encore à découvrir.
Transformer le diagnostic en suivi utile
Séparez éventuellement les articles FR, les articles EN et les pages utilitaires dans des sitemaps de diagnostic. Conservez une couverture complète et des équivalences de langue cohérentes. Ces fichiers servent à comparer des populations, pas à multiplier artificiellement les signaux.
Après correction, demandez une inspection des pages importantes une fois, puis notez la date. Des demandes répétées ne constituent pas une stratégie de contenu. Le prochain contrôle doit regarder si la dernière lecture avance, si l’échantillon est exploré et si les impressions apparaissent sur une période réellement disponible.
Pour choisir les prochaines pages à améliorer, distinguez enfin trois situations : aucune donnée d’indexation exploitable ; pages indexées sans impressions ; impressions présentes sans clics. Elles appellent respectivement un meilleur diagnostic, un travail de pertinence et de preuve, puis une analyse de la requête, du titre et de la promesse. Nos outils gratuits et ressources de contrôle peuvent soutenir ce travail ; ils ne remplacent pas les données de votre propriété.

