Un problème de budget de crawl se prouve en croisant trois éléments : le périmètre réel du catalogue, les requêtes Googlebot dans les journaux serveur et le statut « Découverte – non indexée » dans Search Console. Tant que ces signaux ne convergent pas, réduire le nombre d’URLs revient à traiter une hypothèse, pas un diagnostic. La documentation Google décrit d’ailleurs ce chantier comme destiné principalement aux très grands sites ou à ceux dont une large part des URLs reste non explorée.

Pourquoi la réduction du budget de crawl est souvent un faux remède

Google définit le budget de crawl comme la répartition des ressources d’exploration allouées à un site, déterminée par deux éléments : la capacité de crawl et la demande de crawl. Deux forces le composent : la capacité de crawl, c’est-à-dire les ressources que l’infrastructure alloue à un hôte, et la demande de crawl, c’est-à-dire l’intérêt perçu pour les pages. Un hôte est ici un nom d’hôte unique : www.exemple.fr et code.exemple.fr ont des budgets séparés (documentation Google).

Conséquence pratique : si la demande est faible parce que les pages sont peu utiles ou mal liées, réduire encore le nombre d’URLs ne fera pas grimper l’exploration des pages importantes. Et si la capacité n’est pas saturée, le problème n’est pas un plafond de ressources mais un problème de priorité ou de qualité.

Qui est réellement concerné par cette question ?

La même documentation cible trois profils : les sites d’au moins un million de pages uniques dont le contenu change modérément, les sites d’au moins dix mille pages uniques au contenu quotidien, et les sites dont une large part des URLs est classée « Découverte – non indexée » dans Search Console. Ces seuils sont indicatifs, pas des règles exactes.

Pour un catalogue de taille moyenne en France, en Belgique francophone ou en Suisse, la bonne réaction est souvent de vérifier la qualité du catalogue et la structure de liens avant de parler de budget de crawl.

Comment prouver un problème de budget de crawl sur un grand catalogue ?

La preuve se construit en trois couches, dans cet ordre.

1. Délimiter le périmètre réel

Comptez les URLs uniques par type : fiches produits, variantes, pages de filtres, pages de recherche interne, pagination, pages de catégories vides. Un catalogue qui affiche 50 000 produits peut exposer plusieurs millions d’URLs si chaque combinaison de filtres est explorable. C’est ce périmètre, et non le nombre de produits, qui pèse sur l’exploration.

2. Lire les journaux serveur

Filtrez les requêtes dont l’agent utilisateur correspond à Googlebot. Mesurez, sur une fenêtre d’au moins deux semaines :

  • le nombre de requêtes par jour et par type d’URL ;
  • la part des requêtes qui touchent des URLs sans valeur (filtres, recherche interne, paramètres) ;
  • le délai entre la publication d’une page et sa première visite Googlebot ;
  • les codes de réponse renvoyés, notamment les redirections en chaîne et les erreurs.

Un catalogue sain montre une exploration concentrée sur les fiches et catégories utiles, avec un délai de découverte court pour les nouveautés. Un catalogue en difficulté montre l’inverse : beaucoup de requêtes sur des URLs secondaires et une découverte lente des pages stratégiques.

3. Croiser avec Search Console

Le rapport sur l’indexation des pages indique les motifs d’exclusion. La mention « Découverte – non indexée » signale que Google connaît l’URL mais ne l’a pas encore explorée. Une proportion élevée sur des pages importantes est un signal fort. À l’inverse, « Explorée – non indexée » renvoie plutôt à un problème de qualité ou de duplication, pas de budget.

Exemple hypothétique de diagnostic

Imaginons un distributeur européen de pièces techniques avec 120 000 références et 1,8 million d’URLs uniques, dont 70 % proviennent de filtres à paramètres. Sur deux semaines, les journaux montrent que 60 % des requêtes Googlebot visent ces filtres, tandis que les nouvelles fiches produits attendent en moyenne trois semaines avant leur première exploration. Dans Search Console, 40 % des fiches récentes sont en « Découverte – non indexée ».

Ici, la réduction du budget de crawl n’est pas le premier levier : le problème est que des URLs secondaires consomment l’exploration. La première action consiste à rendre les filtres non explorables ou à les consolider, puis à vérifier si le délai de découverte des fiches diminue. Les chiffres de cet exemple sont illustratifs et ne proviennent d’aucune mesure réelle.

Tableau de décision : réduire ou corriger ?

Signal observé Interprétation probable Première action
Beaucoup de requêtes sur filtres et recherche interne Capacité gaspillée Bloquer ou consolider ces URLs
Nouvelles pages explorées en quelques jours Budget non saturé Ne pas réduire, travailler la qualité
« Découverte – non indexée » élevé sur pages stratégiques File d’attente réelle Prioriser les liens internes vers ces pages
« Explorée – non indexée » dominant Problème de contenu ou de duplication Auditer la valeur des pages
Peu de requêtes Googlebot au total Capacité ou demande faible Vérifier l’accessibilité et les liens

Ce que la réduction du budget de crawl ne règle pas

Réduire le nombre d’URLs exposées ne crée pas de demande pour les pages restantes. Google précise aussi que robots.txt sert à bloquer des pages ou ressources que vous ne voulez pas voir explorer du tout, et non à réaffecter temporairement le budget vers d’autres pages (documentation Google).

Autrement dit, si vous bloquez des filtres uniquement pour « libérer » du budget, vous prenez une décision durable pour un objectif conjoncturel. La vérification à faire est simple : après un changement, comparez sur deux semaines le délai de découverte des pages stratégiques et la part des requêtes qui les visent. Sans amélioration mesurable, le changement n’a pas produit l’effet attendu.

Méthode de vérification réutilisable

  1. Listez les types d’URLs et leur volume respectif.
  2. Extrayez deux semaines de journaux Googlebot et classez les requêtes par type.
  3. Relevez le délai médian entre publication et première exploration.
  4. Relevez les motifs d’exclusion dans Search Console.
  5. Identifiez les URLs secondaires qui captent l’exploration.
  6. Corrigez d’abord ces URLs, puis remesurez sur une fenêtre comparable.

Cette méthode évite de confondre un problème de budget avec un problème de qualité, de liens internes ou de duplication. Elle s’applique aussi bien à un catalogue français qu’à un site belge ou suisse, à condition d’adapter les seuils au volume réel.

Questions fréquentes

Faut-il réduire le budget de crawl dès qu’un grand catalogue a des pages non indexées ?

Non. Il faut d’abord distinguer « Découverte – non indexée » d’« Explorée – non indexée ». La première peut indiquer un problème d’exploration, la seconde renvoie plutôt à la qualité ou à la duplication. La réduction n’est pertinente que si les journaux confirment une exploration gaspillée sur des URLs secondaires.

Combien de temps faut-il observer avant de conclure ?

Deux semaines de journaux constituent un minimum raisonnable pour lisser les variations. Une fenêtre plus courte risque de confondre un pic ponctuel avec une tendance. Après un changement, remesurez sur une durée équivalente pour comparer.

Ce qu’il faut retenir

Un problème de budget de crawl se prouve, il ne se suppose pas. Le périmètre réel du catalogue, les journaux serveur Googlebot et les motifs d’exclusion dans Search Console forment le trio de preuve. Tant que ces signaux ne convergent pas vers une exploration gaspillée, réduire le nombre d’URLs expose à dégrader la couverture sans résoudre la cause. La démarche utile consiste à mesurer, corriger les URLs secondaires, puis vérifier l’effet sur les pages stratégiques.

SEARCH ENGINE TRENDS

À vous de transformer l'idée en action.

Tous les articles