Google peut indexer les PDF, et le type de fichier est déterminé par l'en-tête HTTP Content-Type renvoyé au crawl, avec un repli possible sur l'extension. Un PDF ancien reste donc visible tant qu'il est accessible, indexable et lié. Le diagnostic consiste à inventorier les PDF, vérifier leurs en-têtes et leur indexation, puis décider entre mise à jour, remplacement, noindex ou suppression.

Pourquoi un catalogue PDF périmé reste-t-il dans Google ?

Un PDF n'est pas un cas particulier exotique : Google peut indexer le contenu de la plupart des fichiers texte et de certains formats encodés, dont l'Adobe Portable Document Format (.pdf), comme le documente la page officielle sur les types de fichiers indexables (Google Search Central). Le type est déterminé par l'en-tête HTTP Content-Type renvoyé lors du crawl ; si cet en-tête est absent ou incorrect, Google peut utiliser l'extension du fichier ou re-analyser le document avec un autre analyseur.

Deux conséquences pratiques en découlent pour un catalogue commercial :

  • Un PDF publié à l'adresse /catalogue-2024.pdf peut continuer à être exploré et indexé même si la page HTML qui le présentait a été refaite.
  • Un fichier mal servi, par exemple avec un Content-Type incohérent, peut être interprété différemment de ce que l'équipe attend.

Le document ne disparaît pas parce qu'il est « vieux ». Il disparaît quand il n'est plus accessible, plus indexable, ou quand une version plus récente le remplace dans les liens et les résultats.

Comment savoir si un PDF est encore indexé et affiché ?

La vérification se fait en trois temps, sans supposer que le référencement d'un PDF se comporte comme celui d'une page HTML.

  1. Inventaire. Listez les PDF réellement exposés : catalogue général, tarifs, fiches techniques, plaquettes. Les URL se repèrent dans le plan de site et les liens internes.
  2. Contrôle des en-têtes. Pour chaque URL, vérifiez le Content-Type renvoyé, le code de statut et la présence éventuelle d'un en-tête X-Robots-Tag. La spécification des robots meta et de X-Robots-Tag précise que ces directives ne sont lues et suivies que si les robots peuvent accéder aux pages qui les contiennent (Google Search Central). Un noindex posé sur un fichier bloqué par robots.txt n'a donc pas l'effet escompté.
  3. Contrôle de l'affichage. Recherchez le titre du document et une référence interne unique (numéro de référence, nom de gamme, année). Notez si le résultat pointe vers la version attendue ou vers une édition antérieure.

Un point de méthode : ne concluez pas à partir d'une seule requête. Un PDF peut apparaître sur des requêtes de marque, de référence ou de gamme sans être visible sur le terme générique. Le suivi doit être nominatif, document par document.

Exemple de suivi (hypothétique)

Prenons un cas fictif, uniquement illustratif. Une enseigne de matériel publie chaque année un catalogue PDF. En 2026, l'équipe constate que la recherche sur une référence de produit renvoie encore catalogue-2023.pdf. Le fichier est toujours en ligne, toujours lié depuis un ancien article de blog, et son en-tête Content-Type est correct. Aucun X-Robots-Tag n'est présent.

Le diagnostic ne consiste pas à « désindexer le PDF » par réflexe. Il faut d'abord vérifier si le document contient des informations commerciales encore valides (prix, disponibilité, garanties) ou s'il induit en erreur. Si le contenu est faux, la décision porte sur le remplacement par la version courante, la mise à jour du fichier à la même URL, ou le retrait. Si le contenu reste exact mais secondaire, un lien vers la version à jour peut suffire.

Faut-il supprimer, remplacer ou mettre à jour un PDF périmé ?

Le choix dépend de trois critères : l'exactitude commerciale, la valeur de recherche résiduelle et le coût de maintenance.

Situation Option raisonnable Vérification
Le PDF contient des prix ou des références encore valides Conserver, ajouter un lien vers la version à jour Le lien est-il visible et suivi ?
Le contenu est faux mais l'URL reçoit des visites Remplacer le fichier à la même URL, ou rediriger Le nouveau fichier est-il servi avec le bon Content-Type ?
Le contenu est faux et l'URL n'a plus d'utilité Retirer le fichier et les liens internes Le fichier renvoie-t-il un statut d'erreur ou une redirection ?
Le document doit rester accessible mais non indexé En-tête X-Robots-Tag noindex Le fichier est-il accessible aux robots ?

La dernière ligne mérite une précision : la spécification indique que les règles robots ne sont suivies que si les robots peuvent accéder aux pages concernées. Bloquer un PDF dans robots.txt tout en espérant un noindex est une combinaison contradictoire.

Comment organiser un suivi récurrent sans alourdir le processus ?

Un tableau de suivi suffit dans la plupart des cas. Pour chaque PDF : URL, titre, année, responsable, statut (à jour, à remplacer, à retirer), date de dernière vérification, et décision. Ce tableau doit être relié au cycle de publication commerciale, pas traité comme une tâche SEO isolée.

Trois règles simples réduisent les risques :

  • Nommer les fichiers avec une version lisible et éviter de réutiliser une URL pour un contenu radicalement différent sans redirection.
  • Vérifier les en-têtes après chaque mise en ligne, notamment le Content-Type.
  • Contrôler les liens internes : un ancien PDF reste souvent visible parce qu'un article ou une fiche produit pointe encore vers lui. La logique d'une fiche produit utile s'applique ici : mieux vaut renvoyer vers l'information exacte que vers un document daté.

Pour les marchés francophones, la question se pose surtout en France, en Belgique et en Suisse, où les catalogues PDF servent souvent de référence commerciale. Les obligations fiscales ou légales liées aux documents ne se transposent pas d'un pays à l'autre : le suivi SEO ne remplace pas une validation juridique locale.

Que faire quand un PDF périmé apparaît malgré tout ?

Si un ancien PDF continue d'apparaître, vérifiez dans l'ordre : l'accessibilité du fichier, son Content-Type, la présence d'un X-Robots-Tag, les liens internes qui pointent vers lui, et l'existence d'une version plus récente correctement liée. Si le document doit disparaître, le retrait du fichier et des liens est plus fiable qu'une simple demande de retrait. Si le document doit rester, la mise à jour du contenu est préférable à une désindexation qui priverait les utilisateurs d'une information utile.

Un dernier point de prudence : les effets d'un changement d'indexation ne sont pas instantanés. Comme pour toute modification d'index, il faut suivre les effets sans conclusion hâtive et comparer document par document avant de généraliser.

Questions fréquentes

Un PDF peut-il être désindexé avec une balise meta robots ?

Une balise meta robots s'insère dans le HTML. Pour un PDF, la directive équivalente passe par l'en-tête HTTP X-Robots-Tag. La spécification de Google précise que ces règles ne sont suivies que si les robots peuvent accéder au fichier.

Pourquoi un ancien catalogue apparaît-il encore alors qu'il n'est plus lié ?

Un fichier peut rester indexé un certain temps après la suppression des liens, et il peut aussi être découvert par d'autres chemins. La vérification porte sur l'accessibilité réelle du fichier et sur les liens résiduels, pas seulement sur la page d'accueil.

Faut-il supprimer tous les anciens catalogues PDF ?

Non. Un document exact et utile peut rester en ligne. La décision dépend de l'exactitude commerciale, de la valeur pour l'utilisateur et du risque d'information trompeuse.

SEARCH ENGINE TRENDS

À vous de transformer l'idée en action.

Tous les articles