Distinguer une permission robots, une requête simulée, une vraie visite et une citation avec des preuves séparées.

Écran d’analyse de données, illustration du suivi marketing
Photographie d’illustration. Crédits
Dans cet article
  1. Cartographier les robots par fonction
  2. Mettre à jour les sources IP de 2026
  3. Utiliser une IP réellement observée
  4. Traiter le pare-feu avec une règle limitée
  5. Séparer simulation, exploration et citation

Un robots.txt permissif et une réponse HTTP 200 ne suffisent pas à démontrer qu’un vrai robot IA a lu votre catalogue. Le fichier décrit une permission. Une requête envoyée depuis votre ordinateur mesure un accès depuis votre adresse IP. Pour vérifier une visite authentique, il faut confronter les journaux, l’adresse source et la plage officielle du fournisseur.

Cette distinction évite deux erreurs coûteuses : ouvrir le pare-feu à toute personne qui écrit un nom de robot dans son User-Agent, ou présenter un test simulé comme une preuve de visibilité dans ChatGPT. Le protocole suivant vise les pages publiques d’une boutique ou d’un média, sans toucher aux espaces privés.

Cartographier les robots par fonction

OpenAI distingue OAI-SearchBot, GPTBot et ChatGPT-User : recherche, entraînement et actions déclenchées par un utilisateur ne sont pas une seule autorisation. Autoriser la recherche n’oblige pas à autoriser l’entraînement. Cette séparation doit apparaître dans votre inventaire avant toute modification du fichier robots.

Préparez un tableau avec le fournisseur, la fonction, le token robots, le fichier de plages IP, la règle actuelle et la personne responsable. Ajoutez une colonne pour la date du dernier contrôle. Une liste recopiée d’un article ancien ne doit pas devenir votre référence opérationnelle.

Pour Google, l’infrastructure des robots possède sa documentation de vérification. Les familles de crawlers et de fetchers ne partagent pas toutes le même fichier d’adresses. Le contrôleur doit donc associer une fonction à sa source officielle, pas mélanger tous les réseaux Google dans une exception générale.

Mettre à jour les sources IP de 2026

Google a annoncé le déplacement de ses fichiers IP le 31 mars 2026, vers /crawling/ipranges/. Si un ancien script vise /search/apis/ipranges/, relevez sa destination finale et examinez le JSON reçu. Un HTTP 200 n’établit pas que son schéma reste utilisable.

Voici les sources à vérifier pour trois robots de recherche :

Fonction Fichier officiel à télécharger
Crawlers communs Google common-crawlers.json
Recherche OpenAI searchbot.json
PerplexityBot perplexitybot.json

Nous avons récupéré ces trois endpoints en GET le 3 octobre 2026 : ils répondaient en 200 avec une liste prefixes. Ce contrôle valide leur accessibilité et leur structure à cette date. Il ne montre aucune visite de ces robots sur votre site.

Utiliser une IP réellement observée

Relevez l’adresse source dans un journal de confiance au niveau du CDN ou du serveur. Si votre origine reçoit seulement l’adresse d’un proxy, documentez comment le CDN fournit l’IP du client. Un en-tête transmis librement par le visiteur n’est pas une preuve d’identité.

Pour un événement, gardez l’heure UTC, l’hôte, le chemin, le statut, l’action du pare-feu et un identifiant de requête. Évitez de copier cookies, jetons, emails ou paramètres personnels dans le dossier SEO. Reliez ensuite l’événement à la version du site servie à ce moment.

Téléchargez la liste officielle sans désactiver la validation TLS :

curl --fail --silent --show-error https://openai.com/searchbot.json -o searchbot.json

Notre vérificateur Python gratuit utilise uniquement la bibliothèque standard. Il compare une IP à une liste locale et ne modifie aucune règle réseau :

python3 crawler-ip-check.py searchbot.json 192.0.2.10

L’adresse de cet exemple est documentaire ; remplacez-la par celle du journal. Un résultat NO_PREFIX_MATCH signifie seulement qu’elle n’appartient pas aux préfixes du fichier utilisé. Il ne prouve ni une attaque ni une erreur du fournisseur. PREFIX_MATCH établit une correspondance d’adresse, pas l’identité complète du produit ou son utilisation de votre contenu. Vérifiez aussi la fonction et le contexte de la requête.

Traiter le pare-feu avec une règle limitée

La documentation Perplexity décrit une vérification combinant nom du robot et IP officielle. À partir de ce principe, construisez une exception limitée à la bonne fonction et aux chemins publics utiles. Ne désactivez pas la protection du panier, du compte ou de l’administration pour résoudre une difficulté d’accès à un article.

Avant de changer une règle, conservez un exemple du refus et une copie de la configuration. Après changement, recherchez une nouvelle requête authentifiée sur la même page. Comparez le statut, le type de contenu et le début du HTML : une page de challenge peut parfois sembler être une réponse réussie.

Préparez aussi un retour arrière. Si la tâche de mise à jour ne télécharge plus une liste valide, elle doit signaler l’erreur au lieu de remplacer silencieusement une configuration correcte par une liste vide. Documentez l’âge de la dernière copie disponible ; choisir de la conserver temporairement est une décision d’exploitation, pas une confirmation qu’elle reste complète.

Séparer simulation, exploration et citation

Une requête locale portant OAI-SearchBot dans son User-Agent permet de détecter certaines différences de traitement. Elle ne provient pas des réseaux du fournisseur. Présentez-la comme simulation, y compris lorsque son statut est 200.

Une visite vérifiée dans les journaux établit un accès réel à un chemin et à une heure. Elle ne prouve pas que la page a intégré un index, fourni une citation ou produit une vente. Construisez donc quatre mesures distinctes : réponses servies à des robots vérifiés ; pages récupérées ; citations observées ; visites et commandes réellement attribuées.

Sur Google, l’optimisation pour les fonctions IA conserve les exigences d’indexation et de qualité du SEO. Un fichier llms.txt peut orienter d’autres systèmes, mais ne remplace pas cette étape. Pour une boutique Q4, commencez par les informations que le lecteur doit pouvoir vérifier : offre, variante, prix actuel, disponibilité et livraison. Notre dossier Q4 et nos ressources organisent ces contrôles sans promettre une citation IA.