Tout ce qu'un site communique à un robot passe par un petit nombre de mécanismes : un fichier texte à la racine, des en-têtes HTTP, des codes de statut et des balises. Leur portée respective est régulièrement surestimée — en particulier celle du fichier robots, à qui on prête des pouvoirs qu'il n'a pas.
Fichier texte placé à la racine d'un domaine, indiquant aux robots quelles zones ils ne doivent pas explorer. Standardisé formellement par la RFC 9309 depuis 2022.
Approfondir : noindex, canonical et robots.txt : le trio de contrôle de l'indexation →
Identifiant qu'un client HTTP transmet pour se déclarer. Chaque robot possède le sien, ce qui permet de lui adresser des règles spécifiques.
Instruction du fichier robots interdisant l'exploration d'un chemin. Les règles se résolvent par correspondance la plus spécifique, et non par ordre d'apparition.
Approfondir : noindex, canonical et robots.txt : le trio de contrôle de l'indexation →
Directive non standard demandant un délai entre deux requêtes d'un robot. Elle ne fait pas partie de la RFC 9309 et Google l'ignore.
Réponse HTTP indiquant que la requête a abouti et que le corps renvoyé est le contenu demandé.
Codes de redirection. Le 301 déclare un déplacement définitif et transmet les signaux vers la nouvelle URL ; le 302 déclare un déplacement temporaire et conserve l'URL d'origine dans l'index.
Approfondir : Boucle de redirection derrière un reverse proxy : diagnostic et correction →
Le 404 signale une ressource introuvable, le 410 une ressource supprimée définitivement. Le second exprime une intention explicite et accélère la sortie de l'index.
Famille de codes signalant une défaillance du serveur. Face à des erreurs répétées, Google réduit son rythme d'exploration pour ne pas aggraver la situation.
Approfondir : Lire le rapport d'indexation Search Console sans se tromper de diagnostic →
Page renvoyant un code de succès alors que son contenu signale une absence : résultat vide, produit retiré, message d'erreur applicatif.
Étape supplémentaire durant laquelle Google exécute le JavaScript d'une page pour en obtenir le contenu final. Elle intervient après l'exploration initiale, avec un délai variable.
Enregistrement de chaque requête reçue par le serveur, incluant le user-agent, l'URL, le code renvoyé et l'horodatage.
Approfondir : Indexation Google : crawl, budget de crawl et pages « explorées non indexées » →
Protocole ouvert permettant de notifier des moteurs de recherche qu'une URL a été créée, modifiée ou supprimée, sans attendre leur passage.
Mécanisme par lequel Google ajuste automatiquement son rythme d'exploration en fonction des temps de réponse observés et de la fraîcheur du contenu.
Approfondir : Indexation Google : crawl, budget de crawl et pages « explorées non indexées » →
Ces définitions s'appuient sur la documentation officielle référencée dans nos ressources. Une définition vous paraît inexacte ou datée ? Signalez-la — les corrections sont vérifiées, datées et créditées.