Indexation

L'indexation concentre le vocabulaire le plus mal employé du SEO. « Indexé » et « crawlé » sont couramment confondus alors qu'ils décrivent deux étapes séparées par des semaines. Cette page définit chaque terme dans son sens strict, et signale pour chacun l'erreur de raisonnement qu'il provoque le plus souvent.

Index #

La base de données dans laquelle Google stocke les pages qu'il a décidé de conserver après analyse. Y figurer est la condition nécessaire — mais pas suffisante — pour apparaître dans les résultats de recherche.

Pourquoi

Une page absente de l'index n'a aucune chance de recevoir du trafic, quel que soit son contenu. Vérifier la présence dans l'index précède toute analyse de positionnement.

Erreur fréquente

Croire qu'un site entier est « dans l'index ». L'indexation s'évalue page par page : un site peut avoir 90 % de ses URL indexées et voir ses pages les plus stratégiques exclues.

Approfondir : Indexation Google : crawl, budget de crawl et pages « explorées non indexées » →

Exploration (crawl) #

L'étape où un robot télécharge le contenu d'une URL. Elle précède l'analyse et l'indexation, et peut en être séparée par un délai allant de quelques minutes à plusieurs semaines.

Pourquoi

Sans exploration, aucune évaluation n'est possible. Un blocage à ce niveau rend invisible tout le travail éditorial effectué sur la page.

Erreur fréquente

Traiter « crawlé » comme un synonyme d'« indexé ». Une page peut être explorée des dizaines de fois et rester définitivement hors de l'index.

Approfondir : Indexation Google : crawl, budget de crawl et pages « explorées non indexées » →

Budget de crawl #

Le volume d'exploration que Google consacre à un site sur une période donnée. Il résulte de deux facteurs : la capacité du serveur à répondre sans se dégrader, et l'intérêt que Google porte au site.

Pourquoi

Sur un site volumineux, il détermine le délai entre la publication et la prise en compte. Un budget mal réparti fait explorer en boucle des pages sans valeur pendant que les nouvelles publications attendent.

Erreur fréquente

S'en préoccuper sur un site de quelques centaines de pages. Google indique explicitement que la notion ne concerne pas les sites de moins de quelques milliers d'URL — l'optimiser à cette échelle ne produit rien.

Approfondir : Indexation Google : crawl, budget de crawl et pages « explorées non indexées » →

Explorée, actuellement non indexée #

Motif de Search Console signifiant que Google a téléchargé la page, l'a analysée, et a décidé de ne pas la conserver. C'est un verdict rendu après examen, pas une file d'attente.

Pourquoi

C'est l'indicateur de santé éditoriale le plus direct qu'un site possède. Un volume important signale un problème de valeur du contenu, jamais un problème technique.

Erreur fréquente

Chercher une cause technique. Aucune balise, aucun sitemap, aucune demande d'indexation ne fera changer d'avis Google sur une page qu'il a jugée insuffisante.

Approfondir : Lire le rapport d'indexation Search Console sans se tromper de diagnostic →

Détectée, actuellement non indexée #

Motif signifiant que Google connaît l'URL — par un lien ou un sitemap — mais ne l'a pas encore téléchargée. Il n'a donc aucune opinion sur son contenu.

Pourquoi

Décrit un problème de capacité ou de priorité d'exploration, pas de qualité. Les leviers sont le maillage interne, la performance serveur et la réduction du volume d'URL générées.

Erreur fréquente

Le confondre avec « explorée non indexée ». Les deux libellés sont voisins et désignent des problèmes opposés : l'un se corrige techniquement, l'autre éditorialement.

Approfondir : Lire le rapport d'indexation Search Console sans se tromper de diagnostic →

Canonicalisation #

Le processus par lequel Google choisit, parmi plusieurs URL au contenu équivalent, celle qui représentera le groupe dans l'index. La balise rel=canonical permet d'indiquer sa préférence.

Pourquoi

Elle évite la dispersion des signaux entre plusieurs versions d'une même page et concentre l'autorité sur une URL unique.

Erreur fréquente

Considérer la balise comme une directive. C'est une indication : Google peut retenir une autre URL si les autres signaux du site — liens internes, sitemap, redirections — la contredisent.

Approfondir : noindex, canonical et robots.txt : le trio de contrôle de l'indexation →

Noindex #

Directive, servie par balise meta ou par en-tête HTTP, demandant à un moteur de ne pas conserver la page dans son index. Contrairement à la canonicalisation, elle est impérative.

Pourquoi

C'est le seul moyen fiable de retirer durablement une page de l'index tout en la laissant accessible aux visiteurs et aux robots.

Erreur fréquente

La combiner avec un blocage dans le fichier robots. Une page bloquée ne peut pas être explorée, donc la directive n'est jamais lue : la page peut rester indexée sans description.

Approfondir : noindex, canonical et robots.txt : le trio de contrôle de l'indexation →

Désindexation #

Le retrait de pages de l'index, volontaire ou subi. Une désindexation massive et non voulue traduit généralement une réévaluation de la qualité du site par les systèmes automatiques.

Pourquoi

Elle produit une chute de trafic brutale et sans avertissement. La distinguer d'une pénalité manuelle ou d'un incident technique conditionne toute la réponse.

Erreur fréquente

Chercher une pénalité. Une réévaluation algorithmique ne génère aucune notification dans Search Console — l'absence de message n'est pas une preuve d'innocence technique.

Approfondir : Désindexation massive sur Google : anatomie d'un crash et méthode de récupération →

Sitemap XML #

Fichier listant les URL qu'un site souhaite soumettre à l'indexation, avec des métadonnées facultatives comme la date de dernière modification.

Pourquoi

Il aide à la découverte des pages peu liées et sert de liste de référence : bien construit, il devient un filtre de qualité plutôt qu'un inventaire exhaustif.

Erreur fréquente

Y déverser toutes les URL du site. Lister des pages en noindex, bloquées ou de faible valeur envoie des signaux contradictoires et dilue l'utilité du fichier.

Approfondir : Sitemap XML : à quoi ça sert vraiment et comment le construire correctement →

Sitemap en liste blanche #

Approche consistant à ne soumettre que les URL dont la valeur est confirmée, plutôt que l'intégralité des pages générées par le site.

Pourquoi

Sur un site à génération automatique, c'est le levier le plus direct pour concentrer l'exploration sur les pages qui méritent d'être indexées.

Erreur fréquente

L'appliquer sans traiter les pages exclues. Les retirer du sitemap ne les désindexe pas : elles restent accessibles et explorables tant qu'aucune directive ne les couvre.

Approfondir : Sitemap XML : à quoi ça sert vraiment et comment le construire correctement →

Page en double sans URL canonique #

Motif signalant que Google a identifié plusieurs URL au contenu équivalent sans qu'aucune préférence n'ait été exprimée. Il en choisit une seul.

Pourquoi

Le choix de Google peut tomber sur une variante indésirable : version paginée, URL avec paramètres de suivi, page de filtre. Les signaux se répartissent alors sur la mauvaise URL.

Erreur fréquente

Ignorer le motif parce qu'une page reste indexée. Ce n'est pas nécessairement celle qu'on voulait, et les liens acquis pointent souvent vers l'autre.

Approfondir : noindex, canonical et robots.txt : le trio de contrôle de l'indexation →

Indexation mobile-first #

Principe selon lequel Google évalue et indexe la version mobile d'une page, y compris pour le classement des résultats affichés sur ordinateur.

Pourquoi

Tout contenu absent de la version mobile est invisible pour l'indexation, même s'il s'affiche parfaitement sur grand écran.

Erreur fréquente

Masquer du contenu secondaire sur mobile pour alléger l'affichage. Ce contenu n'est plus pris en compte : ce n'est pas une optimisation, c'est une suppression.

Approfondir : Core Web Vitals : mesurer et améliorer la vitesse d'un site WordPress →

Demande d'indexation #

Fonction de Search Console permettant de soumettre une URL pour exploration prioritaire. Elle accélère la découverte, sans influencer la décision d'indexer.

Pourquoi

Utile après la correction d'un défaut technique, pour ne pas attendre le prochain passage naturel du robot.

Erreur fréquente

L'utiliser en boucle sur des pages jugées insuffisantes. Répéter la demande ne change rien à l'évaluation et consomme un quota quotidien limité.

Approfondir : Lire le rapport d'indexation Search Console sans se tromper de diagnostic →

Validation d'un correctif #

Procédure de Search Console déclenchant la réexploration d'un échantillon d'URL affectées par un motif, afin de vérifier qu'un problème a bien été résolu.

Pourquoi

C'est le seul moyen d'obtenir un retour explicite de Google sur une correction, plutôt que d'attendre passivement une évolution des courbes.

Erreur fréquente

La lancer sans avoir corrigé la cause. L'échec est mémorisé et le motif reste marqué comme non résolu, ce qui brouille les diagnostics ultérieurs.

Approfondir : Lire le rapport d'indexation Search Console sans se tromper de diagnostic →

Pages orphelines #

Pages accessibles par leur URL mais vers lesquelles aucun lien interne ne pointe. Elles n'existent, pour un robot, que si un sitemap ou un lien externe les signale.

Pourquoi

Leur absence de liens entrants indique à Google qu'elles ne comptent pas pour le site lui-même — ce qui pèse lourdement sur leur priorité d'exploration.

Erreur fréquente

Compter sur le sitemap pour compenser. Il aide à la découverte mais ne transmet aucune autorité et ne remplace pas le maillage interne.

Approfondir : Le maillage interne : structurer les liens d'un site pour le référencement →

Ces définitions s'appuient sur la documentation officielle référencée dans nos ressources. Une définition vous paraît inexacte ou datée ? Signalez-la — les corrections sont vérifiées, datées et créditées.