Balise noindex : cacher une page de Google volontairement
Un internaute qui arrive depuis Google sur votre page « Merci, votre message a bien été envoyé » ne comprend pas ce qu'il fait là, et vos statistiques comptent une demande qui n'existe pas. La balise noindex sert précisément à garder ce genre de page hors des résultats. Bien utilisée, elle fait le ménage ; oubliée au mauvais endroit, elle peut effacer tout un site de Google.
Ce que fait la balise noindex
La balise noindex est une consigne placée dans le code d'une page, plus précisément une balise meta « robots », invisible pour le visiteur. Elle demande aux moteurs de recherche de ne pas afficher cette page dans leurs résultats. Google et Bing la respectent : au passage suivant de leur robot, la page sort de l'index, c'est-à-dire de la liste des pages que le moteur peut proposer.
Pour les fichiers qui ne contiennent pas de code HTML, comme un PDF, la même consigne peut être transmise par le serveur, sous la forme d'un en-tête appelé X-Robots-Tag. Le principe reste identique.
Deux précisions évitent bien des malentendus :
- la page reste accessible à toute personne qui possède le lien : noindex ne protège rien, et un contenu confidentiel demande un mot de passe ;
- le retrait intervient quand le robot revient lire la page, ce qui peut prendre de quelques jours à plusieurs semaines.
Vous croiserez parfois le mot « nofollow » à côté. Il porte sur les liens présents dans la page, que les robots sont invités à ne pas suivre, sans rien changer à l'affichage de la page elle-même.
Les pages qui gagnent à rester hors de Google
Sur un petit site, la liste est courte. Voici les candidates habituelles :
- la page de remerciement affichée après un formulaire, une réservation ou une commande : elle n'a de sens qu'à ce moment-là, et elle sert souvent à compter les demandes ;
- les pages de test, brouillons, maquettes ou copies de travail du site, si elles sont accessibles en ligne ;
- les pages en double, comme une version imprimable ou certaines pages de filtres d'une boutique ;
- les pages de fonctionnement : panier, compte client, résultats du moteur de recherche interne, souvent déjà masquées par l'outil de création ;
- les pages juridiques, comme les mentions légales ou la politique de confidentialité.
Ce dernier cas se discute. Ces pages n'apportent guère de visites, et certains sites préfèrent les masquer ; d'autres les laissent visibles, ce qui ne pose aucun problème. Dans les deux cas, elles doivent rester accessibles depuis chaque page du site, en général par un lien en pied de page.
Pour les doublons, d'autres solutions conviennent souvent mieux : une redirection, une fusion de pages ou une balise canonical, qui désigne la version à privilégier. L'article sur le contenu dupliqué aide à choisir. Quant aux pages qui doivent vous amener des clients, comme l'accueil, vos services ou la page contact, elles ne doivent jamais porter cette consigne.
Noindex ou robots.txt : ne pas confondre
Le fichier robots.txt agit en amont : il demande aux robots de ne pas explorer certaines adresses. Il ne garantit pas leur absence des résultats, car une adresse bloquée mais citée ailleurs peut quand même apparaître. Le rôle de ce fichier est détaillé dans l'article sur le sitemap et le robots.txt.
Un piège fréquent consiste à cumuler les deux. Si une page porte un noindex mais que le robots.txt en interdit l'exploration, Google ne peut pas lire la consigne, et la page risque de rester dans ses résultats. Pour retirer une page, laissez-la donc accessible aux robots le temps qu'ils constatent le noindex.
En cas d'urgence, par exemple une page publiée par erreur avec des informations périmées, l'outil de suppression de la Search Console masque une adresse pendant quelques mois. La solution reste provisoire : profitez de ce délai pour ajouter le noindex ou supprimer la page.
L'erreur classique : tout le site en noindex
Pendant sa construction, un site est souvent masqué aux moteurs de recherche. Sur WordPress, une case des réglages demande aux moteurs de ne pas indexer le site, et les créateurs de sites proposent des options comparables. Si personne ne désactive ce réglage au lancement, Google obéit, et le nouveau site reste introuvable.
D'autres variantes, plus discrètes, produisent le même effet :
- une extension de référencement réglée pour masquer tout un type de contenu, par exemple tous les produits ou tous les articles du blog ;
- une version de test mise en ligne telle quelle, avec ses réglages de confidentialité ;
- une refonte qui réinstalle les paramètres par défaut d'un outil ;
- un modèle de page dupliqué qui emporte avec lui son noindex.
Le symptôme ne varie pas : des pages qui n'apparaissent jamais, ou qui disparaissent des résultats quelques jours après une modification. C'est l'une des premières causes à écarter quand un site n'apparaît pas sur Google.
Vérifier qu'une page est bien réglée
L'inspection d'URL de la Search Console
Collez l'adresse d'une page dans la barre de recherche, en haut de la Search Console. L'outil indique si la page est indexée et, sinon, pour quelle raison, y compris lorsqu'une balise noindex a été détectée. Il repère aussi la consigne transmise par le serveur, invisible dans le code de la page.
Le rapport sur l'indexation des pages
Ce rapport regroupe les pages exclues par motif. Ouvrez la ligne qui mentionne la balise noindex et parcourez les adresses : vous ne devez y trouver que des pages masquées volontairement. Une page de service dans cette liste signale un réglage à corriger.
Le code source, en dépannage
Sur ordinateur, faites un clic droit sur la page et choisissez l'affichage du code source, puis cherchez le mot « noindex » avec la fonction de recherche du navigateur. S'il n'apparaît pas, la page ne contient pas cette balise.
Une fois une consigne indésirable retirée, demandez une nouvelle indexation depuis l'inspection d'URL. Le retour dans les résultats prend ensuite quelques jours, parfois davantage.
À faire cette semaine
- Inspectez votre page d'accueil et vos principales pages de services dans la Search Console.
- Parcourez la liste des pages exclues par une balise noindex et vérifiez que chacune l'est volontairement.
- Ajoutez le noindex à votre page de remerciement si elle n'en a pas, sans la bloquer dans le robots.txt.
- Si vous préparez un nouveau site, demandez que ce contrôle figure dans les vérifications avant la mise en ligne, en le précisant dès votre demande de devis.