Empêcher du contenu d’apparaître dans Google : les bonnes méthodes
Bloquer l'exploration, désindexer, protéger par mot de passe : découvrez les bonnes méthodes pour contrôler ce que Google affiche de votre site.
La plupart des efforts SEO visent à faire indexer des pages. Mais il est parfois tout aussi important de faire l’inverse : empêcher un contenu d’apparaître dans la recherche Google. Données réservées aux visiteurs de votre site, contenu de faible qualité produit par les utilisateurs, pages répétitives sur un très gros site : plusieurs situations justifient de restreindre ce que Google voit et affiche.
Maîtriser ces méthodes est un volet à part entière de la gestion de l’indexation. Bloquer le bon contenu protège la qualité perçue de votre site, évite que des pages sans valeur diluent votre visibilité, et aide Google à concentrer son exploration sur vos pages importantes. Encore faut-il choisir la bonne technique : chacune a une portée et des effets différents, et une méthode mal choisie peut soit échouer, soit avoir des conséquences indésirables. Ce tutoriel les passe en revue.
Le choix entre noindex et robots.txt est l’arbitrage que je vois le plus souvent mal tranché : pour retirer une page de la recherche, il faut un noindex, donc laisser Google l’explorer, surtout pas la bloquer. Et si un contenu est déjà indexé, je le rappelle toujours, l’outil de suppression de la Search Console ne fait qu’un retrait temporaire ; pour un effet durable, c’est le noindex ou la suppression réelle de la page.
Pourquoi empêcher Google d'accéder à un contenu
Trois raisons principales motivent ce choix. La première est de limiter l’accès à des données que vous réservez aux visiteurs de votre site ; gardez à l’esprit que certains fichiers publiés contiennent des métadonnées susceptibles d’apparaître dans la recherche. La deuxième est de masquer un contenu de faible qualité : sur un site où les utilisateurs publient eux-mêmes, une partie des contributions peut être médiocre, voire assimilable à du spam, et nuire au classement. La troisième concerne les très gros sites, au-delà de quelques centaines de milliers d’URL : bloquer les pages répétitives ou secondaires via le fichier robots.txt aide Google à se concentrer sur le contenu important.
Les méthodes pour bloquer un contenu
Google propose plusieurs moyens d’empêcher l’affichage d’un contenu, chacun adapté à un type de contenu et à un objectif précis. Le tableau ci-dessous les compare pour vous aider à choisir.
| Méthode | S'applique à | Effet |
|---|---|---|
Supprimer le contenu du site |
Tous types de contenus |
Le moyen le plus sûr : le contenu disparaît de Google et du Web |
Protéger par mot de passe |
Tous types de contenus |
Réserve l’accès aux utilisateurs autorisés et empêche l’affichage dans Google |
Règle noindex |
Tous types de contenus |
La page reste accessible par lien mais n’apparaît pas dans les résultats |
Interdire l’exploration via robots.txt |
Images et vidéos |
Empêche Googlebot d’explorer et donc d’indexer ces fichiers multimédias |
Désactiver des propriétés Google |
Pages Web |
Exclut le contenu de services précis (Shopping, Hotels, etc.) |
Bien choisir entre noindex et robots.txt
La confusion la plus fréquente oppose la règle noindex et le fichier robots.txt, qui n’ont pas le même rôle. La balise meta robots noindex indique à Google de ne pas indexer la page : celle-ci peut rester reliée par des liens et accessible, mais n’apparaît pas dans les résultats. Le fichier robots.txt, lui, interdit l’exploration et s’utilise pour les images et les vidéos. Pour une page Web que vous voulez désindexer, c’est noindex qu’il faut employer, en laissant la page explorable afin que Google puisse lire la directive. Voici la forme exacte de cette balise.
<head>
<meta name="robots" content="noindex">
</head>
Supprimer un contenu déjà présent dans Google
Les méthodes précédentes empêchent un contenu d’apparaître, mais que faire s’il figure déjà dans les résultats ? Vous pouvez alors demander la suppression de la page hébergée sur votre site directement auprès de Google. Cette démarche traite les contenus déjà indexés, là où le noindex ou le robots.txt agissent en amont. Pour un retrait durable, combinez la demande de suppression avec une méthode de blocage : sans cela, la page risque de réapparaître lors d’une prochaine exploration.
Bloquer une page Web dans le fichier robots.txt n’est pas un moyen fiable de la tenir hors des résultats : si d’autres sites pointent vers elle, Google peut l’indexer sans en explorer le contenu. Pire, une page bloquée par robots.txt ne pourra jamais voir sa règle noindex lue par Google, puisque celui-ci ne l’explore pas. Pour désindexer une page Web, laissez-la explorable et appliquez-lui une règle noindex.
À faire
- supprimer ou protéger par mot de passe les contenus vraiment sensibles
- appliquer noindex aux pages Web à exclure des résultats
- réserver robots.txt aux images et vidéos
- demander la suppression d’un contenu déjà indexé
- combiner suppression et blocage pour un retrait durable
À éviter
- bloquer une page Web par robots.txt en espérant la désindexer
- placer un noindex sur une page bloquée à l’exploration
- compter sur robots.txt pour protéger des données confidentielles
- laisser du contenu de faible qualité s’indexer librement
- oublier les métadonnées des fichiers publiés
Points clés à retenir
- Supprimez ou protégez par mot de passe les contenus sensibles.
- Utilisez noindex pour exclure une page Web des résultats.
- Réservez le blocage robots.txt aux images et aux vidéos.
- Ne bloquez jamais par robots.txt une page que vous voulez désindexer.
- Demandez la suppression d'un contenu déjà présent dans Google.
Contrôler ce que Google affiche suppose de choisir la méthode adaptée.
Quiz : testez vos connaissances
Quiz : testez vos connaissances
-
Quelle est la méthode la plus sûre pour qu'un contenu n'apparaisse jamais dans Google ?
- Ajouter la balise meta keywords avec une mention privée
- Supprimer le contenu de votre site
- Le bloquer dans le fichier robots.txt
Supprimer le contenu de votre site est le seul moyen de garantir qu’il ne s’affichera plus dans Google ni ailleurs sur le Web. Pour un contenu privé, protégez-le par mot de passe.
-
Le fichier robots.txt suffit-il à tenir une page Web hors des résultats de Google ?
- Oui, c'est même la méthode recommandée pour les données confidentielles
- Non, si d'autres sites pointent vers elle, Google peut quand même l'indexer
- Oui, une page bloquée par robots.txt disparaît toujours des résultats
Bloquer une page Web dans le
robots.txtn’est pas un moyen fiable de la tenir hors des résultats. Si d’autres sites pointent vers elle, Google peut l’indexer. Pour exclure une page, utilisez la règlenoindex. -
Quelle est la bonne pratique pour exclure une page Web des résultats tout en la laissant accessible ?
- Réserver le robots.txt aux pages Web sensibles
- La bloquer dans robots.txt puis y ajouter un noindex
- Lui appliquer la balise meta robots noindex et la laisser explorable
La balise
noindexindique à Google de ne pas indexer la page, qui peut rester accessible. Attention, unnoindexplacé sur une page bloquée à l’exploration ne peut pas être lu.
Besoin d'un accompagnement SEO ?
Un contenu mal protégé peut se retrouver visible dans Google sans que vous l'ayez voulu.