Balises meta robots et X-Robots-Tag : contrôler l’indexation
Maîtrisez les balises meta robots et l'en-tête X-Robots-Tag pour contrôler l'indexation et l'affichage de vos pages dans Google.
La balise meta robots est l’outil le plus précis pour piloter, page par page, la façon dont Google indexe votre contenu et le présente dans les résultats. Elle se place dans la section du document HTML et s’adresse aux robots d’exploration. Son équivalent côté serveur, l’en-tête HTTP X-Robots-Tag, applique les mêmes règles, y compris à des fichiers non HTML comme les PDF ou les images.
Bien utilisées, ces directives évitent que des pages sans valeur SEO (pages de remerciement, résultats de recherche interne, espaces privés) n’encombrent l’index. Elles permettent aussi d’affiner l’affichage : longueur d’un extrait, taille d’un aperçu d’image, durée d’un aperçu vidéo. C’est un levier de contrôle fin qui complète le fichier robots.txt et la balise canonique dans toute stratégie d’indexation.
Ce que j’apprécie avec la balise meta robots et son équivalent X-Robots-Tag, c’est la précision page par page, là où le robots.txt reste un instrument trop large. L’erreur fréquente est de vouloir piloter un PDF ou une image avec une balise HTML : pour ces fichiers non HTML, seul l’en-tête HTTP fait le travail. Je choisis toujours le bon mécanisme selon le type de ressource avant d’écrire la moindre directive.
Deux mécanismes : la balise meta et l'en-tête HTTP
La balise meta robots s’écrit dans le HTML de la page. Toute règle utilisable dans cette balise peut aussi être transmise via l’en-tête X-Robots-Tag, configuré au niveau du serveur (par exemple dans un fichier .htaccess sur Apache ou un fichier de configuration NGINX). L’en-tête est indispensable pour les ressources qui n’ont pas de HTML : c’est la seule façon d’appliquer un noindex à un PDF ou de bloquer l’indexation d’images.
<!DOCTYPE html>
<html>
<head>
<meta name="robots" content="noindex">
</head>
<body></body>
</html>
Cibler un robot précis
La valeur robots de l’attribut name vise tous les robots d’exploration. Pour adresser une règle à un robot en particulier, remplacez-la par son jeton user-agent. Google reconnaît deux jetons dans la balise meta : googlebot pour les résultats texte et googlebot-news pour Google Actualités. Les attributs name et content ne sont pas sensibles à la casse. La règle nofollow, elle, se décline aussi au niveau de chaque lien : voyez à ce sujet comment qualifier les liens sortants.
<!-- Aucun extrait pour Google, mais traduction bloquee -->
<meta name="googlebot" content="notranslate">
<meta name="googlebot-news" content="nosnippet">
Les directives d'indexation et d'affichage utiles
Chaque valeur de l’attribut content correspond à une règle. La valeur par défaut, all, n’impose aucune restriction : il est inutile de la déclarer. Voici les directives les plus courantes pour contrôler indexation et affichage ; elles figurent parmi les balises meta acceptées par Google.
| Directive | Effet | Remarque |
|---|---|---|
noindex |
Empêche l’affichage de la page dans les résultats |
La page doit rester explorable pour que la règle soit lue |
nofollow |
Demande de ne pas suivre les liens de la page |
Sans cette règle, Google peut suivre les liens pour découvrir d’autres pages |
none |
Équivaut à noindex, nofollow |
Combine les deux restrictions |
nosnippet |
Pas d’extrait ni d’aperçu vidéo dans les résultats |
S’applique à tous les types de résultats |
max-snippet:[n] |
Limite l’extrait à n caractères |
0 équivaut à nosnippet ; -1 laisse Google décider |
max-image-preview:[valeur] |
Taille de l’aperçu d’image |
Valeurs : none, standard ou large |
max-video-preview:[n] |
Durée maximale d’un aperçu vidéo en secondes |
0 limite à une image fixe ; -1 illimité |
noimageindex |
N’indexe pas les images de la page |
Les images n’apparaîtront pas dans les résultats |
unavailable_after:[date] |
Retire la page des résultats après une date |
La date doit respecter un format standard (RFC 822, ISO 8601…) |
Combiner plusieurs règles
Vous pouvez cumuler des directives en les séparant par une virgule dans une seule balise, ou en utilisant plusieurs balises. En cas de règles contradictoires, Google applique la plus restrictive : entre max-snippet:50 et nosnippet, c’est nosnippet qui l’emporte. Si plusieurs robots et plusieurs règles coexistent, le moteur retient la somme des règles négatives.
<!-- Une seule balise, regles separees par une virgule -->
<meta name="robots" content="noindex, nofollow">
<!-- Limiter l'extrait et autoriser un grand apercu d'image -->
<meta name="robots" content="max-snippet:20, max-image-preview:large">
La balise meta robots et l’en-tête X-Robots-Tag ne sont lus qu’au moment de l’exploration de l’URL. Si une page est exclue de l’exploration par le fichier robots.txt, Google ne verra jamais votre règle noindex : elle sera tout simplement introuvable et donc ignorée. Pour qu’une directive d’indexation soit prise en compte, la page qui la porte doit rester explorable.
À faire
- placer la balise meta robots dans le
- utiliser X-Robots-Tag pour les fichiers non HTML
- laisser explorable toute page portant une règle noindex
- combiner les directives selon vos besoins d’affichage
À éviter
- bloquer dans robots.txt une page que vous voulez désindexer avec noindex
- déclarer la valeur all par défaut inutilement
- multiplier les règles contradictoires
- oublier de cibler le bon user-agent quand c’est nécessaire
Points clés à retenir
- Placez la balise meta robots dans le <head> de la page.
- Utilisez X-Robots-Tag pour les PDF, images et autres fichiers.
- Gardez explorable toute page portant un noindex.
- En cas de conflit, la règle la plus restrictive s'applique.
- Affinez l'affichage avec max-snippet et max-image-preview.
La balise meta robots et X-Robots-Tag pilotent finement indexation et affichage.
Quiz : testez vos connaissances
Quiz : testez vos connaissances
-
Que se passe-t-il si une page portant un noindex est aussi bloquée dans le robots.txt ?
- Les deux règles se renforcent et désindexent la page à coup sûr
- Le noindex est appliqué encore plus vite grâce au blocage
- Google ne lit pas le noindex, car la balise n'est lue qu'à l'exploration de l'URL
La balise
meta robotset l’en-têteX-Robots-Tagne sont lus qu’au moment de l’exploration de l’URL. Une page exclue de l’exploration ne peut pas voir sonnoindexpris en compte. -
Que choisit Google face à des règles d'indexation contradictoires sur une page ?
- Il ignore toutes les règles en conflit
- Il applique la règle la plus restrictive
- Il applique la règle la plus permissive
En cas de règles contradictoires, Google applique la plus restrictive. Entre
max-snippet:50etnosnippet, c’estnosnippetqui l’emporte. -
Comment transmettre une règle d'indexation à un fichier non HTML comme un PDF ?
- Avec une balise meta robots ajoutée dans le PDF
- Avec la balise meta keywords du document
- Avec l'en-tête HTTP X-Robots-Tag configuré au niveau du serveur
Toute règle utilisable dans la balise
meta robotspeut être transmise via l’en-têteX-Robots-Tag, configuré au niveau du serveur. Il est particulièrement adapté aux fichiers non HTML.
Besoin d'un accompagnement SEO ?
Un mauvais usage des directives robots peut désindexer des pages stratégiques sans que vous le sachiez.