Le fichier robots.txt : à quoi il sert (et à quoi il ne sert pas)
Le robots.txt gère le trafic des robots d'exploration, pas la visibilité dans les résultats. Son rôle, ses limites, et quand lui préférer noindex.
Le fichier robots.txt indique aux robots des moteurs quelles URL ils peuvent explorer sur votre site. Son but premier : éviter de surcharger votre serveur de requêtes. Un malentendu très répandu : il ne sert PAS à empêcher une page d’apparaître dans Google. C’est une nuance essentielle, et la source de beaucoup d’erreurs.
Le malentendu le plus tenace de tout le SEO technique tient en une phrase : le robots.txt ne sert pas à désindexer une page. Bloquer une URL n’empêche pas Google de l’afficher s’il la trouve ailleurs, ça l’empêche juste de lire son contenu. Quand je veux vraiment sortir une page de la recherche, je passe par noindex, jamais par un blocage de l’exploration.
Bloquer une page dans le robots.txt ne la retire pas des résultats. Si d’autres sites pointent vers elle, Google peut l’indexer quand même (sans description). Pour empêcher l’affichage, utilisez noindex ou un mot de passe.
À quoi sert vraiment le robots.txt
Son rôle dépend du type de fichier :
Type de fichier |
Ce que permet le robots.txt |
Page web (HTML, PDF…) |
Gérer le trafic d’exploration, éviter d’explorer des pages secondaires (mais pas les cacher des résultats) |
Fichier multimédia (image, vidéo, audio) |
Empêcher ces fichiers d’apparaître dans les résultats |
Fichier de ressource (script, style non essentiels) |
Alléger l’exploration, à condition de ne pas gêner la compréhension de la page |
Exemple de fichier robots.txt
Un fichier robots.txt se place à la racine du site. Voici un exemple simple qui bloque l’exploration d’un dossier et indique l’emplacement du sitemap :
User-agent: *
Disallow: /panier/
Sitemap: https://www.monsite.fr/sitemap.xml
Les limites à connaître
Avant de vous reposer sur le robots.txt, gardez en tête ses limites ; pour aller plus loin, voyez aussi comment soigner la structure de vos URL :
À faire
- l’utiliser pour gérer la charge d’exploration et éviter d’explorer des pages sans intérêt
- protéger les contenus vraiment privés par mot de passe
À éviter
- compter sur lui pour cacher une page des résultats (utilisez noindex)
- bloquer des ressources nécessaires à l’affichage de la page (Google ne comprendrait plus la page)
- supposer que tous les robots le respectent (seuls les robots sérieux le font)
Quiz : testez vos connaissances
Quiz : testez vos connaissances
-
Quel est le but premier du fichier robots.txt ?
- Empêcher une page d'apparaître dans les résultats de Google
- Protéger des contenus privés à la place d'un mot de passe
- Éviter de surcharger le serveur en indiquant quelles URL les robots peuvent explorer
Le
robots.txtindique quelles URL les robots peuvent explorer, surtout pour éviter de surcharger le serveur. Il ne sert pas à empêcher une page d’apparaître dans Google. -
Pour retirer une page des résultats de Google, que faut-il utiliser ?
- Rien, une page bloquée ne peut jamais s'afficher dans Google
- Un blocage dans le robots.txt, qui suffit à la faire disparaître
- La règle noindex, car le robots.txt empêche l'exploration mais pas l'indexation
Une URL bloquée dans le
robots.txtpeut tout de même apparaître si d’autres sites pointent vers elle. Pour retirer une page des résultats, utiliseznoindex. -
Tous les robots respectent-ils le fichier robots.txt ?
- Oui, c'est une norme que tous les robots appliquent
- Non, Googlebot et les robots sérieux oui, mais d'autres l'ignorent
- Oui, dès lors que le fichier est placé à la racine du site
Googlebot et les robots sérieux respectent le
robots.txt, mais d’autres l’ignorent. Pour du contenu vraiment privé, le mot de passe reste plus sûr.
Besoin d'un accompagnement SEO ?
Un robots.txt mal réglé peut bloquer ce qu'il ne faut pas. On le vérifie avec vous.