SEO technique

robots.txt : le guide complet

robots.txt indique aux robots ce qu’ils peuvent explorer ou non. Une seule mauvaise ligne peut retirer tout votre site des résultats.

Mis à jour 16 septembre 2026 · 8 min de lecture
Advertisement

À quoi sert robots.txt

robots.txt est un fichier texte à la racine de votre domaine qui indique aux robots les parties du site qu’ils peuvent explorer. C’est une demande, pas une sécurité : les robots honnêtes l’observent, les autres l’ignorent.

Ce n’est pas fait pour masquer des pages : utilisez noindex pour cela.

Les directives essentielles

Directive Signification
User-agent Le robot concerné (* = tous)
Allow Chemins explorables
Disallow Chemins à ne pas explorer
Sitemap URL complète de votre sitemap
Crawl-delay Délai entre requêtes (souvent ignoré)

Un fichier de départ sûr

User-agent: *
Allow: /
Disallow: /api/
Disallow: /search
Disallow: /*?s=

Sitemap: https://exemple.com/sitemap.xml

Générez un fichier correct avec le générateur robots.txt.

Allow et Disallow : l’ordre

La correspondance la plus longue l’emporte, donc la spécificité compte. Allow: /blog peut créer une exception sous Disallow: /. Testez les règles ambiguës avant de déployer.

Six erreurs qui pénalisent

  1. Disallow: / en production — désindexe tout le site.
  2. Bloquer CSS et JS — Google en a besoin pour rendre la page.
  3. Compter sur robots.txt pour la confidentialité — utilisez l’authentification.
  4. Bloquer le sitemap ou les pages que vous voulez voir classées.
  5. Fautes de syntaxe — Disallow / (sans deux-points) est ignoré.
  6. Pas de référence au sitemap.

robots.txt et noindex ensemble

Piège classique : si une page est interdite dans robots.txt, le robot ne voit jamais son noindex — la page peut donc rester indexée. Pour la retirer, autorisez l’exploration et ajoutez noindex.

Testez avant de publier

Déployez en préproduction, ouvrez /robots.txt et vérifiez que les URL attendues sont autorisées. Contrôlez la couverture dans la Search Console après la mise en ligne.

Construisez le vôtre

Utilisez le générateur robots.txt gratuit, puis associez-lui un sitemap XML.

Advertisement
Help Center

robots.txt : le guide complet — FAQ

À la racine du domaine : https://exemple.com/robots.txt. Il ne peut pas être dans un sous-dossier et doit être accessible publiquement.

Non. Il empêche l’exploration, pas l’indexation. Une URL interdite peut apparaître dans les résultats si elle est liée ailleurs. Pour exclure une page, utilisez une balise noindex.

Il demande aux robots bien élevés de ne rien explorer du site. À n’utiliser que sur un site de préproduction ou privé.

À lire aussi

cta.title

cta.text

cta.button
100% Free No signup Private & secure
Advertisement