Le robots.txt est un fichier texte placé à la racine du site, lu par les robots des moteurs. Il pilote le crawl grâce aux directives User-agent, Disallow, Allow et Sitemap. Il ne bloque jamais l’indexation d’une page à lui seul.
Robots.txt, c’est quoi exactement ?
Le robots.txt est un fichier texte brut hébergé à la racine d’un domaine, à l’adresse votresite.com/robots.txt. Il donne des instructions de crawl aux robots des moteurs, comme Googlebot ou Bingbot. Ce fichier respecte le protocole REP, normalisé par l’IETF en 2022.
Je vérifie votre configuration technique de fond en comble.
Sa mission n’est pas de cacher une page des résultats de recherche. Il oriente simplement le budget de crawl vers les zones utiles du site à explorer. Une page bloquée peut malgré tout apparaître dans Google si elle reçoit des liens externes.
Un sous-domaine comme blog.votresite.com nécessite son propre fichier robots.txt. Les règles définies sur le domaine principal ne s’appliquent jamais à ses sous-domaines.
Depuis 2019, Google a officiellement arrêté de supporter la directive « noindex » dans le robots.txt. Pour retirer une page des résultats, utilisez une balise meta robots noindex ou une suppression via Search Console.
A quoi sert le robots.txt pour le crawl budget ?
Chaque robot dispose d’un budget de crawl limité par site à explorer. Le robots.txt évite que ce budget se disperse sur des pages sans valeur SEO. Cela concerne le panier, les filtres, le back-office et la recherche interne.
Un site e-commerce avec 50 000 URL à facettes gaspille vite son budget. Bloquer ces chemins concentre l’exploration des robots vers les pages stratégiques. Cela inclut les fiches produits et les articles à fort potentiel.
Un client e-commerce voyait 12 000 pages filtrées explorées chaque semaine par Googlebot. Après un Disallow ciblé sur les URL à facettes, la situation a changé. 80 % du budget s’est réorienté vers les fiches produits en un mois.
Comment savoir si votre site a un problème de crawl budget ?
Ouvrez le rapport Statistiques sur l’exploration depuis Search Console pour vérifier. Un pic de requêtes sur des URL inutiles signale un gaspillage réel.
Un autre signal existe dans le rapport de couverture. La section Découverte non indexée actuellement grossit souvent aussi. Elle indique que Googlebot se disperse sur du contenu dupliqué.
Syntaxe et directives principales du robots.txt
La syntaxe repose sur un nombre restreint de directives à connaître. Chaque bloc commence par un User-agent, suivi de règles Disallow ou Allow. Les lignes commençant par # restent de simples commentaires, ignorés par les robots.
| Directive | Rôle | Exemple |
|---|---|---|
| User-agent | Cible un robot précis ou tous les robots | User-agent: * |
| Disallow | Interdit l’exploration d’un chemin | Disallow: /panier/ |
| Allow | Autorise un sous-chemin dans un dossier bloqué | Allow: /panier/promo/ |
| Sitemap | Indique l’emplacement du plan du site XML | Sitemap: https://site.fr/sitemap.xml |
| Crawl-delay | Demande un délai entre requêtes, ignoré par Google | Crawl-delay: 10 |
Le caractère astérisque (*) remplace n’importe quelle suite de caractères. Le symbole dollar marque la fin exacte d’une URL précise. Par exemple, Disallow: /*.pdf$ bloque uniquement les fichiers PDF.
Une erreur de syntaxe peut bloquer tout le site par accident du jour au lendemain. La ligne « Disallow: / » sans exception interdit l’exploration complète. Testez toujours vos modifications avant publication.

Exemples de fichiers robots.txt selon votre CMS
Chaque CMS génère une structure de dossiers différente à respecter. Le robots.txt doit s’adapter à cette architecture technique propre à la plateforme.
- Ouvrez ou créez le fichier robots.txt à la racine du site.
- Ajoutez un bloc User-agent: * pour cibler tous les robots.
- Listez les dossiers à exclure avec la directive Disallow.
- Ajoutez la ligne Sitemap avec l’URL complète du fichier XML.
- Testez le fichier via le rapport robots.txt de Search Console.
Exemple concret pour WordPress :
Placez toujours la ligne Sitemap en fin de fichier complet, quel que soit le user-agent ciblé. Elle reste valable pour tous les robots et accélère la découverte de vos nouvelles pages.
Exemple robots.txt pour Shopify
Shopify génère un robots.txt non modifiable par défaut depuis l’interface classique. Depuis 2021, le fichier robots.txt.liquid autorise des règles personnalisées via le thème actif.
Exemple robots.txt pour PrestaShop
PrestaShop propose un générateur natif dans Préférences puis SEO et URLs. Il exclut automatiquement l’admin et les modules techniques sensibles.
Cas des CMS sans accès direct au robots.txt
Wix et Squarespace génèrent un robots.txt automatique et non modifiable dans leur version standard. Seuls certains réglages SEO avancés restent personnalisables via les paramètres de la plateforme. Vérifiez toujours son contenu réel en ouvrant directement l’URL /robots.txt du site publié.
Pièges fréquents et erreurs graves à éviter
Certaines erreurs reviennent souvent chez les sites que j’audite chaque mois. Elles nuisent au référencement sans que le propriétaire du site s’en aperçoive.
| Piège | Conséquence | Solution |
|---|---|---|
| Fichier absent | Google explore tout, sans priorisation | Créer un robots.txt minimal |
| Bloquer le CSS/JS | Rendu incorrect vu par Googlebot | Autoriser /wp-content/themes/ |
| Confondre Disallow et noindex | Page bloquée mais indexée quand même | Utiliser la balise meta noindex |
| Fichier trop lourd | Google ignore au-delà de 500 Ko | Simplifier les règles |
| Lister des dossiers sensibles | Le fichier est public, un attaquant les repère | Ne jamais citer un chemin confidentiel |
Le format du fichier compte aussi beaucoup. Il doit être encodé en UTF-8 et nommé exactement « robots.txt », toujours en minuscules.
Un piège classique touche les sites récemment migrés. Le robots.txt de préproduction bloque tout et reste actif après la mise en ligne. Vérifiez systématiquement ce fichier juste après chaque mise en production.
Le robots.txt reste un fichier public et consultable par n’importe qui sur le web. N’y révélez jamais l’emplacement d’un back-office non standard ou d’un dossier confidentiel.
Comment tester son robots.txt en 2026 avec Search Console ?
Google a retiré l’ancien outil de test robots.txt de l’ancienne interface Search Console. Un nouveau rapport robots.txt l’a remplacé, disponible dans les Paramètres.
Ce rapport affiche la dernière date d’exploration, les erreurs et les avertissements détectés par Google. Il couvre jusqu’à vingt hôtes différents sur un même domaine.
Le protocole compte aussi dans ce suivi. Les versions http et https d’un même nom de domaine exigent chacune leur fichier robots.txt propre.
Google a aussi précisé la liste officielle des directives non supportées par ses robots. Les avertissements du rapport gagnent en clarté grâce à cette documentation.
- Ouvrez Search Console puis la section Paramètres du site.
- Cliquez sur le rapport robots.txt du domaine concerné.
- Vérifiez la date du dernier fichier récupéré par Google.
- Consultez les erreurs et avertissements listés ligne par ligne.
- Demandez une nouvelle exploration en cas de correctif urgent.
Pour vérifier une URL précise, utilisez plutôt l’outil Inspection de l’URL disponible dans Search Console. Il indique si Googlebot peut réellement l’explorer aujourd’hui.

Faut-il bloquer les robots d’IA dans le robots.txt ?
Les moteurs d’intelligence artificielle utilisent aussi des robots pour entraîner leurs modèles sur le contenu web. Chacun possède un user-agent distinct, à cibler individuellement.
Bloquer ces robots ne change rien à votre référencement classique. Cela concerne uniquement l’usage de votre contenu par des IA génératives.
| Robot IA | Éditeur | Rôle |
|---|---|---|
| GPTBot | OpenAI | Entraînement des modèles GPT |
| ClaudeBot | Anthropic | Entraînement des modèles Claude |
| Google-Extended | Entraînement Gemini, hors indexation classique | |
| PerplexityBot | Perplexity | Réponses IA en temps réel |
| CCBot | Common Crawl | Base publique réutilisée par de nombreuses IA |
Exemple de blocage sélectif, sans toucher au crawl SEO classique :
Réfléchissez avant de tout bloquer d’un coup. Certains robots IA génèrent aussi du trafic de citation vers votre site via leurs réponses génératives.
Je réalise l’audit technique complet de votre site.
Robots.txt vs balise meta robots : quelle différence ?
Les deux outils agissent à des étapes très différentes du processus. Le robots.txt intervient avant le crawl, la balise meta agit après l’exploration.
| Critère | Robots.txt | Balise meta robots |
|---|---|---|
| Niveau d’action | Crawl, avant exploration | Indexation, après crawl |
| Emplacement | Racine du domaine | Dans le head de chaque page |
| Bloque l’affichage Google ? | Non garanti | Oui, si la page est crawlable |
| Fichiers non HTML, PDF, images | Compatible | Impossible, utiliser X-Robots-Tag |
Ne combinez jamais Disallow et noindex sur une même page. Googlebot ne peut pas lire une balise noindex sur une page bloquée au crawl.
Pour les fichiers non HTML comme les PDF, utilisez plutôt l’en-tête HTTP X-Robots-Tag à la place. Il produit le même effet qu’une balise meta, sans modifier le document.
Utilisez le robots.txt pour économiser le budget de crawl sur des pages sans valeur. Utilisez plutôt la balise noindex pour retirer une page précise des résultats.
Le robots.txt oriente le crawl, il ne cache pas une page des résultats. Vérifiez sa syntaxe régulièrement après chaque mise à jour. Gardez-le à jour après chaque refonte de site.
Questions fréquentes
Robots.txt, c’est quoi en une phrase ?
C’est un fichier texte à la racine du site qui indique aux robots quelles pages explorer ou ignorer.
Le robots.txt bloque-t-il l’indexation d’une page ?
Non. Il bloque le crawl, pas l’indexation. Une page peut rester visible sur Google via des liens externes.
Où placer le fichier robots.txt ?
Toujours à la racine du domaine, à l’adresse votresite.com/robots.txt, jamais dans un sous-dossier.
Comment tester mon fichier robots.txt en 2026 ?
Utilisez le rapport robots.txt de Search Console, dans les Paramètres, avant toute mise en ligne.
Faut-il bloquer le CSS et le JavaScript dans robots.txt ?
Non. Google a besoin de ces fichiers pour comprendre l’affichage réel de vos pages.
Que se passe-t-il sans fichier robots.txt ?
Les robots explorent l’ensemble du site sans restriction, ce qui peut gaspiller le budget de crawl.
Robots.txt et sitemap.xml, est-ce la même chose ?
Non. Le robots.txt bloque des chemins d’exploration, le sitemap liste les URL à indexer.
Quelle est la taille maximale d’un fichier robots.txt ?
Google ignore tout contenu au-delà de 500 kilo-octets. Gardez le fichier court et lisible.
