Demander un devis

Robots.txt c’est quoi ? Définition, syntaxe et exemple concret

Tom AdanTom Adan25 August 20269 min de lecture
Robots.txt c’est quoi ? Définition, syntaxe et exemple concret
⚡ EN BREF

Le robots.txt est un fichier texte placé à la racine du site, lu par les robots des moteurs. Il pilote le crawl grâce aux directives User-agent, Disallow, Allow et Sitemap. Il ne bloque jamais l’indexation d’une page à lui seul.

Robots.txt, c’est quoi exactement ?

Le robots.txt est un fichier texte brut hébergé à la racine d’un domaine, à l’adresse votresite.com/robots.txt. Il donne des instructions de crawl aux robots des moteurs, comme Googlebot ou Bingbot. Ce fichier respecte le protocole REP, normalisé par l’IETF en 2022.

Un robots.txt mal réglé bloque votre SEO ?

Je vérifie votre configuration technique de fond en comble.

Parler de mon projet

Sa mission n’est pas de cacher une page des résultats de recherche. Il oriente simplement le budget de crawl vers les zones utiles du site à explorer. Une page bloquée peut malgré tout apparaître dans Google si elle reçoit des liens externes.

Un sous-domaine comme blog.votresite.com nécessite son propre fichier robots.txt. Les règles définies sur le domaine principal ne s’appliquent jamais à ses sous-domaines.

💡 Bon à savoir

Depuis 2019, Google a officiellement arrêté de supporter la directive « noindex » dans le robots.txt. Pour retirer une page des résultats, utilisez une balise meta robots noindex ou une suppression via Search Console.

A quoi sert le robots.txt pour le crawl budget ?

Chaque robot dispose d’un budget de crawl limité par site à explorer. Le robots.txt évite que ce budget se disperse sur des pages sans valeur SEO. Cela concerne le panier, les filtres, le back-office et la recherche interne.

Un site e-commerce avec 50 000 URL à facettes gaspille vite son budget. Bloquer ces chemins concentre l’exploration des robots vers les pages stratégiques. Cela inclut les fiches produits et les articles à fort potentiel.

📊 Cas pratique

Un client e-commerce voyait 12 000 pages filtrées explorées chaque semaine par Googlebot. Après un Disallow ciblé sur les URL à facettes, la situation a changé. 80 % du budget s’est réorienté vers les fiches produits en un mois.

Comment savoir si votre site a un problème de crawl budget ?

Ouvrez le rapport Statistiques sur l’exploration depuis Search Console pour vérifier. Un pic de requêtes sur des URL inutiles signale un gaspillage réel.

Un autre signal existe dans le rapport de couverture. La section Découverte non indexée actuellement grossit souvent aussi. Elle indique que Googlebot se disperse sur du contenu dupliqué.

Syntaxe et directives principales du robots.txt

La syntaxe repose sur un nombre restreint de directives à connaître. Chaque bloc commence par un User-agent, suivi de règles Disallow ou Allow. Les lignes commençant par # restent de simples commentaires, ignorés par les robots.

DirectiveRôleExemple
User-agentCible un robot précis ou tous les robotsUser-agent: *
DisallowInterdit l’exploration d’un cheminDisallow: /panier/
AllowAutorise un sous-chemin dans un dossier bloquéAllow: /panier/promo/
SitemapIndique l’emplacement du plan du site XMLSitemap: https://site.fr/sitemap.xml
Crawl-delayDemande un délai entre requêtes, ignoré par GoogleCrawl-delay: 10

Le caractère astérisque (*) remplace n’importe quelle suite de caractères. Le symbole dollar marque la fin exacte d’une URL précise. Par exemple, Disallow: /*.pdf$ bloque uniquement les fichiers PDF.

⚠️ Attention

Une erreur de syntaxe peut bloquer tout le site par accident du jour au lendemain. La ligne « Disallow: / » sans exception interdit l’exploration complète. Testez toujours vos modifications avant publication.

Règles d’autorisation et de blocage dans un fichier robots.txt

Exemples de fichiers robots.txt selon votre CMS

Chaque CMS génère une structure de dossiers différente à respecter. Le robots.txt doit s’adapter à cette architecture technique propre à la plateforme.

  1. Ouvrez ou créez le fichier robots.txt à la racine du site.
  2. Ajoutez un bloc User-agent: * pour cibler tous les robots.
  3. Listez les dossiers à exclure avec la directive Disallow.
  4. Ajoutez la ligne Sitemap avec l’URL complète du fichier XML.
  5. Testez le fichier via le rapport robots.txt de Search Console.

Exemple concret pour WordPress :

💡 Conseil d’expert

Placez toujours la ligne Sitemap en fin de fichier complet, quel que soit le user-agent ciblé. Elle reste valable pour tous les robots et accélère la découverte de vos nouvelles pages.

Exemple robots.txt pour Shopify

Shopify génère un robots.txt non modifiable par défaut depuis l’interface classique. Depuis 2021, le fichier robots.txt.liquid autorise des règles personnalisées via le thème actif.

Exemple robots.txt pour PrestaShop

PrestaShop propose un générateur natif dans Préférences puis SEO et URLs. Il exclut automatiquement l’admin et les modules techniques sensibles.

Cas des CMS sans accès direct au robots.txt

Wix et Squarespace génèrent un robots.txt automatique et non modifiable dans leur version standard. Seuls certains réglages SEO avancés restent personnalisables via les paramètres de la plateforme. Vérifiez toujours son contenu réel en ouvrant directement l’URL /robots.txt du site publié.

Pièges fréquents et erreurs graves à éviter

Certaines erreurs reviennent souvent chez les sites que j’audite chaque mois. Elles nuisent au référencement sans que le propriétaire du site s’en aperçoive.

PiègeConséquenceSolution
Fichier absentGoogle explore tout, sans priorisationCréer un robots.txt minimal
Bloquer le CSS/JSRendu incorrect vu par GooglebotAutoriser /wp-content/themes/
Confondre Disallow et noindexPage bloquée mais indexée quand mêmeUtiliser la balise meta noindex
Fichier trop lourdGoogle ignore au-delà de 500 KoSimplifier les règles
Lister des dossiers sensiblesLe fichier est public, un attaquant les repèreNe jamais citer un chemin confidentiel

Le format du fichier compte aussi beaucoup. Il doit être encodé en UTF-8 et nommé exactement « robots.txt », toujours en minuscules.

Un piège classique touche les sites récemment migrés. Le robots.txt de préproduction bloque tout et reste actif après la mise en ligne. Vérifiez systématiquement ce fichier juste après chaque mise en production.

🔒 Sécurité

Le robots.txt reste un fichier public et consultable par n’importe qui sur le web. N’y révélez jamais l’emplacement d’un back-office non standard ou d’un dossier confidentiel.

Comment tester son robots.txt en 2026 avec Search Console ?

Google a retiré l’ancien outil de test robots.txt de l’ancienne interface Search Console. Un nouveau rapport robots.txt l’a remplacé, disponible dans les Paramètres.

Ce rapport affiche la dernière date d’exploration, les erreurs et les avertissements détectés par Google. Il couvre jusqu’à vingt hôtes différents sur un même domaine.

Le protocole compte aussi dans ce suivi. Les versions http et https d’un même nom de domaine exigent chacune leur fichier robots.txt propre.

Google a aussi précisé la liste officielle des directives non supportées par ses robots. Les avertissements du rapport gagnent en clarté grâce à cette documentation.

  1. Ouvrez Search Console puis la section Paramètres du site.
  2. Cliquez sur le rapport robots.txt du domaine concerné.
  3. Vérifiez la date du dernier fichier récupéré par Google.
  4. Consultez les erreurs et avertissements listés ligne par ligne.
  5. Demandez une nouvelle exploration en cas de correctif urgent.

Pour vérifier une URL précise, utilisez plutôt l’outil Inspection de l’URL disponible dans Search Console. Il indique si Googlebot peut réellement l’explorer aujourd’hui.

Dossier bloqué à l’exploration face à un dossier autorisé

Faut-il bloquer les robots d’IA dans le robots.txt ?

Les moteurs d’intelligence artificielle utilisent aussi des robots pour entraîner leurs modèles sur le contenu web. Chacun possède un user-agent distinct, à cibler individuellement.

Bloquer ces robots ne change rien à votre référencement classique. Cela concerne uniquement l’usage de votre contenu par des IA génératives.

Robot IAÉditeurRôle
GPTBotOpenAIEntraînement des modèles GPT
ClaudeBotAnthropicEntraînement des modèles Claude
Google-ExtendedGoogleEntraînement Gemini, hors indexation classique
PerplexityBotPerplexityRéponses IA en temps réel
CCBotCommon CrawlBase publique réutilisée par de nombreuses IA

Exemple de blocage sélectif, sans toucher au crawl SEO classique :

💡 Conseil d’expert

Réfléchissez avant de tout bloquer d’un coup. Certains robots IA génèrent aussi du trafic de citation vers votre site via leurs réponses génératives.

Un détail technique peut ruiner tout un référencement

Je réalise l’audit technique complet de votre site.

Recevez un devis gratuit

Robots.txt vs balise meta robots : quelle différence ?

Les deux outils agissent à des étapes très différentes du processus. Le robots.txt intervient avant le crawl, la balise meta agit après l’exploration.

CritèreRobots.txtBalise meta robots
Niveau d’actionCrawl, avant explorationIndexation, après crawl
EmplacementRacine du domaineDans le head de chaque page
Bloque l’affichage Google ?Non garantiOui, si la page est crawlable
Fichiers non HTML, PDF, imagesCompatibleImpossible, utiliser X-Robots-Tag
⚠️ Attention

Ne combinez jamais Disallow et noindex sur une même page. Googlebot ne peut pas lire une balise noindex sur une page bloquée au crawl.

Pour les fichiers non HTML comme les PDF, utilisez plutôt l’en-tête HTTP X-Robots-Tag à la place. Il produit le même effet qu’une balise meta, sans modifier le document.

Utilisez le robots.txt pour économiser le budget de crawl sur des pages sans valeur. Utilisez plutôt la balise noindex pour retirer une page précise des résultats.

✅ Ce qu’il faut retenir

Le robots.txt oriente le crawl, il ne cache pas une page des résultats. Vérifiez sa syntaxe régulièrement après chaque mise à jour. Gardez-le à jour après chaque refonte de site.

Questions fréquentes

Robots.txt, c’est quoi en une phrase ?

C’est un fichier texte à la racine du site qui indique aux robots quelles pages explorer ou ignorer.

Le robots.txt bloque-t-il l’indexation d’une page ?

Non. Il bloque le crawl, pas l’indexation. Une page peut rester visible sur Google via des liens externes.

Où placer le fichier robots.txt ?

Toujours à la racine du domaine, à l’adresse votresite.com/robots.txt, jamais dans un sous-dossier.

Comment tester mon fichier robots.txt en 2026 ?

Utilisez le rapport robots.txt de Search Console, dans les Paramètres, avant toute mise en ligne.

Faut-il bloquer le CSS et le JavaScript dans robots.txt ?

Non. Google a besoin de ces fichiers pour comprendre l’affichage réel de vos pages.

Que se passe-t-il sans fichier robots.txt ?

Les robots explorent l’ensemble du site sans restriction, ce qui peut gaspiller le budget de crawl.

Robots.txt et sitemap.xml, est-ce la même chose ?

Non. Le robots.txt bloque des chemins d’exploration, le sitemap liste les URL à indexer.

Quelle est la taille maximale d’un fichier robots.txt ?

Google ignore tout contenu au-delà de 500 kilo-octets. Gardez le fichier court et lisible.

Tom Adan, consultant SEO
Écrit parTom Adan

Consultant SEO à Madagascar. J’accompagne les PME/TPE, e-commerçants, blogueurs et infopreneurs à gagner en visibilité sur Google — durablement, sans dépendre de la publicité.