Générateur de robots.txt
Composez un fichier robots.txt à partir de groupes de règles et de modèles, décidez quels robots d’IA peuvent lire votre site et testez n’importe quelle adresse avec ces règles avant de mettre le fichier en ligne.
- Générateur + testeur
- Options robots IA
- Contrôle des règles
- Dans votre navigateur
Modèles
Un modèle remplace les groupes de règles ci-dessous et conserve vos sitemaps. Modifiez ensuite ce que vous voulez – Annuler rétablit ce que vous aviez.
Règles pour les robots
Il n’y a aucun groupe. Sans règles, chaque robot peut explorer toutes les pages.
Un robot ne suit que le groupe qui le désigne le plus précisément, sinon le groupe *. Dans un groupe, le chemin correspondant le plus long l’emporte ; si une règle Allow et une règle Disallow ont la même longueur, Allow l’emporte. * remplace n’importe quels caractères, $ marque la fin de l’adresse.
Robots d’IA
Les robots d’entraînement copient le contenu dans les données d’entraînement des modèles ; les robots de recherche et de récupération à la demande lisent une page en direct et renvoient généralement vers elle. Chaque interrupteur ajoute ou retire un groupe. Bloquer Google-Extended ne modifie pas votre classement dans la recherche Google. Les entreprises d’IA sérieuses respectent ces règles, mais robots.txt ne peut contraindre personne.
Sitemaps et en-tête du fichier
Utilisez l’adresse complète, https:// compris. Les lignes Sitemap s’appliquent à tous les robots, quel que soit leur emplacement dans le fichier.
Facultatif. Chaque ligne devient un commentaire commençant par #.
Importer un robots.txt existant
robots.txt
Rien à afficher pour l’instant.
Enregistrez le fichier sous le nom robots.txt et envoyez-le à la racine du site, afin qu’il s’ouvre à l’adresse https://your-domain.com/robots.txt. Chaque sous-domaine a besoin de son propre fichier. Une page bloquée peut tout de même apparaître dans les résultats de recherche, sans description – utilisez noindex sur la page elle-même pour l’en exclure.
Vérifications
Tester des adresses avec ces règles
Les adresses complètes comme les chemins tels que /shop/?sort=price fonctionnent. Seuls le chemin et la chaîne de requête sont comparés.
Saisissez le nom d’un robot ou collez un en-tête User-Agent complet.
Saisissez une ou plusieurs adresses pour voir si le robot choisi peut les explorer.
| Adresse | Résultat | Règle déterminante |
|---|
Comment créer un fichier robots.txt
Le fichier est reconstruit après chaque modification.
- 1
Partez d’un modèle ou de votre fichier
Choisissez un modèle comme WordPress, WooCommerce ou « Tout autoriser », ou collez un robots.txt existant pour le charger dans l’éditeur.
- 2
Modifiez les groupes
Ajoutez des user-agents, des chemins Allow et Disallow et les adresses de vos sitemaps. Deux options ajoutent ou retirent les groupes destinés aux robots d’IA.
- 3
Testez, puis téléchargez
Saisissez quelques adresses pour voir si un robot peut les récupérer, lisez les contrôles, puis enregistrez le fichier sous le nom robots.txt à la racine de votre site.
Un éditeur de robots.txt qui s’explique
La correspondance des règles suit la RFC 9309 et le comportement documenté par Google.
Groupes et règles
Chaque groupe désigne un ou plusieurs user-agents et liste ses chemins Allow et Disallow. Groupes et règles peuvent être réordonnés, commentés et supprimés.
Modèles
Tout autoriser, tout bloquer, WordPress, WooCommerce, une boutique de type Shopify, Joomla, Drupal, un site de préproduction et une liste de blocage des robots d’entraînement IA. « Annuler » rétablit votre version.
Options pour les robots d’IA
Une option pour les robots d’entraînement comme GPTBot, ClaudeBot, Google-Extended et CCBot, une autre pour la recherche IA et les récupérations déclenchées par un utilisateur, comme OAI-SearchBot et PerplexityBot.
Testeur intégré
Collez des adresses ou des chemins et choisissez un robot. Pour chacun, vous voyez « Autorisé » ou « Bloqué », le groupe appliqué et la ligne de la règle décisive. Le résultat s’exporte en CSV.
Import avec réparation
Collez ou ouvrez un fichier existant. Les directives mal orthographiées sont reconnues, et les lignes invalides, les règles orphelines et les lignes <code>noindex</code> non prises en charge sont signalées.
Contrôles pendant la saisie
Avertit quand tout le site ou Googlebot est bloqué, quand une règle risque de masquer du CSS ou du JavaScript, quand un chemin est mal formé et quand le fichier dépasse 500 Kio.
Confidentiel par conception
Tout fonctionne dans votre navigateur. Ce que vous saisissez, collez ou ouvrez n’est pas envoyé à un serveur.
Gratuit, sans inscription
Pas de compte, pas de limite, pas de filigrane – sur téléphone, tablette ou ordinateur.
Ce que fait robots.txt – et ce qu’il ne peut pas faire
Un fichier robots.txt est un fichier texte brut placé à la racine d’un hôte, par exemple https://example.com/robots.txt. Il indique aux robots d’exploration quels chemins ils peuvent demander. Le format est normalisé par la RFC 9309 sous le nom de Robots Exclusion Protocol : un groupe commence par une ou plusieurs lignes User-agent, suivies de règles Allow et Disallow. Chaque protocole, sous-domaine et port a besoin de son propre fichier, et les lignes Sitemap valent pour tous les robots, où qu’elles se trouvent.
Un robot ne suit qu’un seul groupe : celui qui le désigne le plus précisément, sinon le groupe *. Dans ce groupe, c’est la règle dont le chemin correspondant est le plus long qui décide ; si une règle Allow et une règle Disallow sont de même longueur, Allow l’emporte. * représente n’importe quelle suite de caractères et $ marque la fin de l’adresse : Disallow: /*.pdf$ bloque donc tous les PDF. Les chemins sont sensibles à la casse. Crawl-delay ne fait pas partie de la norme : Bing le respecte, Google l’ignore.
L’erreur la plus répandue consiste à utiliser robots.txt pour tenir une page à l’écart des résultats de recherche. Il empêche seulement l’exploration : une adresse bloquée peut quand même être indexée, sans description, si d’autres pages pointent vers elle. Pour exclure une page, laissez-la explorable et ajoutez une balise meta robots noindex ou un en-tête X-Robots-Tag. Autres erreurs courantes : un Disallow: / oublié après la préproduction, du CSS ou du JavaScript bloqués dont Google a besoin pour afficher les pages, et des secrets listés dans un fichier que tout le monde peut lire.
Règles robots.txt courantes
| Règle | Effet | Remarque |
|---|---|---|
| <code>Disallow:</code> (vide) | Autorise tout | Même résultat que l’absence de fichier |
| <code>Disallow: /</code> | Bloque tout le site | Uniquement pour les sites qui doivent rester hors des moteurs |
| <code>Disallow: /cart/</code> | Bloque un dossier et tout ce qu’il contient | Sans la barre oblique finale, la règle vaut aussi pour /cart-help |
| <code>Disallow: /*?sort=</code> | Bloque les adresses contenant ce paramètre | <code>*</code> correspond à n’importe quels caractères |
| <code>Allow: /wp-admin/admin-ajax.php</code> | Rouvre un fichier dans un dossier bloqué | La règle la plus longue l’emporte |
| <code>Sitemap: https://example.com/sitemap.xml</code> | Indique votre sitemap aux robots | L’adresse doit être complète |
Conseils
- Indiquez votre sitemap dans le fichier – créez-en un avec le Générateur de sitemap.
- Après la mise en ligne, vérifiez avec le Vérificateur de statut HTTP que
/robots.txtrépond avec le statut 200. Une erreur serveur sur ce fichier peut interrompre l’exploration de tout le site. - Pour exclure une page des résultats de recherche, écrivez une balise meta robots avec le Générateur de balises meta au lieu de bloquer la page ici.
- Robots.txt est une demande, pas un contrôle d’accès. Protégez les dossiers privés par un mot de passe ou une règle IP avec le Générateur de .htaccess.
Questions fréquentes
Vous ne trouvez pas votre réponse ? Contactez-nous — nous répondons rapidement.
Où placer le fichier robots.txt ?
Dans le dossier racine du site, afin qu’il s’ouvre à l’adresse https://votre-domaine.com/robots.txt. Un fichier placé dans un sous-dossier est ignoré. Chaque sous-domaine, et http et https séparément, utilise son propre fichier.
Disallow retire-t-il une page de Google ?
Non. Disallow empêche l’exploration, pas l’indexation. Si d’autres pages pointent vers l’adresse, elle peut quand même apparaître dans les résultats, sans description. Utilisez une balise meta robots noindex ou un en-tête X-Robots-Tag – et ne bloquez pas la page, sinon le robot ne verra jamais cette consigne.
Comment bloquer les robots d’IA comme GPTBot ou ClaudeBot ?
Ajoutez un groupe qui nomme le robot et contient Disallow: /. Les deux options IA de ce générateur écrivent ces groupes pour les robots d’entraînement connus et pour les robots de recherche IA. Les opérateurs sérieux respectent ces règles, mais robots.txt ne peut pas contraindre un robot à obéir.
Bloquer Google-Extended nuit-il à mon classement Google ?
Non. Google-Extended est un jeton de contrôle pour l’utilisation de vos contenus dans les modèles d’IA de Google. Il n’influence ni l’exploration par Googlebot ni votre position dans la recherche Google.
Ai-je vraiment besoin d’un fichier robots.txt ?
Pas forcément. Sans fichier, les robots considèrent que tout peut être récupéré. Un fichier est utile pour tenir les robots à l’écart des pages de résultats de recherche interne, des paniers et des zones d’administration, pour s’adresser à certains robots en particulier et pour annoncer votre sitemap.
Mes données sont-elles envoyées à un serveur ?
Non. L’outil fonctionne entièrement dans votre navigateur. Votre saisie n’est ni envoyée, ni journalisée, ni stockée sur nos serveurs.
Plus d’outils SEO et web gratuits
Générez balises et fichiers, vérifiez codes de statut, redirections, DNS et certificats – gratuitement et sans compte.