Generador de robots.txt

Crea un archivo robots.txt a partir de grupos de reglas y plantillas, decide qué rastreadores de IA pueden leer tu sitio y prueba cualquier dirección con las reglas antes de subir el archivo.

  • Generador + probador
  • Interruptores para bots de IA
  • Comprueba las reglas
  • Funciona en tu navegador

Plantillas

Una plantilla sustituye los grupos de reglas de abajo y conserva tus sitemaps. Después puedes editar lo que quieras: Deshacer recupera lo que tenías.

Reglas para los rastreadores

Un rastreador solo sigue el grupo que lo nombra con más precisión y, si no lo hay, el grupo *. Dentro de un grupo gana la ruta coincidente más larga; cuando una regla Allow y una Disallow tienen la misma longitud, gana Allow. * representa cualquier secuencia de caracteres y $ marca el final de la dirección.

Rastreadores de IA

Los rastreadores de entrenamiento copian el contenido en los datos de entrenamiento de los modelos; los buscadores de IA y los agentes activados por usuarios leen una página en directo y normalmente enlazan a ella. Cada interruptor añade o quita un grupo. Bloquear Google-Extended no cambia tu posición en la Búsqueda de Google. Las empresas de IA serias respetan estas reglas, pero robots.txt no puede obligar a nadie.

Sitemaps y cabecera del archivo

Direcciones de los sitemaps

Usa la dirección completa, incluido https://. Las líneas Sitemap se aplican a todos los rastreadores, estén donde estén en el archivo.

Opcional. Cada línea se convierte en un comentario que empieza por #.

Importar un robots.txt existente

    robots.txt

    Guarda el archivo como robots.txt y súbelo a la raíz del sitio, de modo que se abra en https://your-domain.com/robots.txt. Cada subdominio necesita su propio archivo. Una página bloqueada puede seguir apareciendo en los resultados de búsqueda sin descripción: usa noindex en la propia página para dejarla fuera.

    Comprobaciones

      Probar direcciones con estas reglas

      Sirven tanto direcciones completas como rutas del tipo /shop/?sort=price. Solo se comparan la ruta y la cadena de consulta.

      Escribe el nombre de un rastreador o pega una cabecera User-Agent completa.

      Introduce una o varias direcciones para ver si el rastreador elegido puede acceder a ellas.

      Cómo funciona

      Cómo crear un archivo robots.txt

      El archivo se vuelve a generar después de cada cambio.

      1. 1

        Parte de una plantilla o de tu propio archivo

        Elige una plantilla como WordPress, WooCommerce o «Permitir todo», o pega un robots.txt existente para cargarlo en el editor.

      2. 2

        Edita los grupos

        Añade user-agents, rutas Allow y Disallow y las direcciones de tus sitemaps. Dos interruptores añaden o quitan los grupos de los rastreadores de IA.

      3. 3

        Prueba y descarga

        Introduce unas cuantas direcciones para ver si un rastreador puede acceder a ellas, lee las comprobaciones y guarda el archivo como robots.txt para la raíz de tu sitio.

      Por qué ToolCMB

      Un editor de robots.txt que se explica solo

      La coincidencia de reglas sigue la RFC 9309 y el comportamiento que documenta Google.

      Grupos y reglas

      Cada grupo nombra uno o varios user-agents y enumera sus rutas Allow y Disallow. Los grupos y las reglas se pueden reordenar, comentar y eliminar.

      Plantillas

      Permitir todo, bloquear todo, WordPress, WooCommerce, una tienda tipo Shopify, Joomla, Drupal, un sitio de pruebas y una lista de bloqueo para bots de entrenamiento de IA. Deshacer recupera lo que tenías.

      Interruptores para rastreadores de IA

      Un interruptor para los rastreadores de entrenamiento, como GPTBot, ClaudeBot, Google-Extended y CCBot, y otro para los de búsqueda con IA y las descargas iniciadas por usuarios, como OAI-SearchBot y PerplexityBot.

      Probador integrado

      Pega direcciones o rutas y elige un rastreador. Para cada una verás Permitido o Bloqueado, el grupo que se ha aplicado y la línea de la regla que decide. El resultado se exporta como CSV.

      Importación con reparación

      Pega o abre un archivo existente. Las directivas mal escritas se reconocen, y se señalan las líneas no válidas, las reglas huérfanas y las líneas <code>noindex</code>, que no están admitidas.

      Comprobaciones mientras escribes

      Avisa cuando todo el sitio o Googlebot están bloqueados, cuando una regla puede ocultar CSS o JavaScript, cuando una ruta está mal formada y cuando el archivo supera los 500 KiB.

      Privado por diseño

      Todo funciona en tu navegador. Lo que escribes, pegas o abres no se envía a ningún servidor.

      Gratis y sin registro

      Sin cuenta, sin límites y sin marca de agua: en el móvil, la tableta o el ordenador.

      Qué hace robots.txt y qué no puede hacer

      Un archivo robots.txt es un archivo de texto sin formato situado en la raíz de un host, por ejemplo https://example.com/robots.txt. Indica a los rastreadores qué rutas pueden solicitar. El formato está estandarizado como Robots Exclusion Protocol en la RFC 9309: los grupos empiezan con una o varias líneas User-agent, seguidas de reglas Allow y Disallow. Cada protocolo, subdominio y puerto necesita su propio archivo, y las líneas Sitemap se aplican a todos los rastreadores, estén donde estén.

      Un rastreador sigue un solo grupo: el que lo nombra con más precisión o, si no hay ninguno, el grupo *. Dentro de ese grupo decide la regla cuya ruta coincidente es más larga; si una regla Allow y una Disallow tienen la misma longitud, gana Allow. * representa cualquier secuencia de caracteres y $ marca el final de la dirección, de modo que Disallow: /*.pdf$ bloquea todos los PDF. Las rutas distinguen entre mayúsculas y minúsculas. Crawl-delay no forma parte del estándar: Bing lo respeta y Google lo ignora.

      El error más frecuente es usar robots.txt para mantener una página fuera de los resultados de búsqueda. Solo impide el rastreo: una dirección bloqueada puede indexarse igualmente, sin descripción, cuando otras páginas enlazan a ella. Para excluir una página, deja que se pueda rastrear y añade una metaetiqueta robots noindex o una cabecera X-Robots-Tag. Otros errores habituales son un Disallow: / olvidado de un sitio de pruebas, CSS o JavaScript bloqueados que Google necesita para renderizar las páginas, y secretos enumerados en un archivo que cualquiera puede leer.

      Reglas habituales de robots.txt

      ReglaEfectoNota
      <code>Disallow:</code> (vacío)Permite todoEl mismo resultado que no tener archivo
      <code>Disallow: /</code>Bloquea todo el sitioSolo para sitios que deben quedar fuera de los buscadores
      <code>Disallow: /cart/</code>Bloquea una carpeta y todo lo que contieneSin la barra final también coincide con /cart-help
      <code>Disallow: /*?sort=</code>Bloquea las direcciones que contienen este parámetro<code>*</code> coincide con cualquier carácter
      <code>Allow: /wp-admin/admin-ajax.php</code>Vuelve a abrir un archivo dentro de una carpeta bloqueadaGana la regla más larga
      <code>Sitemap: https://example.com/sitemap.xml</code>Indica a los rastreadores dónde está tu sitemapDebe ser una dirección completa

      Consejos

      • Incluye tu sitemap en el archivo: crea uno con el Generador de sitemap.
      • Después de subirlo, confirma con el Comprobador de estado HTTP que /robots.txt responde con el estado 200. Un error de servidor en este archivo puede detener el rastreo de todo el sitio.
      • Para mantener una página fuera de los resultados de búsqueda, escribe una metaetiqueta robots con el Generador de metaetiquetas en lugar de bloquear la página aquí.
      • Robots.txt es una petición, no un control de acceso. Protege las carpetas privadas con una contraseña o una regla por IP del Generador de .htaccess.
      Preguntas frecuentes

      Preguntas frecuentes

      ¿No encuentras tu respuesta? Escríbenos: respondemos rápido.

      ¿Dónde se coloca el archivo robots.txt?

      En la carpeta raíz del sitio, de modo que se abra en https://your-domain.com/robots.txt. Un archivo en una subcarpeta se ignora. Cada subdominio, y http y https por separado, usa su propio archivo.

      ¿Disallow elimina una página de Google?

      No. Disallow impide el rastreo, no la indexación. Si otras páginas enlazan a la dirección, puede seguir apareciendo en los resultados sin descripción. Usa una metaetiqueta robots noindex o una cabecera X-Robots-Tag, y no bloquees la página: de lo contrario, el rastreador nunca verá esa instrucción.

      ¿Cómo bloqueo bots de IA como GPTBot o ClaudeBot?

      Añade un grupo que nombre al rastreador y contenga Disallow: /. Los dos interruptores de IA de este generador escriben esos grupos para los rastreadores de entrenamiento conocidos y para los de búsqueda con IA. Los operadores serios respetan estas reglas, pero robots.txt no puede obligar a un rastreador a obedecer.

      ¿Bloquear Google-Extended afecta a mi posición en Google?

      No. Google-Extended es un token de control sobre el uso de tu contenido en los modelos de IA de Google. No influye en el rastreo de Googlebot ni en tu posición en la Búsqueda de Google.

      ¿De verdad necesito un archivo robots.txt?

      No necesariamente. Sin archivo, los rastreadores dan por hecho que pueden acceder a todo. Un archivo resulta útil para mantener a los rastreadores fuera de las páginas de resultados de búsqueda interna, los carritos y las zonas de administración, para dirigirse a rastreadores concretos y para anunciar tu sitemap.

      ¿Se envían mis datos a un servidor?

      No. La herramienta funciona por completo en tu navegador. Lo que introduces no se sube, no se registra y no se guarda en nuestros servidores.

      Más herramientas SEO y web gratuitas

      Genera etiquetas y archivos, comprueba códigos de estado, redirecciones, DNS y certificados: gratis y sin cuenta.

      Ver todas las herramientas