Generador de robots.txt

Crea un archivo robots.txt válido en segundos: indica el user-agent, las rutas que quieres bloquear o permitir y la URL de tu sitemap, y luego cópialo o descárgalo.

Un robots.txt es un pequeño archivo de texto en la raíz de tu sitio web que indica a los rastreadores de los buscadores qué partes del sitio no deben rastrear. Es uno de los primeros archivos que solicita Googlebot, y una sola línea equivocada puede ocultar todo tu sitio. Este generador crea el archivo a partir de unos pocos campos sencillos, así que la sintaxis siempre es correcta.

Cómo crear tu archivo

  1. User-Agent: deja * para que las reglas se apliquen a todos los rastreadores, o escribe un bot concreto como Googlebot o Bingbot.
  2. Rutas Disallow: una ruta por línea para las zonas que los rastreadores no deben visitar, por ejemplo /admin/ o /cart/.
  3. Rutas Allow: excepciones dentro de una carpeta bloqueada, por ejemplo /admin/admin-ajax.php.
  4. Crawl-delay: opcional, en segundos (lee la nota más abajo).
  5. URL del sitemap: la dirección completa de tu sitemap XML.
  6. Haz clic en Generate robots.txt y después en Copy o Download.

Sube el archivo al nivel superior de tu dominio para que se abra en https://tudominio.com/robots.txt. Los rastreadores no lo buscan en ningún otro sitio, y cada subdominio necesita su propio archivo.

Ejemplo: una tienda online típica

User-agent: *
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /search
Allow: /search/help

Sitemap: https://example.com/sitemap.xml

El carrito, el pago y la cuenta son distintos para cada visitante y no aportan nada en los resultados de búsqueda, y las páginas de búsqueda interna pueden generar infinitas combinaciones de URL que desperdician tiempo de rastreo. Todo lo demás, incluidas las páginas de productos y categorías, queda abierto.

Cinco errores que conviene evitar

  1. Disallow: / lo bloquea todo. Es habitual en sitios de pruebas y a veces se copia por error al sitio real. Si tus páginas desaparecen de repente de Google, revisa esto primero.
  2. robots.txt no elimina páginas de Google. Una página bloqueada puede indexarse igualmente si otros sitios la enlazan, solo que sin descripción. Para mantener una página fuera de los resultados, deja que se rastree y añade una metaetiqueta noindex.
  3. No bloquees CSS ni JavaScript. Google renderiza las páginas como un navegador. Si no puede cargar tus hojas de estilo y scripts, puede considerar la página rota o no apta para móviles.
  4. Las rutas distinguen mayúsculas y minúsculas. /Admin/ y /admin/ son reglas distintas.
  5. No es una medida de seguridad. El archivo es público y los bots maliciosos lo ignoran. Protege las zonas privadas con un inicio de sesión, no con robots.txt.

Una nota sobre Crawl-delay

Bing y algunos otros rastreadores respetan Crawl-delay, pero Googlebot lo ignora. Google ajusta automáticamente su ritmo de rastreo según la rapidez con que responde tu servidor. Añade un retraso solo si un bot concreto está sobrecargando tu servidor.

Compruébalo después de subirlo

Abre tu robots.txt en el navegador para confirmar que está publicado y usa el informe de robots.txt de Google Search Console (Configuración → robots.txt) para ver la versión que obtuvo Google y los errores que encontró. Prueba una página importante con la herramienta de inspección de URLs para confirmar que no está bloqueada.

¿Usas WordPress? El WordPress robots.txt Generator parte de reglas específicas para WordPress. Comprueba que el sitemap que indicas es válido con el XML Sitemap Generator y lee el artículo (en inglés) How to Create the Perfect Robots.txt File for SEO para ver más ejemplos.

Frequently Asked Questions

En la carpeta raíz de tu dominio, para que se abra en https://tudominio.com/robots.txt. Los rastreadores solo miran esa ubicación exacta, y cada subdominio necesita su propio archivo.

No de forma fiable. Impide el rastreo, pero una página bloqueada puede indexarse si otras páginas la enlazan. Usa una metaetiqueta noindex en una página rastreable para mantenerla fuera de los resultados.

No. Googlebot ignora Crawl-delay y fija su propio ritmo de rastreo según la respuesta de tu servidor. Bing y algunos otros rastreadores sí lo respetan.

No. Google los necesita para mostrar bien tus páginas. Bloquearlos puede hacer que Google crea que tus páginas están rotas o no están adaptadas a móviles.

No es obligatorio. Sin él, los rastreadores simplemente rastrean todo lo que encuentran. Aun así conviene tenerlo para indicar tu sitemap y mantener a los rastreadores fuera del carrito, el inicio de sesión y las búsquedas internas.