Qué controla realmente robots.txt

El archivo indica qué rutas pueden solicitar los rastreadores que respetan el Protocolo de Exclusión de Robots. Su uso principal es gestionar el acceso de bots a recursos o zonas que no necesitan rastrear.

No es una medida de seguridad: cualquiera puede leerlo. Tampoco impide el acceso de personas ni de rastreadores que decidan ignorarlo.

Robots.txt controla rastreo, no garantiza desindexación.

Una URL bloqueada puede aparecer en resultados si Google la descubre por enlaces, aunque no pueda rastrear su contenido.

Dónde debe estar el archivo

Debe publicarse con el nombre exacto robots.txt en la raíz del host: https://ejemplo.com/robots.txt. Las reglas se aplican únicamente al host, protocolo y puerto donde se encuentra.

Un archivo en www.ejemplo.com no controla necesariamente ejemplo.com. Los subdominios también necesitan su propio archivo cuando requieren reglas distintas.

Respuesta del servidor

El archivo debe poder descargarse como texto. Los códigos de estado, redirecciones y errores del servidor afectan a cómo los rastreadores interpretan su disponibilidad, por lo que conviene comprobar la respuesta después de publicarlo.

Sintaxis básica y grupos

Un grupo empieza con uno o varios campos User-agent y continúa con reglas Allow y Disallow. Cada ruta se interpreta desde la raíz del host.

User-agent: *
Disallow: /zona-privada/
Allow: /zona-privada/recurso-publico/

Sitemap: https://ejemplo.com/sitemap.xml

Google utiliza la regla más específica cuando coinciden varias. Admite comodines y el símbolo de final de URL en determinadas reglas. Las rutas distinguen entre mayúsculas y minúsculas.

Directivas que no debes inventar

Google admite user-agent, allow, disallow y sitemap. No admite crawl-delay. Tampoco debe utilizarse una línea noindex dentro del archivo.

Por qué Disallow y noindex no son equivalentes

Si bloqueas una página en robots.txt, Google no puede rastrearla para ver una etiqueta noindex. La URL podría permanecer indexada sin snippet si existen enlaces hacia ella.

Para retirar una página HTML de los resultados, deja que pueda rastrearse y utiliza una metaetiqueta robots noindex o una cabecera HTTP equivalente. Para contenido privado, la solución es restringir el acceso con autenticación, no anunciar su ruta en robots.txt.

Recursos de renderizado

Bloquear CSS, JavaScript o imágenes necesarias puede dificultar que Google renderice y comprenda una página. No copies reglas antiguas sin saber si esas rutas siguen siendo prescindibles.

Cómo añadir el sitemap

La directiva Sitemap utiliza una URL absoluta. Puede aparecer varias veces y no necesita estar dentro de un grupo de rastreadores. Ayuda a descubrir el sitemap, pero no obliga a rastrear ni indexar todas sus URLs.

El sitemap debe contener únicamente URLs canónicas que quieras indexar. Añadirlo a robots.txt no corrige errores de contenido, estados HTTP o canonicalización.

Proceso seguro antes y después de publicar

  1. Descarga el archivo actual y guarda una copia.
  2. Define qué problema pretende resolver cada regla nueva.
  3. Prueba las rutas críticas: home, categorías, productos, servicios y recursos.
  4. Busca bloqueos globales como Disallow: /.
  5. Publica en la raíz y comprueba el código HTTP.
  6. Revisa el informe de robots.txt de Search Console.
  7. Supervisa cambios de rastreo, indexación y cobertura durante los días siguientes.

Durante migraciones o aperturas de entornos de producción, revisa especialmente los archivos heredados de desarrollo. Un bloqueo temporal puede llegar a producción y dejar el sitio completo fuera del rastreo.

Herramienta relacionada

Genera una base y revisa los bloqueos críticos

El generador crea el archivo, valida rutas y sitemaps y avisa si detecta un bloqueo total.

Abrir generador de robots.txt

Fuentes y documentación