Qué controla realmente robots.txt
El archivo indica qué rutas pueden solicitar los rastreadores que respetan el Protocolo de Exclusión de Robots. Su uso principal es gestionar el acceso de bots a recursos o zonas que no necesitan rastrear.
No es una medida de seguridad: cualquiera puede leerlo. Tampoco impide el acceso de personas ni de rastreadores que decidan ignorarlo.
Una URL bloqueada puede aparecer en resultados si Google la descubre por enlaces, aunque no pueda rastrear su contenido.
Dónde debe estar el archivo
Debe publicarse con el nombre exacto robots.txt en la raíz del host: https://ejemplo.com/robots.txt. Las reglas se aplican únicamente al host, protocolo y puerto donde se encuentra.
Un archivo en www.ejemplo.com no controla necesariamente ejemplo.com. Los subdominios también necesitan su propio archivo cuando requieren reglas distintas.
Respuesta del servidor
El archivo debe poder descargarse como texto. Los códigos de estado, redirecciones y errores del servidor afectan a cómo los rastreadores interpretan su disponibilidad, por lo que conviene comprobar la respuesta después de publicarlo.
Sintaxis básica y grupos
Un grupo empieza con uno o varios campos User-agent y continúa con reglas Allow y Disallow. Cada ruta se interpreta desde la raíz del host.
User-agent: * Disallow: /zona-privada/ Allow: /zona-privada/recurso-publico/ Sitemap: https://ejemplo.com/sitemap.xml
Google utiliza la regla más específica cuando coinciden varias. Admite comodines y el símbolo de final de URL en determinadas reglas. Las rutas distinguen entre mayúsculas y minúsculas.
Directivas que no debes inventar
Google admite user-agent, allow, disallow y sitemap. No admite crawl-delay. Tampoco debe utilizarse una línea noindex dentro del archivo.
Por qué Disallow y noindex no son equivalentes
Si bloqueas una página en robots.txt, Google no puede rastrearla para ver una etiqueta noindex. La URL podría permanecer indexada sin snippet si existen enlaces hacia ella.
Para retirar una página HTML de los resultados, deja que pueda rastrearse y utiliza una metaetiqueta robots noindex o una cabecera HTTP equivalente. Para contenido privado, la solución es restringir el acceso con autenticación, no anunciar su ruta en robots.txt.
Recursos de renderizado
Bloquear CSS, JavaScript o imágenes necesarias puede dificultar que Google renderice y comprenda una página. No copies reglas antiguas sin saber si esas rutas siguen siendo prescindibles.
Cómo añadir el sitemap
La directiva Sitemap utiliza una URL absoluta. Puede aparecer varias veces y no necesita estar dentro de un grupo de rastreadores. Ayuda a descubrir el sitemap, pero no obliga a rastrear ni indexar todas sus URLs.
El sitemap debe contener únicamente URLs canónicas que quieras indexar. Añadirlo a robots.txt no corrige errores de contenido, estados HTTP o canonicalización.
Proceso seguro antes y después de publicar
- Descarga el archivo actual y guarda una copia.
- Define qué problema pretende resolver cada regla nueva.
- Prueba las rutas críticas: home, categorías, productos, servicios y recursos.
- Busca bloqueos globales como
Disallow: /. - Publica en la raíz y comprueba el código HTTP.
- Revisa el informe de robots.txt de Search Console.
- Supervisa cambios de rastreo, indexación y cobertura durante los días siguientes.
Durante migraciones o aperturas de entornos de producción, revisa especialmente los archivos heredados de desarrollo. Un bloqueo temporal puede llegar a producción y dejar el sitio completo fuera del rastreo.
Genera una base y revisa los bloqueos críticos
El generador crea el archivo, valida rutas y sitemaps y avisa si detecta un bloqueo total.
Abrir generador de robots.txt