Generador de robots.txt
Crea un robots.txt con reglas por bot, presets y línea de sitemap.
¿Cómo genero un archivo robots.txt gratis y sin registro?
Con el generador de robots.txt de Docuboxer creas el archivo en segundos: eliges un preset o partes de cero, añades grupos de reglas por user-agent (Googlebot, Bingbot, GPTBot, ClaudeBot...) con sus rutas Allow y Disallow, y descargas el resultado listo para subir a la raíz de tu dominio. Todo el procesamiento ocurre en tu navegador, sin subir nada a ningún servidor ni pedirte una cuenta. Ahora la parte honesta: robots.txt controla el rastreo, no la indexación. Si otro sitio enlaza a una URL que bloqueaste, Google puede seguir mostrándola en resultados con solo la dirección, sin descripción. Para sacar una página del índice de verdad, la herramienta que necesitas es la etiqueta meta robots noindex, no este archivo. Y tampoco es una barrera de seguridad: los bots maliciosos y los scrapers que no respetan el estándar simplemente lo ignoran, así que nunca lo uses para esconder contenido sensible.
Cómo usar Generador de robots.txt
- Elige un preset de partida (permitir todo, bloquear todo para un entorno de staging, bloquear crawlers de IA o WordPress típico) o empieza un grupo de reglas desde cero.
- Define el user-agent de cada grupo (usa * para todos los buscadores, o nombres concretos como Googlebot, Bingbot, GPTBot o ClaudeBot) y añade las rutas que quieres permitir o bloquear.
- Añade la URL absoluta de tu sitemap si tienes uno, y opcionalmente un Crawl-delay por grupo, recordando que Google lo ignora por completo.
- Revisa la vista previa en vivo del archivo, cópialo al portapapeles o descárgalo como robots.txt y súbelo a la raíz de tu dominio (tudominio.com/robots.txt).
Casos de uso comunes
Bloquear un entorno de staging antes del lanzamiento
Aplica el preset "Bloquear todo" en el subdominio de pruebas para evitar que Google indexe una versión sin terminar del sitio mientras el equipo sigue trabajando en ella.
Impedir que crawlers de IA entrenen con tu contenido
Usa el preset "Bloquear crawlers de IA" para frenar de un clic a GPTBot, ClaudeBot, CCBot, Google-Extended, PerplexityBot y Bytespider, sin tocar el acceso de Googlebot o Bingbot a tus páginas.
Configurar las rutas típicas de un WordPress
Parte del preset WordPress para bloquear /wp-admin/, /wp-includes/ y las carpetas de plugins y temas, dejando accesible admin-ajax.php, que muchos plugins necesitan para funcionar aunque el resto esté bloqueado.
Optimizar el presupuesto de rastreo en un sitio grande
En catálogos con miles de URLs (filtros, paginación, resultados de búsqueda interna), bloquea las rutas de bajo valor para que los rastreadores dediquen su tiempo a las páginas que sí quieres posicionar.
Declarar el sitemap para que los buscadores lo encuentren solos
Añade la línea Sitemap con la URL absoluta de tu sitemap.xml para que Googlebot y Bingbot lo descubran automáticamente al leer robots.txt, sin depender solo de que lo hayas enviado a mano en Search Console.
Preguntas frecuentes
¿El archivo robots.txt impide que Google indexe mis páginas?
No exactamente. Robots.txt bloquea el rastreo, pero Google puede seguir indexando una URL bloqueada si otro sitio enlaza a ella, mostrándola en resultados sin descripción. Para evitar la indexación de verdad, usa la etiqueta meta robots noindex en la propia página.
¿Puedo bloquear un crawler de IA como GPTBot sin afectar a Google?
Sí. Cada grupo de reglas se aplica solo a su user-agent, así que puedes crear un grupo que bloquee GPTBot o ClaudeBot con Disallow: / y dejar intacto el acceso de Googlebot en su propio grupo. El preset "Bloquear crawlers de IA" ya lo hace por ti.
¿Dónde tengo que subir el archivo robots.txt?
Siempre en la raíz del dominio, nunca en una subcarpeta: tudominio.com/robots.txt. Un archivo en tudominio.com/blog/robots.txt no lo leerá ningún buscador.
¿Sirve robots.txt para ocultar información privada o carpetas sensibles?
No, y usarlo así es contraproducente: el archivo es público, así que listar una ruta en Disallow revela justo esa ruta a cualquiera que lo lea. Además, los bots maliciosos y los scrapers que no respetan el estándar lo ignoran sin más. Para proteger contenido real usa autenticación o control de acceso en el servidor.
¿Qué es el Crawl-delay y lo respeta Google?
Crawl-delay pide a un bot que espere N segundos entre peticiones para no saturar el servidor. Google lo ignora por completo desde hace años (usa la configuración de velocidad de rastreo en Search Console); Bing y algún otro buscador sí lo respetan parcialmente.
¿Puedo tener varios grupos de reglas para el mismo user-agent?
Sí, aunque lo habitual y más claro es un único grupo por agente. El generador te deja crear los que necesites y los emite en el orden en que los añadiste, cada uno como bloque independiente.