Robots.txtes un archivo de texto plAIn colocado en la raíz de un domAIn (yoursite.com/robots.txt) que indica a los rastreadores de motores de búsqueda a qué URLs se les permite o no acceder. Google, Bing y otros rastreadores importantes verifican este archivo antes de solicitar cualquier página. Controla la asignación del presupuesto de rastreo, pero nonoevitar que aparezcan páginas en el índice de Google si están vinculadas desde otros sitios.
Según la documentación de Google: "Googlebot comprueba el archivo robots.txt antes de realizar cualquier solicitud a su servidor". Ese único archivo controla cada decisión de rastreo. Si lo hace mal, le entregará a Google una lista de páginas que no debe rastrear, incluidas a veces el contenido más importante.
¿Qué es robots.txt?
Robots.txt implementa el Protocolo de exclusión de robots, un estándar web de facto desde 1994. Es un archivo de texto plAIn (sin HTML, sin marcado) que continúa con una serie de reglas que los rastreadores web cooperativos leen antes de acceder a cualquier página de su domAIn.
El archivo utiliza tres componentes principales:
- Agente de usuario:Especifica a qué rastreador se dirige la regla.
Agente de usuario: *Se aplica a todos los robots.Agente de usuario: Googlebotse dirige únicamente al rastreador de Google. - Rechazar:Bloquea el acceso a rutas específicas.
No permitir: /admin/evita que los rastreadores soliciten cualquier URL que comience con /admin/. un espacio en blancoRechazar:significa permitirlo todo. - Permitir:Anula una prohibición más amplia para subrutas específicas. Útil cuando bloquea un directorio pero necesita que un archivo dentro de él sea rastreable.
Si Google recibe un200respuesta para robots.txt, sigue las reglas. A404(archivo no encontrado) significa que no hay restricciones: todo se puede rastrear. A5xxUn error del servidor hace que Google limite temporalmente el rastreo de todo el sitio para proteger un servidor con problemas.
Por qué el archivo robots.txt es importante para SEO
En sitios pequeños con 50 páginas, robots.txt tiene poco en juego. En sitios con miles de páginas, es una herramienta fundamental para la asignación de tráfico. Cuatro razones por las que es importante:
- Protección del presupuesto de rastreo.Google asigna un presupuesto de rastreo a cada sitio: una cantidad limitada de páginas que rastreará por día. El bloqueo de páginas de bajo valor (paneles de administración, áreas de preparación, variaciones de filtros duplicados) mantiene ese presupuesto enfocado en las páginas que desea indexar.
- Prevención de la indexación de áreas sensibles.Los resultados de búsqueda interna, las páginas de inicio de sesión, las páginas del carrito y los entornos de preparación no pertenecen al índice de Google. Robots.txt mantiene a los rastreadores alejados de estas rutas incluso antes de que lleguen a la página.
- Descubrimiento más rápido de nuevos contenidos.Cuando los rastreadores dejan de desperdiciar solicitudes en páginas basura, encuentran nuevas publicaciones de blog y Product páginas más rápido. Un sitio que publica 30 Articles nuevos al mes se beneficia de que cada rastreo se dedique a contenido real.
- Gestión de carga del servidor.Bloquear el rastreo innecesario reduce el consumo de recursos. Para alojamiento compartido o implementaciones pequeñas de VPS, esto puede reducir significativamente la strAIn del servidor durante las ráfagas de rastreo.
Cómo funcionan las directivas robots.txt
Un archivo robots.txt se lee de arriba a abajo. La primera regla coincidente gana. Esto es lo que hace cada directiva en la práctica:
Agente de usuario: *
Rechazar:
# Bloquear todos los bots de todo el sitio (peligroso: evitarlo en Production)
Agente de usuario: *
No permitir: /
# Bloquear Googlebot del administrador y del staging únicamente
Agente de usuario: Googlebot
No permitir: /admin/
No permitir: /puesta en escena/
# Apuntar al mapa del sitio XML
Mapa del sitio: HTTPS://example.com/sitemap.XML
Tipos de directivas robots.txt
| Directiva | Función | Ejemplo |
|---|---|---|
| Rechazar | Bloquear al rastreador de la ruta | No permitir: /wp-admin/ |
| Permitir | Anular una prohibición de subruta | Permitir: /wp-admin/admin-AJAX.php |
| Agente de usuario | Apuntar a un rastreador específico | Agente de usuario: Googlebot |
| Mapa del sitio | Apunte al mapa del sitio XML | Mapa del sitio: HTTPS://site.com/sitemap.XML |
| retraso de rastreo | Solicitudes de rastreador de límite de velocidad | Retraso de rastreo: 10 |
Ejemplos reales de robots.txt
1. Sitio WordPress: bloqueo de administrador y filtro URLs
No permitir: /wp-admin/
No permitir: /wp-login.php
No permitir: /carrito/
No permitir: /pagar/
Permitir: /wp-admin/admin-AJAX.php
Mapa del sitio: HTTPS://yoursite.com/sitemap.XML
2. Sitio de comercio electrónico: parámetro de filtro de bloqueo URLs
Un retAIler en línea con 50 Products pero 3000 combinaciones URL generadas por filtro utiliza una línea No permitir para ahorrar presupuesto de rastreo:
No permitir: /Products?filter=
No permitir: /Products?sort=
No permitir: /Products?color=
Mapa del sitio: HTTPS://store.example.com/sitemap.XML
3. El error Production que costó 3 semanas de indexación
Se fue una agencia de marketingNo permitir: /en su Production robots.txt después de copiar desde un entorno de prueba. El resultado: cero páginas nuevas indexadas durante 3 semanas y una fuerte caída del tráfico antes de que se detectara el error a través de Search Console. Una línea, consecuencias masivas.
Robots.txt vs etiqueta meta robots: cuál usar
| Aspecto | Robots.txt | Etiqueta de meta robots |
|---|---|---|
| Ubicación | archivo de directorio raíz | HTML<cabeza>de páginas individuales |
| Momento | antes de gatear | Después del rastreo (se debe recuperar la página) |
| Alcance | Directorios o rutas completos | Páginas individuales |
| ¿Evita la indexación? | No, solo evita el rastreo | Sí -sin índiceelimina de la búsqueda |
| Lo mejor para | Bloquear secciones del sitio a escala | Eliminar páginas específicas de la búsqueda |
Si bloquea una página en robots.txt, Google no puede rastrearla y, por lo tanto, no puede leer el<meta name="robots" content="noindex">etiqueta. Es posible que la página aún aparezca en los resultados si sitios externos enlazan con ella. Para eliminar una página de Google, necesita que se pueda rastrear para que Google pueda ver la directiva noindex.
Cinco mejores prácticas de robots.txt
- Incluya siempre una directiva de mapa del sitio.Dirija a los rastreadores directamente a su mapa de sitio XML para que descubran todos los URL indexables sistemáticamente en lugar de depender únicamente del seguimiento de enlaces.
- Nunca bloquee archivos CSS o JavaScript.Google necesita representar sus páginas para comprender el contenido. Bloquear JS o CSS hace que Google vea una versión simplificada y parcialmente rota de su página, lo que perjudica la evaluación de la calidad.
- Pruebe cada cambio antes de implementarlo.Utilice el probador de robots.txt de Google Search Console o la herramienta de inspección URL para verificar que sus reglas funcionen según lo previsto. Un solo error tipográfico puede romper una regla crítica.
- Revise trimestralmente a medida que su sitio crezca.Nuevos directorios, nuevos complementos CMS y nuevos patrones URL pueden crear rutas basura desbloqueadas. Robots.txt debería evolucionar con el sitio.
- Utilice No permitir para directorios, no para archivos individuales.Bloquear rutas enteras (
/administración/) en lugar de nombres de archivos individuales. Los directorios son estables; los nombres de los archivos cambian. Las reglas a nivel de ruta son más duraderas.
Errores comunes de robots.txt que se deben evitar
- Implementando robots.txt provisionales en Production.El error catastrófico más común. Siempre verifique que Production nunca haya
No permitir: /. - Bloqueo de CSS y JavaScript.Impide que Google represente las páginas correctamente. Hace que Googlebot evalúe diseños de página rotos y sin estilo.
- Bloquear páginas para eliminarlas de Google.Las páginas bloqueadas aún se pueden indexar si se vinculan externamente. Usar
sin índiceen lugar de eliminarlo. - Olvidando el aislamiento subdomAIn.Un archivo robots.txt en ejemplo.com no se aplica a blog.example.com. Cada subdomAIn necesita su propio archivo.
- Sin referencia al mapa del sitio.Falta el
Mapa del sitio:La directiva significa que los rastreadores deben confiar completamente en el descubrimiento de enlaces para encontrar sus páginas. - Confiar en robots.txt para la seguridad.Es un protocolo de cortesía, no un mecanismo de seguridad. Los robots maliciosos lo ignoran. No coloque puntos finales sensibles detrás del archivo robots.txt únicamente.
Preguntas frecuentes
No directamente. Robots.txt evita el rastreo, no la indexación. Si otros sitios enlazan a una página bloqueada, Google aún puede mostrarla en los resultados sin un fragmento de descripción. Utilice una metaetiqueta noindex para eliminar completamente una página de los resultados de búsqueda.
Colóquelo en su raíz domAIn:HTTPS://yoursite.com/robots.txt. La ubicación del subdirectorio no funciona. Cada subdomAIn necesita su propio archivo robots.txt; una regla en example.com/robots.txt no se aplica a blog.example.com.
Indirectamente, sí. El bloqueo de páginas de bajo valor preserva el presupuesto de rastreo para contenido importante. En sitios grandes, esto significa un descubrimiento e indexación más rápidos de nuevas páginas, lo que potencialmente acelera las mejoras en la clasificación de las páginas importantes.
Los robots de motores de búsqueda legítimos (Googlebot, Bingbot) respetan el archivo robots.txt. Los robots y raspadores maliciosos normalmente lo ignoran. No confíe en robots.txt por seguridad: es una guía para rastreadores cooperativos, no un firewall.
Si Google recibe un error de servidor 5xx al recuperar el archivo robots.txt, limita temporalmente el rastreo de todo el sitio para evitar sobrecargar un servidor con problemas. Se prueba un 404 (archivo no encontrado) trEAT como sin restricciones: todas las páginas se pueden rastrear.
