Robots.txtes un archivo de texto plAIn colocado en la raíz de un domAIn (yoursite.com/robots.txt) que indica a los rastreadores de motores de búsqueda a qué URLs se les permite o no acceder. Google, Bing y otros rastreadores importantes verifican este archivo antes de solicitar cualquier página. Controla la asignación del presupuesto de rastreo, pero nonoevitar que aparezcan páginas en el índice de Google si están vinculadas desde otros sitios.

Ubicación del archivo
/robots.txten domAIn raíz
Categoría
Técnico SEO
lo que controla
Acceso de rastreo, no indexación
Dificultad
Intermedio

Según la documentación de Google: "Googlebot comprueba el archivo robots.txt antes de realizar cualquier solicitud a su servidor". Ese único archivo controla cada decisión de rastreo. Si lo hace mal, le entregará a Google una lista de páginas que no debe rastrear, incluidas a veces el contenido más importante.

¿Qué es robots.txt?

Robots.txt implementa el Protocolo de exclusión de robots, un estándar web de facto desde 1994. Es un archivo de texto plAIn (sin HTML, sin marcado) que continúa con una serie de reglas que los rastreadores web cooperativos leen antes de acceder a cualquier página de su domAIn.

El archivo utiliza tres componentes principales:

  • Agente de usuario:Especifica a qué rastreador se dirige la regla.Agente de usuario: *Se aplica a todos los robots.Agente de usuario: Googlebotse dirige únicamente al rastreador de Google.
  • Rechazar:Bloquea el acceso a rutas específicas.No permitir: /admin/evita que los rastreadores soliciten cualquier URL que comience con /admin/. un espacio en blancoRechazar:significa permitirlo todo.
  • Permitir:Anula una prohibición más amplia para subrutas específicas. Útil cuando bloquea un directorio pero necesita que un archivo dentro de él sea rastreable.
Reglas de procesamiento de Google

Si Google recibe un200respuesta para robots.txt, sigue las reglas. A404(archivo no encontrado) significa que no hay restricciones: todo se puede rastrear. A5xxUn error del servidor hace que Google limite temporalmente el rastreo de todo el sitio para proteger un servidor con problemas.

Por qué el archivo robots.txt es importante para SEO

En sitios pequeños con 50 páginas, robots.txt tiene poco en juego. En sitios con miles de páginas, es una herramienta fundamental para la asignación de tráfico. Cuatro razones por las que es importante:

  1. Protección del presupuesto de rastreo.Google asigna un presupuesto de rastreo a cada sitio: una cantidad limitada de páginas que rastreará por día. El bloqueo de páginas de bajo valor (paneles de administración, áreas de preparación, variaciones de filtros duplicados) mantiene ese presupuesto enfocado en las páginas que desea indexar.
  2. Prevención de la indexación de áreas sensibles.Los resultados de búsqueda interna, las páginas de inicio de sesión, las páginas del carrito y los entornos de preparación no pertenecen al índice de Google. Robots.txt mantiene a los rastreadores alejados de estas rutas incluso antes de que lleguen a la página.
  3. Descubrimiento más rápido de nuevos contenidos.Cuando los rastreadores dejan de desperdiciar solicitudes en páginas basura, encuentran nuevas publicaciones de blog y Product páginas más rápido. Un sitio que publica 30 Articles nuevos al mes se beneficia de que cada rastreo se dedique a contenido real.
  4. Gestión de carga del servidor.Bloquear el rastreo innecesario reduce el consumo de recursos. Para alojamiento compartido o implementaciones pequeñas de VPS, esto puede reducir significativamente la strAIn del servidor durante las ráfagas de rastreo.

Cómo funcionan las directivas robots.txt

Un archivo robots.txt se lee de arriba a abajo. La primera regla coincidente gana. Esto es lo que hace cada directiva en la práctica:

# Permitir que todos los bots rastreen todo (predeterminado cuando no existe ningún archivo)
Agente de usuario: *
Rechazar:

# Bloquear todos los bots de todo el sitio (peligroso: evitarlo en Production)
Agente de usuario: *
No permitir: /

# Bloquear Googlebot del administrador y del staging únicamente
Agente de usuario: Googlebot
No permitir: /admin/
No permitir: /puesta en escena/

# Apuntar al mapa del sitio XML
Mapa del sitio: HTTPS://example.com/sitemap.XML

Tipos de directivas robots.txt

DirectivaFunciónEjemplo
Rechazar Bloquear al rastreador de la ruta No permitir: /wp-admin/
PermitirAnular una prohibición de subrutaPermitir: /wp-admin/admin-AJAX.php
Agente de usuarioApuntar a un rastreador específicoAgente de usuario: Googlebot
Mapa del sitioApunte al mapa del sitio XMLMapa del sitio: HTTPS://site.com/sitemap.XML
retraso de rastreoSolicitudes de rastreador de límite de velocidadRetraso de rastreo: 10

Ejemplos reales de robots.txt

1. Sitio WordPress: bloqueo de administrador y filtro URLs

Agente de usuario: *
No permitir: /wp-admin/
No permitir: /wp-login.php
No permitir: /carrito/
No permitir: /pagar/
Permitir: /wp-admin/admin-AJAX.php

Mapa del sitio: HTTPS://yoursite.com/sitemap.XML

2. Sitio de comercio electrónico: parámetro de filtro de bloqueo URLs

Un retAIler en línea con 50 Products pero 3000 combinaciones URL generadas por filtro utiliza una línea No permitir para ahorrar presupuesto de rastreo:

Agente de usuario: Googlebot
No permitir: /Products?filter=
No permitir: /Products?sort=
No permitir: /Products?color=

Mapa del sitio: HTTPS://store.example.com/sitemap.XML

3. El error Production que costó 3 semanas de indexación

Se fue una agencia de marketingNo permitir: /en su Production robots.txt después de copiar desde un entorno de prueba. El resultado: cero páginas nuevas indexadas durante 3 semanas y una fuerte caída del tráfico antes de que se detectara el error a través de Search Console. Una línea, consecuencias masivas.

AspectoRobots.txtEtiqueta de meta robots
Ubicaciónarchivo de directorio raízHTML<cabeza>de páginas individuales
Momentoantes de gatearDespués del rastreo (se debe recuperar la página)
AlcanceDirectorios o rutas completosPáginas individuales
¿Evita la indexación?No, solo evita el rastreoSí -sin índiceelimina de la búsqueda
Lo mejor paraBloquear secciones del sitio a escalaEliminar páginas específicas de la búsqueda
Trampa crítica: bloquear una página sin índice en robots.txt

Si bloquea una página en robots.txt, Google no puede rastrearla y, por lo tanto, no puede leer el<meta name="robots" content="noindex">etiqueta. Es posible que la página aún aparezca en los resultados si sitios externos enlazan con ella. Para eliminar una página de Google, necesita que se pueda rastrear para que Google pueda ver la directiva noindex.

Cinco mejores prácticas de robots.txt

  1. Incluya siempre una directiva de mapa del sitio.Dirija a los rastreadores directamente a su mapa de sitio XML para que descubran todos los URL indexables sistemáticamente en lugar de depender únicamente del seguimiento de enlaces.
  2. Nunca bloquee archivos CSS o JavaScript.Google necesita representar sus páginas para comprender el contenido. Bloquear JS o CSS hace que Google vea una versión simplificada y parcialmente rota de su página, lo que perjudica la evaluación de la calidad.
  3. Pruebe cada cambio antes de implementarlo.Utilice el probador de robots.txt de Google Search Console o la herramienta de inspección URL para verificar que sus reglas funcionen según lo previsto. Un solo error tipográfico puede romper una regla crítica.
  4. Revise trimestralmente a medida que su sitio crezca.Nuevos directorios, nuevos complementos CMS y nuevos patrones URL pueden crear rutas basura desbloqueadas. Robots.txt debería evolucionar con el sitio.
  5. Utilice No permitir para directorios, no para archivos individuales.Bloquear rutas enteras (/administración/) en lugar de nombres de archivos individuales. Los directorios son estables; los nombres de los archivos cambian. Las reglas a nivel de ruta son más duraderas.

Errores comunes de robots.txt que se deben evitar

  • Implementando robots.txt provisionales en Production.El error catastrófico más común. Siempre verifique que Production nunca hayaNo permitir: /.
  • Bloqueo de CSS y JavaScript.Impide que Google represente las páginas correctamente. Hace que Googlebot evalúe diseños de página rotos y sin estilo.
  • Bloquear páginas para eliminarlas de Google.Las páginas bloqueadas aún se pueden indexar si se vinculan externamente. Usarsin índiceen lugar de eliminarlo.
  • Olvidando el aislamiento subdomAIn.Un archivo robots.txt en ejemplo.com no se aplica a blog.example.com. Cada subdomAIn necesita su propio archivo.
  • Sin referencia al mapa del sitio.Falta elMapa del sitio:La directiva significa que los rastreadores deben confiar completamente en el descubrimiento de enlaces para encontrar sus páginas.
  • Confiar en robots.txt para la seguridad.Es un protocolo de cortesía, no un mecanismo de seguridad. Los robots maliciosos lo ignoran. No coloque puntos finales sensibles detrás del archivo robots.txt únicamente.

Preguntas frecuentes

No directamente. Robots.txt evita el rastreo, no la indexación. Si otros sitios enlazan a una página bloqueada, Google aún puede mostrarla en los resultados sin un fragmento de descripción. Utilice una metaetiqueta noindex para eliminar completamente una página de los resultados de búsqueda.

Colóquelo en su raíz domAIn:HTTPS://yoursite.com/robots.txt. La ubicación del subdirectorio no funciona. Cada subdomAIn necesita su propio archivo robots.txt; una regla en example.com/robots.txt no se aplica a blog.example.com.

Indirectamente, sí. El bloqueo de páginas de bajo valor preserva el presupuesto de rastreo para contenido importante. En sitios grandes, esto significa un descubrimiento e indexación más rápidos de nuevas páginas, lo que potencialmente acelera las mejoras en la clasificación de las páginas importantes.

Los robots de motores de búsqueda legítimos (Googlebot, Bingbot) respetan el archivo robots.txt. Los robots y raspadores maliciosos normalmente lo ignoran. No confíe en robots.txt por seguridad: es una guía para rastreadores cooperativos, no un firewall.

Si Google recibe un error de servidor 5xx al recuperar el archivo robots.txt, limita temporalmente el rastreo de todo el sitio para evitar sobrecargar un servidor con problemas. Se prueba un 404 (archivo no encontrado) trEAT como sin restricciones: todas las páginas se pueden rastrear.

Fuentes

Akshay VR

Akshay VR

Jefe de marketing · theStacc · ex especialista senior en marketing, ARKA 360 · Malappuram, Kerala

Akshay lidera las operaciones editoriales y de contenido en theStacc. Escribe sobre SEO artesanía, operaciones de contenido y las pequeñas decisiones técnicas que determinan qué páginas Google realmente rastrea, incluido cómo robots.txt puede destruir silenciosamente el tráfico orgánico cuando se implementa descuidadamenteSSLy.