El crawl budget o presupuesto de rastreo es el número total de URLs que Googlebot obtendrá de un sitio durante un período determinado. Equivale al límite de tasa de rastreo (capacidad del servidor que Googlebot puede usar de forma segura) multiplicado por la demanda de rastreo (cuánto quiere Google volver a rastrear en función de la frescura y popularidad). La optimización importa más en sitios con 10.000+ URLs o alta cadencia de publicación.

Fórmula
Límite de tasa × Demanda
Categoría
SEO técnico
Umbral
10.000+ URLs
Dificultad
Avanzado

Por debajo de 1.000 URLs, el crawl budget no es un problema. Por encima de 10.000 — especialmente en ecommerce y sitios de noticias — se convierte en la razón principal por la que el contenido nuevo permanece sin indexar durante semanas. Si corriges el crawl budget, la velocidad de indexación pasa de semanas a días.

¿Qué es el crawl budget?

El crawl budget es un concepto de SEO técnico que describe cuánto de tu sitio Googlebot rastreará en una ventana de tiempo determinada. Google introdujo el término oficialmente en una publicación de blog en 2017 para aclarar años de confusión.

Dos factores se combinan para fijar el presupuesto:

  • Límite de tasa de rastreo. El número máximo de conexiones paralelas que Googlebot puede abrir a tu sitio sin degradar el rendimiento para usuarios reales. Los servidores rápidos obtienen un límite más alto; los lentos se ven limitados.
  • Demanda de rastreo. Qué tanto Google quiere rastrear tus URLs. Las páginas populares y actualizadas frecuentemente tienen alta demanda. Las páginas obsoletas y huérfanas tienen baja demanda.

Multiplica ambos y obtienes el número de URLs que Googlebot obtendrá por día. Si desperdicias esas obtenciones en URLs con parámetros o enlaces rotos, las páginas importantes permanecen sin indexar.

La postura oficial de Google

Google afirma que la mayoría de los sitios no necesitan preocuparse por el crawl budget. Se convierte en una preocupación a partir de aproximadamente 10.000 URLs, o en sitios que publican 30+ páginas al mes y muestran retrasos de indexación en Search Console.

Por qué importa el crawl budget

  1. Indexación más rápida. Más presupuesto gastado en URLs importantes significa que el contenido nuevo se posiciona en días en lugar de semanas.
  2. Priorización. Los sitios bien gestionados permiten que Google descubra primero las páginas que importan, no permutaciones de filtros.
  3. Señal de salud del sitio. Los sistemas de ranking de Google prestan atención a la eficiencia de rastreo. Un sitio lleno de soft 404s y cadenas de redirección parece abandonado.
  4. Costo de servidor. Cada rastreo desperdiciado es una solicitud consumida en tu infraestructura: dinero real a escala de ecommerce.

Cómo asigna Googlebot el crawl budget

La asignación funciona como una negociación de dos partes entre tu servidor y los programadores de Google.

Límite de tasa de rastreo (impulsado por el servidor)

Googlebot muestrea tus tiempos de respuesta. Las respuestas rápidas y saludables (menos de 200ms) le permiten abrir más conexiones paralelas. Las respuestas lentas (más de 500ms) o errores 5xx hacen que retroceda. El límite existe para evitar que Google tumbe tu sitio.

Demanda de rastreo (impulsada por Google)

Google decide qué URLs quiere rastrear y con qué frecuencia según:

  • Popularidad. Las URLs con más enlaces entrantes e impresiones se vuelven a rastrear con mayor frecuencia.
  • Obsolescencia. Las URLs que cambian frecuentemente se revisitan en intervalos más cortos.
  • Tipo. Las páginas de inicio, categorías y páginas de alta autoridad encabezan la lista de demanda.
# Fórmula de crawl budget (simplificada)
Crawl budget = Límite de tasa de rastreo × Demanda de rastreo

# Ejemplo: sitio ecommerce mediano
Límite de tasa: 50 peticiones/seg
Demanda efectiva: ~40% de utilización
Rastreo diario: ~1.7M peticiones

Qué desperdicia más el crawl budget

DesperdiciadorCómo quema presupuestoSolución
Navegación facetadaMillones de combinaciones de filtrosrobots.txt o canonical a la categoría principal
Parámetros de sesión / seguimientoMisma página, infinitas variantes de URLCanonical, herramienta de parámetros de URL
Enlaces rotos (4xx)Googlebot vuelve a verificar URLs fallidasDevolver 410 Gone o corregir el enlace
Cadenas de redirecciónMúltiples saltos por rastreoApuntar 301s directamente a la URL final
Calendarios infinitosCada fecha futura = nueva URLNofollow en enlaces futuros, bloqueo robots
Contenido duplicadoMúltiples URLs con mismo contenidoCanonical a la URL principal
Soft 404sPáginas vacías devolviendo 200 OKDevolver 404 real o añadir contenido
Páginas de etiquetas / archivos de bajo valorContenido fino que Googlebot ignoraNoindex y consolidar

Ejemplos reales de crawl budget

1. Sitio ecommerce con navegación facetada

Un minorista tiene 12.000 productos pero expone 1.2M de URLs debido a filtros de color, tamaño y marca. Googlebot gasta el 80% de su crawl budget en permutaciones de filtros. Las páginas de producto nuevas tardan 3-4 semanas en indexarse. Bloquear los 6 principales parámetros de filtro en robots.txt reduce las URLs rastreables a 40.000; el tiempo de indexación baja a 2-3 días.

2. Editor de noticias con deriva de archivos

Un sitio de noticias publica 40 artículos diarios. En 8 años acumula 115.000 páginas archivadas. Googlebot gasta una parte significativa del presupuesto volviendo a rastrear archivos obsoletos. Consolidar páginas de etiquetas y aplicar noindex a 60.000 artículos de bajo tráfico libera presupuesto para el contenido fresco diario que realmente genera tráfico.

3. Optimización de sitio pequeño

Un SaaS B2B con solo 800 URLs nunca alcanzará un límite de crawl budget. El tiempo se invierte mejor en enlaces internos y frescura de contenido que en la optimización técnica del crawl budget.

Crawl rate

  • Peticiones por segundo que hace Googlebot.
  • Determinado por el rendimiento del servidor.
  • Medido en tiempo real.
  • Ajustable por dominio en Search Console (heredado).
  • La dimensión "qué tan rápido".

Crawl budget

  • Total de URLs que Googlebot obtiene por período.
  • Límite de tasa multiplicado por demanda.
  • Agregado por día / semana.
  • No se puede aumentar manualmente.
  • La dimensión "cuántas".

8 mejores prácticas para el crawl budget

  1. Mejora el tiempo de respuesta del servidor. Un TTFB inferior a 200ms aumenta automáticamente los límites de tasa de rastreo. Los servidores lentos se ven limitados.
  2. Devuelve 410 Gone para páginas eliminadas permanentemente. 410 es una señal más fuerte que 404 y se elimina más rápido de la cola de rastreo de Google.
  3. Mantén limpio tu XML sitemap. Incluye solo URLs canónicas e indexables. Cada URL muerta o redirigida en un sitemap es un rastreo desperdiciado.
  4. Bloquea URLs de bajo valor en robots.txt. Filtros facetados, resultados de búsqueda interna y URLs de administración nunca deben ver a Googlebot.
  5. Elimina cadenas de redirección. Las cadenas multiplican el costo de rastreo. Apunta los 301 directamente al destino final.
  6. Corrige enlaces internos que apuntan a redirecciones o 404s. Los enlaces internos rotos desperdician cada rastreo futuro de esa página.
  7. Consolida contenido fino. Fusiona páginas de etiquetas de bajo tráfico, categorías finas y publicaciones anticuadas.
  8. Usa el informe de estadísticas de rastreo. El informe Crawl Stats de Google Search Console muestra peticiones por día, tiempos de respuesta y desglose por tipo de archivo.
Error común — asumir que noindex ahorra presupuesto inmediatamente

Añadir noindex no detiene el rastreo. Googlebot aún debe obtener la página para ver la etiqueta. Solo después de varios rastreos confirmados, noindex hace que la URL pase a una cola de baja prioridad. Para detener el rastreo por completo, bloquea la URL en robots.txt.

Errores comunes de crawl budget que debes evitar

  • Bloquear URLs ya indexadas en robots.txt. Google no puede ver la etiqueta noindex en una URL bloqueada y puede mantenerla indexada.
  • Ignorar los archivos de registro. Search Console muestra resúmenes. Los archivos de registro muestran exactamente qué URLs visita Googlebot y con qué frecuencia.
  • Asumir que los sitios pequeños necesitan optimización. Por debajo de 1.000 URLs no importa.
  • Bloquear CSS o JS. Googlebot necesita estos archivos para renderizar páginas. Bloquea solo lo que realmente no es indexable.
  • Publicar sin podar. Un archivo de 8 años con 60% de páginas sin tráfico arrastra la eficiencia de rastreo.

Preguntas frecuentes

El crawl budget es el número total de URLs que Googlebot obtendrá de tu sitio durante un período determinado. Equivale al límite de tasa de rastreo (capacidad del servidor que Googlebot puede usar de forma segura) multiplicado por la demanda de rastreo (cuánto quiere Google volver a rastrear según frescura y popularidad).

Google dice que la mayoría de sitios por debajo de 1.000 URLs nunca necesitan preocuparse por el crawl budget. La optimización empieza a importar a partir de 10.000+ URLs indexables, o si un sitio más pequeño publica 30+ páginas nuevas al mes y muestra retrasos de indexación.

El informe Crawl Stats de Google Search Console muestra peticiones por día, tiempos de respuesta y desglose por tipo de archivo. Combínalo con el análisis de archivos de registro del servidor para ver exactamente en qué URLs está gastando Googlebot el presupuesto.

Navegación facetada, URLs con ID de sesión, calendarios infinitos, cadenas de redirección, enlaces rotos y variantes de parámetros duplicados. Cada uno desperdicia obtenciones que Googlebot podría gastar en páginas importantes.

Eventualmente. Googlebot aún debe obtener la página para ver la etiqueta noindex, por lo que los primeros rastreos consumen presupuesto. Una vez que Google confirma noindex, visita la URL con menos frecuencia. Bloquea en robots.txt si nunca quieres que se rastree.

Cómo te ayuda theStacc

La auditoría técnica de theStacc ejecuta un análisis completo de crawl budget: qué patrones de URL desperdician obtenciones, dónde las cadenas de redirección pierden equity y qué familias de parámetros deberían bloquearse. Cada hallazgo se clasifica por el aumento proyectado de indexación para que sepas qué corregir primero — y qué dejar en paz.

Fuentes

Akshay VR

Akshay VR

Marketing Head · theStacc · ex-Sr Marketing Specialist, ARKA 360

Akshay lidera las operaciones editoriales y de contenido en theStacc. Escribe sobre el oficio del SEO, operaciones de contenido y las pequeñas decisiones que se acumulan en victorias de ranking, incluyendo qué URLs dejar que Google rastree y cuáles ocultar.