En una nueva publicación en el blog oficial de Google Search Central, Martin Splitt y Gary Illyes explican en detalle cómo funciona el rastreo de Googlebot y por qué es fundamental para la presencia de un sitio en los resultados de búsqueda. El artículo[1], titulado «Crawling December: The how and why of Googlebot crawling», está disponible en developers.google.com.
El rastreo, definido como el proceso mediante el cual Google descubre y revisita páginas web, es realizado por Googlebot. Este programa, al igual que un navegador, descarga no solo el HTML principal de una página, sino también recursos adicionales como JavaScript, CSS, imágenes y videos necesarios para construir y renderizar completamente el contenido.

fuente: captura de pantalla pripia
Proceso de rastreo explicado
Googlebot inicia con la descarga del HTML de la página, que se transfiere al Web Rendering Service (WRS). Este último se encarga de descargar los recursos referenciados en el HTML, renderizar la página y preparar los datos para su indexación. Sin embargo, a diferencia de un navegador, el tiempo entre cada paso puede ser mayor debido a restricciones de programación relacionadas con la carga percibida del servidor que aloja los recursos.
Este comportamiento tiene un impacto directo en el crawl budget, un límite en la cantidad de solicitudes que Googlebot puede realizar a un servidor en un periodo determinado. Según el artículo, el WRS intenta mitigar este impacto almacenando en caché los recursos referenciados durante un máximo de 30 días, independientemente de las directivas HTTP de cacheo.
Recomendaciones clave para los propietarios de sitios
Google ofrece consejos prácticos para optimizar el uso del presupuesto de rastreo, como:
- Reducir la cantidad de recursos necesarios: Minimizar el uso de JavaScript, CSS y otros elementos para reducir las solicitudes realizadas por Googlebot.
- Alojar recursos en un hostname diferente: Usar un subdominio o un CDN para desplazar la carga del presupuesto de rastreo al servidor que gestiona los recursos.
- Gestionar parámetros de cache-busting con cautela: Evitar cambios innecesarios en las URL de recursos para prevenir que Googlebot tenga que volver a rastrear recursos sin modificaciones.
El artículo también alerta sobre los riesgos de bloquear recursos esenciales mediante robots.txt. Esto podría impedir que Google renderice correctamente la página, lo que dificultaría la extracción de contenido y podría perjudicar el ranking en los resultados de búsqueda.
Análisis del rastreo por parte de los propietarios
Google recomienda a los administradores de sitios analizar los registros de acceso (access logs) para comprender mejor las solicitudes realizadas por Googlebot. Los datos en Search Console, particularmente en el informe de estadísticas de rastreo, también pueden proporcionar detalles desglosados sobre los tipos de recursos rastreados.
Fuentes de la información
- [1] “Crawling December: The How and Why of Googlebot Crawling .” Google for Developers, https://developers.google.com/search/blog/2024/12/crawling-december-resources.

