Indexación en Google: ¿qué pasa antes de que Google muestre una página? Ilustración con velocímetro y gráfico SEO

Indexación en Google: ¿qué pasa antes de que Google muestre una página?

Por Andrés Perugachi | Publicado: | Lectura: 7 min

Descubrimiento, rastreo, renderizado, indexación y ranking: los cinco pasos que recorre una URL antes de aparecer en los resultados de Google, y qué papel juegan robots.txt, el sitemap, el meta robots y el crawl budget.

Para entender cómo una página se muestra en Google primero hay que comprender un concepto clave en SEO: la indexación en Google. Estos días estaba retomando un curso de SEO técnico y me topé con este tema, que es muy interesante y profundo para analizar.

Por eso en este artículo vas a entender de forma específica cómo funciona la indexación de Google (además te vas a ahorrar unos dólares en un curso que, en lo personal, no me explicó la indexación tan a fondo como te la explicaré aquí). ¡Empecemos!

Los 5 pasos que sigue Google antes de mostrar tu contenido

Para que Google muestre tu contenido en las búsquedas, este debe pasar por cinco pasos que es indispensable conocer: Descubrimiento (Discover), Rastreo (Crawl), Renderizado (Render), Indexación (Index) y Rankeo (Rank). Cada uno de estos pasos está contemplado por Google y hace que disponga de recursos para usarlos en tu web. La cantidad de recursos usados para rastrear e indexar tu sitio se llama crawl budget o presupuesto de rastreo.

  1. Descubrimiento: Google se entera de que una URL existe.
  2. Rastreo: Googlebot visita la URL y descarga sus recursos.
  3. Renderizado: Google «pinta» la página tal como la vería un usuario.
  4. Indexación: guarda esa información en su índice.
  5. Rankeo: decide en qué posición y formato mostrarla en la SERP.

Descubrimiento (Discover) de contenido en Google

El descubrimiento es la primera etapa, en la que Google entra a tu casa (tu web) y empieza a analizar qué existe y por dónde puede empezar.

Formas en las que Google descubre tu contenido:

  • Mediante los enlaces en tus páginas o entradas que apuntan a la nueva URL.
  • Mediante el enlazado externo que apunta a tu URL.
  • Mediante la solicitud de indexación de Google Search Console.
  • Mediante el sitemap de tu sitio web.

Imaginemos que llegas a una enorme mansión que acabas de descubrir y estás listo para tomar fotos y documentar todo. Ahí está la puerta que te permite pasar del descubrimiento al rastreo.

Rastreo (Crawl) de contenido en Google

El rastreo de Google, siguiendo el ejemplo anterior, es el proceso por el cual Google investiga tu sitio web y analiza en qué puntos debe enfocarse. Para ello tiene una puerta de entrada que le permite saber qué puede rastrear y qué no: el archivo robots.txt.

El archivo robots.txt actúa como un gate o puerta de acceso que permite o no a los robots de Google (robots de imágenes, mobile, contenido, CSS y JS) ingresar a tu web, contenido y páginas para empezar a encontrar todos los recursos y añadirlos a una cola: la cola de rastreo.

Robots.txt es un indicador de recomendaciones sobre lo que Google puede ver y lo que no debería tomar en cuenta, pero no actúa como una sentencia restrictiva para que Google no ingrese y visite tu contenido.

Cuando Google ha entrado a tu web se encuentra con las diferentes secciones o categorías contenidas en el sitemap, otro de los archivos importantes para que Google rastree tu contenido.

Ahora imaginemos lo siguiente: Google entra a tu web, conoce las categorías y páginas, pero quiere llevarse una foto o impresión de lo que contiene cada una para que, cuando un usuario haga una búsqueda, Google sepa que tú tienes ese contenido y lo muestre. A este proceso lo conocemos como renderizado.

Renderizado (Render) de contenido en Google

La primera vez que Google mencionó este concepto fue cerca de 2011, y la teoría no confirmada detrás de esto fue Google Panda (el content quality update de Google). Con esta actualización fueron apareciendo todas las cosas increíbles que hoy tenemos de Google en cuestión de calidad de contenido.

Muchas veces asociamos el renderizado con JavaScript, pero Google, mediante sus ingenieros, ha confirmado que no solo existe el renderizado de JS: también existen otros renderizados.

El renderizado ha sido uno de los temas más discutidos y uno de los que la mayoría de los SEO quiere entender, pero antes hay que hacernos una pregunta: ¿el rendering ayuda a posicionar mejor mi web? Esta pregunta se le hizo a Martin Splitt, de Google, y su respuesta fue:

«Hablando en general, no. Pero, específicamente, si hay un problema en el cual una parte del contenido de tu página rompe el renderizado y hace que el contenido no se muestre, en ese caso sí afectará a tu página: tu contenido no será indexado, o lo será pero no se mostrará donde tú quieres que se muestre.»

Por esta razón entender el renderizado de Google es importante, y vamos a desglosarlo en los siguientes puntos: definición de renderizado, schema y layout tree, y los recursos del servidor necesarios. ¡Aquí vamos!

Definición de renderizado

El renderizado es el proceso por el cual Google toma cierta información del rastreo y analiza el HTML (que llega en forma de texto después del rastreo). Para mostrar el diseño final, Google debe obtener todos los recursos de tu página (hay un título aquí, una imagen por acá, luego más texto, etc.). Todo este proceso Google lo entiende y lo desensambla para una interacción visual por parte del usuario.

La ejecución de JS es parte del renderizado inicial, en el que Google ensambla y arma las piezas, lo que da como resultado algo conocido como layout tree: este le dice a Google qué tan grandes son las cosas en la página y dónde están.

¿El schema markup ayuda en el renderizado?

El schema markup sí ayuda al renderizado, ya que este es un proceso asincrónico que sucede en paralelo mientras se ejecutan más funciones en el proceso de indexación, y el schema apoya al estar en la parte inicial del HTML brindándole a Google información rápida para conocer más de lo que trata la página.

Hay que tomar en cuenta que el schema markup no es parte del layout tree, porque no es un elemento visual. El layout tree se produce de la mezcla del DOM (todo el contenido de una página como objeto, en forma de nodos) con el CSSOM (la misma información que el DOM, pero del CSS que tiene la página).

Recursos del servidor necesarios para el renderizado

Para Google resulta muy caro dedicar esfuerzos al renderizado e indexación de una web, y por eso hay algunas cosas que podemos hacer para ayudar a Google a optimizar sus recursos de renderizado.

El recurso del servidor en el que podemos enfocar nuestros esfuerzos es el tiempo de CPU para procesar el contenido: cuanto menos trabajo necesite Google para construir tu página, más barato le resulta renderizarla e indexarla.

Indexación (Index) de contenido en Google

Después del largo proceso de renderización, que parece muy corto, pasamos a la indexación de contenido. En este punto Google se lleva todas las fotografías de tu página y las almacena en sus directorios a la espera de que un usuario necesite y busque la información.

Para que este proceso suceda debe existir una etiqueta presente en el HTML renderizado: la meta robots tag, que es la que permite o no que un contenido sea indexable en la búsqueda. Así también tenemos los atributos follow y nofollow, que afectan a la atribución de señales hacia las URLs que están dentro de esa página (enlaces internos o externos).

Adicionalmente, al existir muchos bots de Google, puedes hacer que ciertos bots no puedan rastrear tu página y otros sí. Por ejemplo, en el siguiente extracto de código la meta robots tag está bloqueando al bot de Google News:

<meta name="googlebot-news" content="noindex" />

Luego de este proceso Google por fin tiene tu información y va a proceder a clasificar tu sitio de acuerdo con la importancia del contenido y el papel que juegue en los atributos de cada página de resultados (SERP).

Rankeo (Rank) de contenido en Google

Como último paso, Google reconoce el E-E-A-T de tu sitio web y la calidad de tu contenido después de la indexación, y procede a atribuirle un espacio en la página de resultados de búsqueda, conocida como SERP. Para entrar en la SERP actualmente puedes ocupar muchos espacios, que te comento a continuación:

  • Aparecer directo en la búsqueda: Google te dio un espacio en los resultados de búsqueda orgánica.
  • Aparecer en el fragmento de preguntas de People Also Ask (esto se puede dar en búsquedas relacionadas con la intención principal de tu contenido).
  • Aparecer en Discover o en el paquete de imágenes enriquecido por Google.
  • Aparecer en la sección de la SGE / AI Overviews con un fragmento de resumen optimizado para IA.

Luego de todo esto ya puedes entender de mejor manera cómo Google indexa y rankea un contenido o página en su motor de búsqueda. Si llegaste a este punto te comento que estoy armando un curso de SEO en el cual explicaré todo lo que necesitas saber para triunfar en SEO de forma fácil y como un PRO.

Espero que este contenido te haya sido útil y no olvides compartirlo.

Preguntas frecuentes sobre la indexación en Google

¿Qué es la indexación en Google?
Es el proceso por el cual Google almacena en su índice la información de una página después de rastrearla y renderizarla, para poder mostrarla cuando un usuario haga una búsqueda relacionada. Sin indexación una URL no puede aparecer en los resultados.
¿Cuáles son los pasos que sigue Google antes de mostrar una página?
Cinco: descubrimiento (Discover), rastreo (Crawl), renderizado (Render), indexación (Index) y ranking (Rank). Cada paso consume recursos de Google; la cantidad que dedica a tu sitio se conoce como crawl budget o presupuesto de rastreo.
¿El archivo robots.txt impide que Google indexe una página?
No. Robots.txt es una recomendación sobre qué rastrear y qué no, no una orden restrictiva. Para impedir la indexación se usa la etiqueta meta robots con noindex en el HTML renderizado.
¿El renderizado ayuda a posicionar mejor?
Según Martin Splitt de Google, en general no. Pero si algo en la página rompe el renderizado y el contenido no llega a mostrarse, ese contenido no se indexará o no aparecerá donde esperas, y ahí sí afecta al posicionamiento.
¿El schema markup forma parte del layout tree?
No. El schema markup no es un elemento visual, por lo que no entra en el layout tree (resultado de combinar el DOM y el CSSOM). Sí ayuda al renderizado porque aporta a Google información rápida sobre el tema de la página desde el inicio del HTML.
¿Cómo descubre Google una URL nueva?
A través de enlaces internos desde tus propias páginas, enlaces externos que apuntan a la URL, el sitemap XML y la solicitud de indexación en Google Search Console.
Andrés Perugachi

Sobre el autor: Andrés Perugachi Arias

Search marketing specialist · SEO expert · E-commerce · Technical SEO · B2B marketing manager · Consultor SEO para retail, travel y SaaS

Consultor SEO y marketing digital en Quito, Ecuador. Ayudo a marcas y negocios a ganar tráfico orgánico rentable con SEO técnico, contenidos y analítica.

Conoce más