← Volver al blog

Cómo comprobar si una página está indexada en Google

Cómo comprobar si una página está indexada en Google

Para comprobar si una página está indexada en Google, pega su URL en la herramienta de Inspección de URLs de Search Console, o haz una búsqueda rápida con site: si te basta una respuesta aproximada. Una página que no está indexada no puede posicionar ni recibir tráfico orgánico, por buena que sea, y aun así cualquiera que la visite la ve completamente normal.

A continuación tienes cuatro formas de comprobarlo, de la más rápida a la más completa, además de los motivos por los que una página suele quedarse fuera y de por qué una comprobación que hiciste el mes pasado puede haber dejado de ser cierta.

Rastreada, indexada y posicionada son tres estados distintos

Estas palabras se usan como si fueran sinónimos, y eso genera confusión al leer Search Console.

Rastreada significa que Googlebot ha descargado la página. Indexada significa que Google la ha procesado y la ha guardado como apta para aparecer en los resultados. Posicionada significa que realmente aparece en las búsquedas. Cada paso depende del anterior, pero ninguno garantiza el siguiente. Una página puede rastrearse y no indexarse nunca, y una página indexada puede estar en la novena página de resultados.

Cuando preguntas si una página está indexada, preguntas por el paso intermedio. Si la respuesta es no, el trabajo de contenido y de enlaces en esa página no servirá de nada hasta que resuelvas el problema de indexación.

Método 1: el operador site:

Busca en Google site: seguido de la URL, por ejemplo site:example.com/pricing/. Si sale un resultado, la página casi seguro está indexada. Si la búsqueda no devuelve nada, probablemente no lo esté.

Es una prueba de cinco segundos y no da para más. El operador no ofrece una visión completa del índice, a veces omite páginas que sí están indexadas y no te dice nada sobre por qué falta una página. Úsalo para una comprobación rápida, no para un diagnóstico.

Método 2: Inspección de URLs en Search Console

Para una URL concreta, esta es la respuesta de referencia. Abre la propiedad en Google Search Console, pega la URL completa en la barra de inspección de la parte superior y lee el veredicto: "La URL está en Google" o "La URL no está en Google".

Lo útil está en el detalle de debajo. En el apartado de indexación verás si se permitió el rastreo, si se permitió la indexación, la fecha del último rastreo, el canonical declarado por el usuario y el canonical seleccionado por Google. Si la página está excluida, aparece el motivo, por ejemplo:

"Probar URL publicada" descarga la página tal como está ahora mismo, algo útil después de un arreglo, porque el informe principal muestra la versión del último rastreo de Google. Cuando el problema está resuelto, "Solicitar indexación" le pide a Google que vuelva a rastrearla, aunque no garantiza que la incluya. La limitación es que funciona con una URL cada vez y solo en propiedades verificadas.

Método 3: el informe Páginas

Para un sitio entero, ve a Indexación y después a Páginas en Search Console. El gráfico divide las URL conocidas entre indexadas y no indexadas, y la tabla de debajo agrupa las no indexadas por motivo. Haz clic en un motivo para ver URL de ejemplo.

Aquí es donde se ven los patrones. Una sola URL "Excluida por la etiqueta 'noindex'" puede ser intencionada. Trescientas que aparecen en la misma semana apuntan a una plantilla. En este informe también verás si una sección entera se ha quedado en "Descubierta: actualmente sin indexar". Su punto débil son los plazos: los datos se actualizan al ritmo de Google y suelen ir varios días por detrás. Si ves una fila que requiere trabajo, nuestra guía para corregir errores de cobertura del índice en GSC repasa cada estado.

Método 4: un crawler para las señales de bloqueo

Screaming Frog, Sitebulb y crawlers similares no pueden decirte qué ha indexado Google. Lo que sí te dicen es si cada página puede indexarse, porque informan de la etiqueta meta robots, la cabecera HTTP X-Robots-Tag, el canonical y si robots.txt bloquea la URL. En un sitio con miles de páginas, suele ser la forma más rápida de encontrar la causa de un grupo de exclusiones.

El inconveniente es que hay que lanzarlo a mano. Muestra el estado del día en que rastreas.

Motivos habituales por los que una página no está indexada

Lo primero que hay que descartar es una directiva noindex. Puede estar en el HTML como <meta name="robots" content="noindex"> o llegar como cabecera de respuesta X-Robots-Tag: noindex, que no se ve en el código fuente. En la etiqueta noindex, explicada tratamos las dos.

Un Disallow en robots.txt impide que Google descargue la página. Curiosamente, una página bloqueada puede indexarse igualmente, sin su contenido, si otros sitios enlazan a ella, así que bloquear no es una forma fiable de eliminar una URL. Lo explicamos en cómo comprobar tu robots.txt.

Un canonical que apunta a otra URL le dice a Google que esta página es una copia, y entonces indexa la otra URL.

El descubrimiento es el problema menos visible: nada enlaza a la página y no está en el sitemap XML, así que Google no la ha encontrado o no la ha priorizado. Y "Rastreada: actualmente sin indexar" significa que Google descargó la página y decidió no conservarla, a menudo porque le parece pobre o demasiado parecida a otra.

Los tres primeros son problemas de configuración que normalmente se arreglan en minutos. Los dos últimos requieren trabajo de contenido y de enlazado.

Por qué no basta con comprobar una vez si una página está indexada

Una comprobación de indexación te dice el estado del día en que la hiciste. A partir de ahí, una actualización de plugin puede añadir un noindex, una migración puede copiar a producción el robots.txt de staging con Disallow: / o un cambio en el CMS puede apuntar los canonical al host equivocado. La página estaba indexada cuando la miraste y ya no lo está, y Search Console solo lo refleja cuando Google vuelve a rastrear y el informe se actualiza.

En un sitio que gestionas de cerca, repetir las comprobaciones de vez en cuando es viable. En una cartera de sitios de clientes donde otras personas hacen deploys, no lo es. Deltio revisa las páginas de cada sitemap en un ciclo diario: lee la etiqueta y la cabecera noindex, el canonical y robots.txt, detecta las URL eliminadas del sitemap y envía una alerta por Slack o email con el nombre del sitio y las páginas afectadas cuando algo cambia respecto a la comprobación anterior. Te avisa de que una página ha dejado de ser indexable, no de lo que Google ha hecho ya con ella, así que la Inspección de URLs sigue siendo el lugar para confirmar el resultado. En alertas de cambios SEO explicamos qué cambios merecen una alerta.

Si quieres tenerlo funcionando en tus sitios, puedes empezar una prueba gratuita de 14 días.

Preguntas frecuentes

¿Cuánto tarda Google en indexar una página nueva?
No hay un plazo fijo. En sitios que Google rastrea a menudo, una página puede indexarse en uno o dos días, mientras que los sitios nuevos o que se actualizan poco pueden esperar semanas. Enlazarla desde una página ya indexada e incluirla en el sitemap XML ayuda a que Google la encuentre antes.
¿"Solicitar indexación" en la Inspección de URLs garantiza que la página se indexe?
No. Añade la URL a la cola de rastreo de Google con cierta prioridad, pero es Google quien decide si la indexa. Si la página lleva un noindex, está bloqueada o se considera de poco valor, la solicitud no cambia el resultado. Además, hay un límite diario de solicitudes por propiedad.
¿Una página bloqueada por robots.txt puede aparecer en Google?
Sí. Si otras páginas enlazan a ella, Google puede indexar la URL sin rastrearla, normalmente sin descripción. Para mantener una página fuera de los resultados, permite el rastreo y usa una etiqueta noindex o una cabecera X-Robots-Tag, porque Google tiene que descargar la página para ver el noindex.
¿Cómo compruebo la indexación de un PDF o una imagen en lugar de una página HTML?
La Inspección de URLs funciona con cualquier URL de tu propiedad verificada, PDF incluidos. Como esos archivos no pueden llevar una etiqueta meta robots, su indexación se controla con la cabecera HTTP X-Robots-Tag, así que revisa las cabeceras de respuesta si un PDF aparece excluido o incluido cuando no debería.
¿Qué significa "Descubierta: actualmente sin indexar"?
Google sabe que la URL existe, normalmente por un sitemap o un enlace, pero todavía no la ha rastreado. En sitios grandes suele indicar un problema de priorización del rastreo, así que reforzar los enlaces internos hacia esas páginas y quitar del sitemap las URL de poco valor suele ayudar más que volver a enviarlas.