Indexación en Google: por qué el sitio no es visible y cómo solucionarlo
¿Tienes un sitio web listo, pero no lo encuentras en el buscador? Las páginas deben estar en el índice antes de comenzar a abordar las posiciones. Le mostraremos cómo verificar la indexación, por qué las páginas no están indexadas y cómo solucionarlo paso a paso.
¿Qué es la indexación y por qué todo depende de ella?
Antes de que una página pueda ser colocada en los resultados de búsqueda, debe pasar por dos pasos: el motor de búsqueda primero debe encontrarla y descargarla (rastrear) y luego incluirla en su índice (índice). Sólo lo que está en el índice se puede mostrar a los usuarios. Abordar posiciones o palabras clave para una página que no está en el índice no tiene sentido: es invisible para el motor de búsqueda.
Un malentendido común: "Tengo un sitio web en línea, por lo que está en Google". No es automático. Google tiene que descubrir un sitio web, rastrearlo y decidir indexarlo; y en cada uno de esos pasos, algo puede salir mal.
Cómo saber si una página está en el índice
Comprobación rápida de orientación: introduzca `site:vasedomena.cz` en Google. Verá el número aproximado de páginas indexadas. Tenga cuidado: este operador es impreciso y está muestreado, así que tómelo sólo como una señal aproximada, no como la verdad.
Una fuente confiable es Google Search Console, sección "Indexación de páginas". Mostrará exactamente qué páginas están indexadas, cuáles no y, lo más importante, por qué (motivos de exclusión). Puede verificar una URL específica a través del "Comprobador de URL", que le indicará el estado actual y le permitirá solicitar la indexación.
Los motivos más comunes por los que una página no está indexada
- Bloqueo en robots.txt: el archivo prohíbe a los motores de búsqueda rastrear la página. Entonces Google no lo descargará en absoluto.
- La etiqueta noindex: en el encabezado de la página (meta robots) o en el encabezado HTTP X-Robots-Tag está la instrucción "no indexar". Un error común después de pasar de un sitio de prueba a producción.
- Canonicalización en otros lugares: canónico se refiere a otra URL, por lo que Google la indexa en lugar de esta página (normalmente todo se fusiona en la página de inicio).
- La página no está vinculada a ninguna parte; el motor de búsqueda no tiene forma de descubrirla (faltan el vínculo y el registro en el mapa del sitio).
- Contenido reducido o duplicado: Google rastrea la página, pero la califica como insuficientemente valiosa ("Aprobada, no indexada").
- Errores del servidor o respuesta lenta: cuando la página devuelve 5xx o tarda mucho en cargarse, el rastreo no se completará.
- Dominio nuevo o débil: los sitios jóvenes con poca autoridad tardan semanas en indexar todo el sitio; Google rastrea lentamente.
Cómo arreglar la indexación paso a paso
Avance desde los bloqueos más difíciles hasta las causas sutiles: no tiene sentido abordar el contenido mientras la página está bloqueada por robots.txt.
- Verifique que el archivo robots.txt no prohíba secciones importantes (no permitir líneas). Desbloquea lo que debería ser público.
- Verifique que la página no tenga ningún índice en los meta robots o en el encabezado HTTP. Si sobra del desarrollo, elimínelo.
- Verifique que sea canónico: debe apuntar a sí mismo (autorreferenciado), no a otra página, a menos que esa sea la intención.
- Devuelve el estado HTTP 200 para las páginas que se van a indexar; manejar inexistente a través de 404/410, redireccionar a través de 301.
- Complete la página en un mapa del sitio XML y vincúlela desde páginas relevantes para que el motor de búsqueda la descubra.
- Para contenido ligero, agregue valor: texto original, respuestas a las preguntas de los usuarios, estructura con títulos.
- En Search Console, solicite la indexación de las URL clave y vuelva a enviar el mapa del sitio. Luego espere: el nuevo rastreo lleva días o semanas.
Cómo ayudar a Google más rápido
Diriges el motor de búsqueda con tres cosas: un mapa del sitio XML actualizado enviado en Search Console, enlaces internos de alta calidad (enlazan páginas nuevas desde páginas potentes y ya indexadas) y enlaces de retroceso de sitios web confiables que traerán al rastreador primero.
Tenga paciencia con un sitio web nuevo: incluso un sitio web técnicamente perfecto se indexa gradualmente en un dominio joven. No confíes en el operador `site:`, sigue el informe en Search Console.
Indexación y motor de búsqueda AI (GEO)
La misma lógica se aplica a los motores de búsqueda generativos como ChatGPT, Perplexity o Google AI Overviews: si no pueden leer y procesar su contenido, no pueden citarlo. El acceso de los robots de IA vuelve a estar controlado por robots.txt (y además por el archivo llms.txt), así que bloquéelos sólo de forma consciente. Es más fácil acceder a un sitio web legible, estructurado e interconectado tanto en el índice clásico como en las respuestas de IA.
Cómo verificar la indexación y sus obstáculos
Después de cada modificación importante del sitio web, vale la pena repetir la comprobación. Nuestra herramienta de indexabilidad recorre la página y señala noindex, bloqueo en robots.txt, canonical incorrecto y mapa del sitio faltante, es decir, todos los obstáculos técnicos que impiden la indexación. En particular, consulte el archivo robots.txt y el mapa del sitio XML para que Google reciba las instrucciones correctas.
Preguntas frecuentes
¿Cuánto tiempo le toma a Google indexar un nuevo sitio web?
Para un dominio nuevo con poca autoridad, puede llevar días o semanas, y para sitios grandes, incluso más. Puede acelerar el proceso enviando un mapa del sitio en Search Console, solicitando la indexación de URL clave y enlaces internos de alta calidad.
¿Por qué Search Console informa "Aprobado - No indexado"?
Google retiró la página, pero decidió no clasificarla (todavía), generalmente debido a contenido escaso, duplicado o de bajo valor. Agregue el valor original y vincule la página.
¿La página se indexa cuando está en el mapa del sitio?
Un mapa del sitio ayuda a descubrir una página, pero no es garantía de indexación. La página no debe estar bloqueada (robots.txt/noindex), debe devolver 200, ser autocanónica y contener contenido suficientemente valioso.
¿El sitio: operador es confiable?
No. `site:vasedomena.cz` es sólo una orientación aproximada: está muestreado y retrasado. Puede encontrar las cifras exactas y los motivos de exclusión en Google Search Console en el informe "Indexación de páginas".