Robots (indexación y robots.txt)
Controla lo que los motores de búsqueda pueden rastrear e indexar.
Qué es
La indexación se controla mediante dos cosas: el archivo robots.txt (lo que se puede rastrear) y el encabezado meta robots/X-Robots-Tag (si se indexa una página, por ejemplo, noindex). Se confunden fácilmente.
Por qué importa
La mala configuración es uno de los errores de SEO más destructivos: un "noindex" o un "Disallow: /" dejado accidentalmente puede eliminar todo el sitio de Google. Por el contrario, la falta de reglas permite indexar páginas inútiles (carrito, filtros) y desperdiciar el presupuesto de rastreo.
Cómo hacerlo
- 1Verifique que las páginas de producción NO tengan ningún índice (un resto común del desarrollo/puesta en escena).
- 2En robots.txt, no bloquees CSS/JS ni las páginas que quieras indexar.
- 3Bloquea solo lo que no debería estar en el índice (admin, carrito, búsqueda interna).
- 4Consulte el mapa del sitio en robots.txt.
- 5Recuerde: robots.txt evita el rastreo, pero no necesariamente la indexación; para eliminarlo del índice, utilice meta noindex.
robots.txt
Agente de usuario: *
No permitir: / ← bloquea TODO el sitioAgente de usuario: *
No permitir: /admin/
No permitir: /carrito/
Permitir: /
Mapa del sitio: https://www.example.cz/sitemap.xmlConclusión
La indexación es el "interruptor maestro" de la visibilidad; por eso pertenece a las comprobaciones críticas. Después de cada implementación, verifique que no quede ningún índice del entorno de prueba y que robots.txt no bloquee nada importante. Un error aquí puede costar todo su tráfico orgánico.
Temas relacionados