Robots (indicizzazione e robots.txt)
Controlla cosa i motori di ricerca possono scansionare e indicizzare.
Cos'è
L'indicizzazione è governata da due elementi: il file robots.txt (cosa si può scansionare) e il meta robots / l'header X-Robots-Tag (se indicizzare la pagina, ad es. noindex). È facile confonderli.
Perché è importante
Una configurazione errata è uno degli errori SEO più devastanti: un "noindex" lasciato per errore o un "Disallow: /" possono escludere l'intero sito da Google. Al contrario, regole mancanti lasciano indicizzare pagine inutili (carrello, filtri) sprecando crawl budget.
Come fare
- 1Verifica che le pagine di produzione NON abbiano noindex (residuo comune dallo sviluppo/sito di test).
- 2Nel robots.txt non bloccare CSS/JS né le pagine che vuoi indicizzare.
- 3Blocca solo ciò che non deve essere nell'indice (admin, carrello, ricerca interna).
- 4Indica il link alla sitemap nel robots.txt.
- 5Ricorda: robots.txt impedisce la scansione, ma non necessariamente l'indicizzazione, per l'esclusione dall'indice serve il meta noindex.
robots.txt
User-agent: *
Disallow: / ← blocca TUTTO il sitoUser-agent: *
Disallow: /admin/
Disallow: /carrello/
Allow: /
Sitemap: https://www.example.it/sitemap.xmlConclusione
L'indicizzazione è l'"interruttore principale" della visibilità, per questo rientra tra i controlli critici. Dopo ogni implementazione verifica che non sia rimasto un noindex dall'ambiente di test e che robots.txt non blocchi nulla di importante. Un singolo errore qui può costare tutto il traffico organico.
Argomenti correlati