Home/ Wiki/ SEO/ Robots.txt e Sitemap

Robots.txt e Sitemap XML

Due file di testo che decidono cosa Google guarda del tuo sito e cosa ignora. Sono facili da scrivere e sono la cosa che più spesso trovo sbagliata.

Configurazione tecnica del crawling con robots.txt e sitemap
Indice dei contenuti
Aggiornato: Aprile 2026 8 min di lettura

Cos'è il file robots.txt

Il robots.txt è un file di testo che sta nella radice del sito (per esempio https://esempio.it/robots.txt) e dice ai crawler dei motori di ricerca dove possono andare e dove no. Fa parte del Robots Exclusion Protocol, che è in giro dai primi anni del web e funziona ancora così, con due righe di testo.

Punti chiave

  • Il robots.txt dice ai crawler cosa non scansionare; la sitemap XML indica cosa dovrebbe essere scansionato: sono strumenti complementari.
  • Il robots.txt è una direttiva volontaria: per nascondere contenuti dall'indice si usa il meta tag noindex, non il Disallow.
  • Un robots.txt ben configurato preserva il crawl budget, evitando che i bot sprechino risorse su pagine irrilevanti.
  • Ogni URL in sitemap deve restituire codice 200 e non essere bloccata dal robots.txt; il tag chiave è lastmod con date reali.
  • Verifica sempre con Google Search Console prima di andare in produzione: un errore può deindicizzare l'intero sito.

È uno degli strumenti base della SEO tecnica, perché governa il crawl budget: quante pagine Googlebot visita nel tempo che ti dedica. Su un sito grande fa una differenza concreta, perché evita che il crawler consumi il suo giro su pagine di amministrazione, ricerche interne e duplicati, invece che sui contenuti che ti interessano.

"Un robots.txt mal configurato può impedire l'indicizzazione dell'intero sito. Verifica sempre la configurazione con Google Search Console prima di andare in produzione."

Sintassi e direttive principali

La sintassi del robots.txt si basa su regole semplici ma precise. Ogni blocco di istruzioni inizia con la dichiarazione dello User-agent a cui si applicano le direttive, seguito dalle regole di Allow e Disallow che valgono solo per quel bot. Quando più blocchi sono presenti, Googlebot applica quello con lo User-agent più specifico, ignorando gli altri: un dettaglio che spiega molti comportamenti apparentemente inattesi.

Le direttive che si usano:

  • User-agent: specifica a quale crawler si applicano le regole (* per tutti i bot, Googlebot per Google)
  • Disallow: blocca l'accesso a un percorso specifico (es. Disallow: /admin/)
  • Allow: consente l'accesso a un sotto-percorso altrimenti bloccato (es. Allow: /admin/public/)
  • Crawl-delay: imposta un ritardo in secondi tra una richiesta e l'altra (supportato da Bing, non da Google)
  • Sitemap: indica la posizione della sitemap XML del sito
Direttiva Esempio Effetto
Disallow: / Blocca tutto il sito Nessuna pagina viene scansionata
Disallow: (vuoto) Consente tutto Tutte le pagine sono accessibili
Disallow: /privato/ Blocca la cartella /privato/ Solo quella sezione viene esclusa
Disallow: /*.pdf$ Blocca tutti i PDF Usa pattern matching avanzato

È importante ricordare che il robots.txt è una direttiva: i crawler rispettosi come Googlebot lo seguono, mentre i bot malevoli possono ignorarlo. Per proteggere contenuti sensibili, è preferibile utilizzare autenticazione server-side o meta tag noindex.

Cos'è la Sitemap XML

La Sitemap XML è un file in formato XML che elenca tutte le URL importanti del sito web, fornendo ai motori di ricerca una mappa completa dei contenuti da indicizzare. A differenza del robots.txt che indica cosa non scansionare, la sitemap indica cosa dovrebbe essere scansionato.

La sitemap serve soprattutto in questi casi:

  • Siti di grandi dimensioni con migliaia di pagine
  • Siti nuovi con pochi backlink esterni
  • Pagine che non sono facilmente raggiungibili tramite link interni
  • Siti con contenuti multimediali (video, immagini) o internazionali (hreflang)

La sitemap si collega direttamente alla strategia di struttura URL del sito: ogni URL presente nella sitemap deve restituire un codice 200 e non deve essere bloccata dal robots.txt.

Come si scrive una sitemap

Il formato è un tag <urlset> che contiene un <url> per pagina, con dentro:

  • <loc> (obbligatorio): l'URL completa della pagina
  • <lastmod>: la data dell'ultima modifica in formato ISO 8601
  • <changefreq>: la frequenza prevista di aggiornamento (daily, weekly, monthly)
  • <priority>: un valore da 0.0 a 1.0 che indica la priorità relativa

Best practice per la Sitemap

Google ha dichiarato che i tag changefreq e priority vengono ignorati. Concentrati piuttosto su lastmod con date reali di aggiornamento. Ogni sitemap XML ha un limite di 50.000 URL e 50 MB non compressi. Per siti molto grandi, utilizza un sitemap index che raggruppa più sitemap.

Per siti di medie e grandi dimensioni, una buona strategia prevede la creazione di sitemap separate per tipologia di contenuto: una per le pagine principali, una per gli articoli del blog, una per i prodotti e-commerce. Questo approccio facilita il monitoraggio in Google Search Console.

Testing e validazione

Prima di fidarti, prova. Gli strumenti:

  1. Google Search Console: ha il tester per il robots.txt, ti fa inviare la sitemap e ti mostra errori di copertura e stato di indicizzazione
  2. Strumenti di validazione XML: verificano che la sitemap rispetti lo schema XSD ufficiale del protocollo sitemaps.org
  3. Screaming Frog / Sitebulb: tool di crawling che confrontano le URL nella sitemap con quelle effettivamente presenti sul sito, evidenziando discrepanze
  4. Bing Webmaster Tools: fa le stesse cose per l'ecosistema Bing, che alimenta anche le ricerche di ChatGPT

Dopo ogni modifica significativa alla struttura del sito, aggiorna la sitemap e verifica che il robots.txt non blocchi accidentalmente le nuove sezioni. I Core Web Vitals non dipendono direttamente da questi file, però un crawling efficiente contribuisce a una migliore esperienza complessiva.

Un'abitudine operativa utile è impostare un controllo periodico: scaricare il robots.txt direttamente dal browser, confrontare il numero di URL dichiarate in sitemap con quelle effettivamente indicizzate (visibili nel rapporto "Pagine" di Search Console) e annotare ogni scostamento. Discrepanze ricorrenti, molte URL inviate ma non indicizzate, sono spesso il sintomo di contenuti duplicati o di pagine bloccate per errore, non di un problema della sitemap in sé.

Generare e automatizzare i file

Nella pratica quotidiana questi file raramente si scrivono a mano: i CMS più diffusi li generano in automatico. Su WordPress plugin come Yoast SEO o Rank Math producono una sitemap index aggiornata a ogni pubblicazione e gestiscono il robots.txt da pannello; framework come Next.js o Astro espongono file di configurazione dedicati che generano robots.txt e sitemap.xml in fase di build. L'obiettivo è che la mappa del sito resti sempre allineata ai contenuti reali senza intervento manuale.

Anche l'AI può accelerare il lavoro: puoi chiedere a un assistente di redigere un robots.txt commentato a partire dall'elenco delle cartelle da escludere, o di validare la struttura di una sitemap esistente. Resta però indispensabile la verifica umana, perché un suggerimento generico può proporre un Disallow troppo ampio. La regola pratica è semplice: ogni regola che blocca qualcosa va testata su Search Console prima di considerarla definitiva.

Gli errori che trovo più spesso

Gli errori che trovo più spesso, in ordine di danno:

  • Bloccare CSS e JavaScript nel robots.txt: impedisce a Google di renderizzare correttamente le pagine, compromettendo la SEO mobile e l'analisi dei contenuti
  • Includere URL con redirect nella sitemap: ogni URL deve restituire codice 200, non 301 o 302
  • Dimenticare la dichiarazione della sitemap nel robots.txt: aggiungi sempre Sitemap: https://tuosito.it/sitemap.xml in fondo al file
  • Non aggiornare la sitemap dopo modifiche strutturali: URL obsolete generano errori 404 che impattano negativamente sulla percezione del sito
  • Usare il robots.txt per nascondere pagine dall'indice: il disallow non impedisce l'indicizzazione se la pagina riceve link esterni. Usa il meta tag noindex per questo scopo

Un robots.txt pulito e una sitemap aggiornata sono il pavimento della SEO tecnica: non ti fanno salire da soli, e se sono sbagliati ti tengono fermo qualsiasi altra cosa tu faccia. Con i meta tag a posto e una struttura URL coerente hai sistemato la parte che dipende solo da te.

Vuoi imparare ad applicarlo davvero?

Scopri i corsi e la formazione di Federico Boggia su AI, dati e digitale.

Vai ai corsi
Federico BoggiaRispondo io, in giornata

Ciao! Dimmi che ti serve: un corso online, una giornata in aula a Livorno o la formazione per la tua azienda.

Scrivimi su WhatsApp