Il file robots.txt è un piccolo file di testo che sta nella radice del sito, all’indirizzo https://tuodominio.it/robots.txt. Serve a dire ai programmi che esplorano il web, i cosiddetti crawler, quali parti del sito possono visitare e quali no. È uno dei primi file che Google, Bing e gli altri motori leggono quando arrivano sul tuo sito.
È semplice da scrivere, ma un errore di una sola riga può far sparire un sito dai risultati di ricerca. Vediamo come funziona, cosa fa e, soprattutto, cosa non fa.
Come è fatto
Il file è composto da gruppi di regole. Ogni gruppo comincia indicando a quale crawler si rivolge, poi elenca i percorsi vietati o permessi:
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://tuodominio.it/sitemap.xml
- User-agent: il nome del crawler. L’asterisco
*vale per tutti;Googlebotsolo per Google. - Disallow: il percorso che il crawler non deve visitare.
Disallow: /blocca l’intero sito. - Allow: un’eccezione dentro un percorso bloccato.
- Sitemap: l’indirizzo della mappa del sito, che aiuta i motori a trovare tutte le pagine.
I principali motori capiscono anche due caratteri speciali: * per «qualsiasi sequenza di caratteri» e $ per «fine dell’indirizzo». Per esempio Disallow: /*?orderby= blocca tutti gli indirizzi che contengono il parametro di ordinamento.
Cosa fa davvero
robots.txt controlla la scansione, cioè quali pagine il crawler scarica. È utile per:
- evitare che i motori sprechino tempo su pagine inutili, come i filtri a faccette dei negozi, le ricerche interne o i carrelli;
- ridurre il carico sul server causato dalla scansione di migliaia di pagine senza valore;
- indicare dove si trova la sitemap;
- decidere quali bot di intelligenza artificiale possono leggere i tuoi contenuti.
Cosa non fa
Qui nascono gli equivoci più comuni.
- Non è una protezione. Il file è pubblico e chiunque può leggerlo. I bot malevoli lo ignorano, anzi a volte lo usano per scoprire le cartelle che vorresti nascondere. Per fermare i bot dannosi serve Security Intelligence, non robots.txt.
- Non toglie una pagina da Google. Una pagina bloccata può comparire comunque nei risultati, senza descrizione, se altri siti la collegano. Per escluderla dall’indice serve l’istruzione
noindexnella pagina, e la pagina deve restare visitabile perché Google possa leggerla. - Non è un obbligo. I crawler seri lo rispettano, ma è una convenzione, non una regola tecnica.
Gli errori che costano cari
Disallow: /dimenticato. Succede spesso quando un sito di prova viene messo online: il blocco totale usato durante lo sviluppo resta al suo posto e il sito sparisce da Google nel giro di qualche settimana.- Bloccare CSS e JavaScript. Google deve poter caricare fogli di stile e script per capire come appare la pagina. Bloccare
/wp-content/o le cartelle dei temi peggiora la valutazione delle pagine. - Bloccare pagine che vuoi togliere dall’indice. Se blocchi una pagina con robots.txt, Google non vede più il
noindex, quindi la pagina può restare indicizzata. - Regole scritte male. Gli spazi e le maiuscole contano nei percorsi:
/Carrello/e/carrello/sono indirizzi diversi.
Dove si trova sul tuo hosting
Il file va nella cartella principale del sito, public_html. Puoi crearlo o modificarlo dal File Manager del pannello o via SFTP sulla porta 2300.
Se usi WordPress e il file non esiste, WordPress ne genera uno «virtuale» con regole di base. I plugin SEO più diffusi permettono di modificarlo dal pannello di WordPress. PrestaShop e Magento hanno invece le loro impostazioni nel pannello di amministrazione, come vediamo nell’articolo con i file pronti per ogni piattaforma.
Un dettaglio utile: sulla rete iWebLab Edge i file .txt non vengono mai tenuti in cache, quindi una modifica a robots.txt è visibile subito a tutti i crawler.
Come controllarlo
- Apri
https://tuodominio.it/robots.txtnel browser e rileggi le regole. - In Google Search Console, nelle impostazioni, c’è il rapporto su robots.txt: mostra la versione letta da Google, la data dell’ultima lettura e gli eventuali errori.
- Con SEO Log Intelligence vedi quali pagine i motori visitano davvero e se continuano a passare su percorsi che hai bloccato.
In sintesi
- robots.txt dice ai crawler cosa possono visitare: serve a guidare la scansione e a risparmiare risorse.
- Non protegge nulla e non toglie le pagine da Google: per quello servono Security Intelligence e il
noindex. - Attenzione a
Disallow: /, ai CSS e JavaScript bloccati e alle regole scritte male. - Il file sta in
public_html; sulla rete iWebLab Edge le modifiche sono visibili subito.
Vuoi un controllo del robots.txt del tuo sito? Apri un ticket.