Il file robots.txt è un piccolo file di testo che sta nella radice del sito, all’indirizzo https://tuodominio.it/robots.txt. Serve a dire ai programmi che esplorano il web, i cosiddetti crawler, quali parti del sito possono visitare e quali no. È uno dei primi file che Google, Bing e gli altri motori leggono quando arrivano sul tuo sito.

È semplice da scrivere, ma un errore di una sola riga può far sparire un sito dai risultati di ricerca. Vediamo come funziona, cosa fa e, soprattutto, cosa non fa.

Come è fatto

Il file è composto da gruppi di regole. Ogni gruppo comincia indicando a quale crawler si rivolge, poi elenca i percorsi vietati o permessi:

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://tuodominio.it/sitemap.xml
  • User-agent: il nome del crawler. L’asterisco * vale per tutti; Googlebot solo per Google.
  • Disallow: il percorso che il crawler non deve visitare. Disallow: / blocca l’intero sito.
  • Allow: un’eccezione dentro un percorso bloccato.
  • Sitemap: l’indirizzo della mappa del sito, che aiuta i motori a trovare tutte le pagine.

I principali motori capiscono anche due caratteri speciali: * per «qualsiasi sequenza di caratteri» e $ per «fine dell’indirizzo». Per esempio Disallow: /*?orderby= blocca tutti gli indirizzi che contengono il parametro di ordinamento.

Cosa fa davvero

robots.txt controlla la scansione, cioè quali pagine il crawler scarica. È utile per:

  • evitare che i motori sprechino tempo su pagine inutili, come i filtri a faccette dei negozi, le ricerche interne o i carrelli;
  • ridurre il carico sul server causato dalla scansione di migliaia di pagine senza valore;
  • indicare dove si trova la sitemap;
  • decidere quali bot di intelligenza artificiale possono leggere i tuoi contenuti.

Cosa non fa

Qui nascono gli equivoci più comuni.

  • Non è una protezione. Il file è pubblico e chiunque può leggerlo. I bot malevoli lo ignorano, anzi a volte lo usano per scoprire le cartelle che vorresti nascondere. Per fermare i bot dannosi serve Security Intelligence, non robots.txt.
  • Non toglie una pagina da Google. Una pagina bloccata può comparire comunque nei risultati, senza descrizione, se altri siti la collegano. Per escluderla dall’indice serve l’istruzione noindex nella pagina, e la pagina deve restare visitabile perché Google possa leggerla.
  • Non è un obbligo. I crawler seri lo rispettano, ma è una convenzione, non una regola tecnica.

Gli errori che costano cari

  1. Disallow: / dimenticato. Succede spesso quando un sito di prova viene messo online: il blocco totale usato durante lo sviluppo resta al suo posto e il sito sparisce da Google nel giro di qualche settimana.
  2. Bloccare CSS e JavaScript. Google deve poter caricare fogli di stile e script per capire come appare la pagina. Bloccare /wp-content/ o le cartelle dei temi peggiora la valutazione delle pagine.
  3. Bloccare pagine che vuoi togliere dall’indice. Se blocchi una pagina con robots.txt, Google non vede più il noindex, quindi la pagina può restare indicizzata.
  4. Regole scritte male. Gli spazi e le maiuscole contano nei percorsi: /Carrello/ e /carrello/ sono indirizzi diversi.

Dove si trova sul tuo hosting

Il file va nella cartella principale del sito, public_html. Puoi crearlo o modificarlo dal File Manager del pannello o via SFTP sulla porta 2300.

Se usi WordPress e il file non esiste, WordPress ne genera uno «virtuale» con regole di base. I plugin SEO più diffusi permettono di modificarlo dal pannello di WordPress. PrestaShop e Magento hanno invece le loro impostazioni nel pannello di amministrazione, come vediamo nell’articolo con i file pronti per ogni piattaforma.

Un dettaglio utile: sulla rete iWebLab Edge i file .txt non vengono mai tenuti in cache, quindi una modifica a robots.txt è visibile subito a tutti i crawler.

Come controllarlo

  • Apri https://tuodominio.it/robots.txt nel browser e rileggi le regole.
  • In Google Search Console, nelle impostazioni, c’è il rapporto su robots.txt: mostra la versione letta da Google, la data dell’ultima lettura e gli eventuali errori.
  • Con SEO Log Intelligence vedi quali pagine i motori visitano davvero e se continuano a passare su percorsi che hai bloccato.

In sintesi

  • robots.txt dice ai crawler cosa possono visitare: serve a guidare la scansione e a risparmiare risorse.
  • Non protegge nulla e non toglie le pagine da Google: per quello servono Security Intelligence e il noindex.
  • Attenzione a Disallow: /, ai CSS e JavaScript bloccati e alle regole scritte male.
  • Il file sta in public_html; sulla rete iWebLab Edge le modifiche sono visibili subito.

Vuoi un controllo del robots.txt del tuo sito? Apri un ticket.

Altri articoli su WordPress, WooCommerce e CMS

Parliamone

Un hosting che ti spiega le cose, e poi le fa

Questi articoli nascono dalle domande dei nostri clienti. Se vuoi un hosting dove dietro ogni risposta c’è un tecnico vero, parliamone.

  • 4,9 su 5 su Trustpilot264 recensioni, il 96% a cinque stelle
  • Risponde un tecnicoIn italiano, da chi gestisce i server
  • Il trasloco lo facciamo noiSito, database e posta, controllati prima di spostare i DNS