Skip to content

Glenat 15

Actu

Come esplorare efficacemente la struttura e i contenuti di un sito web moderno

Ci si imbatte regolarmente in siti il cui menu mostra una decina di voci, ma dove trovare una pagina precisa è un vero e proprio percorso ad ostacoli. Prima ancora di parlare di restyling o SEO, la questione di partenza è più semplice…

Femme analyste explorant une carte de structure de site web sur un bureau en bois dans un bureau moderne

Ci si imbatte regolarmente in siti il cui menu mostra una decina di sezioni, ma dove trovare una pagina precisa diventa un percorso ad ostacoli. Prima ancora di parlare di restyling o SEO, la questione di partenza è più semplice: come leggere la struttura di un sito web esistente per capire cosa contiene, cosa manca e cosa crea problemi ai visitatori come ai robot di esplorazione.

File robots.txt e sitemap XML: i primi due riflessi di esplorazione

Quando si vuole comprendere la struttura di un sito web, non si inizia a cliccare nel menu. Si aprono due file accessibili aggiungendo /robots.txt e /sitemap.xml all’URL radice.

Il robots.txt indica quali sezioni sono bloccate per i robot di ricerca. Una cartella intera nascosta (ad esempio /staging/ o /archive/) segnala spesso contenuti abbandonati o una migrazione incompleta. La sitemap XML, invece, elenca le pagine che il proprietario del sito considera indicizzabili. Confrontare la sitemap con il menu di navigazione rivela le discrepanze: pagine orfane assenti nel menu, vecchie URL ancora dichiarate, categorie vuote.

Si può consultare il sito Actu Web in dettaglio per osservare un esempio concreto di sitemap strutturata per sezioni tematiche, il che offre una lettura rapida dell’organizzazione editoriale.

Questa fase richiede alcuni minuti e fornisce una mappatura grezza del contenuto prima di qualsiasi analisi approfondita.

Uomo in piedi davanti a uno schermo che mostra uno strumento di esplorazione della struttura del sito web in un ufficio domestico

Esplorazione da parte dei robot IA: GPTBot, ClaudeBot e le nuove regole di accesso

Dal 2023, i registri dei server registrano visite di robot che non esistevano alcuni anni fa: GPTBot (OpenAI), ClaudeBot (Anthropic), PerplexityBot, Applebot e OAI-SearchBot. Questi agenti non cercano di indicizzare pagine per un motore classico. Raccolgono contenuti per addestrare modelli di linguaggio o alimentare risposte conversazionali.

Distinguerli dai crawler classici come Googlebot è diventata un’attività a sé stante. Le opzioni di filtraggio passano attraverso il robots.txt (direttive User-agent specifiche), ma anche attraverso regole CDN, WAF o restrizioni IP per un controllo più granulare.

Il file llms.txt, uno strato di struttura al di fuori dell’HTML

Dal 2025, diversi guide raccomandano di posizionare un file llms.txt alla radice del sito. Questo file elenca le URL prioritarie e le politiche di accesso per ogni agente IA. Alcuni vi aggiungono riassunti di contenuto per sezione.

L’obiettivo è facilitare un’esplorazione mirata da parte dei modelli di linguaggio, dove la sitemap XML rimane orientata verso i motori di ricerca tradizionali. Si passa da una logica “indicizzazione per Google” a una logica “visibilità multi-agenti” che copre anche la ricerca conversazionale.

I feedback variano sull’adozione reale di questo file da parte dei diversi agenti, ma il principio di segmentare gli accessi in base al tipo di robot si sta progressivamente affermando come una buona pratica.

Siti in Single Page Application: la trappola del contenuto invisibile

Un sito costruito in SPA (React, Vue, Angular) carica tutto il suo contenuto tramite JavaScript lato client. Visivamente, la navigazione sembra fluida. Per un robot di esplorazione, il risultato può essere una pagina quasi vuota se il rendering server (SSR o prerendering) non è configurato.

Senze rendering lato server, la maggior parte del contenuto di una SPA rimane invisibile ai crawler. Googlebot esegue JavaScript, ma con un ritardo e delle limitazioni. I robot IA, invece, non dispongono tutti di questa capacità.

Quando si analizza la struttura di un sito SPA, è necessario verificare tre punti concreti:

  • Il codice sorgente grezzo (Ctrl+U nel browser) contiene il testo visibile sullo schermo, o solo tag vuoti e chiamate JavaScript?
  • Le URL interne generano pagine distinte lato server, o tutto passa attraverso un unico punto d’ingresso con frammenti (#)?
  • La sitemap XML fa riferimento a tutte le rotte dell’applicazione, comprese le sottopagine dinamiche?

Se il codice sorgente è vuoto e la sitemap non copre le rotte interne, il sito ha un problema di esplorazione che colpisce sia il SEO classico che la visibilità presso gli agenti IA.

Due colleghi che collaborano all'audit della struttura e dei contenuti di un sito web in uno spazio di coworking

Navigazione mobile e profondità di clic: misurare l’accessibilità reale del contenuto

Su desktop, un menu a discesa a due livelli dà accesso a diverse decine di pagine con un clic. Su mobile, lo stesso menu si trasforma in un accordione o in un hamburger, e ogni livello aggiunge un’interazione tattile. La profondità di clic percepita su mobile è spesso il doppio di quella su desktop.

Per valutare la struttura dal punto di vista dell’utente, si conta il numero di tocchi necessari per raggiungere le pagine più consultate. Oltre tre tocchi dalla pagina iniziale, il tasso di abbandono aumenta in modo notevole. È anche un segnale per i motori di ricerca: una pagina sepolta a cinque livelli di profondità riceve meno budget di crawl.

Collegamenti interni e link contestuali

Il menu principale non è sufficiente per rendere tutte le pagine accessibili. I link integrati nel corpo degli articoli o delle schede prodotto costituiscono il collegamento interno contestuale. Questa rete di link interni svolge due funzioni:

  • Guida il visitatore verso contenuti complementari senza dover tornare al menu, riducendo così la profondità di navigazione effettiva
  • Distribuisce l’autorità SEO tra le pagine, segnalando ai robot quali pagine sono tematicamente collegate
  • Offre agli agenti IA percorsi di esplorazione aggiuntivi verso contenuti che non figurano sempre nella sitemap

Analizzare il collegamento interno di un sito significa mappare le sue connessioni reali, non solo la sua struttura teorica.

Audit di un sito web moderno: da cosa iniziare concretamente

Riassumiamo la sequenza di azioni: aprire il robots.txt per individuare i blocchi, leggere la sitemap XML per elencare le pagine dichiarate, verificare la presenza di un file llms.txt, testare il rendering lato server su alcune pagine chiave e poi contare la profondità di clic su mobile. Questi cinque controlli coprono gli aspetti che la maggior parte degli audit trascura, in particolare l’accesso dei robot IA ai contenuti e il comportamento reale dei siti in JavaScript.

L’esplorazione di un sito web non si limita più alla sua navigazione visibile. La struttura che conta è quella che i robot, classici o conversazionali, riescono effettivamente a leggere.

Come esplorare efficacemente la struttura e i contenuti di un sito web moderno