Termine del glossario
Web scraping
Il web scraping estrae dati o contenuti dai siti tramite codice: analizzando l'HTML, riproducendo le pagine in un browser headless o acquisendo istantanee visive da usare per analisi, controllo o archiviazione.
Scraping, crawling e acquisizione di screenshot
Le tre attività si sovrappongono, ma hanno scopi diversi.
Il web crawling consiste nel percorrere sistematicamente i siti seguendo i link. Il crawler parte da un URL, scopre le pagine collegate e le visita in modo ricorsivo. Lo scopo è ricostruire o indicizzare la struttura del sito. I motori di ricerca sono l'esempio più noto.
Il web scraping fa un passo in più: estrae dati specifici dalle pagine visitate. Uno scraper può ricavare dagli elementi HTML prezzi, testo degli articoli, recapiti o metadati. Il risultato è costituito da dati strutturati, come CSV, JSON o righe di un database, e non dall'HTML grezzo.
L'acquisizione di screenshot conserva l'aspetto visivo di una pagina in un determinato momento. A differenza dello scraping, non estrae dati strutturati, ma genera un'immagine della pagina riprodotta. È utile per archiviazione, test di regressione visiva, controllo della concorrenza e documentazione della conformità, quando lo stato visivo conta quanto i dati sottostanti.
Gli approcci sono complementari. Un sistema di controllo può estrarre il prezzo da una pagina di prodotto, acquisire uno screenshot come prova visiva ed eseguire periodicamente il crawling del sito per trovare nuove pagine.
Dove si usa il web scraping
- Controllo dei prezzi — commercianti e ricercatori estraggono i prezzi della concorrenza per seguirne i cambiamenti, individuare promozioni e adeguare le proprie strategie.
- Aggregazione di contenuti — servizi di notizie e strumenti di ricerca raccolgono articoli, titoli e riepiloghi da più fonti e li presentano in un'unica interfaccia.
- Ricerca di contatti commerciali — le aziende consultano directory pubbliche, bacheche di lavoro e profili social per reperire recapiti e dati sulle imprese.
- Ricerca accademica — chi fa ricerca estrae serie di dati da fonti pubbliche per analisi, studio delle opinioni e individuazione delle tendenze.
- Conformità e archiviazione — le organizzazioni acquisiscono ed estraggono contenuti web per conservare le informazioni pubblicate a fini legali o normativi.
Come funziona
Lo scraping più semplice scarica l'HTML di una pagina tramite una richiesta HTTP e lo analizza con una libreria come BeautifulSoup per Python o Cheerio per Node.js. Il programma individua gli elementi tramite selettori CSS o espressioni XPath e ne estrae testo, attributi o struttura.
I siti moderni caricano spesso i contenuti in modo dinamico tramite JavaScript, quindi scaricare soltanto l'HTML non basta. In questi casi un browser headless, come Puppeteer per Chrome, Playwright per più browser o Selenium, riproduce l'intera pagina, esegue JavaScript e rende disponibile il DOM risultante per l'estrazione.
Alcuni sistemi combinano l'estrazione dei dati con l'acquisizione visiva. Dopo aver riprodotto una pagina nel browser headless, lo strumento ricava i dati strutturati dal DOM e contemporaneamente salva uno screenshot. Il doppio risultato è particolarmente utile quando contano sia i dati sia il loro contesto visivo.
Nei prodotti per screenshot, la distinzione è importante. Se occorre dimostrare l'aspetto di una pagina in un dato momento, l'acquisizione è spesso il risultato più adatto anche senza dati strutturati. Se bisogna raccogliere campi, prezzi o testo su larga scala, gli screenshot sono prove di supporto, non il risultato principale.
Errori comuni
- Ignorare i termini di servizio. Molti siti vietano l'accesso automatico. Estrarre dati in violazione di tali termini può esporre ad azioni legali anche quando le informazioni sono pubbliche. Controlla sempre i termini e robots.txt.
- Eseguire lo scraping senza limiti di frequenza. Richieste troppo rapide possono sovraccaricare il server, causare il blocco dell'indirizzo IP o costituire un attacco di negazione del servizio. Inserisci pause e rispetta le direttive crawl-delay del sito.
- Scaricare soltanto l'HTML di pagine generate da JavaScript. Se il contenuto viene caricato dopo l'apertura, una semplice richiesta HTTP restituisce una pagina vuota o incompleta. Riproducila interamente in un browser headless prima di estrarre i dati.
- Trattare gli screenshot come dati strutturati. Le immagini conservano l'aspetto, ma non offrono dati leggibili dal software. Per estrarre testo da uno screenshot occorre un ulteriore passaggio OCR, che può introdurre errori. Quando servono dati strutturati, analizza direttamente l'HTML.
Domande frequenti
Il web scraping è legale?
Dipende dai dati estratti, dal loro uso e dalla giurisdizione. Estrarre dati accessibili al pubblico è in genere consentito, ma violare i termini di servizio, aggirare l'autenticazione o raccogliere dati personali può comportare responsabilità legali. Negli Stati Uniti, la decisione hiQ contro LinkedIn del 2022 sostiene l'estrazione di dati pubblici; le leggi variano però da paese a paese.
Qual è la differenza tra scraping e crawling?
Il crawling passa da una pagina all'altra seguendo i link e scopre gli URL. Lo scraping estrae dati specifici da quelle pagine. Un crawler trova le pagine, uno scraper ne ricava i contenuti. Molti strumenti svolgono entrambe le attività.
Posso estrarre un sito acquisendo screenshot?
Gli screenshot conservano l'aspetto visivo della pagina, ma non producono dati strutturati. Sono utili per archiviazione, controllo e confronti visivi. Se servono testo, prezzi o altre informazioni strutturate, l'analisi dell'HTML o l'accesso tramite API sono più efficienti.
Serve un browser headless per lo scraping?
Non sempre. Nelle pagine statiche basta scaricare l'HTML con un client HTTP. I siti moderni che dipendono da JavaScript richiedono invece un browser headless, come Puppeteer o Playwright, che riproduca la pagina ed esegua JavaScript prima dell'estrazione.
Come si collega il web scraping al controllo dei siti?
Il controllo dei siti usa spesso tecniche di scraping: carica una pagina a intervalli, estrae determinati valori, come prezzi, stati o contenuti, e li confronta con i risultati precedenti. Il controllo visivo aggiunge gli screenshot per rilevare cambiamenti di impaginazione che la sola estrazione dei dati non mostrerebbe.
Fonti
- Robots.txt introduction — Google Search Central
- Scrapy at a glance — Scrapy
Risorse correlate
Acquisizione di siti web
Automazione degli screenshot di siti web con Shotomatic
Cattura automaticamente screenshot di siti web su Mac da liste di URL, con opzioni desktop, tablet, mobile, viewport e pagina intera.
Blog
I migliori strumenti per automatizzare gli screenshot sul Mac (2026)
Confronta Shotomatic, Snagit e CleanShot X per acquisizioni a intervalli, guide basate sui clic, siti in serie, PDF ricercabili e screenshot manuali.