Glossarbegriff

Web Scraping

Web Scraping ist das programmatische Extrahieren von Daten oder Inhalten aus Websites. Dazu werden HTML ausgewertet, Seiten in einem Headless-Browser gerendert oder visuelle Zustände für Analyse, Monitoring und Archivierung aufgenommen.

Scraping, Crawling und Screenshots

Die drei Tätigkeiten überschneiden sich, erfüllen aber unterschiedliche Aufgaben.

Web Crawling durchläuft Websites systematisch über ihre Links. Ein Crawler startet mit einer URL, findet verlinkte Seiten und besucht sie rekursiv, um die Struktur zu erfassen oder zu indexieren. Suchmaschinen sind das bekannteste Beispiel.

Web Scraping extrahiert konkrete Daten aus den besuchten Seiten, etwa Produktpreise, Artikeltexte, Kontaktdaten oder Metadaten aus HTML-Elementen. Die Ausgabe besteht aus strukturierten CSV-, JSON- oder Datenbankwerten statt nur aus rohem HTML.

Screenshot-Aufnahmen bewahren das gerenderte Aussehen zu einem Zeitpunkt. Sie liefern keine strukturierten Daten, sind aber für Archivierung, visuelle Regressionstests, Wettbewerbsbeobachtung und Nachweise wichtig, wenn der sichtbare Zustand ebenso zählt wie die zugrunde liegenden Werte.

Die Ansätze können zusammenarbeiten: Ein Monitoring-Ablauf liest Preise aus, sichert einen Screenshot als visuellen Beleg und crawlt die Website regelmäßig nach neuen Seiten.

Typische Einsatzbereiche

  • Preisbeobachtung: Händler und Forschende verfolgen Wettbewerberpreise und Aktionen.
  • Content-Aggregation: Nachrichten- und Rechercheangebote bündeln Artikel, Überschriften und Zusammenfassungen mehrerer Quellen.
  • Leadgenerierung: Unternehmen erfassen öffentliche Verzeichnisse, Stellenbörsen und Profile nach Kontakt- und Unternehmensdaten.
  • Forschung: Öffentliche Datensätze werden für Analysen, Stimmungsbilder und Trends gesammelt.
  • Compliance und Archivierung: Organisationen sichern veröffentlichte Webinhalte für rechtliche oder regulatorische Nachweise.

So funktioniert Web Scraping

Ein einfacher Scraper ruft HTML per HTTP ab und verarbeitet es etwa mit BeautifulSoup für Python oder Cheerio für Node.js. CSS-Selektoren oder XPath finden die Zielelemente; Text, Attribute und Struktur werden ausgelesen.

Moderne Seiten laden Inhalte oft erst mit JavaScript. Dann genügt das statische HTML nicht. Ein Headless-Browser wie Puppeteer, Playwright oder Selenium rendert die Seite vollständig, führt JavaScript aus und stellt anschließend das erzeugte DOM zur Extraktion bereit.

Manche Abläufe kombinieren strukturierte Daten und visuelle Belege. Nach dem Rendern liest das Werkzeug DOM-Werte aus und erstellt gleichzeitig einen Screenshot. Das ist bei Monitoring sinnvoll, wenn Wert und Kontext erhalten bleiben müssen.

Für Screenshot-Produkte zählt diese Trennung: Soll bewiesen werden, wie eine Seite zu einem Zeitpunkt aussah, ist das Bild das richtige Artefakt. Sollen Preise, Text oder Felder in großer Menge gesammelt werden, bleibt der Screenshot nur ergänzender Beleg.

Häufige Fehler

  • Nutzungsbedingungen ignorieren. Automatisierter Zugriff kann untersagt sein. Prüfe Bedingungen und robots.txt, bevor du Daten erfasst.
  • Ohne Begrenzung anfragen. Zu viele Abrufe überlasten Server, führen zu IP-Sperren oder können einem Denial-of-Service ähneln. Verwende Pausen und beachte Crawl-Delay-Vorgaben.
  • JavaScript-Seiten statisch abrufen. Nachgeladener Inhalt fehlt dann. Rendere die Seite vollständig in einem Headless-Browser.
  • Screenshots für strukturierte Daten halten. Text daraus benötigt OCR und kann Fehler enthalten. Wenn Felder gebraucht werden, lies möglichst die HTML-Quelle direkt aus.

Häufig gestellte Fragen

Ist Web Scraping legal?

Das hängt von den erfassten Daten, ihrer Nutzung und der Rechtsordnung ab. Öffentlich zugängliche Daten dürfen häufig erfasst werden, doch Verstöße gegen Nutzungsbedingungen, das Umgehen einer Anmeldung und personenbezogene Daten können Haftungsrisiken schaffen. Das US-Urteil hiQ gegen LinkedIn von 2022 stützt das Scraping öffentlicher Daten; andere Länder können anders entscheiden.

Was unterscheidet Scraping und Crawling?

Crawling folgt Links von Seite zu Seite und entdeckt URLs. Scraping extrahiert bestimmte Daten aus diesen Seiten. Ein Crawler findet Seiten, ein Scraper liest ihre Inhalte aus. Viele Werkzeuge tun beides.

Kann ich eine Website per Screenshot scrapen?

Ein Screenshot bewahrt das Aussehen, extrahiert aber keine strukturierten Daten. Er eignet sich für Archivierung, Überwachung und visuelle Vergleiche. Für Text, Preise und andere Felder sind HTML-Auswertung oder eine API effizienter.

Brauche ich zum Scrapen einen Headless-Browser?

Nicht immer. Bei statischen Seiten reicht ein HTTP-Abruf des HTML. JavaScript-lastige Websites benötigen häufig Puppeteer oder Playwright, damit die Seite ausgeführt und der Inhalt vor der Extraktion gerendert wird.

Wie hängt Web Scraping mit Website-Monitoring zusammen?

Monitoring lädt Seiten in Abständen, extrahiert Werte wie Preise, Zustände oder Inhalte und vergleicht sie mit früheren Ergebnissen. Ein zusätzlicher Screenshot erkennt Layoutänderungen, die reine Datenauswertung übersieht.

Quellen

Verwandte Inhalte

Web Scraping: Bedeutung und Anwendung | Glossar | Shotomatic