Glossarbegriff

Web-Crawler

Ein Web-Crawler besucht systematisch Webseiten, folgt Links, lädt Inhalte und kann auf jeder Seite Screenshots erstellen oder Daten extrahieren.

So arbeiten Web-Crawler

Ein Crawler startet mit einer oder mehreren Ausgangs-URLs. Er lädt deren HTML, sucht Links und legt sie in eine Warteschlange. Danach besucht er die nächsten URLs, entdeckt weitere Links und wiederholt den Vorgang. So entsteht eine Karte der Website.

Mehrere Regeln steuern den Ablauf. Tiefenlimits legen fest, wie viele Linkebenen verfolgt werden. URL-Filter begrenzen Domains, Subdomains und Pfadmuster. Rate Limits verhindern zu viele gleichzeitige Anfragen an den Zielserver.

Einfache Crawler laden rohes HTML per HTTP. Weitergehende Varianten rendern JavaScript im Headless-Browser, warten auf dynamische Inhalte und verarbeiten die fertige Seite. Bei Single-Page-Anwendungen ist dieser Unterschied entscheidend.

Eine Menge bereits besuchter URLs verhindert Doppelarbeit. Üblicherweise wird außerdem robots.txt beachtet, die erlaubte und gesperrte Pfade für automatisierte Zugriffe angibt.

Crawling und Scraping

Die Tätigkeiten hängen zusammen, haben aber andere Ziele. Crawling dient der Entdeckung von Seiten und ihrer Struktur. Scraping dient der Extraktion von Text, Preisen, Bildern und Metadaten.

In der Praxis werden sie kombiniert. Der Crawler findet alle Produktseiten eines Shops, der Scraper liest Name, Preis und Verfügbarkeit. Ebenso kann ein Crawler Marketingseiten entdecken, die eine Screenshot-Engine anschließend visuell sichert.

Crawling beantwortet „Welche Seiten gibt es?“, Scraping „Was steht auf jeder Seite?“ Bei Screenshot-Werkzeugen ist der Crawler die Entdeckungsschicht; das Bildsystem macht aus der URL-Liste Nachweise, Audits oder Archive.

Typische Einsatzbereiche

  • Suchmaschinen: Googlebot und Bingbot entdecken und indexieren Seiten im gesamten Web.
  • Website- und SEO-Audits: Defekte Links, fehlende Meta-Tags, Weiterleitungsketten und Barrierefreiheitsprobleme werden seitenweit geprüft.
  • Visuelles Monitoring: Ein integrierter Crawler erfasst Hunderte Seiten ohne manuelle Navigation.
  • Archiv und Compliance: Eigene oder externe Websites werden als Daten- und Bildnachweis gesichert.
  • Wettbewerbsbeobachtung: Preise, Produktstarts und Content-Änderungen werden verfolgt.

Häufige Fehler

  • robots.txt ignorieren. Das kann Sperren, rechtliche Probleme und unnötige Last verursachen.
  • Ohne Rate Limit crawlen. Begrenze parallele Verbindungen und füge Pausen ein.
  • Doppelte URLs nicht normalisieren. Slash, Query und Fragmente können dieselbe Seite mehrfach erzeugen. Führe eine Besuchsliste.
  • JavaScript-Rendering auslassen. React-, Vue- und Angular-Inhalte können im rohen HTML fehlen.
  • Keinen Umfang festlegen. Ohne Tiefe und Filter führen Endlosseiten, externe Domains oder dynamische URLs zu unbegrenztem Crawling.

Häufig gestellte Fragen

Was unterscheidet Web-Crawler und Web-Scraper?

Ein Crawler entdeckt Seiten, indem er Links folgt. Ein Scraper extrahiert konkrete Daten daraus. Viele Werkzeuge kombinieren beides: Der Crawler findet URLs, Scraper oder Screenshot-Engine verarbeiten sie.

Führen Web-Crawler JavaScript aus?

Klassische Crawler laden nur rohes HTML. Moderne Varianten können einen Headless-Browser nutzen, um JavaScript-lastige Seiten und dynamisch geladene Inhalte vollständig zu rendern.

Wie begrenze ich die besuchten Seiten?

Tiefenlimits beschränken die Zahl gefolgter Linkebenen. Erlaubnis- und Sperrmuster schließen Domains oder Pfade ein beziehungsweise aus. `robots.txt` sollte technisch und ethisch beachtet werden.

Kann ein Crawler jede Seite als Screenshot speichern?

Ja. Manche Screenshot-Tools besuchen gefundene Seiten automatisch und erfassen jede davon. Das eignet sich für visuelle Audits, Archive und Website-Monitoring.

Ist Web Crawling legal?

Öffentliche Seiten dürfen häufig gecrawlt werden. Beachte trotzdem `robots.txt`, überlaste den Server nicht und prüfe die Nutzungsbedingungen. Authentifizierte Bereiche und personenbezogene Daten bringen zusätzliche rechtliche Fragen mit sich.

Quellen

Verwandte Inhalte

Web-Crawler: Bedeutung und Anwendung | Glossar | Shotomatic