Webseiten-Extraktor

Zieh Titel, Metadaten, Überschriften, Links, Bilder und Text aus jeder öffentlichen Seite

100 % kostenlos. Dieses Tool braucht unseren Server für die Arbeit. Was du sendest, wird dort verarbeitet und danach verworfen – nie gespeichert.

Selector supports a tag name, .class or #id. Full CSS selectors are not supported - anything more complex returns nothing rather than a wrong answer.

12 of 12 scrapes left today.

Über dieses Tool

Zieh die Struktur aus jeder öffentlichen Webseite. Gib eine URL und es gibt Titel, Meta-Description, Canonical, Sprache, Open-Graph-Tags, jede Überschrift in Reihenfolge, alle Links als intern oder extern markiert und für nofollow geflaggt, jedes Bild mit Alt-Text und deklarierter Größe und den lesbaren Text mit Wortzahl zurück. Ein optionaler einfacher Selektor - ein Tag-Name, eine Klasse oder eine id - gibt nur den Text passender Elemente zurück, genug um Preise, Titel oder Listeneinträge zu ziehen, ohne einen Scraper zu schreiben. Links und Text können mit einem Klick kopiert werden.

Ablauf

Prüfe eine Seite, bevor du sie veröffentlichst

  1. 1Die Seite auslesenZieh Überschriften, Links, Bilder und Metadaten.Du bist hier
  2. 2Meta-Tags prüfenTitel und Beschreibung so, wie Suchmaschinen sie lesen.Öffnen
  3. 3Die Share-Karte vorschauenSieh, wie sie in Social Media aussieht.Öffnen
  4. 4Screenshot machenSpeichere eine Aufnahme der fertigen Seite für dein Archiv.Öffnen

So verwendest du dieses Tool

  1. Eine URL einfügenJede öffentliche http- oder https-Seite. Sie wird serverseitig geholt, daher funktionieren Seiten, die Browser-Requests blocken, trotzdem.
  2. Einen Selektor hinzufügen, wenn du einen willstEin Tag-Name, .class oder #id grenzt das Ergebnis auf genau diese Elemente ein.
  3. Die Tabs durchsehenÜbersicht, Überschriften, Links, Bilder, Meta und Text haben jeweils eine eigene Ansicht, mit Kopieren-Buttons für die Listen.

Warum es nutzen

  • Alles in einem Durchgang - Metadaten, Überschriften, Links, Bilder und Text - statt ein Tool pro Feld.
  • Links werden entdoppelt und als intern oder extern markiert, mit nofollow geflaggt.
  • Bilder enthalten Alt-Text, fehlende Alt-Attribute sind also sofort sichtbar.
  • Open Graph und Meta-Tags sind zusammen gelistet, um zu prüfen, wie eine Seite geteilt wird.
  • Skripte und Styles werden vor der Text-Extraktion entfernt, sodass die Wortzahl echten Inhalt widerspiegelt.
  • Kopieren-Buttons für die Linkliste und den Seitentext.

Häufige Anwendungen

  • Eine Seite auf fehlenden Alt-Text, Überschriften oder Meta-Description auditieren.
  • Jeden Outbound-Link einer Seite für ein Backlink- oder Compliance-Review exportieren.
  • Prüfen, wie eine Seite beim Teilen wirkt, indem du ihre Open-Graph-Tags liest.
  • Eine Liste von Produkttiteln oder Preisen mit einem Klassen-Selektor ziehen.
  • Echten Wortinhalt auf einer Konkurrenzseite zählen.
  • Den lesbaren Text eines Artikels zur Analyse holen.

Tipps für bessere Ergebnisse

  • Starte mit dem Übersicht-Tab - die meisten SEO-Probleme sind dort in Sekunden sichtbar.
  • Nutze die internen und externen Filter auf dem Links-Tab vor dem Kopieren.
  • Schalte Seitentext extrahieren aus für ein viel kleineres, schnelleres Ergebnis, wenn du nur Links willst.
  • Ein Klassen-Selektor matcht jedes Element mit dieser Klasse, halte ihn also spezifisch.
  • Der Überschriften-Tab zeigt Verschachtelung durch Einrückung, wodurch eine kaputte Überschriftenreihenfolge offensichtlich wird.
  • Manche Sites liefern Servern anderes Markup als Browsern, vergleiche also mit der Live-Seite, wenn etwas seltsam wirkt.

Fehler, die du vermeiden solltest

  • Volle CSS-Selektor-Unterstützung zu erwarten - nur ein Tag-Name, .class oder #id werden verarbeitet.
  • Eine Seite zu scrapen, deren Inhalt vollständig nach dem Laden per JavaScript gerendert wird, was die leere Hülle zurückgibt.
  • Eine Login- oder Consent-Wall als die echte Seite zu lesen.
  • Anzunehmen, die Linkliste sei ein voller Site-Crawl - sie deckt die eine Seite ab, die du geholt hast.
  • Gescrapten Inhalt so zu nutzen, wie die Site es verbietet; prüfe zuerst die Bedingungen und Robots-Regeln.

Häufig gestellte Fragen

Titel, Meta-Description, Canonical, Sprache, Open Graph und Meta-Tags, jede Überschrift mit ihrer Ebene, entdoppelte Links als intern oder extern markiert und für nofollow geflaggt, Bilder mit Alt-Text und deklarierten Abmessungen und den lesbaren Seitentext mit Wortzahl.

Nur einfache: ein Tag-Name, .class oder #id. Komplexeres gibt nichts zurück statt einer falschen Antwort - das ehrliche Verhalten für einen regex-basierten Extractor.

Weil die Seite ihren Inhalt nach dem Laden mit JavaScript rendert. Dieses Tool holt das HTML, das der Server sendet, eine client-gerenderte Seite gibt also ihre leere Hülle zurück. Dafür nutze das Website-Screenshot-Tool, das einen echten Browser fährt.

Nein. Der Fetch ist anonym ohne Cookies oder Session, alles hinter einem Login gibt die ausgeloggte Seite zurück.

Das hängt von der Site ab. Viele veröffentlichen Bedingungen oder eine Robots-Datei, die beschreiben, welchen automatisierten Zugriff sie erlauben, und Urheberrecht gilt weiter für den Inhalt, den du holst. Prüfe, bevor du gescraptes Material nutzt, besonders kommerziell.

Related guides