Liest HTML-Dateien per XPath aus, extrahiert Werte, Tabellen, Links und reinen Text und kann Elemente, Texte oder Attribute ändern und zurückschreiben. So lassen sich Berichte aus Webseiten-Exporten gewinnen oder HTML-Vorlagen automatisch befüllen.
Block-Einstellungen
Gelten für den ganzen Modul-Block (im Editor oben im Inspektor, in YAML direkt unter dem Modulnamen).
Feld
Typ
Pflicht
Beschreibung
datei
Text
—
Pfad zur .html-Datei. Beim Block-Eintritt wird sie geladen; fehlt sie oder wird kein Pfad angegeben, startet das Modul mit einem leeren <html><body></body></html>. Für 'speichern' ist 'datei' Pflicht.
einrückung
Wahrheit
—
Steuert die Einrückung beim Speichern (Vorgabe: an). Wird derzeit nur gemerkt.
Aktionen
parsenverändernd
Lädt einen HTML-String direkt als aktuelles Dokument (statt aus einer Datei).
Eingaben
Feld
Typ
Pflicht
Beschreibung
text
Text
—
Der HTML-Text, der als Dokument geladen wird (leer = leeres Dokument).
wert-lesenlesend
Liest den Textinhalt des ersten Elements, das auf den XPath passt.
Eingaben
Feld
Typ
Pflicht
Beschreibung
xpath
Text
ja
XPath-Ausdruck, z.B. //h1 oder //a[@href].
standard
Text
—
Rückgabewert, falls kein Element gefunden wird.
Ausgaben (über ergebnis:)
wert
Der getrimmte Textinhalt des Treffers oder der Standard.
werte-lesenlesend
Liest den Textinhalt aller Elemente, die auf den XPath passen, als Liste.
Eingaben
Feld
Typ
Pflicht
Beschreibung
xpath
Text
ja
XPath-Ausdruck, der mehrere Elemente treffen kann.
Ausgaben (über ergebnis:)
werte
Liste der Texte aller Treffer.
attribut-lesenlesend
Liest den Wert eines Attributs am ersten passenden Element.
Eingaben
Feld
Typ
Pflicht
Beschreibung
xpath
Text
ja
XPath-Ausdruck zur Auswahl des Elements.
name
Text
ja
Name des Attributs, z.B. href oder class.
standard
Text
—
Rückgabewert, falls Element oder Attribut fehlt.
Ausgaben (über ergebnis:)
wert
Der Attributwert oder der Standard.
abfragenlesend
Liefert den äußeren HTML-Code aller passenden Elemente.
Eingaben
Feld
Typ
Pflicht
Beschreibung
xpath
Text
ja
XPath-Ausdruck zur Auswahl der Elemente.
Ausgaben (über ergebnis:)
treffer
Liste mit dem vollständigen HTML jedes Treffer-Knotens.
existiertlesend
Prüft, ob mindestens ein Element auf den XPath passt.
Eingaben
Feld
Typ
Pflicht
Beschreibung
xpath
Text
ja
XPath-Ausdruck, dessen Vorhandensein geprüft wird.
Ausgaben (über ergebnis:)
vorhanden
Wahr, wenn ein Treffer existiert, sonst falsch.
anzahllesend
Zählt die Elemente, die auf den XPath passen.
Eingaben
Feld
Typ
Pflicht
Beschreibung
xpath
Text
ja
XPath-Ausdruck, dessen Treffer gezählt werden.
Ausgaben (über ergebnis:)
anzahl
Anzahl der gefundenen Elemente.
tabellenlesend
Liest alle HTML-Tabellen als verschachtelte Listen (Tabelle > Zeile > Zelle).
Ausgaben (über ergebnis:)
tabellen
Liste aller Tabellen; jede ist eine Liste von Zeilen, jede Zeile eine Liste der Zelltexte.
linkslesend
Listet alle Links (a-Elemente mit href) mit Anzeigetext und Ziel.
Ausgaben (über ergebnis:)
links
Liste von Objekten mit 'text' (Linktext) und 'ziel' (href).
text-extrahierenlesend
Extrahiert den gesamten sichtbaren Text des Dokuments ohne HTML-Tags.
Ausgaben (über ergebnis:)
text
Der reine Textinhalt des Dokuments.
nach-markdownlesend
Wandelt das HTML in Markdown um (Überschriften, Fett/Kursiv, Listen, Links, Code usw.).
Ausgaben (über ergebnis:)
markdown
Der Markdown-Text des Dokuments.
wert-setzenverändernd
Ersetzt den Textinhalt des ersten passenden Elements.
Eingaben
Feld
Typ
Pflicht
Beschreibung
xpath
Text
ja
XPath-Ausdruck zur Auswahl des Elements (kein Treffer = Fehler).
wert
Text
—
Der neue Textinhalt (leer = leerer Inhalt).
attribut-setzenverändernd
Setzt oder ergänzt ein Attribut am ersten passenden Element.
Eingaben
Feld
Typ
Pflicht
Beschreibung
xpath
Text
ja
XPath-Ausdruck zur Auswahl des Elements (kein Treffer = Fehler).
name
Text
ja
Name des zu setzenden Attributs.
wert
Text
—
Der Attributwert (leer = leerer Wert).
element-entfernenverändernd
Entfernt alle Elemente, die auf den XPath passen.
Eingaben
Feld
Typ
Pflicht
Beschreibung
xpath
Text
ja
XPath-Ausdruck der zu entfernenden Elemente (kein Treffer = Fehler).
schreibenverändernd
Ersetzt das gesamte Dokument durch neuen HTML-Inhalt.
Eingaben
Feld
Typ
Pflicht
Beschreibung
inhalt
Text
—
Der neue komplette HTML-Inhalt (Vorgabe: leeres Dokument).
speichernverändernd
Schreibt das aktuelle Dokument zurück in die Block-Datei.
speichern-unterverändernd
Schreibt das aktuelle Dokument in eine angegebene Datei.
Eingaben
Feld
Typ
Pflicht
Beschreibung
pfad
Text
ja
Zielpfad der zu schreibenden HTML-Datei.
Beispiele
Tabelle und Links aus einem HTML-Export auslesen
Liest die Überschrift, alle Tabellenzeilen und die Links aus einer gespeicherten Webseite.