Chrome-Erweiterung
Eine Webseite als Markdown speichern, das Sie nicht nachbearbeiten müssen
Klicken Sie auf das Symbol, und der Clip ist schon da – Titel, Autor, Datum und Quelle im Frontmatter, der Text ohne Navigation. Alles passiert in Ihrem Browser: kein Konto, kein Server, keine Telemetrie.

Das Problem ist nie die Umwandlung. Es ist alles, was mitkommt.
Jeder Clipper macht aus HTML Markdown. Dann öffnen Sie die Notiz und finden das Cookie-Banner, das Seitenmenü, eine „Auch interessant“-Liste und eine Tabelle, die unterwegs zerfallen ist. Clean Clipper ist genau darum herum gebaut, das zu entfernen – und das Entfernen ist gemessen, nicht behauptet.
was andere Clipper behalten
[Zum Inhalt](#main) [Anmelden](/login) [Registrieren](/register) [Start](/) [News](/news) [Sport](/sport) [Kultur](/kultur) [Mehr](/mehr) Wir verwenden Cookies und ähnliche Technologien, um Ihr Erlebnis zu verbessern. [Alle akzeptieren] [Einstellungen] # Der Artikel, für den Sie gekommen sind Der eigentliche erste Absatz des Textes. <div class="promo-inline"> ## Auch interessant [Eine andere Überschrift](/a) [Noch eine](/b) [Und eine dritte](/c)
was in der Notiz landet
# Der Artikel, für den Sie gekommen sind Der eigentliche erste Absatz des Textes.
Was die Ausgabe sauber macht
- Code behält seine Sprache. Der Zaun kommt mit
jsheraus, nicht nackt – Hervorhebung wirkt sofort beim Einfügen. - Tabellen bleiben ganz. Eine Zelle mit Code oder Liste zerreißt die Zeile nicht mehr.
- Fußnoten funktionieren wirklich. Verweise werden zu
[^1]mit Definitionen am Ende der Notiz statt zu toten Ankern. - Daten werden gelesen, nicht geraten. JSON-LD,
article:published_time,citation_date(Standard von arXiv, PubMed, IEEE),time[datetime], Unix-Stempel. Kein Datum auf der Seite heißt leeres Feld, niemals das heutige. - Menüs, Banner und „Auch interessant“ fliegen raus. Logoleisten, Seitenzähler und in jedem Abschnitt wiederholte Navigation erreichen die Notiz nie.
- Kein einziges übriges Tag. Kein
divodertablemitten im Text.
---
title: "Markow-Kette – Wikipedia"
source: "https://de.wikipedia.org/wiki/Markow-Kette"
date: "2003-09-14T11:02:41.000Z"
extraction: "dom"
---
Eine Markow-Kette ist ein stochastischer Prozess, bei dem die Wahrscheinlichkeit
jedes Ereignisses nur vom im vorherigen Ereignis erreichten Zustand abhängt.[^1]
[^1]: Markow, A. A. (1906): Ausdehnung des Gesetzes der großen Zahlen auf
voneinander abhängige Größen.Gemessen an 512 Seiten der meistbesuchten Websites
Zwei Durchläufe. Der erste nahm 109 Seiten aus den hundert meistbesuchten Websites weltweit und in Russland und verglich die Ausgabe mit drei anderen Extraktions-Engines. Der zweite nahm die Top-50 in zwölf europäischen Ländern – 403 weitere Seiten, jede in der Sprache des Landes erfasst.
Wohin gespeichert wird
- Markdown in die Zwischenablage kopieren
- Die
.md-Datei herunterladen - In einen von Ihnen gewählten Ordner auf der Festplatte schreiben
- Direkt in den Obsidian-Vault schreiben – kein Plugin, keine lokale REST-API, kein URI-Schema; die Datei ist einfach da
Der Klick auf das Symbol ist einstellbar. Lassen Sie das Vorschaufenster, oder machen Sie daraus einen Klick, der die Notiz in den Vault legt und gar nichts öffnet.

Ehrlich über die Quelle
Jede Notiz trägt ein Feld extraction. dom heißt: der Text kam aus dem, was der Browser tatsächlich gerendert hat. jsonld-articlebody heißt: die Seite wurde nie fertig gerendert und der Text musste aus ihren eigenen strukturierten Daten gelesen werden. Und wenn auf der Seite überhaupt kein Artikel steht – Shop, Feed, Suchergebnis – sagt die Erweiterung das, statt Ihnen dreihundert Links hinzuwerfen.
Fünfzehn Arten, es zu benutzen
EntwicklerCode-Zäune behalten ihr Sprach-Tag: Die Hervorhebung wirkt sofort beim Einfügen.
Clean Clipper liest die Sprache eines Codeblocks auf der Seite selbst – aus der Klasse am Zaun, aus dem Elternelement, aus der Auszeichnung des Highlighters – und schreibt sie in den Zaun. Auf einem technischen Korpus aus neun Seiten überlebte die Marke in 73 von 156 Zäunen, gegen 20 und 0 bei den beiden verglichenen Engines. Der Rest der Seite kommt als gewöhnliches Markdown an, ohne Seitenleiste.
- Der Zaun kommt als ```js heraus und nicht nackt – die Hervorhebung wirkt in Obsidian, VS Code und GitHub sofort beim Einfügen
- Die Sprache wird von der Seite gelesen – Klasse am Zaun, Elternelement, Auszeichnung des Highlighters – und nie aus dem Code geraten
- Eine Parametertabelle mit Code in einer Zelle behält ihre Zeilen, statt zusammenzufallen
Obsidian-NutzerSie wählen einen Ordner im Vault, ein Klick legt die Notiz dort ab. Obsidian muss nicht laufen.
Die Erweiterung schreibt die .md-Datei selbst, in einen Ordner, für den Sie einmal Zugriff erteilen. Es gibt kein Community-Plugin, keinen lokalen Server und keinen obsidian://-Link, der gepflegt werden müsste. Die Notiz liegt einfach da, wenn Sie das nächste Mal in Ihr Wissensarchiv schauen.
- Kein Plugin, kein lokaler Server, keine
obsidian://-Links - Obsidian muss nicht offen sein – die Datei erscheint im Ordner, und der Index holt sie sich später
- YAML-Frontmatter mit title, source, author, published und extraction, und Sie entscheiden, welche Felder bleiben
KI und SprachmodelleWiederholte Navigation ist verschwendeter Kontext. Sie fällt weg, bevor der Text das Modell erreicht.
Wird eine Webseite in ein Modell eingefügt, zählt jede doppelte Menüzeile und jedes Banner als Kontext und konkurriert mit dem Text, um den es Ihnen geht. Auf einem Korpus von 109 Seiten ließ Clean Clipper 102 doppelte Navigationszeilen übrig, die drei anderen Engines 282, 478 und 491. Das Frontmatter nennt nebenbei Quelladresse und Erscheinungsdatum.
- Rund viermal weniger doppelte Navigationszeilen als im Schnitt der verglichenen Engines
- Null übrige HTML-Tags über 512 gemessene Seiten – das Modell muss sich an keiner verirrten Auszeichnung vorbeiarbeiten
- Das Frontmatter nennt Quelladresse und Erscheinungsdatum ausdrücklich, statt sie erraten zu lassen
ForschungDas Datum kommt aus den Metadaten, auch aus `citation_date`, dem Standard von arXiv und PubMed.
Ein gespeicherter Aufsatz ohne sein Erscheinungsdatum wird zu einem Beleg, den Sie später rekonstruieren müssen. Die Erweiterung liest das Datum aus den Metadaten der Seite, statt es im Text zu suchen, und lässt das Feld leer, wenn die Seite keines trägt. Verweise werden zu echten Markdown-Fußnoten, deren Definitionen am Ende der Datei stehen.
- Liest
citation_dateundcitation_publication_date– die Meta-Tags, die arXiv, PubMed und IEEE ausgeben - Dazu JSON-LD
datePublished,article:published_time,time[datetime]und Unix-Stempel - Kein Datum auf der Seite heißt leeres Feld, niemals das Datum des heutigen Tages
StudiumVorlesungen, Kapitel und Nachschlageseiten werden zu Markdown-Dateien, die Ihnen gehören.
Kursmaterial verschwindet am Ende des Semesters und Links faulen; eine Markdown-Datei auf Ihrer Festplatte tut das nicht. Ein Clip nimmt den Text, seine Quelladresse und sein Datum mit und öffnet sich in jedem Editor, mit oder ohne Netz. Alles, was hier beschrieben ist, ist kostenlos und verlangt kein Konto.
- Markieren Sie eine Stelle, und nur die Auswahl wird erfasst – praktisch für eine Definition oder eine Aufgabe
- Jede Notiz trägt ihre Quelladresse, das spätere Zitieren kostet keine Suche
- Die Dateien öffnen sich offline, in Obsidian, Logseq, Joplin oder einem schlichten Texteditor
AutorenJeder Clip behält Quelladresse, Autor und Erscheinungsdatum – die Herkunft geht nicht verloren.
Recherche, die aus Bildschirmfotos und Lesezeichen besteht, wird genau in dem Moment unbrauchbar, in dem sie belegt werden soll. Eine Markdown-Datei mit Frontmatter trägt Titel, Autor, Erscheinungsdatum und Quelladresse in sich selbst. Sie bleibt Jahre später lesbar und durchsuchbar, ohne von einem Dienst abzuhängen.
- Titel, Autor, Erscheinungsdatum und Quelladresse im Frontmatter jeder Datei
- Der Autor wird in strukturierten Daten und Autorenzeilen gesucht, und die falschen Treffer fallen heraus
- Der Artikeltext ohne Navigation und Werbeblöcke, fertig zum Zitieren
JournalismusHalten Sie die Seite so fest, wie Sie sie gelesen haben – mit Erscheinungsdatum und Adresse.
Seiten werden umgeschrieben, korrigiert und zurückgezogen, oft ohne jeden Hinweis darauf. Ein Clip mit Quelladresse, Erscheinungsdatum und vollständigem Text ist ein Beleg, auf den Sie später zeigen können. Er liegt als Markdown auf Ihrer Festplatte und nicht bei einem Dienst, den es morgen vielleicht nicht mehr gibt.
- Das Erscheinungsdatum kommt aus den Metadaten der Seite, nicht aus dem Fließtext
- Die Quelladresse steht im Frontmatter jeder Notiz, zusammen mit dem Titel, wie er damals lautete
- Der vollständige Artikeltext, ohne die Navigations- und Werbeblöcke, die sich zwischen zwei Besuchen ändern
Juristische ArbeitDer Text wie veröffentlicht, mit Adresse und Datum, in einer Datei, über die Sie verfügen.
Vorschriften, Geschäftsbedingungen und Hinweise ändern sich ohne Ankündigung und ohne sichtbare Historie. Eine Markdown-Kopie mit der Adresse, von der sie stammt, und dem Datum, das sie trug, belegt, was dort stand, als Sie es gelesen haben. Auf dem Weg dorthin wird nichts zusammengefasst und nichts umformuliert.
- Wortlaut bleibt Wortlaut – die Erweiterung fasst nichts zusammen, schreibt nichts um, stellt nichts um
- Quelladresse und Erscheinungsdatum stehen im Frontmatter, über dem Text
- Tabellen mit Gebühren, Fristen und Schwellenwerten überstehen die Umwandlung unversehrt
AnalyseDer Tabellenschreiber gehört zur Erweiterung: Eine Zelle mit Code zerreißt die Zeile nicht.
Allgemeine HTML-zu-Markdown-Konverter scheitern an genau den Tabellen, auf die es ankommt – denen mit einer Liste, einem Link oder einem Codebeispiel in einer Zelle. Die Erweiterung schreibt die Tabelle selbst und ebnet den Zellinhalt ein, statt die Zeile fallen zu lassen. Auf einem Korpus mit fünfzehn Tabellen kamen zwölf heil an, gegen je sieben bei den verglichenen Engines.
- Ein eigener GFM-Tabellenschreiber statt eines allgemeinen Plugins
- Zwölf von fünfzehn Tabellen auf dem technischen Korpus erhalten, gegen je sieben bei den verglichenen Engines
- Eine Zelle mit Liste, Link oder Code wird sauber eingeebnet, statt die Zeile zu zerreißen
UnterrichtMaterial erfassen, Quelle behalten, drucken oder ablegen – ohne das Beiwerk der Website.
Eine Seite, die direkt aus dem Browser gedruckt wird, bringt Menüs, Cookie-Leiste und Werbung mit aufs Blatt. Ein Clip bringt den Text, und die Quelladresse bleibt darin stehen, damit der Nachweis später keine Suche kostet. Gedruckt wird aus dem Clip-Fenster, ohne dass eine Datei gespeichert werden muss.
- Eine Druckschaltfläche im Clip-Fenster druckt den Clip und nicht die Seite
- Der Lesemodus zeigt das Ergebnis ohne Markdown-Zeichen, so wie es aufs Blatt kommt
- Die Quelladresse bleibt in der Notiz, der Nachweis kostet später keine Mühe
ÜbersetzungNavigation, Banner und wiederholte Menüs erreichen die Segmentliste gar nicht erst.
Ausgangstext, der aus einer Webseite kopiert wird, bringt die Navigation mit, und jeder Menüpunkt wird zu einem Segment, das übersprungen werden will. Ihn vor dem Import zu entfernen geht schneller, als ihn hinterher aus der Segmentliste zu putzen. Fett, kursiv, Links und Listen bleiben dabei als Markdown erhalten.
- Menüs, Seitenzähler und „Auch interessant“-Leisten fallen vor dem Export weg
- Doppelte Navigationszeilen rund viermal seltener als im Schnitt der verglichenen Engines
- Fett, kursiv, Links, Code und Listen werden zu Markdown, das die meisten CAT-Tools als Inline-Tags behandeln
ProduktmanagementChangelogs, Dokumentation und Release Notes als datierte, durchsuchbare Notizen im eigenen Ordner.
Wettbewerbsrecherche in Lesezeichen zerfällt zu einer Liste von Links, die sich nicht durchsuchen lässt. Als Markdown erfasst wird daraus ein Bestand, den Sie durchsuchen, vergleichen und in einer Entscheidungsvorlage belegen können. Das Erscheinungsdatum kommt dabei von der Seite und nicht vom Tag der Erfassung.
- Das Erscheinungsdatum kommt von der Seite, ein Changelog-Eintrag behält seine echte Zeit
- Regeln pro Website legen jeden Wettbewerber in einen eigenen Ordner
- Tabellen mit Tarifen und Grenzwerten überstehen die Umwandlung unversehrt
Technische RedaktionStruktur, Code-Zäune und Tabellen kommen mit; das Beiwerk der Website bleibt zurück.
Dokumentation zu migrieren heißt meist: HTML umwandeln und danach länger damit verbringen, das wieder zu entfernen, was der Konverter behalten hat. Genau dieses Entfernen ist der Teil, für den Clean Clipper gebaut wurde – und der Teil, der gemessen wurde: null übrige HTML-Tags über 512 erfasste Seiten.
- Überschriften, Listen, Tabellen, Code-Zäune und Fußnoten werden zu gewöhnlichem Markdown
- Sprach-Tags an den Code-Zäunen bleiben erhalten – 73 von 156 Zäunen auf dem technischen Korpus
- Null übrige HTML-Tags über 512 gemessene Seiten
Persönliches ArchivSchlichte Markdown-Dateien auf Ihrer Festplatte. Kein Konto, kein Dienst, nichts Abschaltbares.
Lesezeichen zeigen auf Seiten, die sich ändern oder verschwinden. Ein Clip ist der Text selbst, in einem Format ohne Anbieter und ohne Verfallsdatum, gespeichert dort, wo Sie es entscheiden. Erscheinungsdatum, Quelladresse und Extraktionsweg stehen in der Datei, nicht in einer Datenbank daneben.
- Haltbares offenes Format – schlichter Text mit YAML-Frontmatter, ohne Datenbank daneben
- Kein Konto und kein Server: Die Erweiterung stellt überhaupt keine Netzanfragen
- Erscheinungsdatum und Quelladresse werden zusammen mit dem Text festgehalten
Lesen ohne LärmEin Lesemodus, der den Text ohne Menüs, ohne Banner und ohne Markdown-Zeichen zeigt.
Das Beiwerk einer Seite ist nicht nur optischer Ballast – es ist Text, den ein Screenreader vorliest und den ein Mensch überspringen muss. Das Clip-Fenster zeigt den Artikel für sich allein, im hellen oder dunklen Thema Ihres Browsers, und in ihm läuft kein Skript der Seite.
- Der Lesemodus zeigt den Clip als gewöhnlichen Text, ohne Markdown-Zeichen
- Menüs, Banner und Teilen-Leisten sind vorher entfernt, es gibt nichts zu überspringen
- Im Clip-Fenster läuft kein Skript der Seite – nichts lädt nach und nichts verschiebt sich beim Lesen