Messung · ·
Was gemessen wurde, woran, und was herauskam
Getestet an 512 Seiten: 109 im direkten Vergleich mit drei anderen Engines und 403 nur mit unserem Kern. Keine Abstürze und in keinem extrahierten Artikel ein übriges HTML-Tag. Korpus und Skripte werden mit dem nächsten Durchlauf veröffentlicht; bis dahin ist diese Seite das vollständige Protokoll dessen, was lief und was herauskam.
Durchlauf eins: 109 Seiten, vier Engines im direkten Vergleich
Das Korpus sind die hundert meistbesuchten Websites der Welt und die hundert meistbesuchten in Russland. Domains ohne Inhalt – Messenger, Banken, Streaming, Behördenportale – wurden vorab ausgeschlossen. Die Seiten wurden mit einem echten Browser erfasst, wobei von jeder Startseite ein Inhaltslink aufgelöst wurde, sofern es einen gab.
Vier Engines liefen über dieselben 109 erfassten Seiten: Defuddle 0.19.3 mit Turndown 7.2.4 (der Kern des offiziellen Obsidian Web Clipper), Mozilla Readability 0.6.0 mit demselben Turndown (der Kern von MarkDownload), MarkSnip 5.2.0 – sein tatsächlich ausgelieferter Code, entpackt aus dem Paket im Chrome Web Store – und Clean Web Clipper 0.1.0.
| Kennzahl | Defuddle 0.19.3 | Mozilla Readability 0.6.0 | MarkSnip 5.2.0 | Clean Web Clipper 0.1.0 |
|---|---|---|---|---|
| Seiten | 109 | 107 | 107 | 109 |
| Abstürze | 0 | 2 | 2 | 0 |
| Übrige HTML-Tags | 532 | 718 | 2 | 0 |
| Doppelte Menüzeilen | 491 | 282 | 478 | 102 |
| Anteil kurzer Zeilen | 0.278 | 0.262 | 0.263 | 0.221 |
| Gefundene Autoren | 23 | 27 | 28 | 28 |
| Gefundene Erscheinungsdaten | 28 | 13 | 13 | 24 |
| Extrahierte Tabellen (von 56) | 3 | 8 | 11 | 5 |
| Anteil nützlichen Textes | 0.878 | 0.931 | 0.934 | 0.890 |
Wo Clean Web Clipper zurückliegt
- Tabellen: 5 gegen 11 bei MarkSnip. 41 der 56 Tabellen der Quellen stehen auf einer einzigen Seite und sind Layout statt Inhalt, das keine Engine extrahieren sollte; die echte Lücke sind eine Handvoll Seiten, auf denen unsere Wurzelsuche einen zu engen Block wählt.
- Anteil nützlichen Textes: 0,890 gegen 0,934. Teils ist das Absicht – es verweigert Feed-Seiten, die andere Engines zurückgeben –, teils ist es dieselbe zu enge Wurzel.
- Erscheinungsdaten: 24 gegen 28 bei Defuddle.
- Autoren: gleichauf mit der besten Engine, 28 gegen 28 bei MarkSnip, nachdem die Autorenerkennung überarbeitet wurde. Bei der ersten Auswertung dieses Korpus waren es 20.
Durchlauf zwei: 403 Seiten in zwölf europäischen Sprachen, nur unser Kern
Die Top-50 jedes der zwölf Länder, erfasst mit einem Browser, der auf die Sprache des Landes eingestellt war – sonst liefert die Hälfte davon eine englische Seite und gemessen wird etwas anderes.
152 der 403 Seiten antworteten mit „kein Artikel“: Shopseiten, Portal-Startseiten und Feeds, auf denen es keinen Artikel zu extrahieren gibt. Diese Antwort ist Absicht, und deshalb zählen diese Seiten als getestet und nicht als erfasst.
| Sprache | Seiten | Abstürze | Übrige HTML-Tags | Linkanteil |
|---|---|---|---|---|
| Deutsch | 40 | 0 | 0 | 0.058 |
| Französisch | 39 | 0 | 0 | 0.050 |
| Spanisch | 40 | 0 | 0 | 0.060 |
| Italienisch | 40 | 0 | 0 | 0.036 |
| Polnisch | 30 | 0 | 0 | 0.064 |
| Portugiesisch | 36 | 0 | 0 | 0.060 |
| Niederländisch | 37 | 0 | 0 | 0.049 |
| Türkisch | 31 | 0 | 0 | 0.042 |
| Ukrainisch | 13 | 0 | 0 | 0.054 |
| Tschechisch | 28 | 0 | 0 | 0.039 |
| Schwedisch | 28 | 0 | 0 | 0.036 |
| Rumänisch | 41 | 0 | 0 | 0.039 |
Zeit pro Seite: 4 min 38 s
Der Zähler auf lessroutinemorelife.com rechnet 4 min 38 s für jede Seite, mit der Sie etwas gemacht haben – kopiert, gespeichert, gedruckt oder an einen KI-Chat gesendet –, einmal pro Tag und Seite. Das Fenster zu öffnen ist keine Ersparnis und zählt nicht. Diese Zeit hat der Betreiber von Hand an mehr als 1.000 verschiedenen Inhaltsseiten gemessen: Text kopieren, einfügen, aufräumen, Titel und Quelle ergänzen und dann auf übrige HTML-Auszeichnung prüfen. Berechnet wurden sowohl der Mittelwert als auch der Median.
Der Zähler ist daher die Zahl solcher Seiten mal diese Zeit und keine Summe gestoppter Zeiten für jede einzelne. Er misst nicht, wie lange eine bestimmte Seite bei Ihnen gedauert hätte.
Was die Zahlen bedeuten
- Abstürze – die Engine warf auf der Seite einen Fehler und gab nichts zurück. Ein Durchlauf ohne Abstürze kann trotzdem voller Menüs sein; das messen die anderen Zeilen.
- Übrige HTML-Tags – wie viel rohe Auszeichnung ins Markdown durchgekommen ist. Alles über null ist ein Fehler.
- Doppelte Menüzeilen – Zeilen über zwölf Zeichen, die mehr als einmal vorkommen. Das ist die in jedem Abschnitt wiederholte Navigation.
- Anteil kurzer Zeilen – der Anteil der Zeilen unter fünfundzwanzig Zeichen. Hoch heißt: erfasste Linklisten statt Fließtext.
- Linkanteil – der Anteil der Zeichen, die in Linkbeschriftungen sitzen. Hoch heißt: ein Menü ist mitgekommen.
- „Kein Artikel“ – die Seite enthielt keinen Artikeltext, also sagte die Erweiterung das, statt Links zurückzugeben. Das ist weder ein Absturz noch ein Clip.
Ehrliche Grenzen dieser Messung
- Die ukrainische Stichprobe umfasst 13 Seiten, nicht 40 – der größte Teil des Korpus antwortete vom Ort der Aufnahme aus nicht. Diese Zeile ist nur als Hinweis zu lesen.
- Die türkischen und tschechischen Top-50 sind in Richtung Shops und Fahrpläne verschoben, und die tragen überhaupt kein Erscheinungsdatum. Das ist eine Eigenschaft des Korpus und nicht der Extraktion.
- Die konkurrierenden Engines liefen nur über das erste Korpus. Der europäische Durchlauf misst Clean Web Clipper allein.
- Seiten, auf denen jede Engine unter 500 Zeichen zurückgab, wurden ausgeschlossen: das ist ein Captcha oder eine Sperre und keine Frage der Extraktionsqualität.
- Beide Durchläufe sind Momentaufnahmen lebender Websites vom Ende August 2026. Dieselben Skripte liefern später etwas andere Zahlen, weil sich diese Websites ändern.