Clean Web Clipper Zu Chrome hinzufügen – kostenlos

Messung · ·

Was gemessen wurde, woran, und was herauskam

Getestet an 512 Seiten: 109 im direkten Vergleich mit drei anderen Engines und 403 nur mit unserem Kern. Keine Abstürze und in keinem extrahierten Artikel ein übriges HTML-Tag. Korpus und Skripte werden mit dem nächsten Durchlauf veröffentlicht; bis dahin ist diese Seite das vollständige Protokoll dessen, was lief und was herauskam.

Durchlauf eins: 109 Seiten, vier Engines im direkten Vergleich

Das Korpus sind die hundert meistbesuchten Websites der Welt und die hundert meistbesuchten in Russland. Domains ohne Inhalt – Messenger, Banken, Streaming, Behördenportale – wurden vorab ausgeschlossen. Die Seiten wurden mit einem echten Browser erfasst, wobei von jeder Startseite ein Inhaltslink aufgelöst wurde, sofern es einen gab.

Vier Engines liefen über dieselben 109 erfassten Seiten: Defuddle 0.19.3 mit Turndown 7.2.4 (der Kern des offiziellen Obsidian Web Clipper), Mozilla Readability 0.6.0 mit demselben Turndown (der Kern von MarkDownload), MarkSnip 5.2.0 – sein tatsächlich ausgelieferter Code, entpackt aus dem Paket im Chrome Web Store – und Clean Web Clipper 0.1.0.

KennzahlDefuddle 0.19.3Mozilla Readability 0.6.0MarkSnip 5.2.0Clean Web Clipper 0.1.0
Seiten109107107109
Abstürze0220
Übrige HTML-Tags53271820
Doppelte Menüzeilen491282478102
Anteil kurzer Zeilen0.2780.2620.2630.221
Gefundene Autoren23272828
Gefundene Erscheinungsdaten28131324
Extrahierte Tabellen (von 56)38115
Anteil nützlichen Textes0.8780.9310.9340.890
Zu Chrome hinzufügen – kostenlosVollständig kostenlos, ohne Konto, ohne Grenzen. Die Extraktion geht offline; Nutzungsereignisse gehen hinaus, wenn Sie online sind, und ein Schalter stoppt sie.For Chrome on a computer

Wo Clean Web Clipper zurückliegt

Durchlauf zwei: 403 Seiten in zwölf europäischen Sprachen, nur unser Kern

Die Top-50 jedes der zwölf Länder, erfasst mit einem Browser, der auf die Sprache des Landes eingestellt war – sonst liefert die Hälfte davon eine englische Seite und gemessen wird etwas anderes.

152 der 403 Seiten antworteten mit „kein Artikel“: Shopseiten, Portal-Startseiten und Feeds, auf denen es keinen Artikel zu extrahieren gibt. Diese Antwort ist Absicht, und deshalb zählen diese Seiten als getestet und nicht als erfasst.

SpracheSeitenAbstürzeÜbrige HTML-TagsLinkanteil
Deutsch40000.058
Französisch39000.050
Spanisch40000.060
Italienisch40000.036
Polnisch30000.064
Portugiesisch36000.060
Niederländisch37000.049
Türkisch31000.042
Ukrainisch13000.054
Tschechisch28000.039
Schwedisch28000.036
Rumänisch41000.039

Zeit pro Seite: 4 min 38 s

Der Zähler auf lessroutinemorelife.com rechnet 4 min 38 s für jede Seite, mit der Sie etwas gemacht haben – kopiert, gespeichert, gedruckt oder an einen KI-Chat gesendet –, einmal pro Tag und Seite. Das Fenster zu öffnen ist keine Ersparnis und zählt nicht. Diese Zeit hat der Betreiber von Hand an mehr als 1.000 verschiedenen Inhaltsseiten gemessen: Text kopieren, einfügen, aufräumen, Titel und Quelle ergänzen und dann auf übrige HTML-Auszeichnung prüfen. Berechnet wurden sowohl der Mittelwert als auch der Median.

Der Zähler ist daher die Zahl solcher Seiten mal diese Zeit und keine Summe gestoppter Zeiten für jede einzelne. Er misst nicht, wie lange eine bestimmte Seite bei Ihnen gedauert hätte.

Was die Zahlen bedeuten

Ehrliche Grenzen dieser Messung

Zu Chrome hinzufügen – kostenlosVollständig kostenlos, ohne Konto, ohne Grenzen. Die Extraktion geht offline; Nutzungsereignisse gehen hinaus, wenn Sie online sind, und ein Schalter stoppt sie.For Chrome on a computer

Fragen

Kann ich das nachvollziehen?
Selbst noch nicht. Die Korpuslisten, das Aufnahmeskript und das Bewertungsskript werden mit dem nächsten Durchlauf veröffentlicht. Bis dahin nennt diese Seite Engine-Versionen und Daten, sodass sich ein späterer Durchlauf daran abgleichen lässt. Die Aufnahme hängt an lebenden Websites, deshalb werden die genauen Zahlen wandern, wenn sich diese Websites ändern.
Warum werden andere Produkte hier genannt, in der Store-Beschreibung aber nicht?
Die Store-Beschreibung nennt keine anderen Produkte, diese Seite schon. Ein Vergleich, der verschweigt, womit verglichen wurde, lässt sich nicht nachprüfen – deshalb trägt hier jede Engine ihren Namen und ihre Version.
Ist mehr extrahierter Text besser?
Für sich genommen nicht. Eine Engine, die eine Leistenseite voller Links zurückgibt, steht bei der Menge gut da und beim Nutzen schlecht. Deshalb messen die Tabellen oben das Rauschen und nicht die Größe.