Clean Clipper Zu Chrome hinzufügen – kostenlos

Messung

Was gemessen wurde, woran, und was herauskam

Behauptungen über saubere Ausgabe sind ohne Korpus und Skript nichts wert. Beides ist veröffentlicht.

Durchlauf eins: 109 Seiten, vier Engines

Das Korpus sind die hundert meistbesuchten Websites der Welt und die hundert meistbesuchten in Russland. Domains ohne Inhalt – Messenger, Banken, Streaming, Behördenportale – wurden vorab ausgeschlossen. Die Seiten wurden mit einem echten Browser erfasst, wobei von jeder Startseite ein Inhaltslink aufgelöst wurde, sofern es einen gab.

Vier Engines liefen über dasselbe erfasste DOM: Defuddle (der Kern des offiziellen Obsidian-Clippers), Mozilla Readability, der tatsächlich ausgelieferte Code eines dritten Markdown-Clippers, aus seinem Store-Paket entpackt, und Clean Clipper.

KennzahlEngine AEngine BEngine CClean Clipper
Seiten109107107109
Fehlschläge0220
Übrige HTML-Tags53271820
Doppelte Menüzeilen491282478102
Anteil kurzer Zeilen0.2780.2620.2630.220

Wo Clean Clipper zurückliegt: es fand 20 Autoren gegen 28 bei der besten Engine und extrahierte 4 Tabellen gegen 11 – von den 56 Tabellen der Quellen stehen allerdings 41 auf einer einzigen Seite und sind Layout, kein Inhalt, den überhaupt eine Engine extrahieren sollte. Sein Anteil „nützlichen Textes“ ist niedriger, weil es Leistenseiten verweigert, die andere Engines bereitwillig zurückgeben.

Durchlauf zwei: 403 Seiten in zwölf europäischen Sprachen

Die Top-50 jedes der zwölf Länder, erfasst mit einem Browser, der auf die Sprache des Landes eingestellt war – sonst liefert die Hälfte davon eine englische Seite und gemessen wird etwas anderes.

SpracheSeitenFehlschlägeÜbrige HTML-TagsLinkanteil
Deutsch40000.058
Französisch39000.050
Spanisch40000.060
Italienisch40000.036
Polnisch30000.064
Portugiesisch36000.060
Niederländisch37000.049
Türkisch31000.042
Ukrainisch13000.054
Tschechisch28000.039
Schwedisch28000.036
Rumänisch41000.039

Was die Zahlen bedeuten

Ehrliche Grenzen dieser Messung

Fragen

Kann ich das nachvollziehen?
Ja. Die Korpuslisten, das Aufnahmeskript und das Bewertungsskript liegen im Repository. Die Aufnahme hängt an lebenden Websites, deshalb werden die genauen Zahlen wandern, wenn sich diese Websites ändern.
Warum werden die konkurrierenden Engines hier nicht genannt?
Wettbewerber in Store-Beschreibungen zu nennen verstößt gegen die Richtlinien des Chrome Web Store, und dieselbe Zurückhaltung gilt auf dieser Website. Im Repository stehen die Namen, denn dort lässt sich die Behauptung prüfen.
Ist mehr extrahierter Text besser?
Für sich genommen nicht. Eine Engine, die eine Leistenseite voller Links zurückgibt, steht bei der Menge gut da und beim Nutzen schlecht. Deshalb messen die Tabellen oben das Rauschen und nicht die Größe.