Messung
Was gemessen wurde, woran, und was herauskam
Behauptungen über saubere Ausgabe sind ohne Korpus und Skript nichts wert. Beides ist veröffentlicht.
Durchlauf eins: 109 Seiten, vier Engines
Das Korpus sind die hundert meistbesuchten Websites der Welt und die hundert meistbesuchten in Russland. Domains ohne Inhalt – Messenger, Banken, Streaming, Behördenportale – wurden vorab ausgeschlossen. Die Seiten wurden mit einem echten Browser erfasst, wobei von jeder Startseite ein Inhaltslink aufgelöst wurde, sofern es einen gab.
Vier Engines liefen über dasselbe erfasste DOM: Defuddle (der Kern des offiziellen Obsidian-Clippers), Mozilla Readability, der tatsächlich ausgelieferte Code eines dritten Markdown-Clippers, aus seinem Store-Paket entpackt, und Clean Clipper.
| Kennzahl | Engine A | Engine B | Engine C | Clean Clipper |
|---|---|---|---|---|
| Seiten | 109 | 107 | 107 | 109 |
| Fehlschläge | 0 | 2 | 2 | 0 |
| Übrige HTML-Tags | 532 | 718 | 2 | 0 |
| Doppelte Menüzeilen | 491 | 282 | 478 | 102 |
| Anteil kurzer Zeilen | 0.278 | 0.262 | 0.263 | 0.220 |
Wo Clean Clipper zurückliegt: es fand 20 Autoren gegen 28 bei der besten Engine und extrahierte 4 Tabellen gegen 11 – von den 56 Tabellen der Quellen stehen allerdings 41 auf einer einzigen Seite und sind Layout, kein Inhalt, den überhaupt eine Engine extrahieren sollte. Sein Anteil „nützlichen Textes“ ist niedriger, weil es Leistenseiten verweigert, die andere Engines bereitwillig zurückgeben.
Durchlauf zwei: 403 Seiten in zwölf europäischen Sprachen
Die Top-50 jedes der zwölf Länder, erfasst mit einem Browser, der auf die Sprache des Landes eingestellt war – sonst liefert die Hälfte davon eine englische Seite und gemessen wird etwas anderes.
| Sprache | Seiten | Fehlschläge | Übrige HTML-Tags | Linkanteil |
|---|---|---|---|---|
| Deutsch | 40 | 0 | 0 | 0.058 |
| Französisch | 39 | 0 | 0 | 0.050 |
| Spanisch | 40 | 0 | 0 | 0.060 |
| Italienisch | 40 | 0 | 0 | 0.036 |
| Polnisch | 30 | 0 | 0 | 0.064 |
| Portugiesisch | 36 | 0 | 0 | 0.060 |
| Niederländisch | 37 | 0 | 0 | 0.049 |
| Türkisch | 31 | 0 | 0 | 0.042 |
| Ukrainisch | 13 | 0 | 0 | 0.054 |
| Tschechisch | 28 | 0 | 0 | 0.039 |
| Schwedisch | 28 | 0 | 0 | 0.036 |
| Rumänisch | 41 | 0 | 0 | 0.039 |
Was die Zahlen bedeuten
- Übrige HTML-Tags – wie viel rohe Auszeichnung ins Markdown durchgekommen ist. Alles über null ist ein Fehler.
- Doppelte Menüzeilen – Zeilen über zwölf Zeichen, die mehr als einmal vorkommen. Das ist die in jedem Abschnitt wiederholte Navigation.
- Anteil kurzer Zeilen – der Anteil der Zeilen unter fünfundzwanzig Zeichen. Hoch heißt: erfasste Linklisten statt Fließtext.
- Linkanteil – der Anteil der Zeichen, die in Linkbeschriftungen sitzen. Hoch heißt: ein Menü ist mitgekommen.
Ehrliche Grenzen dieser Messung
- Die ukrainische Stichprobe umfasst 13 Seiten, nicht 40 – der größte Teil des Korpus antwortete vom Ort der Aufnahme aus nicht. Diese Zeile ist nur als Hinweis zu lesen.
- Die türkischen und tschechischen Top-50 sind in Richtung Shops und Fahrpläne verschoben, und die tragen überhaupt kein Erscheinungsdatum. Das ist eine Eigenschaft des Korpus und nicht der Extraktion.
- Die konkurrierenden Engines liefen nur über das erste Korpus. Der europäische Durchlauf misst Clean Clipper allein.
- Seiten, auf denen jede Engine unter 500 Zeichen zurückgab, wurden ausgeschlossen: das ist ein Captcha oder eine Sperre und keine Frage der Extraktionsqualität.