Clean Clipper Aan Chrome toevoegen – gratis

Meting

Wat er gemeten is, waarop, en wat eruit kwam

Beweringen over schone uitvoer zijn niets waard zonder corpus en script. Beide zijn gepubliceerd.

Run één: 109 pagina’s, vier engines

Het corpus is de honderd drukstbezochte websites ter wereld en de honderd drukstbezochte in Rusland. Domeinen zonder inhoud – messengers, bankieren, streaming, overheidsportalen – vielen vooraf af. De pagina’s zijn met een echte browser opgehaald, waarbij vanaf elke homepage een inhoudelijke link werd gevolgd als die er was.

Vier engines liepen over dezelfde opgehaalde DOM: Defuddle (de kern van de officiële Obsidian-clipper), Mozilla Readability, de werkelijk uitgeleverde code van een derde Markdown-clipper uitgepakt uit de storebuild, en Clean Clipper.

MeetpuntEngine AEngine BEngine CClean Clipper
Pagina’s109107107109
Mislukkingen0220
Achtergebleven HTML53271820
Dubbele menuregels491282478102
Aandeel korte regels0.2780.2620.2630.220

Waar Clean Clipper achterblijft: het vond 20 auteurs tegen 28 bij de beste engine, en haalde 4 tabellen eruit tegen 11 – al staan 41 van de 56 brontabellen op één pagina en zijn dat opmaaktabellen en geen inhoud, die geen enkele engine zou moeten meenemen. Het aandeel “bruikbare tekst” ligt lager omdat het tijdlijnpagina’s weigert die andere engines wél teruggeven.

Run twee: 403 pagina’s in twaalf Europese talen

De top vijftig van elk van twaalf landen, opgehaald met de browser in de taal van dat land, omdat de helft anders een Engelse pagina serveert en je iets heel anders meet.

TaalPagina’sMislukkingenAchtergebleven HTMLAandeel links
Duits40000.058
Frans39000.050
Spaans40000.060
Italiaans40000.036
Pools30000.064
Portugees36000.060
Nederlands37000.049
Turks31000.042
Oekraïens13000.054
Tsjechisch28000.039
Zweeds28000.036
Roemeens41000.039

Wat de cijfers betekenen

Eerlijke grenzen van deze meting

Vragen

Kan ik dit zelf nadoen?
Ja. De corpuslijsten, het ophaalscript en het scorescript staan in de repository. Het ophalen hangt af van levende sites, dus de exacte cijfers schuiven mee als die sites veranderen.
Waarom worden de concurrerende engines hier niet bij naam genoemd?
Concurrenten noemen in een storevermelding is tegen het beleid van de Chrome Web Store, en dezelfde terughoudendheid geldt op deze site. In de repository staan ze wél, want daar valt de bewering te controleren.
Is meer geëxtraheerde tekst beter?
Op zichzelf niet. Een engine die een tijdlijnpagina vol links teruggeeft scoort goed op volume en slecht op bruikbaarheid. Daarom meten de tabellen hierboven ruis en geen omvang.