Clean Clipper Ajouter à Chrome – gratuit

Mesure

Ce qui a été mesuré, sur quoi, et ce qui en est sorti

Une promesse de sortie propre ne vaut rien sans un corpus et un script. Les deux sont publiés.

Premier passage : 109 pages, quatre moteurs

Le corpus est constitué des cent sites les plus visités au monde et des cent plus visités en Russie. Les domaines sans contenu rédactionnel – messageries, banque, streaming, portails administratifs – ont été écartés à l’avance. Les pages ont été capturées avec un vrai navigateur, en suivant depuis chaque page d’accueil un lien vers un contenu lorsqu’il en existait un.

Quatre moteurs ont tourné sur le même DOM capturé : Defuddle (le cœur du clipper officiel d’Obsidian), Mozilla Readability, le code réellement livré d’un troisième clipper Markdown extrait de son paquet de la boutique, et Clean Clipper.

MesureMoteur AMoteur BMoteur CClean Clipper
Pages109107107109
Échecs0220
HTML restant53271820
Lignes de menu dupliquées491282478102
Part de lignes courtes0.2780.2620.2630.220

Là où Clean Clipper est derrière : il a trouvé 20 auteurs contre 28 pour le meilleur moteur, et extrait 4 tableaux contre 11 – sachant que 41 des 56 tableaux sources se trouvent sur une seule page et servent à la mise en page, pas au contenu, ce qu’aucun moteur ne devrait extraire. Sa part de « texte utile » est plus basse parce qu’il refuse les pages de fil que les autres moteurs rendent volontiers.

Second passage : 403 pages dans douze langues européennes

Les cinquante premiers sites de chacun des douze pays, capturés avec le navigateur réglé sur la langue du pays, faute de quoi la moitié d’entre eux sert une page en anglais et la mesure porte sur autre chose.

LanguePagesÉchecsHTML restantPart de liens
Allemand40000.058
Français39000.050
Espagnol40000.060
Italien40000.036
Polonais30000.064
Portugais36000.060
Néerlandais37000.049
Turc31000.042
Ukrainien13000.054
Tchèque28000.039
Suédois28000.036
Roumain41000.039

Ce que veulent dire ces chiffres

Les limites honnêtes de cette mesure

Questions

Puis-je reproduire ces chiffres ?
Oui. Les listes du corpus, le script de capture et le script de notation sont dans le dépôt. La capture dépend de sites vivants, donc les chiffres exacts bougeront à mesure que ces sites changent.
Pourquoi les moteurs concurrents ne sont-ils pas nommés ici ?
Nommer des concurrents dans une fiche de boutique est contraire à la politique du Chrome Web Store, et la même retenue est appliquée sur ce site. Le dépôt les nomme, parce que là l’affirmation peut être vérifiée.
Est-ce que plus de texte extrait vaut mieux ?
Pas en soi. Un moteur qui rend une page de fil pleine de liens obtient un bon score en volume et un mauvais en utilité. C’est pourquoi les tableaux ci-dessus mesurent le bruit et non la taille.