Clean Web Clipper Ajouter à Chrome – gratuit

Mesure · ·

Ce qui a été mesuré, sur quoi, et ce qui en est sorti

Testé sur 512 pages : 109 face à face avec trois autres moteurs, et 403 avec notre seul cœur. Aucun plantage, et aucune balise HTML restante dans aucun article extrait. Le corpus et les scripts seront publiés avec le prochain passage ; d’ici là, cette page est le compte rendu complet de ce qui a tourné et de ce qui en est sorti.

Premier passage : 109 pages, quatre moteurs face à face

Le corpus est constitué des cent sites les plus visités au monde et des cent plus visités en Russie. Les domaines sans contenu rédactionnel – messageries, banque, streaming, portails administratifs – ont été écartés à l’avance. Les pages ont été capturées avec un vrai navigateur, en suivant depuis chaque page d’accueil un lien vers un contenu lorsqu’il en existait un.

Quatre moteurs ont tourné sur les mêmes 109 pages capturées : Defuddle 0.19.3 avec Turndown 7.2.4 (le cœur de l’Obsidian Web Clipper officiel), Mozilla Readability 0.6.0 avec le même Turndown (le cœur de MarkDownload), MarkSnip 5.2.0 – son vrai code livré, extrait de son paquet du Chrome Web Store – et Clean Web Clipper 0.1.0.

MesureDefuddle 0.19.3Mozilla Readability 0.6.0MarkSnip 5.2.0Clean Web Clipper 0.1.0
Pages109107107109
Plantages0220
HTML restant53271820
Lignes de menu dupliquées491282478102
Part de lignes courtes0.2780.2620.2630.221
Auteurs trouvés23272828
Dates de publication trouvées28131324
Tableaux extraits (sur 56)38115
Part de texte utile0.8780.9310.9340.890
Ajouter à Chrome – gratuitEntièrement gratuit, sans compte et sans limite. L’extraction marche hors ligne ; les événements d’utilisation partent quand vous êtes en ligne, et un seul interrupteur les arrête.For Chrome on a computer

Là où Clean Web Clipper est derrière

Second passage : 403 pages dans douze langues européennes, notre seul cœur

Les cinquante premiers sites de chacun des douze pays, capturés avec le navigateur réglé sur la langue du pays, faute de quoi la moitié d’entre eux sert une page en anglais et la mesure porte sur autre chose.

152 des 403 pages ont reçu la réponse « aucun article » : vitrines de boutiques, pages d’accueil de portails et fils, où il n’y a pas d’article à extraire. Cette réponse est délibérée, et c’est pourquoi ces pages comptent comme testées plutôt que capturées.

LanguePagesPlantagesHTML restantPart de liens
Allemand40000.058
Français39000.050
Espagnol40000.060
Italien40000.036
Polonais30000.064
Portugais36000.060
Néerlandais37000.049
Turc31000.042
Ukrainien13000.054
Tchèque28000.039
Suédois28000.036
Roumain41000.039

Temps par capture : 4 min 38 s

Le compteur de lessroutinemorelife.com compte chaque capture pour 4 min 38 s. Ce temps a été mesuré à la main par le propriétaire sur plus de mille pages de contenu variées : copier le texte, le coller, le nettoyer, ajouter le titre et la source, puis vérifier qu’aucun balisage HTML ne traîne. La moyenne et la médiane ont été calculées toutes les deux.

Le compteur est donc le nombre de captures multiplié par ce temps, et non une somme de chronométrages de chaque capture. Il ne mesure pas combien de temps une capture donnée vous aurait pris.

Ce que veulent dire ces chiffres

Les limites honnêtes de cette mesure

Ajouter à Chrome – gratuitEntièrement gratuit, sans compte et sans limite. L’extraction marche hors ligne ; les événements d’utilisation partent quand vous êtes en ligne, et un seul interrupteur les arrête.For Chrome on a computer

Questions

Puis-je reproduire ces chiffres ?
Pas encore par vos propres moyens. Les listes du corpus, le script de capture et le script de notation seront publiés avec le prochain passage. D’ici là, cette page donne les versions des moteurs et les dates, pour qu’un passage ultérieur puisse y être comparé. La capture dépend de sites vivants, donc les chiffres exacts bougeront à mesure que ces sites changent.
Pourquoi d’autres produits sont-ils nommés ici, mais pas dans la fiche de la boutique ?
La fiche de la boutique ne nomme pas d’autres produits, cette page si. Une comparaison qui cache avec qui elle compare ne peut pas être vérifiée, donc ici chaque moteur porte son nom et sa version.
Est-ce que plus de texte extrait vaut mieux ?
Pas en soi. Un moteur qui rend une page de fil pleine de liens obtient un bon score en volume et un mauvais en utilité. C’est pourquoi les tableaux ci-dessus mesurent le bruit et non la taille.