Mesure · ·
Ce qui a été mesuré, sur quoi, et ce qui en est sorti
Testé sur 512 pages : 109 face à face avec trois autres moteurs, et 403 avec notre seul cœur. Aucun plantage, et aucune balise HTML restante dans aucun article extrait. Le corpus et les scripts seront publiés avec le prochain passage ; d’ici là, cette page est le compte rendu complet de ce qui a tourné et de ce qui en est sorti.
Premier passage : 109 pages, quatre moteurs face à face
Le corpus est constitué des cent sites les plus visités au monde et des cent plus visités en Russie. Les domaines sans contenu rédactionnel – messageries, banque, streaming, portails administratifs – ont été écartés à l’avance. Les pages ont été capturées avec un vrai navigateur, en suivant depuis chaque page d’accueil un lien vers un contenu lorsqu’il en existait un.
Quatre moteurs ont tourné sur les mêmes 109 pages capturées : Defuddle 0.19.3 avec Turndown 7.2.4 (le cœur de l’Obsidian Web Clipper officiel), Mozilla Readability 0.6.0 avec le même Turndown (le cœur de MarkDownload), MarkSnip 5.2.0 – son vrai code livré, extrait de son paquet du Chrome Web Store – et Clean Web Clipper 0.1.0.
| Mesure | Defuddle 0.19.3 | Mozilla Readability 0.6.0 | MarkSnip 5.2.0 | Clean Web Clipper 0.1.0 |
|---|---|---|---|---|
| Pages | 109 | 107 | 107 | 109 |
| Plantages | 0 | 2 | 2 | 0 |
| HTML restant | 532 | 718 | 2 | 0 |
| Lignes de menu dupliquées | 491 | 282 | 478 | 102 |
| Part de lignes courtes | 0.278 | 0.262 | 0.263 | 0.221 |
| Auteurs trouvés | 23 | 27 | 28 | 28 |
| Dates de publication trouvées | 28 | 13 | 13 | 24 |
| Tableaux extraits (sur 56) | 3 | 8 | 11 | 5 |
| Part de texte utile | 0.878 | 0.931 | 0.934 | 0.890 |
Là où Clean Web Clipper est derrière
- Tableaux : 5 contre 11 pour MarkSnip. 41 des 56 tableaux sources se trouvent sur une seule page et servent à la mise en page, pas au contenu, ce qu’aucun moteur ne devrait extraire. Le vrai écart tient à une poignée de pages où notre choix de la racine retient un bloc trop étroit.
- Part de texte utile : 0,890 contre 0,934. Une partie est délibérée – il refuse des pages de fil que d’autres moteurs rendent – et une partie vient de cette même racine trop étroite.
- Dates de publication : 24 contre 28 pour Defuddle.
- Auteurs : au niveau du meilleur, 28 contre 28 pour MarkSnip, après la refonte de l’extraction de l’auteur. À la première notation de ce corpus, il en trouvait 20.
Second passage : 403 pages dans douze langues européennes, notre seul cœur
Les cinquante premiers sites de chacun des douze pays, capturés avec le navigateur réglé sur la langue du pays, faute de quoi la moitié d’entre eux sert une page en anglais et la mesure porte sur autre chose.
152 des 403 pages ont reçu la réponse « aucun article » : vitrines de boutiques, pages d’accueil de portails et fils, où il n’y a pas d’article à extraire. Cette réponse est délibérée, et c’est pourquoi ces pages comptent comme testées plutôt que capturées.
| Langue | Pages | Plantages | HTML restant | Part de liens |
|---|---|---|---|---|
| Allemand | 40 | 0 | 0 | 0.058 |
| Français | 39 | 0 | 0 | 0.050 |
| Espagnol | 40 | 0 | 0 | 0.060 |
| Italien | 40 | 0 | 0 | 0.036 |
| Polonais | 30 | 0 | 0 | 0.064 |
| Portugais | 36 | 0 | 0 | 0.060 |
| Néerlandais | 37 | 0 | 0 | 0.049 |
| Turc | 31 | 0 | 0 | 0.042 |
| Ukrainien | 13 | 0 | 0 | 0.054 |
| Tchèque | 28 | 0 | 0 | 0.039 |
| Suédois | 28 | 0 | 0 | 0.036 |
| Roumain | 41 | 0 | 0 | 0.039 |
Temps par capture : 4 min 38 s
Le compteur de lessroutinemorelife.com compte chaque capture pour 4 min 38 s. Ce temps a été mesuré à la main par le propriétaire sur plus de mille pages de contenu variées : copier le texte, le coller, le nettoyer, ajouter le titre et la source, puis vérifier qu’aucun balisage HTML ne traîne. La moyenne et la médiane ont été calculées toutes les deux.
Le compteur est donc le nombre de captures multiplié par ce temps, et non une somme de chronométrages de chaque capture. Il ne mesure pas combien de temps une capture donnée vous aurait pris.
Ce que veulent dire ces chiffres
- Plantages – le moteur a levé une erreur sur la page et n’a rien rendu. Un passage sans plantage peut quand même être plein de menus – c’est ce que mesurent les autres lignes.
- Balises HTML restantes – la quantité de balisage brut qui a survécu dans le Markdown. Tout ce qui dépasse zéro est un défaut.
- Lignes de menu dupliquées – les lignes de plus de douze caractères qui apparaissent plus d’une fois. C’est la navigation répétée dans chaque section.
- Part de lignes courtes – la proportion de lignes de moins de vingt-cinq caractères. Une valeur élevée signale des listes de liens capturées plutôt que de la prose.
- Part de liens – la proportion de caractères situés dans des libellés de liens. Une valeur élevée signale qu’un menu a suivi.
- « Aucun article » – la page ne contenait pas de corps d’article, donc l’extension l’a dit au lieu de rendre des liens. Ce n’est ni un plantage ni une capture.
Les limites honnêtes de cette mesure
- L’échantillon ukrainien fait 13 pages et non 40 – l’essentiel du corpus n’a pas répondu depuis le point de capture. Cette ligne n’est qu’indicative.
- Les listes turque et tchèque des cinquante premiers sites penchent vers les boutiques et les horaires, qui ne portent aucune date de publication. C’est une propriété du corpus, pas de l’extraction.
- Les moteurs concurrents n’ont tourné que sur le premier corpus. Le passage européen ne mesure que Clean Web Clipper.
- Les pages où tous les moteurs ont rendu moins de 500 caractères ont été écartées : c’est un captcha ou un blocage, pas une qualité d’extraction.
- Les deux passages sont des instantanés de sites vivants pris fin août 2026. Les mêmes scripts relancés plus tard donneront des chiffres un peu différents, à mesure que ces sites changent.