Mesure
Ce qui a été mesuré, sur quoi, et ce qui en est sorti
Une promesse de sortie propre ne vaut rien sans un corpus et un script. Les deux sont publiés.
Premier passage : 109 pages, quatre moteurs
Le corpus est constitué des cent sites les plus visités au monde et des cent plus visités en Russie. Les domaines sans contenu rédactionnel – messageries, banque, streaming, portails administratifs – ont été écartés à l’avance. Les pages ont été capturées avec un vrai navigateur, en suivant depuis chaque page d’accueil un lien vers un contenu lorsqu’il en existait un.
Quatre moteurs ont tourné sur le même DOM capturé : Defuddle (le cœur du clipper officiel d’Obsidian), Mozilla Readability, le code réellement livré d’un troisième clipper Markdown extrait de son paquet de la boutique, et Clean Clipper.
| Mesure | Moteur A | Moteur B | Moteur C | Clean Clipper |
|---|---|---|---|---|
| Pages | 109 | 107 | 107 | 109 |
| Échecs | 0 | 2 | 2 | 0 |
| HTML restant | 532 | 718 | 2 | 0 |
| Lignes de menu dupliquées | 491 | 282 | 478 | 102 |
| Part de lignes courtes | 0.278 | 0.262 | 0.263 | 0.220 |
Là où Clean Clipper est derrière : il a trouvé 20 auteurs contre 28 pour le meilleur moteur, et extrait 4 tableaux contre 11 – sachant que 41 des 56 tableaux sources se trouvent sur une seule page et servent à la mise en page, pas au contenu, ce qu’aucun moteur ne devrait extraire. Sa part de « texte utile » est plus basse parce qu’il refuse les pages de fil que les autres moteurs rendent volontiers.
Second passage : 403 pages dans douze langues européennes
Les cinquante premiers sites de chacun des douze pays, capturés avec le navigateur réglé sur la langue du pays, faute de quoi la moitié d’entre eux sert une page en anglais et la mesure porte sur autre chose.
| Langue | Pages | Échecs | HTML restant | Part de liens |
|---|---|---|---|---|
| Allemand | 40 | 0 | 0 | 0.058 |
| Français | 39 | 0 | 0 | 0.050 |
| Espagnol | 40 | 0 | 0 | 0.060 |
| Italien | 40 | 0 | 0 | 0.036 |
| Polonais | 30 | 0 | 0 | 0.064 |
| Portugais | 36 | 0 | 0 | 0.060 |
| Néerlandais | 37 | 0 | 0 | 0.049 |
| Turc | 31 | 0 | 0 | 0.042 |
| Ukrainien | 13 | 0 | 0 | 0.054 |
| Tchèque | 28 | 0 | 0 | 0.039 |
| Suédois | 28 | 0 | 0 | 0.036 |
| Roumain | 41 | 0 | 0 | 0.039 |
Ce que veulent dire ces chiffres
- Balises HTML restantes – la quantité de balisage brut qui a survécu dans le Markdown. Tout ce qui dépasse zéro est un défaut.
- Lignes de menu dupliquées – les lignes de plus de douze caractères qui apparaissent plus d’une fois. C’est la navigation répétée dans chaque section.
- Part de lignes courtes – la proportion de lignes de moins de vingt-cinq caractères. Une valeur élevée signale des listes de liens capturées plutôt que de la prose.
- Part de liens – la proportion de caractères situés dans des libellés de liens. Une valeur élevée signale qu’un menu a suivi.
Les limites honnêtes de cette mesure
- L’échantillon ukrainien fait 13 pages et non 40 – l’essentiel du corpus n’a pas répondu depuis le point de capture. Cette ligne n’est qu’indicative.
- Les listes turque et tchèque des cinquante premiers sites penchent vers les boutiques et les horaires, qui ne portent aucune date de publication. C’est une propriété du corpus, pas de l’extraction.
- Les moteurs concurrents n’ont tourné que sur le premier corpus. Le passage européen ne mesure que Clean Clipper.
- Les pages où tous les moteurs ont rendu moins de 500 caractères ont été écartées : c’est un captcha ou un blocage, pas une qualité d’extraction.