Misure
Che cosa è stato misurato, su cosa, e cosa ne è uscito
Le promesse di risultato pulito non valgono niente senza un corpus e uno script. Sono pubblicati tutti e due.
Prova uno: 109 pagine, quattro motori
Il corpus sono i cento siti più visitati al mondo e i cento più visitati in Russia. I domini senza contenuto – messaggistica, banche, streaming, portali della pubblica amministrazione – sono stati esclusi in partenza. Le pagine sono state catturate con un browser vero, seguendo dalla home un link a un contenuto dove ne esisteva uno.
Quattro motori hanno lavorato sullo stesso DOM catturato: Defuddle (il cuore del clipper ufficiale di Obsidian), Mozilla Readability, il codice realmente distribuito di un terzo clipper Markdown estratto dal suo pacchetto nello store, e Clean Clipper.
| Metrica | Motore A | Motore B | Motore C | Clean Clipper |
|---|---|---|---|---|
| Pagine | 109 | 107 | 107 | 109 |
| Errori | 0 | 2 | 2 | 0 |
| HTML rimasto | 532 | 718 | 2 | 0 |
| Righe di menu duplicate | 491 | 282 | 478 | 102 |
| Quota di righe corte | 0.278 | 0.262 | 0.263 | 0.220 |
Dove Clean Clipper è indietro: ha trovato 20 autori contro i 28 del motore migliore e ha estratto 4 tabelle contro 11 – anche se 41 delle 56 tabelle di partenza stanno su una sola pagina e servono all’impaginazione, non al contenuto: nessun motore dovrebbe estrarle. La sua quota di «testo utile» è più bassa perché rifiuta le pagine-feed che gli altri restituiscono volentieri.
Prova due: 403 pagine in dodici lingue europee
I primi cinquanta siti di ciascuno dei dodici paesi, catturati con il browser impostato sulla lingua di quel paese, perché altrimenti metà di loro serve una pagina in inglese e si misura un’altra cosa.
| Lingua | Pagine | Errori | HTML rimasto | Quota di link |
|---|---|---|---|---|
| Tedesco | 40 | 0 | 0 | 0.058 |
| Francese | 39 | 0 | 0 | 0.050 |
| Spagnolo | 40 | 0 | 0 | 0.060 |
| Italiano | 40 | 0 | 0 | 0.036 |
| Polacco | 30 | 0 | 0 | 0.064 |
| Portoghese | 36 | 0 | 0 | 0.060 |
| Olandese | 37 | 0 | 0 | 0.049 |
| Turco | 31 | 0 | 0 | 0.042 |
| Ucraino | 13 | 0 | 0 | 0.054 |
| Ceco | 28 | 0 | 0 | 0.039 |
| Svedese | 28 | 0 | 0 | 0.036 |
| Rumeno | 41 | 0 | 0 | 0.039 |
Che cosa dicono i numeri
- Tag HTML rimasti – quanto markup grezzo è sopravvissuto dentro il Markdown. Qualsiasi valore sopra lo zero è un difetto.
- Righe di menu duplicate – righe più lunghe di dodici caratteri che compaiono più di una volta. È la navigazione ripetuta in ogni sezione.
- Quota di righe corte – la percentuale di righe sotto i venticinque caratteri. Alta vuol dire elenchi di link salvati al posto della prosa.
- Quota di link – la percentuale di caratteri che stanno dentro etichette di link. Alta vuol dire che è arrivato anche un menu.
Limiti onesti di questa misura
- Il campione ucraino è di 13 pagine, non 40: la maggior parte del corpus non ha risposto dal punto di cattura. Quella riga va letta solo come indicazione.
- Le classifiche turca e ceca pendono verso negozi e orari, che non portano nessuna data di pubblicazione. È una proprietà del corpus, non dell’estrazione.
- I motori concorrenti sono stati eseguiti solo sul primo corpus. La prova europea misura Clean Clipper da solo.
- Le pagine su cui tutti i motori hanno restituito meno di 500 caratteri sono state escluse: quello è un captcha o un blocco, non qualità di estrazione.