Misure · ·
Che cosa è stato misurato, su cosa, e cosa ne è uscito
Provato su 512 pagine: 109 a confronto diretto con altri tre motori, e 403 con il solo nostro core. Nessun crash, e nessun tag HTML rimasto in nessun articolo estratto. Il corpus e gli script saranno pubblicati con la prossima prova; fino ad allora questa pagina è il resoconto completo di che cosa è stato eseguito e che cosa ne è uscito.
Prova uno: 109 pagine, quattro motori a confronto
Il corpus sono i cento siti più visitati al mondo e i cento più visitati in Russia. I domini senza contenuto – messaggistica, banche, streaming, portali della pubblica amministrazione – sono stati esclusi in partenza. Le pagine sono state catturate con un browser vero, seguendo dalla home un link a un contenuto dove ne esisteva uno.
Quattro motori hanno lavorato sulle stesse 109 pagine catturate: Defuddle 0.19.3 con Turndown 7.2.4 (il cuore del clipper ufficiale di Obsidian), Mozilla Readability 0.6.0 con lo stesso Turndown (il cuore di MarkDownload), MarkSnip 5.2.0 – il suo codice realmente distribuito, estratto dal pacchetto del Chrome Web Store – e Clean Web Clipper 0.1.0.
| Metrica | Defuddle 0.19.3 | Mozilla Readability 0.6.0 | MarkSnip 5.2.0 | Clean Web Clipper 0.1.0 |
|---|---|---|---|---|
| Pagine | 109 | 107 | 107 | 109 |
| Crash | 0 | 2 | 2 | 0 |
| HTML rimasto | 532 | 718 | 2 | 0 |
| Righe di menu duplicate | 491 | 282 | 478 | 102 |
| Quota di righe corte | 0.278 | 0.262 | 0.263 | 0.221 |
| Autori trovati | 23 | 27 | 28 | 28 |
| Date di pubblicazione trovate | 28 | 13 | 13 | 24 |
| Tabelle estratte (su 56) | 3 | 8 | 11 | 5 |
| Quota di testo utile | 0.878 | 0.931 | 0.934 | 0.890 |
Dove Clean Web Clipper è indietro
- Tabelle: 5 contro 11 di MarkSnip. 41 delle 56 tabelle di partenza stanno su una sola pagina e servono all’impaginazione, non al contenuto: nessun motore dovrebbe estrarle. Il divario vero è una manciata di pagine in cui la nostra scelta della radice prende un blocco troppo stretto.
- Quota di testo utile: 0.890 contro 0.934. In parte è voluto – rifiuta le pagine-feed che gli altri motori restituiscono – e in parte è la stessa radice troppo stretta.
- Date di pubblicazione: 24 contro 28 di Defuddle.
- Autori: alla pari con il migliore, 28 contro 28 di MarkSnip, dopo che l’estrazione dell’autore è stata rifatta. Alla prima valutazione di questo corpus erano 20.
Prova due: 403 pagine in dodici lingue europee, solo il nostro core
I primi cinquanta siti di ciascuno dei dodici paesi, catturati con il browser impostato sulla lingua di quel paese, perché altrimenti metà di loro serve una pagina in inglese e si misura un’altra cosa.
152 delle 403 pagine hanno risposto «nessun articolo»: vetrine di negozi, home page di portali e feed, dove non c’è nessun articolo da estrarre. Quella risposta è voluta, ed è il motivo per cui queste pagine contano come provate e non come salvate.
| Lingua | Pagine | Crash | HTML rimasto | Quota di link |
|---|---|---|---|---|
| Tedesco | 40 | 0 | 0 | 0.058 |
| Francese | 39 | 0 | 0 | 0.050 |
| Spagnolo | 40 | 0 | 0 | 0.060 |
| Italiano | 40 | 0 | 0 | 0.036 |
| Polacco | 30 | 0 | 0 | 0.064 |
| Portoghese | 36 | 0 | 0 | 0.060 |
| Olandese | 37 | 0 | 0 | 0.049 |
| Turco | 31 | 0 | 0 | 0.042 |
| Ucraino | 13 | 0 | 0 | 0.054 |
| Ceco | 28 | 0 | 0 | 0.039 |
| Svedese | 28 | 0 | 0 | 0.036 |
| Rumeno | 41 | 0 | 0 | 0.039 |
Tempo per salvataggio: 4 min 38 s
Il contatore su lessroutinemorelife.com conta ogni salvataggio come 4 min 38 s. Quel tempo è stato misurato a mano dal titolare su più di 1.000 pagine di contenuto diverse: copiare il testo, incollarlo, ripulirlo, aggiungere il titolo e la fonte, poi controllare che non sia rimasto markup HTML. Sono state calcolate sia la media sia la mediana.
Il contatore è quindi il numero di salvataggi moltiplicato per quel tempo, non una somma di cronometraggi di ogni salvataggio. Non misura quanto tempo avrebbe richiesto a te un salvataggio in particolare.
Che cosa dicono i numeri
- Crash – il motore ha generato un errore sulla pagina e non ha restituito niente. Una prova senza crash può comunque essere piena di menu; è quello che misurano le altre righe.
- Tag HTML rimasti – quanto markup grezzo è sopravvissuto dentro il Markdown. Qualsiasi valore sopra lo zero è un difetto.
- Righe di menu duplicate – righe più lunghe di dodici caratteri che compaiono più di una volta. È la navigazione ripetuta in ogni sezione.
- Quota di righe corte – la percentuale di righe sotto i venticinque caratteri. Alta vuol dire elenchi di link salvati al posto della prosa.
- Quota di link – la percentuale di caratteri che stanno dentro etichette di link. Alta vuol dire che è arrivato anche un menu.
- «Nessun articolo» – la pagina non conteneva il corpo di un articolo, quindi l’estensione lo ha detto invece di restituire dei link. Non è né un crash né un salvataggio.
Limiti onesti di questa misura
- Il campione ucraino è di 13 pagine, non 40: la maggior parte del corpus non ha risposto dal punto di cattura. Quella riga va letta solo come indicazione.
- Le classifiche turca e ceca pendono verso negozi e orari, che non portano nessuna data di pubblicazione. È una proprietà del corpus, non dell’estrazione.
- I motori concorrenti sono stati eseguiti solo sul primo corpus. La prova europea misura Clean Web Clipper da solo.
- Le pagine su cui tutti i motori hanno restituito meno di 500 caratteri sono state escluse: quello è un captcha o un blocco, non qualità di estrazione.
- Tutte e due le prove sono istantanee di siti vivi prese alla fine di agosto 2026. Gli stessi script eseguiti più avanti daranno numeri un po’ diversi, man mano che quei siti cambiano.