Clean Clipper Aggiungi a Chrome – gratis

Misure

Che cosa è stato misurato, su cosa, e cosa ne è uscito

Le promesse di risultato pulito non valgono niente senza un corpus e uno script. Sono pubblicati tutti e due.

Prova uno: 109 pagine, quattro motori

Il corpus sono i cento siti più visitati al mondo e i cento più visitati in Russia. I domini senza contenuto – messaggistica, banche, streaming, portali della pubblica amministrazione – sono stati esclusi in partenza. Le pagine sono state catturate con un browser vero, seguendo dalla home un link a un contenuto dove ne esisteva uno.

Quattro motori hanno lavorato sullo stesso DOM catturato: Defuddle (il cuore del clipper ufficiale di Obsidian), Mozilla Readability, il codice realmente distribuito di un terzo clipper Markdown estratto dal suo pacchetto nello store, e Clean Clipper.

MetricaMotore AMotore BMotore CClean Clipper
Pagine109107107109
Errori0220
HTML rimasto53271820
Righe di menu duplicate491282478102
Quota di righe corte0.2780.2620.2630.220

Dove Clean Clipper è indietro: ha trovato 20 autori contro i 28 del motore migliore e ha estratto 4 tabelle contro 11 – anche se 41 delle 56 tabelle di partenza stanno su una sola pagina e servono all’impaginazione, non al contenuto: nessun motore dovrebbe estrarle. La sua quota di «testo utile» è più bassa perché rifiuta le pagine-feed che gli altri restituiscono volentieri.

Prova due: 403 pagine in dodici lingue europee

I primi cinquanta siti di ciascuno dei dodici paesi, catturati con il browser impostato sulla lingua di quel paese, perché altrimenti metà di loro serve una pagina in inglese e si misura un’altra cosa.

LinguaPagineErroriHTML rimastoQuota di link
Tedesco40000.058
Francese39000.050
Spagnolo40000.060
Italiano40000.036
Polacco30000.064
Portoghese36000.060
Olandese37000.049
Turco31000.042
Ucraino13000.054
Ceco28000.039
Svedese28000.036
Rumeno41000.039

Che cosa dicono i numeri

Limiti onesti di questa misura

Domande

Posso rifare la misura?
Sì. Gli elenchi del corpus, lo script di cattura e quello di punteggio stanno nel repository. La cattura dipende da siti vivi, quindi i numeri esatti cambieranno man mano che quei siti cambiano.
Perché i motori concorrenti non sono nominati qui?
Nominare i concorrenti nelle schede dello store è contro le regole del Chrome Web Store, e la stessa misura vale su questo sito. Nel repository sono nominati, perché lì l’affermazione si può verificare.
Più testo estratto è meglio?
Non da solo. Un motore che restituisce una pagina-feed piena di link fa un bel numero sul volume e un pessimo risultato sull’utilità. Per questo le tabelle qui sopra misurano il rumore, non la dimensione.