Clean Web Clipper Aggiungi a Chrome – gratis

Misure · ·

Che cosa è stato misurato, su cosa, e cosa ne è uscito

Provato su 512 pagine: 109 a confronto diretto con altri tre motori, e 403 con il solo nostro core. Nessun crash, e nessun tag HTML rimasto in nessun articolo estratto. Il corpus e gli script saranno pubblicati con la prossima prova; fino ad allora questa pagina è il resoconto completo di che cosa è stato eseguito e che cosa ne è uscito.

Prova uno: 109 pagine, quattro motori a confronto

Il corpus sono i cento siti più visitati al mondo e i cento più visitati in Russia. I domini senza contenuto – messaggistica, banche, streaming, portali della pubblica amministrazione – sono stati esclusi in partenza. Le pagine sono state catturate con un browser vero, seguendo dalla home un link a un contenuto dove ne esisteva uno.

Quattro motori hanno lavorato sulle stesse 109 pagine catturate: Defuddle 0.19.3 con Turndown 7.2.4 (il cuore del clipper ufficiale di Obsidian), Mozilla Readability 0.6.0 con lo stesso Turndown (il cuore di MarkDownload), MarkSnip 5.2.0 – il suo codice realmente distribuito, estratto dal pacchetto del Chrome Web Store – e Clean Web Clipper 0.1.0.

MetricaDefuddle 0.19.3Mozilla Readability 0.6.0MarkSnip 5.2.0Clean Web Clipper 0.1.0
Pagine109107107109
Crash0220
HTML rimasto53271820
Righe di menu duplicate491282478102
Quota di righe corte0.2780.2620.2630.221
Autori trovati23272828
Date di pubblicazione trovate28131324
Tabelle estratte (su 56)38115
Quota di testo utile0.8780.9310.9340.890
Aggiungi a Chrome – gratisGratis per intero, senza account e senza limiti. L’estrazione funziona anche offline; gli eventi d’uso partono quando sei in linea, e un solo interruttore li ferma.For Chrome on a computer

Dove Clean Web Clipper è indietro

Prova due: 403 pagine in dodici lingue europee, solo il nostro core

I primi cinquanta siti di ciascuno dei dodici paesi, catturati con il browser impostato sulla lingua di quel paese, perché altrimenti metà di loro serve una pagina in inglese e si misura un’altra cosa.

152 delle 403 pagine hanno risposto «nessun articolo»: vetrine di negozi, home page di portali e feed, dove non c’è nessun articolo da estrarre. Quella risposta è voluta, ed è il motivo per cui queste pagine contano come provate e non come salvate.

LinguaPagineCrashHTML rimastoQuota di link
Tedesco40000.058
Francese39000.050
Spagnolo40000.060
Italiano40000.036
Polacco30000.064
Portoghese36000.060
Olandese37000.049
Turco31000.042
Ucraino13000.054
Ceco28000.039
Svedese28000.036
Rumeno41000.039

Tempo per salvataggio: 4 min 38 s

Il contatore su lessroutinemorelife.com conta ogni salvataggio come 4 min 38 s. Quel tempo è stato misurato a mano dal titolare su più di 1.000 pagine di contenuto diverse: copiare il testo, incollarlo, ripulirlo, aggiungere il titolo e la fonte, poi controllare che non sia rimasto markup HTML. Sono state calcolate sia la media sia la mediana.

Il contatore è quindi il numero di salvataggi moltiplicato per quel tempo, non una somma di cronometraggi di ogni salvataggio. Non misura quanto tempo avrebbe richiesto a te un salvataggio in particolare.

Che cosa dicono i numeri

Limiti onesti di questa misura

Aggiungi a Chrome – gratisGratis per intero, senza account e senza limiti. L’estrazione funziona anche offline; gli eventi d’uso partono quando sei in linea, e un solo interruttore li ferma.For Chrome on a computer

Domande

Posso rifare la misura?
Non ancora da solo. Gli elenchi del corpus, lo script di cattura e quello di punteggio saranno pubblicati con la prossima prova. Fino ad allora questa pagina riporta le versioni dei motori e le date, così una prova successiva si può confrontare con queste. La cattura dipende da siti vivi, quindi i numeri esatti cambieranno man mano che quei siti cambiano.
Perché qui gli altri prodotti sono nominati e nella scheda dello store no?
La scheda dello store non nomina altri prodotti; questa pagina sì. Un confronto che nasconde con chi è stato fatto non si può verificare, quindi qui ogni motore porta il suo nome e la sua versione.
Più testo estratto è meglio?
Non da solo. Un motore che restituisce una pagina-feed piena di link fa un bel numero sul volume e un pessimo risultato sull’utilità. Per questo le tabelle qui sopra misurano il rumore, non la dimensione.