Clean Web Clipper Aan Chrome toevoegen – gratis

Meting · ·

Wat er gemeten is, waarop, en wat eruit kwam

Getest op 512 pagina’s: 109 naast drie andere engines gelegd, en 403 met alleen onze kern. Geen crashes, en in geen enkel geëxtraheerd artikel achtergebleven HTML-tags. Het corpus en de scripts worden bij de volgende run gepubliceerd; tot dan is deze pagina het volledige verslag van wat er liep en wat eruit kwam.

Run één: 109 pagina’s, vier engines naast elkaar

Het corpus is de honderd drukstbezochte websites ter wereld en de honderd drukstbezochte in Rusland. Domeinen zonder inhoud – messengers, bankieren, streaming, overheidsportalen – vielen vooraf af. De pagina’s zijn met een echte browser opgehaald, waarbij vanaf elke homepage een inhoudelijke link werd gevolgd als die er was.

Vier engines liepen over dezelfde 109 opgehaalde pagina’s: Defuddle 0.19.3 met Turndown 7.2.4 (de kern van de officiële Obsidian Web Clipper), Mozilla Readability 0.6.0 met dezelfde Turndown (de kern van MarkDownload), MarkSnip 5.2.0 – de echte uitgeleverde code, uitgepakt uit de build in de Chrome Web Store – en Clean Web Clipper 0.1.0.

MeetpuntDefuddle 0.19.3Mozilla Readability 0.6.0MarkSnip 5.2.0Clean Web Clipper 0.1.0
Pagina’s109107107109
Crashes0220
Achtergebleven HTML53271820
Dubbele menuregels491282478102
Aandeel korte regels0.2780.2620.2630.221
Gevonden auteurs23272828
Gevonden publicatiedata28131324
Geëxtraheerde tabellen (van 56)38115
Aandeel bruikbare tekst0.8780.9310.9340.890
Aan Chrome toevoegen – gratisVolledig gratis, zonder account en zonder limiet. De extractie werkt offline; gebruiksgebeurtenissen gaan eruit als je online bent, en één schakelaar zet ze stop.For Chrome on a computer

Waar Clean Web Clipper achterblijft

Run twee: 403 pagina’s in twaalf Europese talen, alleen onze kern

De top vijftig van elk van twaalf landen, opgehaald met de browser in de taal van dat land, omdat de helft anders een Engelse pagina serveert en je iets heel anders meet.

152 van de 403 pagina’s antwoordden “geen artikel”: webwinkels, homepages van portalen en tijdlijnen, waar geen artikel te extraheren valt. Dat antwoord is bewust, en daarom tellen deze pagina’s als getest en niet als geclipt.

TaalPagina’sCrashesAchtergebleven HTMLAandeel links
Duits40000.058
Frans39000.050
Spaans40000.060
Italiaans40000.036
Pools30000.064
Portugees36000.060
Nederlands37000.049
Turks31000.042
Oekraïens13000.054
Tsjechisch28000.039
Zweeds28000.036
Roemeens41000.039

Tijd per clip: 4 min 38 s

De teller op lessroutinemorelife.com rekent elke clip als 4 min 38 s. Die tijd heeft de eigenaar met de hand gemeten op meer dan 1.000 uiteenlopende inhoudspagina’s: de tekst kopiëren, plakken, opschonen, titel en bron toevoegen en daarna controleren op achtergebleven HTML-opmaak. Zowel het gemiddelde als de mediaan is berekend.

De teller is dus het aantal clips maal die tijd, en geen optelsom van stopwatchtijden per clip. Hij meet niet hoe lang een bepaalde clip jou zou hebben gekost.

Wat de cijfers betekenen

Eerlijke grenzen van deze meting

Aan Chrome toevoegen – gratisVolledig gratis, zonder account en zonder limiet. De extractie werkt offline; gebruiksgebeurtenissen gaan eruit als je online bent, en één schakelaar zet ze stop.For Chrome on a computer

Vragen

Kan ik dit zelf nadoen?
Zelf nog niet. De corpuslijsten, het ophaalscript en het scorescript worden bij de volgende run gepubliceerd. Tot dan geeft deze pagina de versies van de engines en de data, zodat een latere run ermee te vergelijken is. Het ophalen hangt af van levende sites, dus de exacte cijfers schuiven mee als die sites veranderen.
Waarom worden andere producten hier wel genoemd en in de storevermelding niet?
De storevermelding noemt geen andere producten; deze pagina wel. Een vergelijking die verbergt wie er vergeleken is, valt niet te controleren, dus hier draagt elke engine haar naam en versie.
Is meer geëxtraheerde tekst beter?
Op zichzelf niet. Een engine die een tijdlijnpagina vol links teruggeeft scoort goed op volume en slecht op bruikbaarheid. Daarom meten de tabellen hierboven ruis en geen omvang.