Meting · ·
Wat er gemeten is, waarop, en wat eruit kwam
Getest op 512 pagina’s: 109 naast drie andere engines gelegd, en 403 met alleen onze kern. Geen crashes, en in geen enkel geëxtraheerd artikel achtergebleven HTML-tags. Het corpus en de scripts worden bij de volgende run gepubliceerd; tot dan is deze pagina het volledige verslag van wat er liep en wat eruit kwam.
Run één: 109 pagina’s, vier engines naast elkaar
Het corpus is de honderd drukstbezochte websites ter wereld en de honderd drukstbezochte in Rusland. Domeinen zonder inhoud – messengers, bankieren, streaming, overheidsportalen – vielen vooraf af. De pagina’s zijn met een echte browser opgehaald, waarbij vanaf elke homepage een inhoudelijke link werd gevolgd als die er was.
Vier engines liepen over dezelfde 109 opgehaalde pagina’s: Defuddle 0.19.3 met Turndown 7.2.4 (de kern van de officiële Obsidian Web Clipper), Mozilla Readability 0.6.0 met dezelfde Turndown (de kern van MarkDownload), MarkSnip 5.2.0 – de echte uitgeleverde code, uitgepakt uit de build in de Chrome Web Store – en Clean Web Clipper 0.1.0.
| Meetpunt | Defuddle 0.19.3 | Mozilla Readability 0.6.0 | MarkSnip 5.2.0 | Clean Web Clipper 0.1.0 |
|---|---|---|---|---|
| Pagina’s | 109 | 107 | 107 | 109 |
| Crashes | 0 | 2 | 2 | 0 |
| Achtergebleven HTML | 532 | 718 | 2 | 0 |
| Dubbele menuregels | 491 | 282 | 478 | 102 |
| Aandeel korte regels | 0.278 | 0.262 | 0.263 | 0.221 |
| Gevonden auteurs | 23 | 27 | 28 | 28 |
| Gevonden publicatiedata | 28 | 13 | 13 | 24 |
| Geëxtraheerde tabellen (van 56) | 3 | 8 | 11 | 5 |
| Aandeel bruikbare tekst | 0.878 | 0.931 | 0.934 | 0.890 |
Waar Clean Web Clipper achterblijft
- Tabellen: 5 tegen 11 bij MarkSnip. 41 van de 56 brontabellen staan op één pagina en zijn opmaak in plaats van inhoud, die geen enkele engine zou moeten meenemen; het echte gat is een handvol pagina’s waar onze wortelkeuze een te smal blok pakt.
- Aandeel bruikbare tekst: 0,890 tegen 0,934. Een deel daarvan is bewust – de extensie weigert tijdlijnpagina’s die andere engines wel teruggeven – en een deel is diezelfde te smalle wortel.
- Publicatiedata: 24 tegen 28 bij Defuddle.
- Auteurs: gelijk met de beste, 28 tegen 28 bij MarkSnip, nadat de auteursherkenning is herzien. Bij de eerste scoring van dit corpus waren het er 20.
Run twee: 403 pagina’s in twaalf Europese talen, alleen onze kern
De top vijftig van elk van twaalf landen, opgehaald met de browser in de taal van dat land, omdat de helft anders een Engelse pagina serveert en je iets heel anders meet.
152 van de 403 pagina’s antwoordden “geen artikel”: webwinkels, homepages van portalen en tijdlijnen, waar geen artikel te extraheren valt. Dat antwoord is bewust, en daarom tellen deze pagina’s als getest en niet als geclipt.
| Taal | Pagina’s | Crashes | Achtergebleven HTML | Aandeel links |
|---|---|---|---|---|
| Duits | 40 | 0 | 0 | 0.058 |
| Frans | 39 | 0 | 0 | 0.050 |
| Spaans | 40 | 0 | 0 | 0.060 |
| Italiaans | 40 | 0 | 0 | 0.036 |
| Pools | 30 | 0 | 0 | 0.064 |
| Portugees | 36 | 0 | 0 | 0.060 |
| Nederlands | 37 | 0 | 0 | 0.049 |
| Turks | 31 | 0 | 0 | 0.042 |
| Oekraïens | 13 | 0 | 0 | 0.054 |
| Tsjechisch | 28 | 0 | 0 | 0.039 |
| Zweeds | 28 | 0 | 0 | 0.036 |
| Roemeens | 41 | 0 | 0 | 0.039 |
Tijd per clip: 4 min 38 s
De teller op lessroutinemorelife.com rekent elke clip als 4 min 38 s. Die tijd heeft de eigenaar met de hand gemeten op meer dan 1.000 uiteenlopende inhoudspagina’s: de tekst kopiëren, plakken, opschonen, titel en bron toevoegen en daarna controleren op achtergebleven HTML-opmaak. Zowel het gemiddelde als de mediaan is berekend.
De teller is dus het aantal clips maal die tijd, en geen optelsom van stopwatchtijden per clip. Hij meet niet hoe lang een bepaalde clip jou zou hebben gekost.
Wat de cijfers betekenen
- Crashes – de engine gaf een fout op de pagina en leverde niets op. Een run zonder crashes kan nog steeds vol menu’s zitten; dat meten de andere rijen.
- Achtergebleven HTML-tags – hoeveel ruwe markup het tot in de Markdown heeft gehaald. Alles boven nul is een defect.
- Dubbele menuregels – regels langer dan twaalf tekens die meer dan één keer voorkomen. Dat is navigatie die in elke sectie terugkomt.
- Aandeel korte regels – het deel van de regels onder vijfentwintig tekens. Hoog betekent geknipte linklijsten in plaats van lopende tekst.
- Aandeel links – het deel van de tekens dat in linkteksten zit. Hoog betekent dat er een menu is meegekomen.
- “Geen artikel” – de pagina bevatte geen artikeltekst, dus de extensie zei dat in plaats van links terug te geven. Het is geen crash en ook geen clip.
Eerlijke grenzen van deze meting
- Het Oekraïense sample is 13 pagina’s en geen 40 – het grootste deel van het corpus reageerde niet vanaf het meetpunt. Lees die regel dus alleen als indicatie.
- De Turkse en Tsjechische top vijftig hellen naar webwinkels en dienstregelingen, en die dragen helemaal geen publicatiedatum. Dat is een eigenschap van het corpus en niet van de extractie.
- De concurrerende engines liepen alleen over het eerste corpus. De Europese run meet Clean Web Clipper alleen.
- Pagina’s waar elke engine onder de 500 tekens bleef zijn eruit gelaten: dat is een captcha of een blokkade, geen extractiekwaliteit.
- Beide runs zijn momentopnamen van levende sites, gemaakt eind augustus 2026. Dezelfde scripts geven later iets andere cijfers, omdat die sites veranderen.