Meting
Wat er gemeten is, waarop, en wat eruit kwam
Beweringen over schone uitvoer zijn niets waard zonder corpus en script. Beide zijn gepubliceerd.
Run één: 109 pagina’s, vier engines
Het corpus is de honderd drukstbezochte websites ter wereld en de honderd drukstbezochte in Rusland. Domeinen zonder inhoud – messengers, bankieren, streaming, overheidsportalen – vielen vooraf af. De pagina’s zijn met een echte browser opgehaald, waarbij vanaf elke homepage een inhoudelijke link werd gevolgd als die er was.
Vier engines liepen over dezelfde opgehaalde DOM: Defuddle (de kern van de officiële Obsidian-clipper), Mozilla Readability, de werkelijk uitgeleverde code van een derde Markdown-clipper uitgepakt uit de storebuild, en Clean Clipper.
| Meetpunt | Engine A | Engine B | Engine C | Clean Clipper |
|---|---|---|---|---|
| Pagina’s | 109 | 107 | 107 | 109 |
| Mislukkingen | 0 | 2 | 2 | 0 |
| Achtergebleven HTML | 532 | 718 | 2 | 0 |
| Dubbele menuregels | 491 | 282 | 478 | 102 |
| Aandeel korte regels | 0.278 | 0.262 | 0.263 | 0.220 |
Waar Clean Clipper achterblijft: het vond 20 auteurs tegen 28 bij de beste engine, en haalde 4 tabellen eruit tegen 11 – al staan 41 van de 56 brontabellen op één pagina en zijn dat opmaaktabellen en geen inhoud, die geen enkele engine zou moeten meenemen. Het aandeel “bruikbare tekst” ligt lager omdat het tijdlijnpagina’s weigert die andere engines wél teruggeven.
Run twee: 403 pagina’s in twaalf Europese talen
De top vijftig van elk van twaalf landen, opgehaald met de browser in de taal van dat land, omdat de helft anders een Engelse pagina serveert en je iets heel anders meet.
| Taal | Pagina’s | Mislukkingen | Achtergebleven HTML | Aandeel links |
|---|---|---|---|---|
| Duits | 40 | 0 | 0 | 0.058 |
| Frans | 39 | 0 | 0 | 0.050 |
| Spaans | 40 | 0 | 0 | 0.060 |
| Italiaans | 40 | 0 | 0 | 0.036 |
| Pools | 30 | 0 | 0 | 0.064 |
| Portugees | 36 | 0 | 0 | 0.060 |
| Nederlands | 37 | 0 | 0 | 0.049 |
| Turks | 31 | 0 | 0 | 0.042 |
| Oekraïens | 13 | 0 | 0 | 0.054 |
| Tsjechisch | 28 | 0 | 0 | 0.039 |
| Zweeds | 28 | 0 | 0 | 0.036 |
| Roemeens | 41 | 0 | 0 | 0.039 |
Wat de cijfers betekenen
- Achtergebleven HTML-tags – hoeveel ruwe markup het tot in de Markdown heeft gehaald. Alles boven nul is een defect.
- Dubbele menuregels – regels langer dan twaalf tekens die meer dan één keer voorkomen. Dat is navigatie die in elke sectie terugkomt.
- Aandeel korte regels – het deel van de regels onder vijfentwintig tekens. Hoog betekent geknipte linklijsten in plaats van lopende tekst.
- Aandeel links – het deel van de tekens dat in linkteksten zit. Hoog betekent dat er een menu is meegekomen.
Eerlijke grenzen van deze meting
- Het Oekraïense sample is 13 pagina’s en geen 40 – het grootste deel van het corpus reageerde niet vanaf het meetpunt. Lees die regel dus alleen als indicatie.
- De Turkse en Tsjechische top vijftig hellen naar webwinkels en dienstregelingen, en die dragen helemaal geen publicatiedatum. Dat is een eigenschap van het corpus en niet van de extractie.
- De concurrerende engines liepen alleen over het eerste corpus. De Europese run meet Clean Clipper alleen.
- Pagina’s waar elke engine onder de 500 tekens bleef zijn eruit gelaten: dat is een captcha of een blokkade, geen extractiekwaliteit.