Mätning · ·
Vad som mättes, på vad, och vad som kom ut
Testat på 512 sidor: 109 jämförda direkt med tre andra motorer och 403 med enbart vår kärna. Inga krascher och inga kvarlämnade HTML-taggar i någon extraherad artikel. Korpuset och skripten publiceras med nästa körning; till dess är den här sidan hela redovisningen av vad som kördes och vad som kom ut.
Körning ett: 109 sidor, fyra motorer jämförda direkt
Korpuset är de hundra mest besökta webbplatserna i världen och de hundra mest besökta i Ryssland. Domäner utan innehåll – meddelandetjänster, bank, strömning, myndighetsportaler – sorterades bort i förväg. Sidorna hämtades med en riktig webbläsare, via en innehållslänk från startsidan där en sådan fanns.
Fyra motorer kördes över samma 109 hämtade sidor: Defuddle 0.19.3 med Turndown 7.2.4 (kärnan i Obsidians officiella Web Clipper), Mozilla Readability 0.6.0 med samma Turndown (kärnan i MarkDownload), MarkSnip 5.2.0 – dess verkliga levererade kod, uppackad från bygget i Chrome Web Store – och Clean Web Clipper 0.1.0.
| Mått | Defuddle 0.19.3 | Mozilla Readability 0.6.0 | MarkSnip 5.2.0 | Clean Web Clipper 0.1.0 |
|---|---|---|---|---|
| Sidor | 109 | 107 | 107 | 109 |
| Krascher | 0 | 2 | 2 | 0 |
| Kvarlämnad HTML | 532 | 718 | 2 | 0 |
| Dubblerade menyrader | 491 | 282 | 478 | 102 |
| Andel korta rader | 0.278 | 0.262 | 0.263 | 0.221 |
| Hittade författare | 23 | 27 | 28 | 28 |
| Hittade publiceringsdatum | 28 | 13 | 13 | 24 |
| Extraherade tabeller (av 56) | 3 | 8 | 11 | 5 |
| Andel användbar text | 0.878 | 0.931 | 0.934 | 0.890 |
Där Clean Web Clipper ligger efter
- Tabeller: 5 mot 11 för MarkSnip. 41 av de 56 tabellerna i källorna sitter på en enda sida och är layout snarare än innehåll, som ingen motor borde extrahera; det verkliga glappet är en handfull sidor där vårt rotval väljer ett för smalt block.
- Andel användbar text: 0.890 mot 0.934. En del är medveten – tillägget vägrar flödessidor som andra motorer lämnar ifrån sig – och en del är samma för smala rotval.
- Publiceringsdatum: 24 mot 28 för Defuddle.
- Författare: i nivå med den bästa, 28 mot 28 för MarkSnip, efter att författarhämtningen gjordes om. Vid den första poängsättningen av det här korpuset var det 20.
Körning två: 403 sidor på tolv europeiska språk, enbart vår kärna
De femtio största webbplatserna i vart och ett av tolv länder, hämtade med webbläsaren inställd på landets språk – annars serverar hälften av dem en engelsk sida och mätningen gäller något annat.
152 av de 403 sidorna svarade ”ingen artikel”: butiksfronter, portalers startsidor och flöden, där det inte finns någon artikel att extrahera. Det svaret är medvetet, och det är därför sidorna räknas som testade snarare än klippta.
| Språk | Sidor | Krascher | Kvarlämnad HTML | Länkandel |
|---|---|---|---|---|
| Tyska | 40 | 0 | 0 | 0.058 |
| Franska | 39 | 0 | 0 | 0.050 |
| Spanska | 40 | 0 | 0 | 0.060 |
| Italienska | 40 | 0 | 0 | 0.036 |
| Polska | 30 | 0 | 0 | 0.064 |
| Portugisiska | 36 | 0 | 0 | 0.060 |
| Nederländska | 37 | 0 | 0 | 0.049 |
| Turkiska | 31 | 0 | 0 | 0.042 |
| Ukrainska | 13 | 0 | 0 | 0.054 |
| Tjeckiska | 28 | 0 | 0 | 0.039 |
| Svenska | 28 | 0 | 0 | 0.036 |
| Rumänska | 41 | 0 | 0 | 0.039 |
Tid per sida: 4 min 38 s
Räknaren på lessroutinemorelife.com räknar 4 min 38 s för varje sida du gjorde något med – kopierade, sparade, skrev ut eller skickade till en AI-chatt – en gång per dygn och sida. Att bara öppna fönstret är ingen besparing och räknas som noll. Den tiden togs för hand av ägaren på mer än 1 000 varierade sidor med innehåll: kopiera texten, klistra in den, städa den, lägga till titel och källa och sedan kontrollera att ingen HTML-uppmärkning ligger kvar. Både medelvärdet och medianen räknades ut.
Räknaren är alltså antalet sådana sidor multiplicerat med den tiden, inte en summa av tidtagningar för varje sida. Den mäter inte hur lång tid en viss sida hade tagit för just dig.
Vad siffrorna betyder
- Krascher – motorn kastade ett fel på sidan och returnerade ingenting. En körning utan krascher kan ändå vara full av menyer; det är vad de andra raderna mäter.
- Kvarlämnade HTML-taggar – hur mycket rå uppmärkning som överlevde in i Markdown-texten. Allt över noll är en defekt.
- Dubblerade menyrader – rader längre än tolv tecken som förekommer mer än en gång. Det är navigering som upprepas i varje avsnitt.
- Andel korta rader – andelen rader under tjugofem tecken. Högt värde betyder avklippta länklistor snarare än löpande text.
- Länkandel – andelen tecken som sitter inuti länketiketter. Högt värde betyder att en meny följde med.
- ”Ingen artikel” – sidan rymde ingen artikeltext, så tillägget sa det i stället för att returnera länkar. Det är varken en krasch eller ett klipp.
Ärliga gränser för den här mätningen
- Det ukrainska urvalet är 13 sidor, inte 40 – större delen av korpuset svarade inte från hämtningsplatsen. Läs den raden som en indikation, inget mer.
- De turkiska och tjeckiska topp femtio-listorna lutar mot butiker och tidtabeller, som inte bär något publiceringsdatum alls. Det är en egenskap hos korpuset, inte hos extraheringen.
- Konkurrerande motorer kördes bara på det första korpuset. Den europeiska körningen mäter Clean Web Clipper ensamt.
- Sidor där varje motor gav under 500 tecken sorterades bort: det är en captcha eller en blockering, inte extraheringskvalitet.
- Båda körningarna är ögonblicksbilder av levande sajter, tagna i slutet av augusti 2026. Samma skript körda senare ger något andra siffror i takt med att sajterna ändras.