Clean Web Clipper Lägg till i Chrome – gratis

Mätning · ·

Vad som mättes, på vad, och vad som kom ut

Testat på 512 sidor: 109 jämförda direkt med tre andra motorer och 403 med enbart vår kärna. Inga krascher och inga kvarlämnade HTML-taggar i någon extraherad artikel. Korpuset och skripten publiceras med nästa körning; till dess är den här sidan hela redovisningen av vad som kördes och vad som kom ut.

Körning ett: 109 sidor, fyra motorer jämförda direkt

Korpuset är de hundra mest besökta webbplatserna i världen och de hundra mest besökta i Ryssland. Domäner utan innehåll – meddelandetjänster, bank, strömning, myndighetsportaler – sorterades bort i förväg. Sidorna hämtades med en riktig webbläsare, via en innehållslänk från startsidan där en sådan fanns.

Fyra motorer kördes över samma 109 hämtade sidor: Defuddle 0.19.3 med Turndown 7.2.4 (kärnan i Obsidians officiella Web Clipper), Mozilla Readability 0.6.0 med samma Turndown (kärnan i MarkDownload), MarkSnip 5.2.0 – dess verkliga levererade kod, uppackad från bygget i Chrome Web Store – och Clean Web Clipper 0.1.0.

MåttDefuddle 0.19.3Mozilla Readability 0.6.0MarkSnip 5.2.0Clean Web Clipper 0.1.0
Sidor109107107109
Krascher0220
Kvarlämnad HTML53271820
Dubblerade menyrader491282478102
Andel korta rader0.2780.2620.2630.221
Hittade författare23272828
Hittade publiceringsdatum28131324
Extraherade tabeller (av 56)38115
Andel användbar text0.8780.9310.9340.890
Lägg till i Chrome – gratisHelt gratis, inget konto, inga gränser. Extraheringen fungerar offline; användningshändelser skickas när du är uppkopplad, och en enda knapp stoppar dem.For Chrome on a computer

Där Clean Web Clipper ligger efter

Körning två: 403 sidor på tolv europeiska språk, enbart vår kärna

De femtio största webbplatserna i vart och ett av tolv länder, hämtade med webbläsaren inställd på landets språk – annars serverar hälften av dem en engelsk sida och mätningen gäller något annat.

152 av de 403 sidorna svarade ”ingen artikel”: butiksfronter, portalers startsidor och flöden, där det inte finns någon artikel att extrahera. Det svaret är medvetet, och det är därför sidorna räknas som testade snarare än klippta.

SpråkSidorKrascherKvarlämnad HTMLLänkandel
Tyska40000.058
Franska39000.050
Spanska40000.060
Italienska40000.036
Polska30000.064
Portugisiska36000.060
Nederländska37000.049
Turkiska31000.042
Ukrainska13000.054
Tjeckiska28000.039
Svenska28000.036
Rumänska41000.039

Tid per sida: 4 min 38 s

Räknaren på lessroutinemorelife.com räknar 4 min 38 s för varje sida du gjorde något med – kopierade, sparade, skrev ut eller skickade till en AI-chatt – en gång per dygn och sida. Att bara öppna fönstret är ingen besparing och räknas som noll. Den tiden togs för hand av ägaren på mer än 1 000 varierade sidor med innehåll: kopiera texten, klistra in den, städa den, lägga till titel och källa och sedan kontrollera att ingen HTML-uppmärkning ligger kvar. Både medelvärdet och medianen räknades ut.

Räknaren är alltså antalet sådana sidor multiplicerat med den tiden, inte en summa av tidtagningar för varje sida. Den mäter inte hur lång tid en viss sida hade tagit för just dig.

Vad siffrorna betyder

Ärliga gränser för den här mätningen

Lägg till i Chrome – gratisHelt gratis, inget konto, inga gränser. Extraheringen fungerar offline; användningshändelser skickas när du är uppkopplad, och en enda knapp stoppar dem.For Chrome on a computer

Frågor

Kan jag göra om mätningen själv?
Inte på egen hand än. Korpuslistorna, hämtningsskriptet och poängskriptet publiceras med nästa körning. Till dess anger den här sidan motorernas versioner och datumen, så att en senare körning kan ställas mot dem. Hämtningen beror på levande sajter, så exakta siffror kommer att driva i takt med att sajterna ändras.
Varför namnges andra produkter här men inte i butikstexten?
Butikstexten namnger inga andra produkter; den här sidan gör det. En jämförelse som döljer vem som jämfördes går inte att kontrollera, så här bär varje motor sitt namn och sin version.
Är mer extraherad text bättre?
Inte i sig. En motor som lämnar ifrån sig en flödessida full av länkar får höga siffror på volym och låga på användbarhet. Därför mäter tabellerna ovan brus i stället för storlek.