Clean Web Clipper Přidat do Chromu – zdarma

Měření · ·

Co se měřilo, na čem a co z toho vyšlo

Otestováno na 512 stránkách: 109 v přímém srovnání se třemi jinými nástroji a 403 jen s naším jádrem. Žádný pád a v žádném vytaženém článku nezbyla HTML značka. Korpus i skripty zveřejníme s příštím prohonem; do té doby je tahle stránka úplným záznamem toho, co běželo a co z toho vyšlo.

První prohon: 109 stránek, čtyři nástroje v přímém srovnání

Korpus tvoří stovka nejnavštěvovanějších webů světa a stovka nejnavštěvovanějších v Rusku. Domény bez obsahu – messengery, bankovnictví, streamovací služby, státní portály – byly předem vyřazené. Stránky se zachytávaly skutečným prohlížečem, s otevřením obsahového odkazu z titulní strany tam, kde nějaký byl.

Čtyři nástroje běžely nad stejnými 109 zachycenými stránkami: Defuddle 0.19.3 s Turndown 7.2.4 (jádro oficiálního Obsidian Web Clipperu), Mozilla Readability 0.6.0 se stejným Turndownem (jádro MarkDownloadu), MarkSnip 5.2.0 – jeho skutečně vydaný kód, rozbalený z balíčku v Chrome Web Store – a Clean Web Clipper 0.1.0.

UkazatelDefuddle 0.19.3Mozilla Readability 0.6.0MarkSnip 5.2.0Clean Web Clipper 0.1.0
Stránek109107107109
Pády0220
Zbylé HTML53271820
Zdvojené řádky menu491282478102
Podíl krátkých řádků0.2780.2620.2630.221
Nalezení autoři23272828
Nalezená data vydání28131324
Vytažené tabulky (z 56)38115
Podíl užitečného textu0.8780.9310.9340.890
Přidat do Chromu – zdarmaZdarma celé, bez účtu a bez limitů. Extrakce funguje offline; události o používání odcházejí, když jste online, a jeden přepínač je zastaví.For Chrome on a computer

Kde Clean Web Clipper zaostává

Druhý prohon: 403 stránek ve dvanácti evropských jazycích, jen naše jádro

Padesátka nejnavštěvovanějších webů ve dvanácti zemích, zachycená s prohlížečem nastaveným na jazyk dané země – jinak jich polovina naservíruje anglickou stránku a měří se něco jiného.

152 ze 403 stránek odpovědělo „tady článek není“: výlohy e-shopů, titulní strany portálů a výpisy, kde žádný článek k vytažení není. Ta odpověď je záměrná, a proto se tyto stránky počítají jako otestované, ne uložené.

JazykStránekPádyZbylé HTMLPodíl odkazů
němčina40000.058
francouzština39000.050
španělština40000.060
italština40000.036
polština30000.064
portugalština36000.060
nizozemština37000.049
turečtina31000.042
ukrajinština13000.054
čeština28000.039
švédština28000.036
rumunština41000.039

Čas na stránku: 4 min 38 s

Počítadlo na lessroutinemorelife.com počítá 4 min 38 s za každou stránku, se kterou jste něco udělali – zkopírovali, uložili, vytiskli nebo poslali do AI chatu – jednou za den na stránku. Pouhé otevření okna úsporou není a nepočítá se vůbec. Ten čas ručně naměřil provozovatel na více než 1 000 různých stránkách s obsahem: zkopírovat text, vložit ho, vyčistit, doplnit název a zdroj a pak zkontrolovat, jestli nezbyly HTML značky. Spočítal se průměr i medián.

Počítadlo je tedy počet takových stránek vynásobený tímto časem, ne součet stopek u jednotlivých uložení. Neměří, jak dlouho by vám zabralo kterékoli konkrétní uložení.

Co ta čísla znamenají

Poctivé hranice tohoto měření

Přidat do Chromu – zdarmaZdarma celé, bez účtu a bez limitů. Extrakce funguje offline; události o používání odcházejí, když jste online, a jeden přepínač je zastaví.For Chrome on a computer

Otázky

Dá se to zopakovat?
Zatím ne sami. Seznamy korpusu, skript na zachycení i skript na vyhodnocení zveřejníme s příštím prohonem. Do té doby tahle stránka uvádí verze nástrojů a data, aby se s nimi dal pozdější prohon porovnat. Zachytávání závisí na živých webech, takže přesná čísla se s tím, jak se weby mění, budou posouvat.
Proč jsou tu jiné produkty jmenované, a v popisu v obchodě ne?
Popis v obchodě jiné produkty nejmenuje; tahle stránka ano. Srovnání, které tají, s kým se srovnávalo, nejde ověřit, a proto tu každý nástroj nese své jméno a verzi.
Je víc vytaženého textu lepší?
Samo o sobě ne. Nástroj, který vrátí výpisovou stránku plnou odkazů, vyjde dobře na objem a špatně na užitečnost. Proto tabulky výše měří šum, ne velikost.