Měření · ·
Co se měřilo, na čem a co z toho vyšlo
Otestováno na 512 stránkách: 109 v přímém srovnání se třemi jinými nástroji a 403 jen s naším jádrem. Žádný pád a v žádném vytaženém článku nezbyla HTML značka. Korpus i skripty zveřejníme s příštím prohonem; do té doby je tahle stránka úplným záznamem toho, co běželo a co z toho vyšlo.
První prohon: 109 stránek, čtyři nástroje v přímém srovnání
Korpus tvoří stovka nejnavštěvovanějších webů světa a stovka nejnavštěvovanějších v Rusku. Domény bez obsahu – messengery, bankovnictví, streamovací služby, státní portály – byly předem vyřazené. Stránky se zachytávaly skutečným prohlížečem, s otevřením obsahového odkazu z titulní strany tam, kde nějaký byl.
Čtyři nástroje běžely nad stejnými 109 zachycenými stránkami: Defuddle 0.19.3 s Turndown 7.2.4 (jádro oficiálního Obsidian Web Clipperu), Mozilla Readability 0.6.0 se stejným Turndownem (jádro MarkDownloadu), MarkSnip 5.2.0 – jeho skutečně vydaný kód, rozbalený z balíčku v Chrome Web Store – a Clean Web Clipper 0.1.0.
| Ukazatel | Defuddle 0.19.3 | Mozilla Readability 0.6.0 | MarkSnip 5.2.0 | Clean Web Clipper 0.1.0 |
|---|---|---|---|---|
| Stránek | 109 | 107 | 107 | 109 |
| Pády | 0 | 2 | 2 | 0 |
| Zbylé HTML | 532 | 718 | 2 | 0 |
| Zdvojené řádky menu | 491 | 282 | 478 | 102 |
| Podíl krátkých řádků | 0.278 | 0.262 | 0.263 | 0.221 |
| Nalezení autoři | 23 | 27 | 28 | 28 |
| Nalezená data vydání | 28 | 13 | 13 | 24 |
| Vytažené tabulky (z 56) | 3 | 8 | 11 | 5 |
| Podíl užitečného textu | 0.878 | 0.931 | 0.934 | 0.890 |
Kde Clean Web Clipper zaostává
- Tabulky: 5 proti 11 u MarkSnipu. 41 z 56 zdrojových tabulek leží na jediné stránce a jsou rozvržením, ne obsahem, takže by je neměl vytáhnout žádný nástroj; skutečná mezera je hrstka stránek, kde naše volba kořene sáhne po příliš úzkém bloku.
- Podíl užitečného textu: 0,890 proti 0,934. Zčásti záměrně – odmítá výpisové stránky, které jiné nástroje vrátí – a zčásti kvůli stejně příliš úzkému kořeni.
- Data vydání: 24 proti 28 u Defuddle.
- Autoři: na úrovni nejlepšího, 28 proti 28 u MarkSnipu, po přepracování hledání autora. Při prvním vyhodnocení tohoto korpusu to bylo 20.
Druhý prohon: 403 stránek ve dvanácti evropských jazycích, jen naše jádro
Padesátka nejnavštěvovanějších webů ve dvanácti zemích, zachycená s prohlížečem nastaveným na jazyk dané země – jinak jich polovina naservíruje anglickou stránku a měří se něco jiného.
152 ze 403 stránek odpovědělo „tady článek není“: výlohy e-shopů, titulní strany portálů a výpisy, kde žádný článek k vytažení není. Ta odpověď je záměrná, a proto se tyto stránky počítají jako otestované, ne uložené.
| Jazyk | Stránek | Pády | Zbylé HTML | Podíl odkazů |
|---|---|---|---|---|
| němčina | 40 | 0 | 0 | 0.058 |
| francouzština | 39 | 0 | 0 | 0.050 |
| španělština | 40 | 0 | 0 | 0.060 |
| italština | 40 | 0 | 0 | 0.036 |
| polština | 30 | 0 | 0 | 0.064 |
| portugalština | 36 | 0 | 0 | 0.060 |
| nizozemština | 37 | 0 | 0 | 0.049 |
| turečtina | 31 | 0 | 0 | 0.042 |
| ukrajinština | 13 | 0 | 0 | 0.054 |
| čeština | 28 | 0 | 0 | 0.039 |
| švédština | 28 | 0 | 0 | 0.036 |
| rumunština | 41 | 0 | 0 | 0.039 |
Čas na stránku: 4 min 38 s
Počítadlo na lessroutinemorelife.com počítá 4 min 38 s za každou stránku, se kterou jste něco udělali – zkopírovali, uložili, vytiskli nebo poslali do AI chatu – jednou za den na stránku. Pouhé otevření okna úsporou není a nepočítá se vůbec. Ten čas ručně naměřil provozovatel na více než 1 000 různých stránkách s obsahem: zkopírovat text, vložit ho, vyčistit, doplnit název a zdroj a pak zkontrolovat, jestli nezbyly HTML značky. Spočítal se průměr i medián.
Počítadlo je tedy počet takových stránek vynásobený tímto časem, ne součet stopek u jednotlivých uložení. Neměří, jak dlouho by vám zabralo kterékoli konkrétní uložení.
Co ta čísla znamenají
- Pády – nástroj na stránce vyhodil chybu a nevrátil nic. Prohon bez pádů může být pořád plný menu; to měří ostatní řádky.
- Zbylé HTML značky – kolik syrové syntaxe přežilo do Markdownu. Cokoli nad nulou je vada.
- Zdvojené řádky menu – řádky delší než dvanáct znaků, které se objeví víc než jednou. To je navigace opakovaná v každé sekci.
- Podíl krátkých řádků – kolik řádků má pod dvacet pět znaků. Vysoká hodnota znamená posbírané seznamy odkazů, ne souvislý text.
- Podíl odkazů – kolik znaků leží uvnitř popisků odkazů. Vysoká hodnota znamená, že s textem přišlo i menu.
- „Tady článek není“ – stránka neobsahovala tělo článku, takže to rozšíření řeklo, místo aby vrátilo odkazy. Není to pád ani uložení.
Poctivé hranice tohoto měření
- Ukrajinský vzorek má 13 stránek, ne 40 – většina korpusu z místa snímání neodpověděla. Ten řádek berte jen jako orientační.
- Turecký a český seznam padesátky se kloní k e-shopům a jízdním řádům, které datum vydání vůbec nenesou: v jejich JSON-LD prostě není. Je to vlastnost korpusu, ne extrakce – datum se bere odtud, kde je, a když na stránce žádné není, pole zůstane prázdné.
- Konkurenční nástroje běžely jen na prvním korpusu. Evropský prohon měří samotný Clean Web Clipper.
- Stránky, kde všechny nástroje vrátily pod 500 znaků, byly vyřazené: to je captcha nebo blokace, ne kvalita extrakce.
- Oba prohony jsou snímky živých webů pořízené na konci srpna 2026. Stejné skripty spuštěné později dají trochu jiná čísla, protože se ty weby mění.