Měření
Co se měřilo, na čem a co z toho vyšlo
Tvrzení o čistém výstupu nemá bez korpusu a skriptu žádnou cenu. Obojí je zveřejněné.
První prohon: 109 stránek, čtyři nástroje
Korpus tvoří stovka nejnavštěvovanějších webů světa a stovka nejnavštěvovanějších v Rusku. Domény bez obsahu – messengery, bankovnictví, streamovací služby, státní portály – byly předem vyřazené. Stránky se zachytávaly skutečným prohlížečem, s otevřením obsahového odkazu z titulní strany tam, kde nějaký byl.
Čtyři nástroje běžely nad stejným zachyceným DOM: Defuddle (jádro oficiálního clipperu pro Obsidian), Mozilla Readability, skutečný nasazený kód třetího Markdown clipperu rozbalený z jeho buildu v obchodě, a Clean Clipper.
| Ukazatel | Nástroj A | Nástroj B | Nástroj C | Clean Clipper |
|---|---|---|---|---|
| Stránek | 109 | 107 | 107 | 109 |
| Selhání | 0 | 2 | 2 | 0 |
| Zbylé HTML | 532 | 718 | 2 | 0 |
| Zdvojené řádky menu | 491 | 282 | 478 | 102 |
| Podíl krátkých řádků | 0.278 | 0.262 | 0.263 | 0.220 |
Kde Clean Clipper zaostává: našel 20 autorů proti 28 u nejlepšího nástroje a vytáhl 4 tabulky proti 11 – i když 41 z 56 zdrojových tabulek leží na jediné stránce a jsou rozvržení, ne obsah, takže by je neměl vytahovat žádný nástroj. Jeho podíl „užitečného textu“ je nižší, protože odmítá výpisové stránky, které jiné nástroje ochotně vrátí.
Druhý prohon: 403 stránek ve dvanácti evropských jazycích
Padesátka nejnavštěvovanějších webů ve dvanácti zemích, zachycená s prohlížečem nastaveným na jazyk dané země – jinak jich polovina naservíruje anglickou stránku a měří se něco jiného.
| Jazyk | Stránek | Selhání | Zbylé HTML | Podíl odkazů |
|---|---|---|---|---|
| němčina | 40 | 0 | 0 | 0.058 |
| francouzština | 39 | 0 | 0 | 0.050 |
| španělština | 40 | 0 | 0 | 0.060 |
| italština | 40 | 0 | 0 | 0.036 |
| polština | 30 | 0 | 0 | 0.064 |
| portugalština | 36 | 0 | 0 | 0.060 |
| nizozemština | 37 | 0 | 0 | 0.049 |
| turečtina | 31 | 0 | 0 | 0.042 |
| ukrajinština | 13 | 0 | 0 | 0.054 |
| čeština | 28 | 0 | 0 | 0.039 |
| švédština | 28 | 0 | 0 | 0.036 |
| rumunština | 41 | 0 | 0 | 0.039 |
Co ta čísla znamenají
- Zbylé HTML značky – kolik syrové syntaxe přežilo do Markdownu. Cokoli nad nulou je vada.
- Zdvojené řádky menu – řádky delší než dvanáct znaků, které se objeví víc než jednou. To je navigace opakovaná v každé sekci.
- Podíl krátkých řádků – kolik řádků má pod dvacet pět znaků. Vysoká hodnota znamená posbírané seznamy odkazů, ne souvislý text.
- Podíl odkazů – kolik znaků leží uvnitř popisků odkazů. Vysoká hodnota znamená, že s textem přišlo i menu.
Poctivé hranice tohoto měření
- Ukrajinský vzorek má 13 stránek, ne 40 – většina korpusu z místa snímání neodpověděla. Ten řádek berte jen jako orientační.
- Turecký a český seznam padesátky se kloní k e-shopům a jízdním řádům, které datum vydání vůbec nenesou: v jejich JSON-LD prostě není. Je to vlastnost korpusu, ne extrakce – datum se bere odtud, kde je, a když na stránce žádné není, pole zůstane prázdné.
- Konkurenční nástroje běžely jen na prvním korpusu. Evropský prohon měří samotný Clean Clipper.
- Stránky, kde všechny nástroje vrátily pod 500 znaků, byly vyřazené: to je captcha nebo blokace, ne kvalita extrakce.