Pomiar
Co zmierzono, na czym i co z tego wyszło
Deklaracje o czystym wyniku nic nie znaczą bez korpusu i skryptu. Jedno i drugie jest opublikowane.
Przebieg pierwszy: 109 stron, cztery silniki
Korpus to sto najczęściej odwiedzanych serwisów świata i sto najczęściej odwiedzanych w Rosji. Domeny bez treści – komunikatory, bankowość, streaming, portale urzędowe – wykluczono z góry. Strony zbierano prawdziwą przeglądarką, przechodząc ze strony głównej do odnośnika z treścią tam, gdzie taki był.
Cztery silniki przeszły po tym samym zebranym DOM: Defuddle (rdzeń oficjalnego clippera Obsidian), Mozilla Readability, realny kod trzeciego clippera Markdown rozpakowany z jego wydania sklepowego oraz Clean Clipper.
| Miara | Silnik A | Silnik B | Silnik C | Clean Clipper |
|---|---|---|---|---|
| Strony | 109 | 107 | 107 | 109 |
| Niepowodzenia | 0 | 2 | 2 | 0 |
| Resztki HTML | 532 | 718 | 2 | 0 |
| Powtórzone linie menu | 491 | 282 | 478 | 102 |
| Udział krótkich linii | 0.278 | 0.262 | 0.263 | 0.220 |
Gdzie Clean Clipper wypada gorzej: znalazł 20 autorów wobec 28 u najlepszego silnika i wyciągnął 4 tabele wobec 11 – choć 41 z 56 tabel źródłowych siedzi na jednej stronie i służy układowi, a nie treści, więc żaden silnik nie powinien ich wyciągać. Jego udział „użytecznego tekstu” jest niższy, bo odmawia stron z listami wpisów, które inne silniki chętnie zwracają.
Przebieg drugi: 403 strony w dwunastu językach Europy
Po pięćdziesiąt najpopularniejszych serwisów w każdym z dwunastu krajów, zbieranych przeglądarką ustawioną na język danego kraju – inaczej połowa z nich poda stronę po angielsku i mierzy się coś zupełnie innego.
| Język | Strony | Niepowodzenia | Resztki HTML | Udział odnośników |
|---|---|---|---|---|
| niemiecki | 40 | 0 | 0 | 0.058 |
| francuski | 39 | 0 | 0 | 0.050 |
| hiszpański | 40 | 0 | 0 | 0.060 |
| włoski | 40 | 0 | 0 | 0.036 |
| polski | 30 | 0 | 0 | 0.064 |
| portugalski | 36 | 0 | 0 | 0.060 |
| niderlandzki | 37 | 0 | 0 | 0.049 |
| turecki | 31 | 0 | 0 | 0.042 |
| ukraiński | 13 | 0 | 0 | 0.054 |
| czeski | 28 | 0 | 0 | 0.039 |
| szwedzki | 28 | 0 | 0 | 0.036 |
| rumuński | 41 | 0 | 0 | 0.039 |
Co znaczą te liczby
- Resztki znaczników HTML – ile surowej składni przetrwało do Markdowna. Cokolwiek powyżej zera jest wadą.
- Powtórzone linie menu – linie dłuższe niż dwanaście znaków, które pojawiają się więcej niż raz. To nawigacja zdublowana w każdej sekcji.
- Udział krótkich linii – odsetek linii poniżej dwudziestu pięciu znaków. Wysoki oznacza wycięte listy odnośników zamiast prozy.
- Udział odnośników – odsetek znaków siedzących w etykietach odnośników. Wysoki oznacza, że menu przyszło razem z tekstem.
Uczciwe granice tego pomiaru
- Próbka ukraińska to 13 stron, a nie 40 – większość korpusu nie odpowiedziała z miejsca zbierania. Ten wiersz traktować wyłącznie orientacyjnie.
- Tureckie i czeskie pięćdziesiątki przechylają się w stronę sklepów i rozkładów jazdy, które w ogóle nie noszą daty publikacji. To właściwość korpusu, a nie ekstrakcji.
- Konkurencyjne silniki przepuszczono tylko przez pierwszy korpus. Przebieg europejski mierzy sam Clean Clipper.
- Strony, na których każdy silnik zwrócił poniżej 500 znaków, wykluczono: to captcha albo blokada, a nie jakość ekstrakcji.