Вимірювання · ·
Що вимірювали, на чому і що вийшло
Протестовано на 512 сторінках: 109 пліч-о-пліч проти трьох інших рушіїв і 403 лише нашим ядром. Жодного падіння й жодного вцілілого тега HTML у жодній видобутій статті. Корпус і скрипти буде опубліковано разом із наступним прогоном; доти ця сторінка – повний запис того, що запускали і що вийшло.
Прогін перший: 109 сторінок, чотири рушії пліч-о-пліч
Корпус – сто найвідвідуваніших сайтів світу і сто найвідвідуваніших у Росії. Домени без вмісту – месенджери, банки, стримінг, державні портали – виключено заздалегідь. Сторінки знімали справжнім браузером, переходячи з головної на посилання зі змістом там, де воно було.
Чотири рушії пройшли по тих самих 109 знятих сторінках: Defuddle 0.19.3 із Turndown 7.2.4 (ядро офіційного Obsidian Web Clipper), Mozilla Readability 0.6.0 із тим самим Turndown (ядро MarkDownload), MarkSnip 5.2.0 – його справжній робочий код, розпакований зі складання в Chrome Web Store, – і Clean Web Clipper 0.1.0.
| Показник | Defuddle 0.19.3 | Mozilla Readability 0.6.0 | MarkSnip 5.2.0 | Clean Web Clipper 0.1.0 |
|---|---|---|---|---|
| Сторінок | 109 | 107 | 107 | 109 |
| Падінь | 0 | 2 | 2 | 0 |
| Залишки HTML | 532 | 718 | 2 | 0 |
| Дубльовані рядки меню | 491 | 282 | 478 | 102 |
| Частка коротких рядків | 0.278 | 0.262 | 0.263 | 0.221 |
| Знайдено авторів | 23 | 27 | 28 | 28 |
| Знайдено дат публікації | 28 | 13 | 13 | 24 |
| Видобуто таблиць (із 56) | 3 | 8 | 11 | 5 |
| Частка корисного тексту | 0.878 | 0.931 | 0.934 | 0.890 |
Де Clean Web Clipper позаду
- Таблиці: 5 проти 11 у MarkSnip. 41 із 56 таблиць джерела стоїть на одній сторінці й є версткою, а не змістом, – таке не варто видобувати жодному рушієві; справжній розрив – кілька сторінок, де наш вибір кореня бере надто вузький блок.
- Частка корисного тексту: 0.890 проти 0.934. Почасти це навмисно – розширення відмовляється від сторінок-стрічок, які інші рушії віддають, – а почасти винен той самий надто вузький корінь.
- Дати публікації: 24 проти 28 у Defuddle.
- Автори: нарівні з найкращим, 28 проти 28 у MarkSnip, після того як пошук автора переробили. Під час першого підрахунку на цьому корпусі було 20.
Прогін другий: 403 сторінки дванадцятьма європейськими мовами, лише наше ядро
По п’ятдесят найвідвідуваніших сайтів у кожній із дванадцяти країн, зняті з браузером, налаштованим на мову цієї країни, – інакше половина з них віддає англійську версію і вимірюється зовсім інше.
152 із 403 сторінок відповіли «статті немає»: вітрини магазинів, головні сторінки порталів і стрічки, де статті для видобування немає. Ця відповідь навмисна, і саме тому ці сторінки пораховано як протестовані, а не збережені.
| Мова | Сторінок | Падінь | Залишки HTML | Частка посилань |
|---|---|---|---|---|
| Німецька | 40 | 0 | 0 | 0.058 |
| Французька | 39 | 0 | 0 | 0.050 |
| Іспанська | 40 | 0 | 0 | 0.060 |
| Італійська | 40 | 0 | 0 | 0.036 |
| Польська | 30 | 0 | 0 | 0.064 |
| Португальська | 36 | 0 | 0 | 0.060 |
| Нідерландська | 37 | 0 | 0 | 0.049 |
| Турецька | 31 | 0 | 0 | 0.042 |
| Українська | 13 | 0 | 0 | 0.054 |
| Чеська | 28 | 0 | 0 | 0.039 |
| Шведська | 28 | 0 | 0 | 0.036 |
| Румунська | 41 | 0 | 0 | 0.039 |
Час на одне збереження: 4 хв 38 с
Лічильник на lessroutinemorelife.com рахує кожне збереження як 4 хв 38 с. Цей час власник заміряв вручну на понад 1 000 різноманітних сторінок зі змістом: скопіювати текст, вставити, почистити, додати заголовок і джерело, потім перевірити на залишки розмітки HTML. Пораховано і середнє, і медіану.
Отже, лічильник – це кількість збережень, помножена на цей час, а не сума замірів секундоміром для кожного збереження. Він не вимірює, скільки часу забрало б у вас якесь конкретне збереження.
Що означають ці числа
- Падіння – рушій видав помилку на сторінці й нічого не повернув. Прогін без падінь однаково може бути повним меню; це міряють інші рядки.
- Вцілілі теги HTML – скільки сирої розмітки дожило до Markdown. Будь-що більше за нуль – дефект.
- Дубльовані рядки меню – рядки, довші за дванадцять символів, які трапляються більш ніж один раз. Це навігація, повторена в кожній секції.
- Частка коротких рядків – частка рядків, коротших за двадцять п’ять символів. Висока означає зрізані списки посилань замість прози.
- Частка посилань – частка символів, що сидять у підписах до посилань. Висока означає, що разом зі статтею приїхало меню.
- «Статті немає» – на сторінці не було тіла статті, тож розширення так і сказало, замість того щоб повернути посилання. Це не падіння і не збереження.
Чесні межі цього вимірювання
- Українська вибірка – 13 сторінок, а не 40: решта корпусу не відповіла з точки зйомки. Цей рядок можна читати лише як орієнтир, а не як повноцінний замір.
- Турецький і чеський списки топ-50 зміщені в бік магазинів та розкладів, а там дати публікації немає взагалі. Це властивість корпусу, а не видобування.
- Конкурентні рушії ганяли лише на першому корпусі. Європейський прогін вимірює саме Clean Web Clipper і нікого більше.
- Сторінки, де кожен рушій повернув менш ніж 500 символів, виключено: це капча або блокування, а не якість видобування.
- Обидва прогони – знімки живих сайтів наприкінці серпня 2026 року. Ті самі скрипти, запущені пізніше, дадуть дещо інші числа, бо сайти змінюються.