Clean Web Clipper Додати в Chrome – безкоштовно

Вимірювання · ·

Що вимірювали, на чому і що вийшло

Протестовано на 512 сторінках: 109 пліч-о-пліч проти трьох інших рушіїв і 403 лише нашим ядром. Жодного падіння й жодного вцілілого тега HTML у жодній видобутій статті. Корпус і скрипти буде опубліковано разом із наступним прогоном; доти ця сторінка – повний запис того, що запускали і що вийшло.

Прогін перший: 109 сторінок, чотири рушії пліч-о-пліч

Корпус – сто найвідвідуваніших сайтів світу і сто найвідвідуваніших у Росії. Домени без вмісту – месенджери, банки, стримінг, державні портали – виключено заздалегідь. Сторінки знімали справжнім браузером, переходячи з головної на посилання зі змістом там, де воно було.

Чотири рушії пройшли по тих самих 109 знятих сторінках: Defuddle 0.19.3 із Turndown 7.2.4 (ядро офіційного Obsidian Web Clipper), Mozilla Readability 0.6.0 із тим самим Turndown (ядро MarkDownload), MarkSnip 5.2.0 – його справжній робочий код, розпакований зі складання в Chrome Web Store, – і Clean Web Clipper 0.1.0.

ПоказникDefuddle 0.19.3Mozilla Readability 0.6.0MarkSnip 5.2.0Clean Web Clipper 0.1.0
Сторінок109107107109
Падінь0220
Залишки HTML53271820
Дубльовані рядки меню491282478102
Частка коротких рядків0.2780.2620.2630.221
Знайдено авторів23272828
Знайдено дат публікації28131324
Видобуто таблиць (із 56)38115
Частка корисного тексту0.8780.9310.9340.890
Додати в Chrome – безкоштовноБезкоштовно повністю, без акаунта й обмежень. Видобування працює офлайн; події використання йдуть, коли ви онлайн, і один перемикач їх зупиняє.For Chrome on a computer

Де Clean Web Clipper позаду

Прогін другий: 403 сторінки дванадцятьма європейськими мовами, лише наше ядро

По п’ятдесят найвідвідуваніших сайтів у кожній із дванадцяти країн, зняті з браузером, налаштованим на мову цієї країни, – інакше половина з них віддає англійську версію і вимірюється зовсім інше.

152 із 403 сторінок відповіли «статті немає»: вітрини магазинів, головні сторінки порталів і стрічки, де статті для видобування немає. Ця відповідь навмисна, і саме тому ці сторінки пораховано як протестовані, а не збережені.

МоваСторінокПадіньЗалишки HTMLЧастка посилань
Німецька40000.058
Французька39000.050
Іспанська40000.060
Італійська40000.036
Польська30000.064
Португальська36000.060
Нідерландська37000.049
Турецька31000.042
Українська13000.054
Чеська28000.039
Шведська28000.036
Румунська41000.039

Час на одне збереження: 4 хв 38 с

Лічильник на lessroutinemorelife.com рахує кожне збереження як 4 хв 38 с. Цей час власник заміряв вручну на понад 1 000 різноманітних сторінок зі змістом: скопіювати текст, вставити, почистити, додати заголовок і джерело, потім перевірити на залишки розмітки HTML. Пораховано і середнє, і медіану.

Отже, лічильник – це кількість збережень, помножена на цей час, а не сума замірів секундоміром для кожного збереження. Він не вимірює, скільки часу забрало б у вас якесь конкретне збереження.

Що означають ці числа

Чесні межі цього вимірювання

Додати в Chrome – безкоштовноБезкоштовно повністю, без акаунта й обмежень. Видобування працює офлайн; події використання йдуть, коли ви онлайн, і один перемикач їх зупиняє.For Chrome on a computer

Питання

Чи можна це відтворити?
Самостійно – поки що ні. Списки корпусу, скрипт зйомки та скрипт підрахунку буде опубліковано разом із наступним прогоном. Доти ця сторінка наводить версії рушіїв і дати, тож пізніший прогін можна буде звірити з ними. Зйомка залежить від живих сайтів, тому точні числа дрейфуватимуть разом зі змінами на них.
Чому інші продукти названо тут, але не на сторінці в магазині?
Сторінка в магазині інших продуктів не називає, а ця називає. Порівняння, яке приховує, з ким порівнювали, неможливо перевірити, тож тут кожен рушій має назву й версію.
Чи більше видобутого тексту – це краще?
Саме собою – ні. Рушій, який віддає сторінку-стрічку, повну посилань, виграє за обсягом і програє за користю. Саме тому таблиці вище міряють шум, а не розмір.