Clean Web Clipper Додати в Chrome – безкоштовно

Розширення для Chrome ·

Зберегти вебсторінку в Markdown, який не треба вичищати

Щоб зберегти вебсторінку в Markdown, досить натиснути іконку: заголовок, автор, дата публікації та адреса джерела вже зібрані у frontmatter, а текст – без навігації. Видобування відбувається у вашому браузері: без акаунта, і текст сторінки ніколи його не залишає.

Додати в Chrome – безкоштовноБезкоштовно повністю, без акаунта й обмежень. Видобування працює офлайн; події використання йдуть, коли ви онлайн, і один перемикач їх зупиняє.For Chrome on a computer
Вікно Clean Web Clipper із Markdown збереженої статті Вікіпедії

Clean Web Clipper – безкоштовне розширення для Chrome, що зберігає вебсторінку в чистий Markdown: у буфер обміну, файл .md, теку або просто у vault Obsidian, без акаунта й без входу. Протестовано на 512 сторінках найвідвідуваніших сайтів: жодного падіння і жодного вцілілого тега HTML у видобутих статтях.

Протестовано на 512 сторінках найвідвідуваніших сайтів світу

Два прогони. Перший узяв 109 сторінок зі ста найвідвідуваніших сайтів світу та Росії і порівняв результат пліч-о-пліч із трьома іншими рушіями видобування. Другий узяв по п’ятдесят найвідвідуваніших сайтів у кожній із дванадцяти європейських країн: ще 403 сторінки, кожну знято мовою своєї країни й пропущено лише через наше ядро. Рушії, версії, дати й де ми позаду

512сторінок протестовано
0падінь
0вцілілих тегів HTML у видобутих статтях
102дубльованих рядків меню в порівнянні на 109 сторінках – проти 282, 478 і 491 в інших рушіїв

Проблема ніколи не в конвертації. Проблема в тому, що приїжджає разом із нею.

Перетворити HTML на Markdown вміє будь-яке розширення. А потім ви відкриваєте нотатку – і бачите там банер про cookie, бічне меню, список «читайте також» і таблицю, що розсипалася дорогою. Clean Web Clipper побудований саме навколо того, щоб це прибирати, і прибирання тут не заявлене, а виміряне.

що лишають інші розширення

[До змісту](#main) [Увійти](/login) [Зареєструватися](/register)
[Головна](/) [Новини](/news) [Спорт](/sport) [Культура](/culture) [Ще](/more)

Ми використовуємо файли cookie та подібні технології, щоб покращити ваш досвід.
[Прийняти всі] [Налаштувати]

# Стаття, по яку ви прийшли

Справжній перший абзац тексту.

<div class="promo-inline">

## Читайте також
[Інший заголовок](/a) [Ще один заголовок](/b) [І третій](/c)

що потрапляє в нотатку

# Стаття, по яку ви прийшли

Справжній перший абзац тексту.
Та сама новинна сторінка: що лишає типове розширення і що зберігає Clean Web Clipper

Що робить результат чистим

Справжній результат, без правокuk.wikipedia.org/wiki/Ланцюг_Маркова
---
title: "Ланцюг Маркова – Вікіпедія"
source: "https://uk.wikipedia.org/wiki/Ланцюг_Маркова"
date: "2006-03-11T09:42:18.000Z"
extraction: "dom"
---

Ланцюг Маркова – послідовність випадкових подій зі скінченною або зліченною
кількістю результатів, у якій імовірність кожної події залежить лише від стану,
досягнутого в попередній події.[^1]

[^1]: Марков А. А. Поширення закону великих чисел на величини, що залежать
      одна від одної. – Доповідь Казанському фізико-математичному товариству, 1906.

Як зберегти вебсторінку в Markdown у Chrome

Установіть розширення – далі три кроки. Заздалегідь нічого налаштовувати не треба: типово клік відкриває вікно перегляду з уже готовим Markdown, який можна скопіювати або зберегти файлом. Згодом можна зробити так, щоб один клік записував нотатку просто в теку чи vault, минаючи перегляд.

  1. Закріпіть іконку. Відкрийте меню з пазлом біля адресного рядка й закріпіть Clean Web Clipper на панелі.
  2. Відкрийте статтю, яку хочете зберегти, – саму статтю, а не сторінку з посиланнями на неї.
  3. Натисніть іконку. Markdown з’явиться у вікні перегляду: скопіюйте його або збережіть файл .md.

Куди зберігає

Дія на клік по іконці налаштовується. Можна лишити вікно з переглядом, а можна зробити так, щоб один клік клав нотатку у vault і не відкривав нічого.

Налаштування Clean Web Clipper: вибір дії на клік по іконці
Налаштування вирішують, що робить клік – перегляд, буфер обміну, файл, тека або одразу vault.

Чесно про джерело

Кожна нотатка має поле extraction. dom означає, що текст узято з того, що браузер справді відмалював. jsonld-articlebody – що сторінка так і не дорендерилася і тіло довелося взяти з її ж структурованих даних. А коли статті на сторінці немає взагалі – вітрина, стрічка, результати пошуку – розширення так і каже, замість того щоб вивалити на вас триста посилань.

Екран «Користь» у Clean Web Clipper: збереження, заощаджений час, улюблені сайти й сторінки, де не вдалося
Користь: скільки збережень спрацювало, скільки часу вони заощадили і кожна сторінка, де не вийшло.
Clean Web Clipper відмовляється від сторінки без статті й пропонує надіслати її адресу
На сторінці немає статті – чесна відмова замість трьохсот посилань із меню.
Сторінка першого запуску Clean Web Clipper із трьома кроками налаштування
Перший запуск: закріпити іконку, зберегти сторінку, вибрати, що робить клік.

Чого воно не робить

П’ятнадцять способів це використати

РозробникамБлоки коду зберігають мітку мови, тож вставлений фрагмент підсвічується одразу.

Довідник – це переважно код, і саме його більшість розширень губить дорогою. Clean Web Clipper зчитує мову з розмітки самої сторінки – з класу огорожі, з батьківського елемента або з розмітки підсвічувача – і записує її в блок. На технічному корпусі з дев’яти сторінок мітка вціліла в 73 огорожах зі 156 – проти 20 і 0 у двох порівнюваних рушіїв. Вставлений фрагмент підсвічується в Obsidian, VS Code і на GitHub без жодної правки руками.

  • Блок виходить як ```js, а не голий – підсвічування в Obsidian, VS Code і на GitHub працює одразу після вставляння
  • Мову беруть із розмітки сторінки: клас огорожі, батьківський елемент, сліди підсвічувача – розширення не вгадує її з самого коду, тож мітка правильна рівно настільки, наскільки правильна сторінка
  • Таблиці параметрів серіалізує саме розширення: комірка зі списком або кодом більше не розриває рядок – на технічному корпусі цілими лишилися 12 таблиць із 15 проти 7 у кожного з порівнюваних рушіїв
Докладніше
Користувачам ObsidianОберіть теку всередині vault – і один клік покладе нотатку туди. Obsidian запускати не треба.

Щоб зберегти вебсторінку в Markdown просто у vault, Clean Web Clipper не потребує ані плагіна спільноти, ані локального сервера, ані посилань obsidian://. Ви один раз обираєте теку, браузер запам’ятовує дозвіл – далі файл з’являється сам, навіть коли Obsidian закритий.

  • Без плагіна, без локального сервера, без посилань obsidian:// – розширення пише файл саме
  • Obsidian не мусить бути відкритий: файл просто вже лежить у теці, коли ви туди зазирнете
  • YAML-frontmatter із title, source, author, датою та способом видобування – ви самі обираєте, що з цього лишити
Докладніше
Робота з ШІ та LLMПовторена навігація – це витрачений контекст. Він зрізається до того, як текст дійде до моделі.

На корпусі зі 109 сторінок (порівняльний прогін пліч-о-пліч) Clean Web Clipper лишив 102 дубльовані рядки навігації там, де три інші рушії видобування лишили 282, 478 і 491, – і жодного вцілілого тега HTML. До моделі доходить сама стаття плюс шапка frontmatter, де названо адресу джерела й дату публікації.

  • Приблизно вчетверо менше дубльованої навігації, ніж у середньому в порівнюваних рушіїв: 102 повторені рядки проти 282, 478 і 491
  • Жодного вцілілого тега HTML ні в одній видобутій статті на 512 протестованих сторінках – моделі не доводиться продиратися крізь уламки розмітки
  • YAML-frontmatter прямо віддає моделі адресу джерела й дату публікації, тож твердження можна приписати джерелу, а не вгадувати
Докладніше
ДослідникамЧитає citation_date – стандарт arXiv, PubMed та IEEE – і виносить примітки в кінець нотатки.

Збережена стаття без дати – це посилання, яке потім доведеться відновлювати руками. Clean Web Clipper бере дату з метаданих самої сторінки, а не вгадує її з тексту; якщо на сторінці дати немає, поле лишається порожнім, а не заповнюється сьогоднішнім числом.

  • Читає citation_date і citation_publication_date – метатеги, які віддають arXiv, PubMed та IEEE
  • А також JSON-LD datePublished, article:published_time, time[datetime] і мітки Unix – саме в такому порядку
  • Порожня дата чесніша за вигадану: якщо сторінка мовчить, поле лишається порожнім
Докладніше
СтудентамЛекції, розділи й довідкові сторінки – у файли Markdown, які переживуть доступ до курсу.

Матеріали курсу зникають, щойно закінчується семестр: посилання гниють, сторінку дисципліни архівують, матеріал до семінару переїжджає. Clean Web Clipper кладе прочитане у файли Markdown на вашому диску – вони відкриються в будь-якому редакторі й через десять років, з адресою джерела всередині.

  • Виділили уривок – збережеться лише виділене: так беруть одне означення без сторінки навколо
  • У кожній нотатці є адреса джерела, тож послатися на неї в роботі можна без жодного пошуку
  • Режим читання показує результат звичайним текстом, без символів Markdown, ще до збереження
Докладніше
АвторамЗаголовок, автор, дата публікації й адреса джерела їдуть із кожною нотаткою, тож цитата не губить походження.

Матеріал, зібраний знімками екрана й закладками, стає непридатним саме тоді, коли на нього треба послатися. Файл Markdown тримає заголовок, автора, дату й адресу в тому самому файлі, що й текст, – там, де їх знайде перевірка фактів.

  • title, author, date і source у frontmatter кожної нотатки – підпис живе разом із текстом.
  • Поле автора фільтрується: назви рубрик, назви видань і підписи кнопок за автора не вважаються.
  • Лише тіло статті: форми розсилки, панелі «поділитися» й стрічки «читайте також» до нотатки не доходять.
Докладніше
ЖурналістамТекст таким, яким ви його прочитали, з датою публікації й адресою, у файлі на вашому диску.

Сторінки редагують і знімають. Збережена нотатка тримає повний текст, адресу джерела й дату публікації, яку оголосила сама сторінка, у звичайному файлі, що лишається у вас, а не в сервісі, який може закритися, змінити умови або тихо загубити запис.

  • Дата публікації – з метаданих самої сторінки: JSON-LD, article:published_time, time[datetime], а не з тексту статті.
  • Адреса джерела стоїть у frontmatter кожної нотатки.
  • Повний текст статті без навігації та промоблоків, які змінюються від відвідин до відвідин.
Докладніше
Юридична роботаТекст так, як його опубліковано, з адресою джерела й датою, у файлі, яким розпоряджаєтеся ви.

Нормативні акти, умови користування й офіційні роз’яснення змінюються без попередження. Копія в Markdown з адресою, звідки її взято, і датою, яку оголосила сторінка, – це запис того, що текст говорив у день, коли ви його читали.

  • Дослівний текст – усередині тіла статті ніщо не скорочується, не переписується й не переставляється.
  • Адреса джерела й дата публікації, оголошена сторінкою, – у frontmatter кожної нотатки.
  • Таблиці зборів, строків і порогів серіалізує саме розширення: на технічному корпусі збережено 12 із 15 проти 7 у кожного з порівнюваних рушіїв.
Докладніше
АналітикамКомірка з кодом, списком чи посиланням більше не розриває рядок: цілими лишилися 12 таблиць із 15.

Універсальні конвертери HTML у Markdown ламаються саме на тих таблицях, які мають значення, – там, де в комірці список, посилання чи фрагмент коду. Clean Web Clipper пише таблицю сам і сплющує вміст комірки замість того, щоб викидати рядок.

  • Серіалізатор таблиць GFM, написаний саме для цього, а не універсальний плагін до конвертера.
  • 12 таблиць із 15 цілими на технічному корпусі – проти 7 у кожного з порівнюваних рушіїв.
  • Нерівні двоколонкові таблиці стають рядками з жирним ключем і значенням, а не поламаною сіткою.
Докладніше
ВикладачамСам матеріал без сайту довкола: без меню, без банера про cookie й без реклами на аркуші.

Сторінка, надрукована просто з браузера, переносить на роздатку своє меню, банер про cookie й рекламу. Збереження через розширення бере лише текст, а адресу джерела лишає всередині файлу, тож послатися на першоджерело не коштує додаткової роботи.

  • Кнопка друку друкує збережений текст, а не сторінку з усім, що довкола.
  • Режим читання показує результат звичайним текстом, без символів Markdown, ще до друку чи збереження.
  • Виділіть одну вправу чи одне означення – і збережеться лише воно.
Докладніше
ПерекладачамМеню, банери й повторена навігація не доходять до списку сегментів.

Вихідний текст, вставлений із вебсторінки, тягне за собою навігацію, і кожен пункт меню стає сегментом, який доводиться пропускати, рахувати в обсязі й зрештою пояснювати в рахунку. Clean Web Clipper прибирає це ще до того, як файл потрапить у вашу програму.

  • Меню, пагінатори, банери згоди й стрічки «читайте також» зрізаються ще до появи файлу.
  • Дубльованої навігації приблизно вчетверо менше, ніж у порівнюваних рушіїв: 102 повторені рядки проти 282, 478 і 491.
  • Жодного вцілілого тега HTML у видобутих статтях на 512 протестованих сторінках, тож жоден уламок розмітки не стане внутрішнім тегом.
Докладніше
Продакт-менеджерамСписки змін, документація й нотатки до релізів – у файлах, де можна шукати, порівнювати й цитувати.

Конкурентна розвідка, складена в закладки, з часом вироджується в перелік посилань, у якому нічого не знайти. Збережена в Markdown, вона стає корпусом: по ньому шукають через grep, його порівнюють зі збереженням минулого кварталу і цитують у документі з рішенням – разом із датою.

  • Дату публікації читають зі сторінки, тож запис у списку змін зберігає справжній час виходу, а не день, коли ви його знайшли
  • Правила за сайтом самі розкладають кожного конкурента в його власну теку
  • Таблиці цін і обмежень доїжджають цілими: на технічному корпусі збережено 12 із 15 – проти 7 у кожного з порівнюваних рушіїв
Докладніше
Технічним письменникамЗаголовки, таблиці, огорожі коду й виноски переїжджають; обв’язка сайту лишається на сайті.

Перенесення документації зазвичай означає конвертувати HTML, а потім довше вичищати те, що конвертер залишив. Саме навколо цього вичищання й побудовано Clean Web Clipper, і саме його перевірено: на 512 протестованих сторінках у видобутих статтях не лишилося жодного тега HTML.

  • Заголовки, списки, таблиці, огорожі коду й виноски лягають у стандартний Markdown
  • Огорожі зберігають мітку мови: на технічному корпусі – 73 зі 156, проти 20 і 0 у порівнюваних рушіїв
  • Жодного вцілілого тега HTML у видобутих статтях на 512 протестованих сторінках
Докладніше
Особистий архівЗвичайні файли Markdown на вашому диску. Без акаунта, без сервісу, без нічого, що можна закрити.

Закладки вказують на сторінки, які змінюються або зникають, а сервіси «прочитати пізніше» закриваються, переходять до інших власників або починають брати гроші за експорт. Збережена нотатка – це сам текст, у форматі без постачальника й без строку придатності, і лежить він там, де вирішили ви.

  • Довговічний відкритий формат: звичайний текст із YAML-frontmatter, який читає будь-який редактор і grep
  • Без акаунта: текст і заголовок сторінки не залишають ваш браузер, а збережене лежить на вашому диску
  • Дата публікації й адреса джерела зберігаються разом із текстом, тож нотатку можна впізнати й через роки
Докладніше
Читання без шумуРежим читання без меню, банерів і символів Markdown – у світлій чи темній темі вашого браузера.

Обв’язка сторінки – це не лише візуальний безлад: це текст, який читалка з екрана озвучує, а читач мусить пропускати на кожній сторінці. Вікно збереження показує саму статтю, у світлій або темній темі вашого браузера, і жоден скрипт сторінки в ньому не виконується.

  • Режим читання малює результат як звичайний текст – без символів Markdown, з робочими посиланнями й справжніми заголовками
  • Вікно слухається світлої чи темної теми вашого браузера, а не теми сайту
  • Для довгої статті вікно розгортається приблизно на три чверті екрана
Докладніше
Додати в Chrome – безкоштовноБезкоштовно повністю, без акаунта й обмежень. Видобування працює офлайн; події використання йдуть, коли ви онлайн, і один перемикач їх зупиняє.For Chrome on a computer

Питання

У яких браузерах воно працює?
Chrome та інші браузери на Chromium: Edge, Brave, Vivaldi, Opera. Це розширення Manifest V3, і єдина адреса, до якої воно може звертатися, – наша власна адреса статистики, ніколи не сайти, які ви читаєте.
Чи це безкоштовно?
Так – повністю. Кожна можливість, описана на цьому сайті, працює в безкоштовному розширенні: збереження без ліміту сторінок, vault Obsidian, правила за сайтами, виноски, таблиці, мітки мови в коді й режим читання. Інтерфейс – 19 мовами, за налаштуванням вашого браузера. Ні платної версії, ні акаунта, ні реєстрації.
Чи має Obsidian бути запущений, щоб зберегти у vault?
Ні. Clean Web Clipper записує файл просто в теку, до якої ви дали доступ, через браузерний File System Access API. Obsidian підхопить файл, коли наступного разу зазирне у vault.
Що буде на сторінці, яка не є статтею?
Розширення так і скаже. На вітринах, у стрічках і в результатах пошуку видобувати нічого, і збереження позначається як «немає статті» – замість сторінки, повної посилань.
Чи надсилає Clean Web Clipper мої сторінки кудись?
Ваші сторінки – ні. Видобування й конвертація відбуваються цілком усередині вашого браузера: копія йде в буфер обміну, файл – на ваш диск, і жоден текст чи заголовок сторінки не залишає комп’ютер. Але чотири речі йдуть на наш власний сервер статистики: адреса сторінки, де статті не знайшлося, лише домен успішного збереження, назва екрана розширення, який ви відкрили, і випадковий номер установлення, що пов’язує ці події. Сервер також записує приблизне розташування за IP-адресою – країну, регіон і місто; сама адреса не зберігається. Нічого з цього не потрапляє до третіх сторін, а один перемикач у налаштуваннях зупиняє все й стирає номер. Розширення не просить жодного дозволу на сайтах, які ви читаєте, тож не може зазирнути на сторінку, на якій ви не натиснули іконку.