Розширення для Chrome
Зберегти вебсторінку в Markdown, який не треба вичищати
Щоб зберегти вебсторінку в Markdown, досить натиснути іконку: заголовок, автор, дата публікації та адреса джерела вже зібрані у frontmatter, а текст – без навігації. Усе відбувається у вашому браузері: без акаунта, без сервера, без телеметрії.

Проблема ніколи не в конвертації. Проблема в тому, що приїжджає разом із нею.
Перетворити HTML на Markdown вміє будь-яке розширення. А потім ви відкриваєте нотатку – і бачите там банер про cookie, бічне меню, список «читайте також» і таблицю, що розсипалася дорогою. Clean Clipper побудований саме навколо того, щоб це прибирати, і прибирання тут не заявлене, а виміряне.
що лишають інші розширення
[До змісту](#main) [Увійти](/login) [Зареєструватися](/register) [Головна](/) [Новини](/news) [Спорт](/sport) [Культура](/culture) [Ще](/more) Ми використовуємо файли cookie та подібні технології, щоб покращити ваш досвід. [Прийняти всі] [Налаштувати] # Стаття, по яку ви прийшли Справжній перший абзац тексту. <div class="promo-inline"> ## Читайте також [Інший заголовок](/a) [Ще один заголовок](/b) [І третій](/c)
що потрапляє в нотатку
# Стаття, по яку ви прийшли Справжній перший абзац тексту.
Що робить результат чистим
- Код зберігає мову. Блок виходить із міткою
js, а не голий, тому підсвічування працює одразу після вставляння. - Таблиці лишаються цілими. Комірка з кодом або списком більше не розриває рядок.
- Виноски справді працюють. Посилання-примітки стають
[^1]з визначеннями в кінці нотатки, а не мертвими якорями. - Дату читають, а не вгадують. JSON-LD,
article:published_time,citation_date(стандарт arXiv, PubMed, IEEE),time[datetime], мітки Unix. Якщо дати на сторінці немає – поле лишиться порожнім, а не сьогоднішнім числом. - Меню, банери й «читайте також» зрізаються. Смуги логотипів, пагінатори та навігація, повторена в кожній секції, до нотатки не доходять.
- Жодного вцілілого тега. Ніяких
divчиtableпосеред вашого тексту.
---
title: "Ланцюг Маркова – Вікіпедія"
source: "https://uk.wikipedia.org/wiki/Ланцюг_Маркова"
date: "2006-03-11T09:42:18.000Z"
extraction: "dom"
---
Ланцюг Маркова – послідовність випадкових подій зі скінченною або зліченною
кількістю результатів, у якій імовірність кожної події залежить лише від стану,
досягнутого в попередній події.[^1]
[^1]: Марков А. А. Поширення закону великих чисел на величини, що залежать
одна від одної. – Доповідь Казанському фізико-математичному товариству, 1906.Виміряно на 512 сторінках найвідвідуваніших сайтів світу
Два прогони. Перший узяв 109 сторінок зі ста найвідвідуваніших сайтів світу та Росії і порівняв результат із трьома іншими рушіями видобування. Другий узяв по п’ятдесят найвідвідуваніших сайтів у кожній із дванадцяти європейських країн – ще 403 сторінки, кожну знято мовою своєї країни.
Куди зберігає
- Скопіювати Markdown у буфер обміну
- Завантажити файл
.md - Записати в обрану вами теку на диску
- Записати просто у ваш vault Obsidian – без плагіна, без локального REST API, без URI-схеми; файл просто з’являється
Дія на клік по іконці налаштовується. Можна лишити вікно з переглядом, а можна зробити так, щоб один клік клав нотатку у vault і не відкривав нічого.

Чесно про джерело
Кожна нотатка має поле extraction. dom означає, що текст узято з того, що браузер справді відмалював. jsonld-articlebody – що сторінка так і не дорендерилася і тіло довелося взяти з її ж структурованих даних. А коли статті на сторінці немає взагалі – вітрина, стрічка, результати пошуку – розширення так і каже, замість того щоб вивалити на вас триста посилань.
П’ятнадцять способів це використати
РозробникамБлоки коду зберігають мітку мови, тож вставлений фрагмент підсвічується одразу.
Довідник – це переважно код, і саме його більшість розширень губить дорогою. Clean Clipper зчитує мову з розмітки самої сторінки – з класу огорожі, з батьківського елемента або з розмітки підсвічувача – і записує її в блок. Вставлений фрагмент підсвічується в Obsidian, VS Code і на GitHub без жодної правки руками.
- Блок виходить як ```js, а не голий – підсвічування в Obsidian, VS Code і на GitHub працює одразу після вставляння
- Мову беруть із розмітки сторінки: клас огорожі, батьківський елемент, сліди підсвічувача – розширення не вгадує її з самого коду
- На технічному корпусі мітка мови вціліла в 73 блоках зі 156 – проти 20 і 0 у двох порівнюваних рушіїв
Користувачам ObsidianОберіть теку всередині vault – і один клік покладе нотатку туди. Obsidian запускати не треба.
Щоб зберегти вебсторінку в Markdown просто у vault, Clean Clipper не потребує ані плагіна спільноти, ані локального сервера, ані посилань obsidian://. Ви один раз обираєте теку, браузер запам’ятовує дозвіл – далі файл з’являється сам, навіть коли Obsidian закритий.
- Без плагіна, без локального сервера, без посилань
obsidian://– розширення пише файл саме - Obsidian не мусить бути відкритий: файл просто вже лежить у теці, коли ви туди зазирнете
- YAML-frontmatter із title, source, author, датою та способом видобування – ви самі обираєте, що з цього лишити
Робота з ШІ та LLMПовторена навігація – це витрачений контекст. Він зрізається до того, як текст дійде до моделі.
Коли вебсторінку вставляють у мовну модель, кожен дубльований рядок меню й банер про cookie тарифікуються як контекст і змагаються за увагу моделі. На корпусі зі 109 сторінок Clean Clipper лишив 102 дубльовані рядки навігації там, де три інші рушії лишили 282, 478 і 491.
- Учетверо менше дубльованої навігації, ніж у середньому в порівнюваних рушіїв
- Нуль вцілілих тегів HTML на всіх 512 виміряних сторінках – моделі не доводиться продиратися крізь уламки розмітки
- YAML-frontmatter прямо віддає моделі адресу джерела й дату публікації, тож цитата не втрачає походження
ДослідникамЧитає citation_date – стандарт arXiv, PubMed та IEEE – і виносить примітки в кінець нотатки.
Збережена стаття без дати – це посилання, яке потім доведеться відновлювати руками. Clean Clipper бере дату з метаданих самої сторінки, а не вгадує її з тексту; якщо на сторінці дати немає, поле лишається порожнім, а не заповнюється сьогоднішнім числом.
- Читає
citation_dateіcitation_publication_date– метатеги, які віддають arXiv, PubMed та IEEE - А також JSON-LD
datePublished,article:published_time,time[datetime]і мітки Unix - Порожня дата чесніша за вигадану: якщо сторінка мовчить, поле лишається порожнім
СтудентамЛекції, розділи підручників і довідкові сторінки лягають у файли, які лишаться назавжди.
Матеріали курсу зникають, щойно закінчується семестр, а посилання гниють. Clean Clipper кладе прочитане у звичайні файли Markdown на вашому диску: вони відкриються в будь-якому редакторі й через десять років, без інтернету й без акаунта.
- Виділили уривок – збережеться лише виділене: зручно для означення чи однієї теореми
- У кожній нотатці є адреса джерела, тож послатися на неї в роботі – питання секунди
- Працює з Obsidian, Logseq, Joplin або просто текою з файлами на диску
АвторамКожна нотатка зберігає адресу джерела, автора й дату, тож цитата не втрачає походження.
Матеріал, зібраний знімками екрана й закладками, перестає бути придатним рівно тоді, коли на нього треба послатися. Clean Clipper зберігає сторінку в Markdown разом із автором, датою публікації та адресою, з якої текст узято.
- Заголовок, автор, дата публікації й адреса джерела – у frontmatter кожної нотатки
- Текст статті без навігації та промоблоків: цитату видно, а не вишукуєш серед меню
- Збереження виділеного, коли потрібен один абзац, а не вся сторінка
ЖурналістамЗафіксуйте сторінку такою, якою ви її побачили, разом із датою публікації й адресою.
Сторінки редагують і знімають. Текст, збережений разом з адресою, датою публікації та повним тілом статті, – це запис, на який можна послатися потім, і лежить він на вашому диску, а не в сервісі, який може закритися.
- Дата публікації читається з метаданих сторінки, а не з тексту й не з дня збереження
- Адреса джерела у frontmatter кожної нотатки – посилання не губиться
- Повний текст статті без навігації та промоблоків, які змінюються між відвідинами
Юридична роботаТекст так, як його опубліковано, з адресою джерела й датою, у файлі, яким розпоряджаєтеся ви.
Норми, умови й роз’яснення змінюються без попередження. Копія в Markdown з адресою, звідки її взято, і датою, яку вона несла, – це запис того, що текст говорив у день, коли ви його читали.
- Дослівний текст: розширення нічого не переказує, не переписує й не переставляє місцями
- Адреса джерела й дата публікації – у frontmatter, поруч із текстом, а не в пам’яті
- Таблиці ставок, строків і порогів переживають конвертацію цілими
АналітикамРозширення серіалізує таблиці саме, тож комірка з кодом або списком не розриває рядок.
Універсальні конвертери HTML у Markdown ламаються саме на тих таблицях, які мають значення, – там, де в комірці список, посилання чи фрагмент коду. Clean Clipper пише таблицю сам і сплющує вміст комірки замість того, щоб викидати рядок.
- Власний серіалізатор таблиць GFM замість універсального плагіна
- Дванадцять таблиць із п’ятнадцяти на технічному корпусі – проти семи в кожного порівнюваного рушія
- Комірка зі списком, посиланням або кодом сплющується, а не розриває рядок
ВикладачамЗбережіть матеріал, лишіть джерело, роздрукуйте або покладіть у конспект – без обв’язки сайту.
Сторінка, надрукована просто з браузера, несе на роздатку меню, банер про cookie й рекламу. Clean Clipper лишає текст, заголовки й таблиці, а адресу джерела кладе у frontmatter – щоб було видно, звідки матеріал.
- Кнопка друку друкує збережений текст, а не сторінку з усією її обв’язкою
- Режим читання показує результат без символів Markdown – видно, що отримає клас
- Адреса джерела лишається в нотатці, тож послатися на неї не коштує зусиль
ПерекладачамНавігація, банери й повторені меню не доходять до списку сегментів.
Вихідний текст, вставлений із вебсторінки, тягне за собою навігацію, і кожен пункт меню стає сегментом, який доводиться пропускати. Clean Clipper зрізає обв’язку до імпорту, тож перший сегмент – це вже перше речення статті.
- Меню, пагінатори й стрічки «читайте також» зрізаються ще до експорту
- Дубльованих рядків навігації приблизно вчетверо менше, ніж у порівнюваних рушіїв
- Нуль вцілілих тегів HTML – речення не рветься об уламок розмітки
Продакт-менеджерамСписки змін, документація й нотатки до релізів лягають у датовані нотатки з пошуком.
Конкурентна розвідка, складена в закладки браузера, перетворюється на список посилань, у якому не можна шукати. Збережена в Markdown, вона стає корпусом, який можна грепати, порівнювати й цитувати в документі з рішенням.
- Дата публікації читається зі сторінки, тож запис у списку змін зберігає справжній час
- Правила за сайтами розкладуть кожного конкурента у власну теку
- Таблиці можливостей і обмежень переживають перенесення цілими
Технічним письменникамСтруктура, блоки коду й таблиці переїжджають; обв’язка сайту лишається на сайті.
Перенесення документації зазвичай означає, що ви конвертуєте HTML, а потім довше прибираєте те, що конвертер лишив. Прибирання – це саме те, заради чого зроблено Clean Clipper, і саме те, що виміряно на 512 сторінках.
- Заголовки, списки, таблиці, блоки коду й виноски лягають у стандартний Markdown
- Мітки мови на блоках коду зберігаються: 73 блоки зі 156 проти 20 і 0 у порівнюваних рушіїв
- Нуль вцілілих тегів HTML на всіх 512 виміряних сторінках
Особистий архівЗвичайні файли Markdown на вашому диску. Без акаунта, без сервісу, без нічого, що можна закрити.
Закладки вказують на сторінки, які змінюються або зникають. Збережена нотатка – це сам текст, у форматі без власника й без строку придатності, і лежить він там, де ви вирішили.
- Довговічний відкритий формат – звичайний текст із YAML-frontmatter
- Без акаунта й без сервера: розширення взагалі не робить мережевих запитів
- Дата публікації й адреса джерела зберігаються разом із текстом
Читання без шумуРежим читання показує текст без меню, без банерів і без символів Markdown.
Обв’язка сторінки – це не лише візуальний безлад: це текст, який мусить озвучити читалка з екрана і який доводиться пропускати очима. Вікно збереження показує саму статтю, у світлій або темній темі вашого браузера.
- Режим читання малює результат як звичайний текст, без символів Markdown
- Слухається світлої й темної теми вашого браузера
- Вікно розгортається на три чверті екрана – так читати зручніше