Расширение для Chrome
Страница в Markdown, который не надо доводить руками
Нажали иконку – клип уже есть: заголовок, автор, дата публикации и адрес источника собраны во фронтматтер, текст очищен от навигации. Всё происходит внутри браузера: без аккаунта, и ничего из склипанного никуда не загружается.

Проблема никогда не в конвертации. Проблема в том, что едет вместе с ней.
Любой клиппер превращает HTML в Markdown. Потом открываешь заметку, а там плашка про куки, боковое меню, список «Читайте также» и таблица, рассыпавшаяся по дороге. Clean Clipper построен вокруг того, чтобы это убрать, и убирание замерено, а не заявлено.
что оставляют другие
[К содержанию](#main) [Войти](/login) [Регистрация](/register) [Главная](/) [Новости](/news) [Спорт](/sport) [Культура](/culture) [Ещё](/more) Мы используем куки и похожие технологии, чтобы улучшить ваш опыт. [Принять все] [Настроить] # Статья, за которой вы пришли Настоящий первый абзац текста. <div class="promo-inline"> ## Читайте также [Другой заголовок](/a) [Ещё один заголовок](/b) [И третий](/c)
что попадает в заметку
# Статья, за которой вы пришли Настоящий первый абзац текста.
Что делает вывод чистым
- Код сохраняет язык. Забор выходит с меткой
js, а не голый – подсветка работает сразу после вставки. - Таблицы не рассыпаются. Ячейка с кодом или списком больше не рвёт строку.
- Сноски работают. Ссылки-примечания превращаются в
[^1]с определениями в конце заметки, а не в мёртвые якоря. - Дата читается, а не угадывается. JSON-LD,
article:published_time,citation_date(стандарт arXiv, PubMed, IEEE),time[datetime], Unix-метки. Нет даты на странице – поле пустое, а не сегодняшнее число. - Меню, баннеры и «читайте также» срезаются. Полосы логотипов, пагинаторы и навигация, повторённая в каждой секции, в заметку не попадают.
- Ни одного остатка разметки. Никаких
divиtableпосреди текста.
---
title: "Цепь Маркова – Википедия"
source: "https://ru.wikipedia.org/wiki/Марковская_цепь"
date: "2005-11-26T18:27:29.000Z"
extraction: "dom"
---
Цепь Маркова – последовательность случайных событий с конечным или счётным
числом исходов, где вероятность каждого события зависит только от состояния,
достигнутого в предыдущем событии.[^1]
[^1]: Марков А. А. Распространение закона больших чисел на величины,
зависящие друг от друга. – Известия Физико-математического общества, 1906.Замерено на 512 страницах самых посещаемых сайтов
Два прогона. Первый – 109 страниц из сотни самых посещаемых сайтов мира и Рунета, с сравнением против трёх других движков извлечения. Второй – топ-50 сайтов в каждой из двенадцати европейских стран, ещё 403 страницы, каждая снята на языке своей страны.
Куда сохраняет
- Скопировать Markdown в буфер обмена
- Скачать файл
.md - Записать в выбранную папку на диске
- Записать прямо в vault Obsidian – без плагина, без локального REST API, без URI-схемы; файл просто появляется
Действие по клику настраивается. Можно оставить окно с превью, а можно сделать так, чтобы один клик клал заметку в vault и не открывал ничего.

Честно про источник
Каждая заметка помечена полем extraction. dom – текст взят из того, что браузер действительно отрисовал. jsonld-articlebody – страница не дорендерилась, и тело пришлось взять из её же структурированных данных. А если статьи на странице нет вовсе – витрина, лента, поиск – расширение так и скажет, вместо простыни из трёхсот ссылок.
Пятнадцать способов это использовать
РазработчикамЗаборы кода выходят с меткой языка – подсветка работает сразу после вставки.
Clean Clipper читает язык на самой странице – из класса забора, из родительского элемента, из разметки, которую оставил подсветчик сайта, – и вписывает его в забор. На техническом корпусе из девяти страниц метка пережила клип в 73 заборах из 156, против 20 и 0 у двух сравниваемых движков. Остальная страница приходит обычным Markdown, без бокового меню.
- Забор выходит как ```js, а не голый – подсветка в Obsidian, VS Code и на GitHub работает сразу после вставки
- Язык читается со страницы – класс забора, родительский элемент, разметка подсветчика – и никогда не угадывается по коду
- Таблица параметров с кодом в ячейке сохраняет строки, а не схлопывается
Пользователям ObsidianВыбираете папку внутри vault – клик кладёт заметку туда, и Obsidian может быть закрыт.
Расширение само пишет файл .md в папку, к которой вы один раз дали доступ. Ни плагина сообщества, ни локального сервера, ни ссылок obsidian://, которые надо поддерживать в рабочем состоянии. Заметка просто оказывается на месте, когда вы в следующий раз откроете vault.
- Без плагина, без локального сервера, без ссылок
obsidian:// - Obsidian не обязан быть открыт – файл появляется в папке, индекс подхватит его позже
- YAML-фронтматтер с полями title, source, author, published и extraction, и вы решаете, какие оставить
Работа с ИИ и LLMПовторённая навигация – потраченный контекст. Она убирается до того, как текст дойдёт до модели.
Когда веб-страница уходит в модель как есть, каждая продублированная строка меню и каждая плашка тарифицируются как контекст и отвлекают внимание от текста, ради которого всё затевалось. На корпусе из 109 страниц Clean Clipper оставил 102 повтора навигации там, где три других движка оставили 282, 478 и 491. Заодно фронтматтер прямо отдаёт адрес источника и дату публикации.
- Вчетверо меньше повторов навигации, чем в среднем у сравниваемых движков
- Ни одного остатка HTML на 512 замеренных страницах – модели не приходится обходить случайную разметку
- Фронтматтер прямо называет адрес источника и дату публикации, вместо того чтобы оставлять их на угадывание
ИсследователямДата читается из метаданных, включая `citation_date` – стандарт arXiv, PubMed и IEEE.
Статья, сохранённая без даты публикации, превращается в ссылку, которую придётся восстанавливать. Расширение берёт дату из метаданных страницы, а не выискивает её в тексте, и оставляет поле пустым, когда страница даты не несёт. Ссылки-примечания при этом становятся обычными сносками Markdown, собранными в конце файла.
- Читает
citation_dateиcitation_publication_date– метатеги, которые отдают arXiv, PubMed, eLibrary и IEEE - Читает также
datePublishedиз JSON-LD,article:published_time,time[datetime]и Unix-метки - Нет даты на странице – поле пустое, а не сегодняшнее число
СтудентамЛекции, главы и справочные страницы становятся файлами Markdown, которые остаются у вас.
Учебные материалы закрываются вместе с семестром, а ссылки протухают; файл Markdown на вашем диске – нет. Клип берёт текст, адрес источника и дату публикации и открывается в любом редакторе, с сетью и без неё. Всё, что здесь описано, бесплатно и не требует аккаунта.
- Выделили кусок – склипается только выделение, удобно для определения или условия задачи
- В каждой заметке лежит адрес источника, поэтому сослаться потом можно не ища заново
- Файлы открываются офлайн: Obsidian, Logseq, Joplin или простой текстовый редактор
ПишущимВ каждом клипе остаются адрес источника, автор и дата – атрибуция не теряется.
Материал, собранный из скриншотов и закладок, перестаёт работать ровно в тот момент, когда его надо атрибутировать. Файл Markdown с фронтматтером держит заголовок, автора, дату публикации и адрес внутри себя. Он остаётся читаемым и находимым через годы, не завися ни от какого сервиса.
- Заголовок, автор, дата публикации и адрес источника – во фронтматтере каждого файла
- Автор ищется в структурированных данных и подписях, ложные срабатывания отсеиваются
- Тело статьи без навигации и рекламных блоков – готовое к цитированию
ЖурналистамСтраница остаётся такой, какой вы её читали, – с датой публикации и адресом.
Страницы переписывают, правят и снимают, чаще всего никак это не помечая. Клип, в котором лежат адрес источника, дата публикации и полный текст, – это след, который можно предъявить позже. Он живёт на вашем диске, в Markdown, а не в сервисе, который может закрыться.
- Дата публикации читается из метаданных страницы, а не выискивается в тексте
- Адрес источника – во фронтматтере каждой заметки, вместе с заголовком, каким он был
- Полный текст статьи, без навигации и промоблоков, которые меняются от захода к заходу
Юридическая работаТекст так, как он опубликован, с адресом и датой – в файле, который принадлежит вам.
Регламенты, оферты и пользовательские соглашения меняются без предупреждения и без видимой истории. Копия в Markdown, несущая адрес и дату той редакции, – это след того, что текст говорил в день, когда вы его читали. По дороге ничего не пересказывается и не переформулируется.
- Текст дословно – расширение не пересказывает, не переписывает и не переставляет местами
- Адрес источника и дата публикации во фронтматтере, прямо над текстом
- Таблицы ставок, сроков и порогов переживают конвертацию целыми
АналитикамСериализатор таблиц свой: ячейка со списком или кодом больше не рвёт строку.
Общие конвертеры HTML в Markdown ломаются ровно на тех таблицах, ради которых всё и делается, – там, где в ячейке список, ссылка или кусок кода. Расширение пишет таблицу само и сплющивает содержимое ячейки вместо того, чтобы потерять строку. На корпусе из пятнадцати таблиц целыми доехали двенадцать против семи у каждого из сравниваемых движков.
- Свой сериализатор таблиц GFM, а не универсальный плагин к конвертеру
- Двенадцать таблиц из пятнадцати на техническом корпусе против семи у каждого из сравниваемых движков
- Ячейка со списком, ссылкой или кодом аккуратно сплющивается, а не рвёт строку
ПреподавателямМатериал со страницы без обвязки сайта: сохранить источник, распечатать или разослать.
Страница с заданием, статьёй или разбором превращается в текст, который можно раздать: без меню, баннеров и блоков «Читайте также». Адрес источника и дата публикации остаются во фронтматтере, поэтому ссылку на первоисточник видно и через год.
- Обвязка сайта срезается: остаются заголовки, текст, списки и таблицы
- Адрес источника и дата публикации остаются во фронтматтере – первоисточник виден и через год
- Выделение работает точечно: можно взять только условие задачи или только один раздел
ПереводчикамНавигация, плашки и повторённые меню не доезжают до списка сегментов.
Исходник, вставленный из веб-страницы, тащит за собой всю обвязку, и каждый пункт меню становится сегментом, который надо пропустить. Убрать это до импорта быстрее, чем отфильтровать после. На замеренном корпусе повторы строк меню падают до 102 против 282, 478 и 491 у трёх других движков.
- Меню, пагинаторы, плашки и ленты «Читайте также» срезаются до экспорта
- Повторов навигации примерно вчетверо меньше, чем у сравниваемых движков
- Простой Markdown, который умеют импортировать все крупные CAT-инструменты
Продакт-менеджерамСписки изменений, документация и релиз-ноты становятся датированными заметками с поиском.
Наблюдение за рынком, сложенное в закладки, вырождается в список ссылок, по которому нельзя искать. Склипанное в Markdown, оно превращается в корпус, где можно искать, сравнивать и на который можно сослаться в документе решения. Каждая запись держит ту дату, которую заявляла страница, а не день, когда вы её прочли.
- Дата публикации читается со страницы, поэтому у записи из списка изменений остаётся настоящий календарь
- Правила по сайтам раскладывают каждого конкурента в свою подпапку
- Таблицы тарифов, лимитов и совместимости доезжают целыми
Техническим писателямСтруктура, заборы кода и таблицы доезжают. Обвязка сайта – нет.
Перенос документации обычно состоит из конвертации HTML, а потом из ещё более долгой уборки того, что конвертер оставил. Именно эта уборка здесь и построена, и замерена: ноль остатков HTML на 512 страницах корпуса и 102 повтора строк меню против 282, 478 и 491 у сравниваемых движков.
- Заголовки, списки, таблицы, заборы кода и сноски становятся стандартным Markdown
- Метки языка на заборах сохраняются – 73 забора из 156 против 20 и 0 у сравниваемых движков
- Ноль остатков HTML на 512 замеренных страницах
Личный архивОбычные файлы Markdown на вашем диске: ни аккаунта, ни сервиса, которому есть что закрыть.
Закладка ведёт на страницу, которая меняется или пропадает; клип – это сам текст. Формат – простой текст с YAML-фронтматтером, без владельца и без срока годности, лежащий там, где вы решили. После того как файл записан, от расширения не зависит уже ничего.
- Открытый и долговечный формат – простой текст с YAML-фронтматтером
- Ни аккаунта, ни загрузки: склипанный текст остаётся у вас
- Дата публикации и адрес источника сохраняются вместе с текстом
Чтение без шумаПросмотр показывает текст без меню, плашек и спецсимволов Markdown.
Обвязка страницы – это не только визуальный шум: это текст, который экранный диктор обязан произнести, а читатель – пропустить. Окно клипа показывает одну статью, в светлой или тёмной теме браузера, и ни один скрипт страницы в нём не выполняется. Сохранённый файл – простой текст, который читает любой вспомогательный инструмент.
- Человеческий просмотр показывает клип обычным текстом, без спецсимволов Markdown
- Окно следует светлой или тёмной теме браузера, без отдельной настройки
- Кнопка разворота открывает клип на три четверти экрана, страница остаётся видна позади