Clean Web Clipper Установить – бесплатно

Как устроено · ·

Как Clean Web Clipper извлекает статью в Markdown и где останавливается

Clean Web Clipper извлекает статью из открытой страницы и переводит её в Markdown целиком внутри браузера: конвейер извлечения к серверу не обращается, а единственный адрес, с которым связывается расширение, – наш сервер статистики. Ниже по четырём шагам – как Clean Web Clipper извлекает статью: поиск статьи, срез обвязки, конвертация и отказ «статьи нет» там, где её на странице нет.

Как расширение находит статью на странице?

Сначала расширение ищет привычные контейнеры, в которых обычно лежит статья. Если такого контейнера нет – а на множестве настоящих сайтов его нет, – в ход идёт замер плотности текста: в каком блоке больше всего абзацев, не спрятанных внутрь ссылок. Побеждает самый узкий блок, в котором всё ещё лежит почти весь этот текст.

Блок, где текст состоит в основном из подписей к ссылкам, – это меню или лента, а не статья, и он отбрасывается. Исключение – если в нём больше примерно 1200 символов настоящего текста: длинные статьи законно содержат много ссылок.

Режим «Просмотр» в окне Clean Web Clipper: статья Википедии «Архивирование веб-сайтов», 5 037 слов, 91 сноска и пометка «статья найдена»
Окно Clean Web Clipper в тёмной теме: страница MDN о String.prototype.replace() в Markdown – таблица аргументов строками Markdown и забор кода с меткой js
Отказ Clean Web Clipper на ленте news.ycombinator.com: «Эту страницу я пока не разбираю» и кнопка «Этот сайт мне нужен»
Установить – бесплатноБесплатно, без аккаунта · проверено на 512 страницах в августе 2026, 0 падений ·разбор работает офлайн, статистику останавливает один переключатель в настройках.Для Chrome на компьютере

Срезать меню, баннеры и повторы строк

Дальше уходят известные не-содержательные элементы: навигация, баннеры, панели «поделиться», плашки про куки, пагинаторы, ленты «читайте также» и полосы логотипов. Повторяющиеся строки удаляются: навигация, продублированная в каждой секции, – главный источник шума в склипанной странице: в замере 30 августа 2026 года на 109 страницах у Clean Web Clipper 102 повтора строк меню против 282–491 у трёх других движков.

что оставляют другие

[К содержанию](#main) [Войти](/login) [Регистрация](/register)
[Главная](/) [Новости](/news) [Спорт](/sport) [Культура](/culture) [Ещё](/more)

Мы используем куки и похожие технологии, чтобы улучшить ваш опыт.
[Принять все] [Настроить]

# Статья, за которой вы пришли

Настоящий первый абзац текста.

<div class="promo-inline">

## Читайте также
[Другой заголовок](/a) [Ещё один заголовок](/b) [И третий](/c)

что попадает в заметку

# Статья, за которой вы пришли

Настоящий первый абзац текста.
Та же новостная страница: что оставляет обычный клиппер и что сохраняет Clean Web Clipper

Перевести таблицы, код и сноски в Markdown

Таблицы расширение сериализует само, а не общим плагином: универсальные конвертеры ломаются на ячейке со списком или блоком кода. Заборы кода берут язык из разметки самой страницы. Ссылки-примечания собираются в сноски Markdown до того, как санитайзер срежет идентификаторы, на которые они опираются, – порядок здесь важен, и ошибка в нём молча теряет все сноски. Как это сказалось на таблицах, датах и повторах строк по четырём движкам, – на странице замера.

Где извлечение останавливается?

На витрине, в ленте или в результатах поиска статьи нет. Расширение проверяет готовый Markdown: если больше четверти его сидит внутри подписей к ссылкам, оно отвечает «статьи нет», а не выдаёт триста ссылок. Этот отказ сделан намеренно, и из-за него счётчики символов здесь ниже, чем у инструментов, которые всегда что-то возвращают.

Если отказ случился на настоящей статье, это ошибка: как прислать адрес такой страницы, и такие чинятся первыми.

Чего Clean Web Clipper не делает?

Узнать ответы на частые вопросы

Сколько занимает один клип?
От открытия окна до готового Markdown – 90–820 мс: так вышло в прогоне 12 сентября 2026 года на 17 живых страницах, из них 13 статей. Дольше всего – длинная ветка Stack Overflow на 86 тысяч знаков. Время показано в углу окна клипа.
Работает ли на одностраничных приложениях?
Да. DOM читается после отрисовки, поэтому документация, собранная на JavaScript, снимается такой, какой вы её видите.
Что такое режим извлечения jsonld-articlebody?
Некоторые страницы отдают текст статьи в структурированных данных, но так и не дорисовывают его. Если в структурированных данных текста заметно больше, чем в DOM, расширение берёт его оттуда и записывает, что так и сделало.
Установить – бесплатноБесплатно, без аккаунта · проверено на 512 страницах в августе 2026, 0 падений ·разбор работает офлайн, статистику останавливает один переключатель в настройках.Для Chrome на компьютере