Clean Clipper Установить – бесплатно

Кому это

Хватит платить за одно меню сорок раз

Когда веб-страница уходит в модель как есть, каждая продублированная строка меню и каждая плашка тарифицируются как контекст и отвлекают внимание от текста, ради которого всё затевалось. На корпусе из 109 страниц Clean Clipper оставил 102 повтора навигации там, где три других движка оставили 282, 478 и 491. Заодно фронтматтер прямо отдаёт адрес источника и дату публикации.

Во что обходится вставленная страница

Страница, вставленная в чат целиком, приносит с собой всё, что её окружало. Главное меню, повторённое в каждой секции, плашка про куки, список «Читайте также», подвал с тридцатью юридическими ссылками – это контекст, за который вы платите и который модель обязана разобрать прежде, чем взяться за дело. На длинном документе этой доли хватает, чтобы вытолкнуть за окно половину текста, который был важен.

Дальше это видно по ответам. Модель цитирует пункт меню так, будто это заголовок раздела, путает две статьи, потому что «Читайте также» приклеил чужие заголовки к тексту, или ставит документу дату из подвала. Дать вместо текста ссылку не спасает: многие модели до страницы не достучатся, а те, что достучатся, часто получат версию для бота, а не ту, что читали вы.

Отдельная история начинается, когда в один разговор кладут не одну страницу, а пять. Обычное копирование из браузера сплющивает документ: уровни заголовков пропадают, и пять источников сливаются в одну простыню без швов. Модель перестаёт отличать, где кончился первый документ и начался третий, и в ответе появляются утверждения, собранные из двух разных статей.

Что получает модель

Что остаётся, когда обвязка снятаgosuslugi.ru
---
title: "Налоговый вычет за обучение"
source: "https://www.gosuslugi.ru/help/faq/nalogovye_vychety"
extraction: "dom"
---

Вычет можно заявить и за своё обучение, и за обучение детей до 24 лет,
если они учатся очно.

## Какие документы понадобятся

Как готовить страницу для модели

Настройка занимает минуту и после неё повторяется одно движение: горячая клавиша, потом вставка в чат. Смысл в том, чтобы решение «что выкинуть» принималось один раз в настройках, а не на каждой странице.

  1. В настройках, в разделе «Клик по иконке», выберите «Скопировать Markdown». Дальше Alt+Shift+M кладёт готовый текст в буфер, а окно не открывается вовсе – на длинной статье это заметная разница по времени.
  2. В разделе «Что попадает в заметку» переключите картинки в режим «пропускать». Модель по ссылке изображение всё равно не откроет, а каждая такая ссылка занимает место в контексте наравне с текстом.
  3. Там же откройте «Свойства» и оставьте title, source и published. Три строки в начале файла дают модели атрибуцию сразу и снимают вопрос «откуда это» – гадать по домену в середине текста ей не придётся.
  4. Если чат у вас всегда один и тот же, включите кнопку «В AI-чат» в разделе «Кнопки в окне клипа». Она копирует текст и открывает вкладку чата одним движением; сам текст расширение никуда не отправляет.
  5. На статье нажмите Alt+Shift+M и вставьте текст в чат. Первые строки вставленного – фронтматтер с адресом и датой: по ним сразу видно, что уехало не полстраницы и не витрина вместо статьи.
  6. Когда источников в разговоре несколько, сохраняйте их в папку и прикладывайте файлами, а не вставляйте подряд. Имя файла тогда работает границей между документами, и модель не склеивает два источника в один.

Готовые настройки под работу с моделями

Эти значения оптимизируют одно – долю полезного текста в том, что уходит в контекст. Всё, что нельзя ни прочитать, ни процитировать, здесь выключено.

НастройкаЗначениеПочему именно так
Клик по иконкеСкопировать Markdownпуть до чата и так короткий, окно превью на нём лишний шаг
Картинкипропускатьссылку на изображение модель не откроет, а место в контексте она занимает как обычный текст
Свойства`title`, `source`, `published`атрибуция в первых строках стоит десяток токенов и снимает целый класс ошибок в ответах
Сноскивыносить в конец заметкиномер посреди фразы разрывает предложение, на котором модель строит ответ; в конце они ей не мешают
Срезать навигациювключеноэто и есть тот самый выигрыш: 102 повтора строк меню против 282, 478 и 491 у сравниваемых движков
Кнопка «В AI-чат»включенакопирование и открытие вкладки одним нажатием – когда чат всегда один и тот же
Имя файла`{domain}-{title}`если источники прикладываются файлами, имя становится границей между документами
Сложный случай: витрина вместо статьи – в контекст не уедет ни одной из трёхсот ссылокgosuslugi.ru/situation
---
title: "Жизненные ситуации – Госуслуги"
source: "https://www.gosuslugi.ru/situation"
extraction: "no-article"
---

Три сценария целиком

Разбор длинного регламента

Перед вами страница на сорок тысяч знаков, и нужен ответ на один вопрос: попадает ли ваш случай под исключение из пункта 12. Вставлять её целиком вместе с меню, подвалом и лентой «Читайте также» – значит потратить контекст на то, что к вопросу не относится.

Alt+Shift+M даёт тот же документ без обвязки, с сохранёнными уровнями заголовков. Модель видит, что пункт 12 – это ### внутри раздела ##, и отвечает про него, а не про соседний. Если регламент понадобится ещё раз, тот же файл лежит в папке: переклипать страницу второй раз не нужно.

Пять источников в одном разговоре

Вы собираете сравнение и хотите, чтобы модель работала по пяти конкретным страницам, а не по своим воспоминаниям. Каждую клипаете и сохраняете в папку с именем по шаблону {domain}-{title}, после чего прикладываете пять файлов разом.

У каждого файла в первых строках свой адрес и своя дата публикации, поэтому на просьбу «скажи, где это написано» приходит ссылка на конкретный источник, а не усреднённый пересказ. Пересказывать и сокращать расширение при этом ничего не стало: в файле лежит текст статьи, а выжимка осталась работой модели.

Вопрос по странице, которая открыта под вашим логином

Внутренняя вики, личный кабинет, статья по подписке – до всего этого модель по ссылке не доберётся, а если доберётся, увидит страницу входа. Клип снимает то, что браузер отрисовал уже после вашей авторизации.

Дальше текст идёт в чат через ваш буфер обмена: расширение ничего никуда не отправляет и склипанный текст никуда не загружает. Решение, что именно показывать модели, остаётся вашим и принимается на каждой странице отдельно.

Чем это заменяет привычные способы

Страницу в чат затаскивают пятью способами. Разница между ними – не в удобстве, а в том, сколько мусора приезжает вместе с текстом и что с ним делает модель.

СпособЧто получаетсяЧего стоит
Выделить всё и вставить в чатбыстро, ничего не надо ставитьменю, плашки и подвал уезжают в контекст, уровни заголовков теряются
Дать модели ссылкуодин короткий запросмногие модели до страницы не дойдут, остальные часто получат версию для бота, а страницу за логином – никто
Печать в PDF и приложить файломстраница целиком, как на экранеколонтитулы и разрывы страниц попадают в текст, а таблица разъезжается по двум листам
Другое расширение-клиппертекст без части обвязкина том же корпусе из 109 страниц у сравниваемых движков осталось 282, 478 и 491 повторённых строк меню против наших 102
Пересказать своими словамикоротко и по делумодель работает с вашим пересказом, а не с источником, – и цитировать ей нечего
Clean Clipperтекст статьи в Markdown, с адресом и датой в первых строкаходна страница за раз; выжимку и подсчёт токенов он на себя не берёт

Если модель отвечает не о том

Почему модель цитирует пункт меню как заголовок раздела?

Значит, меню доехало до контекста. Проверьте, что в настройках включено «Срезать навигацию, пагинаторы и служебные секции», и посмотрите на начало вставленного текста: если там «Главная», «Войти», «Все разделы», в чат уехала не та часть страницы.

Обратите внимание и на выделение: то, что вы выделили сами, срезке не подвергается вовсе – расширение считает, что человек выбрал осознанно. Выделяйте текст статьи, а не всё подряд с шапкой.

Почему вместо статьи пришла одна шапка с адресом?

Так выглядит честный отказ. Если тела статьи на странице не нашлось или больше четверти текста приходится на подписи ссылок, расширение отдаёт фронтматтер и ставит в поле extraction значение no-article. Витрины, ленты и страницы поиска попадают под это правило постоянно – и отдать вместо них триста ссылок было бы хуже. Клипайте страницу самого материала.

Почему текста меньше, чем на странице?

Чаще всего страница догружает текст по мере прокрутки, а склипано то, что было отрисовано в момент нажатия. Долистайте до конца и склипайте заново – кнопка «Склипать заново» есть прямо в окне.

Второй случай – поле extraction со значением jsonld-articlebody. Это означает, что в структурированных данных страницы лежало тело статьи заметно длиннее видимого, и взято было оно. Тогда текста, наоборот, обычно больше, а не меньше.

Почему в тексте остались ссылки на картинки?

Потому что режим картинок по умолчанию – «оставлять ссылками». Переключите его на «пропускать»: тогда из вывода убираются и сами изображения, и разметка вида ![](…), которая приезжает из вложенных примеров кода на странице. В контексте после этого не остаётся ни одной ссылки на изображение.

Чего он не делает

Он не пересказывает и не переписывает: текст статьи конвертируется, а не правится, – выжимка остаётся работой модели. Он ничего не отправляет в сервисы ИИ сам: текст идёт через ваш буфер обмена, а сам текст никуда не загружается. Он не считает токены и не режет текст на фрагменты за вас. И он не достаёт страницу, которую вы не открыли: краулера и пакетной обработки здесь нет.

Установить – бесплатноБесплатно целиком, без аккаунта и без ограничений.

Вопросы

Почему не вставить просто адрес и не дать модели открыть его самой?
Потому что многие модели до страницы не достучатся, а те, что достучатся, часто получат версию для бота. Клип фиксирует ровно то, что было на экране, включая страницу за логином, под которым вы уже сидели.
Отправляет ли расширение что-нибудь в сервис ИИ?
Нет. Текст уходит в ваш буфер обмена, а вкладка чата открывается, если вы нажали соответствующую кнопку; само расширение никуда его не отправляет.
Сколько контекста это экономит?
Зависит от страницы, но порядок величины даёт замер: 102 повтора строк меню против 282, 478 и 491 у трёх других движков на одном и том же корпусе из 109 страниц.
Можно ли выкинуть картинки, чтобы сэкономить контекст?
Да. Поставьте картинкам «пропускать», и в Markdown не останется ни одной ссылки на изображение.
Поймёт ли модель, откуда взят текст?
Да, если оставить фронтматтер. В нём открытым текстом лежат заголовок, адрес источника и дата публикации – в самом начале файла.
Что делать со страницей, которая догружает текст при прокрутке?
Долистайте её до конца и только потом клипайте. Берётся то, что отрисовано в момент нажатия: недогруженных абзацев в буфере не окажется, и заметить это по вставленному тексту трудно.
Как отдать модели только один раздел длинной страницы?
Выделите его до нажатия и склипайте выделение. К выделенному расширение не применяет ни срезку навигации, ни отказ «статьи нет» – вы выбрали фрагмент сами, значит, он и уедет целиком.
Сохраняется ли структура заголовков?
Да, уровнями #, ## и ###, как они стоят в теле статьи. Пустые заголовки – частый след навигационных блоков – при этом удаляются, чтобы модель не принимала их за начало нового раздела.
Можно ли склипать пять вкладок разом?
Нет, только по одной. Пакетной обработки и краулера здесь нет: пять источников – это пять нажатий, зато каждый приезжает со своим адресом и своей датой.
Что означает `extraction: "jsonld-articlebody"`?
Что тело статьи взято из структурированных данных страницы, а не из отрисованного HTML. Так происходит, когда в JSON-LD лежит текст заметно длиннее видимого, – обычно на сайтах, которые прячут часть материала за скриптом.