Кому это
Хватит платить за одно меню сорок раз
Когда веб-страница уходит в модель как есть, каждая продублированная строка меню и каждая плашка тарифицируются как контекст и отвлекают внимание от текста, ради которого всё затевалось. На корпусе из 109 страниц Clean Clipper оставил 102 повтора навигации там, где три других движка оставили 282, 478 и 491. Заодно фронтматтер прямо отдаёт адрес источника и дату публикации.
Во что обходится вставленная страница
Страница, вставленная в чат целиком, приносит с собой всё, что её окружало. Главное меню, повторённое в каждой секции, плашка про куки, список «Читайте также», подвал с тридцатью юридическими ссылками – это контекст, за который вы платите и который модель обязана разобрать прежде, чем взяться за дело. На длинном документе этой доли хватает, чтобы вытолкнуть за окно половину текста, который был важен.
Дальше это видно по ответам. Модель цитирует пункт меню так, будто это заголовок раздела, путает две статьи, потому что «Читайте также» приклеил чужие заголовки к тексту, или ставит документу дату из подвала. Дать вместо текста ссылку не спасает: многие модели до страницы не достучатся, а те, что достучатся, часто получат версию для бота, а не ту, что читали вы.
Отдельная история начинается, когда в один разговор кладут не одну страницу, а пять. Обычное копирование из браузера сплющивает документ: уровни заголовков пропадают, и пять источников сливаются в одну простыню без швов. Модель перестаёт отличать, где кончился первый документ и начался третий, и в ответе появляются утверждения, собранные из двух разных статей.
Что получает модель
- Вчетверо меньше повторов навигации, чем в среднем у сравниваемых движков
- Ни одного остатка HTML на 512 замеренных страницах – модели не приходится обходить случайную разметку
- Фронтматтер прямо называет адрес источника и дату публикации, вместо того чтобы оставлять их на угадывание
- Одна горячая клавиша копирует страницу в Markdown, готовый к вставке в любой чат
- Картинки отключаются настройкой – из текста уходит ещё пачка бесполезных ссылок
- На странице без статьи – витрина, лента, поиск – расширение так и скажет вместо трёхсот ссылок
- Заголовки приходят уровнями
#,##,###– модель видит структуру документа, а не плоский текст - Строки, повторяющиеся по странице, схлопываются: одно и то же меню не приезжает по разу на каждую секцию
--- title: "Налоговый вычет за обучение" source: "https://www.gosuslugi.ru/help/faq/nalogovye_vychety" extraction: "dom" --- Вычет можно заявить и за своё обучение, и за обучение детей до 24 лет, если они учатся очно. ## Какие документы понадобятся
Как готовить страницу для модели
Настройка занимает минуту и после неё повторяется одно движение: горячая клавиша, потом вставка в чат. Смысл в том, чтобы решение «что выкинуть» принималось один раз в настройках, а не на каждой странице.
- В настройках, в разделе «Клик по иконке», выберите «Скопировать Markdown». Дальше Alt+Shift+M кладёт готовый текст в буфер, а окно не открывается вовсе – на длинной статье это заметная разница по времени.
- В разделе «Что попадает в заметку» переключите картинки в режим «пропускать». Модель по ссылке изображение всё равно не откроет, а каждая такая ссылка занимает место в контексте наравне с текстом.
- Там же откройте «Свойства» и оставьте
title,sourceиpublished. Три строки в начале файла дают модели атрибуцию сразу и снимают вопрос «откуда это» – гадать по домену в середине текста ей не придётся. - Если чат у вас всегда один и тот же, включите кнопку «В AI-чат» в разделе «Кнопки в окне клипа». Она копирует текст и открывает вкладку чата одним движением; сам текст расширение никуда не отправляет.
- На статье нажмите Alt+Shift+M и вставьте текст в чат. Первые строки вставленного – фронтматтер с адресом и датой: по ним сразу видно, что уехало не полстраницы и не витрина вместо статьи.
- Когда источников в разговоре несколько, сохраняйте их в папку и прикладывайте файлами, а не вставляйте подряд. Имя файла тогда работает границей между документами, и модель не склеивает два источника в один.
Готовые настройки под работу с моделями
Эти значения оптимизируют одно – долю полезного текста в том, что уходит в контекст. Всё, что нельзя ни прочитать, ни процитировать, здесь выключено.
| Настройка | Значение | Почему именно так |
|---|---|---|
| Клик по иконке | Скопировать Markdown | путь до чата и так короткий, окно превью на нём лишний шаг |
| Картинки | пропускать | ссылку на изображение модель не откроет, а место в контексте она занимает как обычный текст |
| Свойства | `title`, `source`, `published` | атрибуция в первых строках стоит десяток токенов и снимает целый класс ошибок в ответах |
| Сноски | выносить в конец заметки | номер посреди фразы разрывает предложение, на котором модель строит ответ; в конце они ей не мешают |
| Срезать навигацию | включено | это и есть тот самый выигрыш: 102 повтора строк меню против 282, 478 и 491 у сравниваемых движков |
| Кнопка «В AI-чат» | включена | копирование и открытие вкладки одним нажатием – когда чат всегда один и тот же |
| Имя файла | `{domain}-{title}` | если источники прикладываются файлами, имя становится границей между документами |
--- title: "Жизненные ситуации – Госуслуги" source: "https://www.gosuslugi.ru/situation" extraction: "no-article" ---
Три сценария целиком
Разбор длинного регламента
Перед вами страница на сорок тысяч знаков, и нужен ответ на один вопрос: попадает ли ваш случай под исключение из пункта 12. Вставлять её целиком вместе с меню, подвалом и лентой «Читайте также» – значит потратить контекст на то, что к вопросу не относится.
Alt+Shift+M даёт тот же документ без обвязки, с сохранёнными уровнями заголовков. Модель видит, что пункт 12 – это ### внутри раздела ##, и отвечает про него, а не про соседний. Если регламент понадобится ещё раз, тот же файл лежит в папке: переклипать страницу второй раз не нужно.
Пять источников в одном разговоре
Вы собираете сравнение и хотите, чтобы модель работала по пяти конкретным страницам, а не по своим воспоминаниям. Каждую клипаете и сохраняете в папку с именем по шаблону {domain}-{title}, после чего прикладываете пять файлов разом.
У каждого файла в первых строках свой адрес и своя дата публикации, поэтому на просьбу «скажи, где это написано» приходит ссылка на конкретный источник, а не усреднённый пересказ. Пересказывать и сокращать расширение при этом ничего не стало: в файле лежит текст статьи, а выжимка осталась работой модели.
Вопрос по странице, которая открыта под вашим логином
Внутренняя вики, личный кабинет, статья по подписке – до всего этого модель по ссылке не доберётся, а если доберётся, увидит страницу входа. Клип снимает то, что браузер отрисовал уже после вашей авторизации.
Дальше текст идёт в чат через ваш буфер обмена: расширение ничего никуда не отправляет и склипанный текст никуда не загружает. Решение, что именно показывать модели, остаётся вашим и принимается на каждой странице отдельно.
Чем это заменяет привычные способы
Страницу в чат затаскивают пятью способами. Разница между ними – не в удобстве, а в том, сколько мусора приезжает вместе с текстом и что с ним делает модель.
| Способ | Что получается | Чего стоит |
|---|---|---|
| Выделить всё и вставить в чат | быстро, ничего не надо ставить | меню, плашки и подвал уезжают в контекст, уровни заголовков теряются |
| Дать модели ссылку | один короткий запрос | многие модели до страницы не дойдут, остальные часто получат версию для бота, а страницу за логином – никто |
| Печать в PDF и приложить файлом | страница целиком, как на экране | колонтитулы и разрывы страниц попадают в текст, а таблица разъезжается по двум листам |
| Другое расширение-клиппер | текст без части обвязки | на том же корпусе из 109 страниц у сравниваемых движков осталось 282, 478 и 491 повторённых строк меню против наших 102 |
| Пересказать своими словами | коротко и по делу | модель работает с вашим пересказом, а не с источником, – и цитировать ей нечего |
| Clean Clipper | текст статьи в Markdown, с адресом и датой в первых строках | одна страница за раз; выжимку и подсчёт токенов он на себя не берёт |
Если модель отвечает не о том
Почему модель цитирует пункт меню как заголовок раздела?
Значит, меню доехало до контекста. Проверьте, что в настройках включено «Срезать навигацию, пагинаторы и служебные секции», и посмотрите на начало вставленного текста: если там «Главная», «Войти», «Все разделы», в чат уехала не та часть страницы.
Обратите внимание и на выделение: то, что вы выделили сами, срезке не подвергается вовсе – расширение считает, что человек выбрал осознанно. Выделяйте текст статьи, а не всё подряд с шапкой.
Почему вместо статьи пришла одна шапка с адресом?
Так выглядит честный отказ. Если тела статьи на странице не нашлось или больше четверти текста приходится на подписи ссылок, расширение отдаёт фронтматтер и ставит в поле extraction значение no-article. Витрины, ленты и страницы поиска попадают под это правило постоянно – и отдать вместо них триста ссылок было бы хуже. Клипайте страницу самого материала.
Почему текста меньше, чем на странице?
Чаще всего страница догружает текст по мере прокрутки, а склипано то, что было отрисовано в момент нажатия. Долистайте до конца и склипайте заново – кнопка «Склипать заново» есть прямо в окне.
Второй случай – поле extraction со значением jsonld-articlebody. Это означает, что в структурированных данных страницы лежало тело статьи заметно длиннее видимого, и взято было оно. Тогда текста, наоборот, обычно больше, а не меньше.
Почему в тексте остались ссылки на картинки?
Потому что режим картинок по умолчанию – «оставлять ссылками». Переключите его на «пропускать»: тогда из вывода убираются и сами изображения, и разметка вида , которая приезжает из вложенных примеров кода на странице. В контексте после этого не остаётся ни одной ссылки на изображение.
Чего он не делает
Он не пересказывает и не переписывает: текст статьи конвертируется, а не правится, – выжимка остаётся работой модели. Он ничего не отправляет в сервисы ИИ сам: текст идёт через ваш буфер обмена, а сам текст никуда не загружается. Он не считает токены и не режет текст на фрагменты за вас. И он не достаёт страницу, которую вы не открыли: краулера и пакетной обработки здесь нет.
Вопросы
Почему не вставить просто адрес и не дать модели открыть его самой?
Отправляет ли расширение что-нибудь в сервис ИИ?
Сколько контекста это экономит?
Можно ли выкинуть картинки, чтобы сэкономить контекст?
Поймёт ли модель, откуда взят текст?
Что делать со страницей, которая догружает текст при прокрутке?
Как отдать модели только один раздел длинной страницы?
Сохраняется ли структура заголовков?
#, ## и ###, как они стоят в теле статьи. Пустые заголовки – частый след навигационных блоков – при этом удаляются, чтобы модель не принимала их за начало нового раздела.