Кому это
Зафиксировать источник до правки
Страницы переписывают, правят и снимают, чаще всего никак это не помечая. Клип, в котором лежат адрес источника, дата публикации и полный текст, – это след, который можно предъявить позже. Он живёт на вашем диске, в Markdown, а не в сервисе, который может закрыться.
Когда страница уже другая
Текст в интернете не документ, а состояние. Заголовок смягчают через час после публикации, абзац исчезает, цитату переформулируют, и ничего из этого не остаётся видимым. Вы ссылаетесь на то, что прочли, вам отвечают, что на странице этого нет, – и вы правы, но доказать это нечем.
Ссылка на внешний архивариус закрывает только часть проблемы. Нужно, чтобы сервис поймал именно ту версию, чтобы он был жив в момент проверки и чтобы он сумел пройти логин или пейволл, из-за которого вы вообще это читали. А пока всё это выясняется, единственная копия, которая действительно нужна, – та, которую вы не сняли.
Отдельно стоит то, что вокруг материала. Ветка обсуждения бывает источником не хуже самой статьи, а исчезает быстрее всех: комментарии подгружаются порциями, ответы сворачиваются в «ещё 42 ответа», а удаление одного сообщения уносит с собой всю ветку под ним. Копировать такое в документ бессмысленно – вложенность теряется, и через неделю нельзя понять, кто кому отвечал.
Что попадает в след
- Дата публикации читается из метаданных страницы, а не выискивается в тексте
- Адрес источника – во фронтматтере каждой заметки, вместе с заголовком, каким он был
- Полный текст статьи, без навигации и промоблоков, которые меняются от захода к заходу
- Поле
extractionфиксирует, как получен текст:domилиjsonld-articlebody - Обычные файлы – ни проприетарного формата, ни аккаунта, ни сервиса, который отзовёт доступ
- На Reddit ветка комментариев сохраняется компактным деревом, вместе со счётом каждого сообщения
- Вложенность ветки передаётся уровнями цитаты – по ним видно, кто кому отвечал, а не просто кто что сказал
- Сколько комментариев вошло в клип, окно говорит числом, а не оставляет считать на глаз
--- title: "Правительство внесло в Госдуму проект бюджета" source: "https://tass.ru/ekonomika/proekt-byudzheta" author: "ТАСС" published: "2024-09-30T07:12:00.000Z" extraction: "dom" --- Внесённый в среду документ задаёт параметры доходов и расходов на следующий год и на плановый период.
Как зафиксировать страницу
Фиксация должна занимать секунды, иначе её не делают. Настройка ниже убирает из пути всё, кроме одного нажатия, а проверку переносит на потом – когда страница уже сохранена.
- В настройках, в разделе «Куда сохранять», выберите папку расследования на диске и впишите подпапку по теме. Разрешение на папку браузер спросит один раз и запомнит.
- Задайте шаблон имени
{date} – {domain} – {title}. Дата берётся из публикации, домен отвечает на вопрос «чья это была страница», и папка читается как хронология темы без открытия единого файла. - В разделе «Клик по иконке» выберите «Положить в папку». Минуты между «надо бы сохранить» и «сохранил» – это ровно то время, за которое заголовок успевают поправить, поэтому окна на этом пути быть не должно.
- Выключите «Если на странице есть выделение – клипать выделение». Фиксируют страницу целиком: вырезанный фрагмент оспорить проще, чем полный текст, и вы не хотите объяснять, почему взяли именно эти три абзаца.
- Открыв материал, дождитесь полной отрисовки и нажмите Alt+Shift+M. На странице обсуждения сначала раскройте свёрнутые ветки: в клип попадает то, что отрисовано, а «ещё 42 ответа» останутся нераскрытыми и в файле.
- Позже откройте файл и проверьте поле
published: оно должно нести дату страницы, а не день вашего клипа. Если поле пустое, страница даты не объявила – это стоит отметить в материале отдельно, а не заполнять по памяти.
Готовые настройки для фиксации источников
Набор рассчитан на скорость и на полноту следа, а не на аккуратность папки. Разбирать проще потом; несохранённую страницу потом не вернуть.
| Настройка | Значение | Почему именно так |
|---|---|---|
| Клик по иконке | Положить в папку | между «надо сохранить» и «сохранил» помещается правка заголовка – окно на этом пути лишнее |
| Имя файла | `{date} – {domain} – {title}` | папка читается как хронология темы, и видно, чья это была страница, без открытия файла |
| Если есть выделение – клипать выделение | выключено | фиксируют страницу целиком: вырезанный фрагмент оспорить проще, чем полный текст |
| Свойства | все пять полей | `extraction` отвечает на вопрос, откуда взят текст, если копию будут разбирать |
| Срезать навигацию | включено | промоблоки меняются от захода к заходу, и в следе от них один шум |
| Картинки | оставлять ссылками | подпись под фотографией часто и есть та деталь, которую при правке убирают первой |
| Подпапка в загрузках | по теме или расследованию | через год у вас будет не одна тема, а поиск по общей куче работает хуже |
--- title: "Параметры проекта бюджета: справка" source: "https://tass.ru/ekonomika/spravka-byudzhet" author: "ТАСС" published: "2024-09-30T07:12:00.000Z" extraction: "jsonld-articlebody" --- | Показатель | 2025 | 2026 | | --- | --- | --- | | Доходы, трлн руб. | 40,3 | 41,8 | | Расходы, трлн руб. | 41,5 | 44,0 | Документ внесён в среду и рассматривается в первом чтении.
Три сценария целиком
Заголовок поправили через час после публикации
Вы прочли новость утром и склипали её сразу, не размышляя, пригодится ли. К обеду заголовок смягчили, а один абзац исчез – на странице об этом ни строчки, потому что помечать правки никто не обязан.
В вашем файле лежит утренняя версия целиком, с адресом и датой публикации. Это не заверенный документ и не осмотр: вес такой копии – вес рабочего файла на вашем диске. Но разговор с редактором она переводит из «мне казалось» в «вот текст, вот адрес, вот время».
Обсуждение как источник
Существенная часть истории лежит не в статье, а в ветке под ней. На Reddit расширение сохраняет обсуждение деревом: вложенность передаётся уровнями цитаты, у каждого сообщения стоит его счёт, а автор поста попадает в поле author, если страница не назвала другого.
Перед клипом раскройте свёрнутые ветки – берётся то, что отрисовано. Сколько комментариев вошло, окно скажет числом. За пределами Reddit комментарии считаются обвязкой страницы и срезаются: это осознанный выбор, а не пропуск.
Материал, до которого у коллег нет доступа
Статья открыта под вашей подпиской или внутри корпоративной системы. Ссылка на неё бесполезна: у второго человека откроется страница входа, а внешний архивариус её и вовсе не увидит.
Клип снимает то, что браузер отрисовал для вас после авторизации. В папку ложится полный текст с адресом и датой – файл, который можно приложить к материалу или показать редактору. Следить за дальнейшими правками этой страницы расширение не станет: переснимать надо самому.
Чем это заменяет привычные способы
Страницу фиксируют пятью способами, и выбирать между ними приходится за секунды. Ниже – что каждый из них на самом деле даёт и чем расплачивается.
| Способ | Что получается | Чего стоит |
|---|---|---|
| Внешний архивный сервис | независимая от вас копия с отметкой времени | нужно, чтобы он поймал именно ту версию, был жив в момент проверки и прошёл логин, – а страницу за подпиской он не увидит |
| Снимок экрана | фиксирует вид страницы целиком | текст не ищется и не цитируется, длинный материал приходится снимать кусками, а подделать снимок проще, чем кажется |
| Скопировать в документ | быстро и без инструментов | дата, адрес и структура теряются, а через месяц непонятно, из какой статьи взят абзац |
| Печать страницы в PDF | сохраняет вёрстку и дату печати | таблицы разъезжаются по листам, текст ищется хуже, а комментарии под материалом обычно не попадают вовсе |
| Сохранить страницу целиком | сохраняется всё, включая оформление | на диске остаётся папка служебных файлов, которую через год не откроет ни один инструмент, кроме браузера |
| Clean Clipper | полный текст с датой публикации и адресом, за секунду | не веб-архив: ни вёрстки, ни скриншота, ни заверенной отметки времени – только датированный файл у вас |
Если след получился неполным
Почему в клипе нет комментариев?
За пределами Reddit – потому что комментарии считаются обвязкой страницы и срезаются вместе с навигацией. На Reddit они сохраняются деревом, но только те, что отрисованы: свёрнутые ветки и непрогруженные порции в файл не попадут. Раскройте их и склипайте заново.
Почему на ленте новостей написано, что статьи нет?
Потому что перед вами лента, а не материал. Когда тела статьи не находится или больше четверти текста приходится на подписи ссылок, расширение отдаёт шапку с адресом и ставит в поле extraction значение no-article.
Для фиксации это как раз нужное поведение: сохранённая лента через день выглядит иначе и следом не является. Клипайте страницу самого материала.
Почему в поле extraction стоит jsonld-articlebody?
Значит, тело статьи взято не из отрисованного HTML, а из структурированных данных страницы: там оказался текст заметно длиннее видимого. Так бывает на сайтах, которые часть материала отдают скриптом. Текста в файле от этого больше, а не меньше, – но при разборе копии разницу стоит держать в виду и называть её прямо.
Почему фотография из материала не сохранилась?
Потому что двоичных файлов расширение не скачивает: в тексте остаётся ссылка на изображение, ведущая на исходный сайт. Если картинка важна для истории – а она бывает важнее абзаца, – сохраните её отдельно обычным «Сохранить изображение» в ту же папку. Вместе с материалом она может исчезнуть в тот же день.
Чего он не делает
Это не веб-архив: сохраняется текст, а не страница в том виде, в каком она показана, – ни вёрстки, ни скриншота, ни сопутствующих файлов. Он не выдаёт заверенную временну́ю отметку, только датированный файл на вашем диске. Он не следит за страницей и не сообщает о правках – переснимать надо самому. И вне Reddit комментарии считаются обвязкой страницы, то есть срезаются.
Вопросы
Заменяет ли это веб-архив?
Сохраняются ли комментарии?
Можно ли записать дату, когда я снял страницу?
{date} – это дата клипа, а дата публикации остаётся отдельным полем фронтматтера.А страница за пейволлом, на который я подписан?
Как понять, откуда взялся текст?
extraction: dom – текст взят из того, что браузер действительно отрисовал; jsonld-articlebody – тело пришлось взять из структурированных данных страницы.