Clean Clipper Установить – бесплатно

Кому это

Статьи, сохранившие настоящую дату

Статья, сохранённая без даты публикации, превращается в ссылку, которую придётся восстанавливать. Расширение берёт дату из метаданных страницы, а не выискивает её в тексте, и оставляет поле пустым, когда страница даты не несёт. Ссылки-примечания при этом становятся обычными сносками Markdown, собранными в конце файла.

Где теряется ссылка

Момент, когда источник становится непригодным, почти всегда один и тот же: его надо атрибутировать. В клипе приблизительный заголовок, адреса нет, а дата – это день, когда вы читали страницу. Вы лезете обратно в браузер искать статью, а она уже переехала или ушла за доступ, которого у вас больше нет. Заметка есть, и она ничего не доказывает.

Второе место разрыва – сноски. Научная статья держится на примечаниях не меньше, чем на основном тексте, а большинство конвертеров превращает их в мёртвые якоря, ведущие на давно закрытую страницу. Номера в тексте остаются, определения пропадают, и понять, на что ссылалось третье примечание, уже нельзя.

Привычный обход – сохранять всё в PDF – переносит проблему на год вперёд. Папка из двухсот файлов ищется плохо: полнотекстовый поиск спотыкается о лигатуры и переносы, из двухколоночной вёрстки абзац копируется вперемешку с соседней колонкой, а метаданных внутри файла обычно нет вовсе. Вы получаете архив, из которого ничего нельзя достать быстрее, чем открыть заново и прочитать.

Что заметка сохраняет

Дата взята из метаданных страницы, а не из текстаcyberleninka.ru
---
title: "Слабые связи и распространение информации в сети"
source: "https://cyberleninka.ru/article/n/slabye-svyazi-i-rasprostranenie-informatsii"
published: "2019-06-03"
extraction: "dom"
---

Слабые связи переносят непропорционально большую долю новой информации,
которая расходится по сети.[^1]

[^1]: Granovetter M. The Strength of Weak Ties // American Journal
      of Sociology. 1973. Vol. 78, № 6.

Как собирать корпус для обзора

Порядок ниже рассчитан на обзор литературы, который вы ведёте не неделю, а полгода. Главное здесь не скорость клипа, а то, чтобы через полгода к каждой выписке нашёлся источник.

  1. В настройках, в разделе «Куда сохранять», выберите папку обзора на диске и впишите шаблон имени файла {date} – {title}. Файлы тогда выстраиваются по дате публикации, и порядок в папке совпадает с хронологией темы, а не с порядком вашего чтения.
  2. В разделе «Что попадает в заметку» откройте «Свойства» и оставьте все пять полей, включая extraction. Когда через полгода возникнет спор о цитате, это первое, на что смотрят: значение dom означает отрисованную страницу, jsonld-articlebody – тело из структурированных данных.
  3. Убедитесь, что «Сноски – выносить в конец заметки» включено. Маркеры в тексте превратятся в [^1], [^2] со сквозной нумерацией с единицы, а определения соберутся под заголовком «Сноски» в конце файла – вместе со списком литературы, который из тела уедет туда же.
  4. Открыв статью, нажмите иконку и посмотрите на свойство published. Пустое поле означает, что даты не нашлось ни в JSON-LD, ни в метатегах вроде citation_date, ни в time[datetime], – и это сигнал искать дату у издателя, а не повод её выдумать.
  5. Если нужен только раздел «Методы» или только выводы, выделите его до нажатия. Выделение приезжает целиком, без срезки, – но помните, что определения сносок остаются за его границей и такие маркеры из текста убираются.
  6. Сохраните файл и держите папку в обычной резервной копии. Дальше это простой текст: полнотекстовый поиск системы и редактора находит цитату по трём словам, а адрес источника лежит во второй строке файла.

Готовые настройки для обзора литературы

Набор рассчитан на долгий проект, где выписка должна пережить смену темы, компьютера и научного руководителя. Всё, что помогает восстановить происхождение цитаты, здесь включено.

НастройкаЗначениеПочему именно так
Имя файла`{date} – {title}`корпус сам сортируется по хронологии темы, а не по порядку вашего чтения
Папка на дискепапка проекта, а не загрузкивыписки должны лежать рядом с текстом обзора и попадать в ту же резервную копию
Свойствавсе пять полей`extraction` объясняет, откуда взят текст, – при спорной цитате это первое, что проверяют
Сноскивыносить в конец заметкинаучный текст держится на примечаниях; в конце они читаются, а посреди абзаца мешают
Картинкиоставлять ссылкамиграфики и формулы на страницах журналов нарисованы картинками, и ссылка хотя бы отмечает их место
Если есть выделение – клипать выделениевключеноиз обзорной статьи чаще нужен один раздел, а не сорок тысяч знаков целиком
Клик по иконкеОткрыть окнодату и автора имеет смысл проверять глазами до сохранения, а не после
Сложный случай: даты на странице нет – строки `published` во фронтматтере просто не появляетсяcyberleninka.ru
---
title: "К вопросу о типологии городских сообществ"
source: "https://cyberleninka.ru/article/n/k-voprosu-o-tipologii"
author: "Иванова Е. А."
extraction: "dom"
---

Рассматриваются подходы к классификации городских сообществ, сложившиеся
в отечественной социологии за последние два десятилетия.

## Сноски

[^1]: Парк Р. Город как социальная лаборатория. – 1929.

Три сценария целиком

Обзор литературы на сорок источников

Вы собираете обзор и за неделю проходите сорок статей в разных базах. Каждую клипаете прямо со страницы, где читаете, – включая те, что открылись через институциональный доступ и по прямой ссылке не откроются ни у кого другого.

В папке проекта сорок файлов, названных по дате публикации и заголовку. Поиск по слову «гетероскедастичность» находит три из них за секунду, и в каждом во второй строке лежит адрес, по которому статья бралась. Библиографическую запись расширение не собирает: ни BibTeX, ни RIS, ни ГОСТ – оформление остаётся за вашим менеджером ссылок.

Статья с датой, которой нет

Страница журнала выглядит аккуратно, но поле published в окне клипа пустое. Это значит, что дату не отдали ни JSON-LD, ни метатеги, ни элемент time – и расширение не стало подставлять сегодняшнее число, потому что молча заведённая неверная дата хуже отсутствующей.

Дальше это ваша развилка: посмотреть выходные данные выпуска, взять дату у издателя или оставить как есть и пометить в тексте обзора. Важно, что развилка видна сразу, а не всплывает на этапе оформления списка литературы, когда до сдачи два дня.

Сноски, понадобившиеся через год

Через год после выписки нужно понять, на что ссылалось третье примечание в статье, которую вы читали. В файле оно на месте: маркер [^3] стоит в тексте, а определение лежит в конце под заголовком «Сноски», уже без служебных стрелок обратных ссылок.

Нумерация в файле сквозная и начинается с единицы независимо от того, как нумеровала страница: сопоставление идёт по цели ссылки, а не по подписи. Если одно и то же примечание встречалось в статье трижды, определение в файле будет одно, а маркеров – три.

Чем это заменяет привычные способы

Источник для обзора фиксируют пятью способами, и каждый ломается на своём этапе. Смотреть стоит не на удобство сохранения, а на то, что происходит через полгода.

СпособЧто получаетсяЧего стоит
Сохранить страницу в PDFвид страницы сохраняется полностьюпоиск по папке спотыкается о переносы, а из двухколоночной вёрстки абзац копируется вперемешку с соседней колонкой
Закладка на статьюделается мгновенночерез год журнал сменил адреса, а институциональный доступ, под которым вы читали, кончился вместе с местом работы
Копировать абзацы в общий документнужное сразу под рукойвыписки быстро теряют происхождение: дата и адрес остаются в голове, а не в файле
Снимок экрананичего не съезжает и не меняетсятекст не ищется, формулу не скопировать, и на каждую цитату приходится открывать картинку
Менеджер библиографииссылка оформится по нужному стилюхранит запись о статье, а не её текст: перечитать выписку внутри него обычно нельзя
Clean Clipperтекст, дата из метаданных и рабочие сноски в одном файлебиблиографию не оформляет и PDF не скачивает – снимает HTML-страницу, которая перед вами

Когда данные не сошлись

Почему поле published пустое?

Потому что страница не назвала дату там, где её ищут. Порядок такой: сначала datePublished в JSON-LD, затем метатеги – article:published_time, citation_date, citation_publication_date и несколько менее распространённых, – и только потом элемент time с атрибутом datetime.

Если ни один источник не сработал, поле остаётся пустым. Подставить день клипа было бы удобнее и хуже: неверная дата в обзоре не перепроверяется, потому что выглядит заполненной.

Почему в поле author оказалось не имя?

Скорее всего, не оказалось: имя проходит через фильтр по форме, а не по списку сайтов. Отсекаются подписи кнопок, названия площадок, строки, начинающиеся с даты, и служебные приписки вроде «[Submitted on …]», которыми препринты открывают блок автора. Хвост плашки режется по словам «фото», «источник», «опубликовано». Если поле всё-таки заполнено неверно, значит, страница называет так самого автора, – поправьте вручную, файл ваш.

Почему при клипе выделения пропали номера сносок?

Потому что определения остались за границей выделения. Маркер сопоставляется с целью по идентификатору ссылки, и когда цели в клипе нет, ссылка вела бы в пустоту – такой маркер убирается вместе с надстрочным знаком. Нужны сноски – клипайте страницу целиком, а лишнее уберёте потом в редакторе.

Почему стоит дата обновления, а не публикации?

Такое бывает на сайтах, которые не отдают дату публикации ни одним из основных способов, но объявляют og:updated_time. Он стоит последним в очереди и берётся, только когда всё остальное пусто. Отличить это можно по самой дате: если она подозрительно свежая для старой статьи, значит, взято именно обновление.

Чего он не делает

Он не собирает библиографическую запись: ни BibTeX, ни RIS, ни ГОСТ – фронтматтер отдаёт сырые поля, а оформление остаётся делом вашего менеджера ссылок. Он не скачивает PDF статьи, а снимает ту HTML-страницу, что перед вами. Он не угадывает отсутствующую дату, а на части корпусов даты не бывает часто – это свойство сайтов, а не извлечения. Формулы, нарисованные картинками, картинками и остаются, то есть ссылками на исходный сайт.

Установить – бесплатноБесплатно целиком, без аккаунта и без ограничений.

Вопросы

А если на странице нет даты публикации?
Поле остаётся пустым. Подставить день клипа было бы хуже: так в заметках молча заводится неверная дата, и ничто потом об этом не напомнит.
Работают ли сноски после клипа?
Да. Они становятся обычными сносками Markdown, которые Obsidian и большинство отрисовщиков превращают в рабочие ссылки внутри заметки.
Можно ли снять статью, закрытую институциональным доступом?
Да, потому что читается та страница, которую браузер уже отрисовал. Видите на экране – значит, склипается.
Заменяет ли это Zotero?
Нет. Zotero ведёт библиографию и оформляет ссылки по стилям; расширение отдаёт читаемый файл Markdown с метаданными – это ответ на другой вопрос.
Можно ли взять только нужный раздел?
Да. Выделите фрагмент до нажатия иконки, и сохранится только выделение – с тем же фронтматтером.
Откуда берётся дата, если метатегов несколько?
Из первого сработавшего источника в фиксированном порядке: JSON-LD, затем метатеги во главе с article:published_time и citation_date, затем time[datetime]. Эвристик по тексту страницы нет – дату из абзаца расширение не вычитывает.
Что происходит с датой в виде числа?
Она распознаётся. Десятизначная и тринадцатизначная Unix-метки, запись 2024/03/07 и полный ISO приводятся к одному виду; значение с годом за пределами промежутка с 1990 по 2100 отбрасывается как заведомо неверное.
Можно ли склипать PDF статьи?
Нет. Снимается HTML-страница, которая перед вами; PDF, открытый во встроенном просмотрщике браузера, для расширения непрозрачен. На страницах журналов клипается HTML-версия статьи, если издатель её публикует.
Как нумеруются сноски в файле?
Сквозной нумерацией с единицы, в порядке появления в тексте, независимо от нумерации на странице. Повторная ссылка на то же примечание получает тот же номер, а определение в конце остаётся одно.
Переживают ли клип формулы?
Набранные текстом – да, вместе с окружающей разметкой. Отрисованные картинкой остаются ссылками на изображения, потому что двоичных файлов расширение не скачивает, а в режиме «пропускать» исчезают вовсе.