Кому это
Статьи, сохранившие настоящую дату
Статья, сохранённая без даты публикации, превращается в ссылку, которую придётся восстанавливать. Расширение берёт дату из метаданных страницы, а не выискивает её в тексте, и оставляет поле пустым, когда страница даты не несёт. Ссылки-примечания при этом становятся обычными сносками Markdown, собранными в конце файла.
Где теряется ссылка
Момент, когда источник становится непригодным, почти всегда один и тот же: его надо атрибутировать. В клипе приблизительный заголовок, адреса нет, а дата – это день, когда вы читали страницу. Вы лезете обратно в браузер искать статью, а она уже переехала или ушла за доступ, которого у вас больше нет. Заметка есть, и она ничего не доказывает.
Второе место разрыва – сноски. Научная статья держится на примечаниях не меньше, чем на основном тексте, а большинство конвертеров превращает их в мёртвые якоря, ведущие на давно закрытую страницу. Номера в тексте остаются, определения пропадают, и понять, на что ссылалось третье примечание, уже нельзя.
Привычный обход – сохранять всё в PDF – переносит проблему на год вперёд. Папка из двухсот файлов ищется плохо: полнотекстовый поиск спотыкается о лигатуры и переносы, из двухколоночной вёрстки абзац копируется вперемешку с соседней колонкой, а метаданных внутри файла обычно нет вовсе. Вы получаете архив, из которого ничего нельзя достать быстрее, чем открыть заново и прочитать.
Что заметка сохраняет
- Читает
citation_dateиcitation_publication_date– метатеги, которые отдают arXiv, PubMed, eLibrary и IEEE - Читает также
datePublishedиз JSON-LD,article:published_time,time[datetime]и Unix-метки - Нет даты на странице – поле пустое, а не сегодняшнее число
- Ссылки-примечания становятся сносками
[^1], определения собираются в конце файла - Автор фильтруется: заголовки рубрик и подписи кнопок в поле author не оказываются
- Адрес источника пишется во фронтматтер, поэтому на заметку можно сослаться саму по себе
- Разные записи даты приводятся к одному виду: Unix-метка,
2024/03/07и полный ISO становятся одной строкой - Неправдоподобная дата отбрасывается – год за пределами промежутка с 1990 по 2100 в поле не попадёт
---
title: "Слабые связи и распространение информации в сети"
source: "https://cyberleninka.ru/article/n/slabye-svyazi-i-rasprostranenie-informatsii"
published: "2019-06-03"
extraction: "dom"
---
Слабые связи переносят непропорционально большую долю новой информации,
которая расходится по сети.[^1]
[^1]: Granovetter M. The Strength of Weak Ties // American Journal
of Sociology. 1973. Vol. 78, № 6.Как собирать корпус для обзора
Порядок ниже рассчитан на обзор литературы, который вы ведёте не неделю, а полгода. Главное здесь не скорость клипа, а то, чтобы через полгода к каждой выписке нашёлся источник.
- В настройках, в разделе «Куда сохранять», выберите папку обзора на диске и впишите шаблон имени файла
{date} – {title}. Файлы тогда выстраиваются по дате публикации, и порядок в папке совпадает с хронологией темы, а не с порядком вашего чтения. - В разделе «Что попадает в заметку» откройте «Свойства» и оставьте все пять полей, включая
extraction. Когда через полгода возникнет спор о цитате, это первое, на что смотрят: значениеdomозначает отрисованную страницу,jsonld-articlebody– тело из структурированных данных. - Убедитесь, что «Сноски – выносить в конец заметки» включено. Маркеры в тексте превратятся в
[^1],[^2]со сквозной нумерацией с единицы, а определения соберутся под заголовком «Сноски» в конце файла – вместе со списком литературы, который из тела уедет туда же. - Открыв статью, нажмите иконку и посмотрите на свойство
published. Пустое поле означает, что даты не нашлось ни в JSON-LD, ни в метатегах вродеcitation_date, ни вtime[datetime], – и это сигнал искать дату у издателя, а не повод её выдумать. - Если нужен только раздел «Методы» или только выводы, выделите его до нажатия. Выделение приезжает целиком, без срезки, – но помните, что определения сносок остаются за его границей и такие маркеры из текста убираются.
- Сохраните файл и держите папку в обычной резервной копии. Дальше это простой текст: полнотекстовый поиск системы и редактора находит цитату по трём словам, а адрес источника лежит во второй строке файла.
Готовые настройки для обзора литературы
Набор рассчитан на долгий проект, где выписка должна пережить смену темы, компьютера и научного руководителя. Всё, что помогает восстановить происхождение цитаты, здесь включено.
| Настройка | Значение | Почему именно так |
|---|---|---|
| Имя файла | `{date} – {title}` | корпус сам сортируется по хронологии темы, а не по порядку вашего чтения |
| Папка на диске | папка проекта, а не загрузки | выписки должны лежать рядом с текстом обзора и попадать в ту же резервную копию |
| Свойства | все пять полей | `extraction` объясняет, откуда взят текст, – при спорной цитате это первое, что проверяют |
| Сноски | выносить в конец заметки | научный текст держится на примечаниях; в конце они читаются, а посреди абзаца мешают |
| Картинки | оставлять ссылками | графики и формулы на страницах журналов нарисованы картинками, и ссылка хотя бы отмечает их место |
| Если есть выделение – клипать выделение | включено | из обзорной статьи чаще нужен один раздел, а не сорок тысяч знаков целиком |
| Клик по иконке | Открыть окно | дату и автора имеет смысл проверять глазами до сохранения, а не после |
--- title: "К вопросу о типологии городских сообществ" source: "https://cyberleninka.ru/article/n/k-voprosu-o-tipologii" author: "Иванова Е. А." extraction: "dom" --- Рассматриваются подходы к классификации городских сообществ, сложившиеся в отечественной социологии за последние два десятилетия. ## Сноски [^1]: Парк Р. Город как социальная лаборатория. – 1929.
Три сценария целиком
Обзор литературы на сорок источников
Вы собираете обзор и за неделю проходите сорок статей в разных базах. Каждую клипаете прямо со страницы, где читаете, – включая те, что открылись через институциональный доступ и по прямой ссылке не откроются ни у кого другого.
В папке проекта сорок файлов, названных по дате публикации и заголовку. Поиск по слову «гетероскедастичность» находит три из них за секунду, и в каждом во второй строке лежит адрес, по которому статья бралась. Библиографическую запись расширение не собирает: ни BibTeX, ни RIS, ни ГОСТ – оформление остаётся за вашим менеджером ссылок.
Статья с датой, которой нет
Страница журнала выглядит аккуратно, но поле published в окне клипа пустое. Это значит, что дату не отдали ни JSON-LD, ни метатеги, ни элемент time – и расширение не стало подставлять сегодняшнее число, потому что молча заведённая неверная дата хуже отсутствующей.
Дальше это ваша развилка: посмотреть выходные данные выпуска, взять дату у издателя или оставить как есть и пометить в тексте обзора. Важно, что развилка видна сразу, а не всплывает на этапе оформления списка литературы, когда до сдачи два дня.
Сноски, понадобившиеся через год
Через год после выписки нужно понять, на что ссылалось третье примечание в статье, которую вы читали. В файле оно на месте: маркер [^3] стоит в тексте, а определение лежит в конце под заголовком «Сноски», уже без служебных стрелок обратных ссылок.
Нумерация в файле сквозная и начинается с единицы независимо от того, как нумеровала страница: сопоставление идёт по цели ссылки, а не по подписи. Если одно и то же примечание встречалось в статье трижды, определение в файле будет одно, а маркеров – три.
Чем это заменяет привычные способы
Источник для обзора фиксируют пятью способами, и каждый ломается на своём этапе. Смотреть стоит не на удобство сохранения, а на то, что происходит через полгода.
| Способ | Что получается | Чего стоит |
|---|---|---|
| Сохранить страницу в PDF | вид страницы сохраняется полностью | поиск по папке спотыкается о переносы, а из двухколоночной вёрстки абзац копируется вперемешку с соседней колонкой |
| Закладка на статью | делается мгновенно | через год журнал сменил адреса, а институциональный доступ, под которым вы читали, кончился вместе с местом работы |
| Копировать абзацы в общий документ | нужное сразу под рукой | выписки быстро теряют происхождение: дата и адрес остаются в голове, а не в файле |
| Снимок экрана | ничего не съезжает и не меняется | текст не ищется, формулу не скопировать, и на каждую цитату приходится открывать картинку |
| Менеджер библиографии | ссылка оформится по нужному стилю | хранит запись о статье, а не её текст: перечитать выписку внутри него обычно нельзя |
| Clean Clipper | текст, дата из метаданных и рабочие сноски в одном файле | библиографию не оформляет и PDF не скачивает – снимает HTML-страницу, которая перед вами |
Когда данные не сошлись
Почему поле published пустое?
Потому что страница не назвала дату там, где её ищут. Порядок такой: сначала datePublished в JSON-LD, затем метатеги – article:published_time, citation_date, citation_publication_date и несколько менее распространённых, – и только потом элемент time с атрибутом datetime.
Если ни один источник не сработал, поле остаётся пустым. Подставить день клипа было бы удобнее и хуже: неверная дата в обзоре не перепроверяется, потому что выглядит заполненной.
Почему в поле author оказалось не имя?
Скорее всего, не оказалось: имя проходит через фильтр по форме, а не по списку сайтов. Отсекаются подписи кнопок, названия площадок, строки, начинающиеся с даты, и служебные приписки вроде «[Submitted on …]», которыми препринты открывают блок автора. Хвост плашки режется по словам «фото», «источник», «опубликовано». Если поле всё-таки заполнено неверно, значит, страница называет так самого автора, – поправьте вручную, файл ваш.
Почему при клипе выделения пропали номера сносок?
Потому что определения остались за границей выделения. Маркер сопоставляется с целью по идентификатору ссылки, и когда цели в клипе нет, ссылка вела бы в пустоту – такой маркер убирается вместе с надстрочным знаком. Нужны сноски – клипайте страницу целиком, а лишнее уберёте потом в редакторе.
Почему стоит дата обновления, а не публикации?
Такое бывает на сайтах, которые не отдают дату публикации ни одним из основных способов, но объявляют og:updated_time. Он стоит последним в очереди и берётся, только когда всё остальное пусто. Отличить это можно по самой дате: если она подозрительно свежая для старой статьи, значит, взято именно обновление.
Чего он не делает
Он не собирает библиографическую запись: ни BibTeX, ни RIS, ни ГОСТ – фронтматтер отдаёт сырые поля, а оформление остаётся делом вашего менеджера ссылок. Он не скачивает PDF статьи, а снимает ту HTML-страницу, что перед вами. Он не угадывает отсутствующую дату, а на части корпусов даты не бывает часто – это свойство сайтов, а не извлечения. Формулы, нарисованные картинками, картинками и остаются, то есть ссылками на исходный сайт.
Вопросы
А если на странице нет даты публикации?
Работают ли сноски после клипа?
Можно ли снять статью, закрытую институциональным доступом?
Заменяет ли это Zotero?
Можно ли взять только нужный раздел?
Откуда берётся дата, если метатегов несколько?
article:published_time и citation_date, затем time[datetime]. Эвристик по тексту страницы нет – дату из абзаца расширение не вычитывает.Что происходит с датой в виде числа?
2024/03/07 и полный ISO приводятся к одному виду; значение с годом за пределами промежутка с 1990 по 2100 отбрасывается как заведомо неверное.