Clean Clipper Установить – бесплатно

Кому это

Материал, который остаётся цитируемым

Материал, собранный из скриншотов и закладок, перестаёт работать ровно в тот момент, когда его надо атрибутировать. Файл Markdown с фронтматтером держит заголовок, автора, дату публикации и адрес внутри себя. Он остаётся читаемым и находимым через годы, не завися ни от какого сервиса.

День, когда надо сослаться

Материал к тексту набирается быстро, а проверяется медленно. Вы прочли сорок страниц, из каждой взяли по фразе, а на вычитке выясняется, что к каждому утверждению нужен источник. У закладок нет даты, скриншоты не ищутся, а в файле с выписками лежат фразы без происхождения. Найти источник заново оказывается дольше, чем было прочитать его в первый раз.

Вторая беда – подпись. Многие инструменты заполняют поле автора первой правдоподобной строкой со страницы: названием рубрики, названием издания, подписью кнопки «поделиться». Неверная атрибуция дороже отсутствующей, потому что её не перепроверяют: поле выглядит заполненным, значит, ему верят.

Третий раз это возвращается уже после сдачи. Редактор или фактчекер просит показать источник, вы отправляете ссылку – а у него она открывается страницей входа, потому что подписка ваша, а не его. Или страницу успели переписать, и абзаца, на который вы опирались, там больше нет. Разговор из «вот источник» превращается в «поверьте, я читал», и весит он ровно столько же, сколько любое другое воспоминание.

Что несёт каждая заметка

Автор читается из структурированных данных, а не из первой попавшейся строкиarzamas.academy
---
title: "Как читать письма первой половины XIX века"
source: "https://arzamas.academy/materials/1584"
author: "Arzamas"
published: "2020-02-11"
extraction: "dom"
---

Письмо тогда было жанром настолько же публичным, насколько частным:
его читали вслух, пересылали и переписывали от руки.

Как собирать материал к тексту

Порядок рассчитан на текст, который пишется неделями, а вычитывается за один вечер. Всё, что делается здесь, делается ради того вечера.

  1. Заведите на диске папку под текст и подпапки по главам, а в настройках, в разделе «Куда сохранять», укажите эту папку и шаблон имени {date} – {domain} – {title}. Три текста в одной подборке легко называются одинаково; домен и дата различают их сразу.
  2. В разделе «Что попадает в заметку» откройте «Свойства» и оставьте все пять полей. На вычитке первыми смотрят author и published, а source – то, что вы отправите редактору вместо пересказа.
  3. Оставьте «Клик по иконке» на «Открыть окно». Поле автора стоит проверять глазами: расширение скорее оставит его пустым, чем впишет туда название рубрики, и заметить этот пропуск надо до того, как файл ляжет в папку.
  4. Читая, клипайте не всю страницу, а тот абзац, который пойдёт в дело: выделите его до нажатия. Фронтматтер у выделения тот же самый, так что происхождение цитаты сохраняется, а лишних сорока тысяч знаков в подборке не заводится.
  5. В окне сверьте заголовок и дату с тем, что видите на странице, и при необходимости поправьте имя файла перед сохранением. Потом это делать некогда, а искать по неверному имени вы будете дольше, чем набирали его сейчас.
  6. Перед сдачей пройдитесь поиском по папке главы. Каждая цитата ищется по трём словам, а рядом с ней в том же файле лежит адрес – на вопрос «откуда» ответ занимает секунду, а не полчаса.

Готовые настройки для сбора материала

Эти значения оптимизируют один момент – тот, когда к утверждению нужен источник. Всё остальное в них подчинено ему.

НастройкаЗначениеПочему именно так
Имя файла`{date} – {domain} – {title}`в подборке к главе три материала часто называются похоже; домен и дата разводят их сразу
Папка на дискеподпапка на главупоиск по главе точнее поиска по всему архиву, а глав в книге обычно не больше двадцати
Свойствавсе пять полейна вычитке первыми смотрят `author` и `published`; `extraction` объясняет спорный случай
Клик по иконкеОткрыть окнопустое поле автора – нормальный результат, но увидеть его надо до сохранения, а не на вычитке
Если есть выделение – клипать выделениевключенов дело идёт один абзац, а не вся статья, и подборка не разбухает
Картинкиоставлять ссылкамиподпись под фотографией нередко и есть источник факта, который вы берёте
Срезать навигациювключеносписки «Читайте также» приклеивают к тексту чужие заголовки, и цитата потом ищется не в той статье
Сложный случай: подписи на странице нет – поле author не появляется вовсе, а не заполняется наугадarzamas.academy/courses
---
title: "Русская литература XX века в ста книгах"
source: "https://arzamas.academy/courses/78"
published: "2019-04-02"
extraction: "dom"
---

> Список составлен так, чтобы по нему можно было читать подряд,
> а не только сверяться.

Каждая книга сопровождается коротким пояснением, почему она попала
в перечень и что читать до неё.

Три сценария целиком

Вычитка, на которой к каждому факту нужен источник

Текст написан, и редактор прислал сорок вопросов вида «откуда это». Раньше на такое уходил день: закладки без дат, файл с выписками без происхождения, память о том, что «это была статья с синим сайтом».

Теперь на каждый вопрос отвечает поиск по папке главы. Файл находится по фразе, в его второй строке адрес, в третьей – автор, в четвёртой – дата публикации. Проверять сам факт расширение, разумеется, не помогает: сомнительный источник, аккуратно склипанный, остаётся сомнительным источником.

Цитата из статьи, до которой у редактора нет доступа

Ключевой абзац лежит в материале по подписке. Ссылка редактору не поможет – у него откроется страница входа. Вы клипаете статью в тот момент, когда читаете её под своим логином: расширение снимает то, что браузер отрисовал для вас.

В папку ложится файл с полным текстом, автором и датой. Его можно приложить к правкам целиком – это обычный текст, а не запись в чьём-то сервисе. Заверенной силы у такой копии нет и быть не может, но для разговора с редактором её достаточно.

Подборка к главе, которая пишется полгода

Глава книги собирается медленно, и материал к ней приходит с интервалом в недели. Каждая находка едет в свою подпапку с датой в имени, поэтому подборка сама выстраивается в хронологию темы, а не в порядок вашего чтения.

Через полгода вы открываете папку и видите двадцать файлов, у каждого из которых происхождение написано в первых строках. Часть источников к этому времени уже переехала или закрылась – но текст остался у вас, а не на чужом сервере.

Чем это заменяет привычные способы

Материал к тексту собирают пятью способами. Ни один из них не плох сам по себе – просто ломаются они в разных местах, и обычно в самый неудобный момент.

СпособЧто получаетсяЧего стоит
Закладки в браузеребыстро и бесплатнонет ни даты, ни автора, ни текста; страница за подписку у второго человека не откроется
Копировать в общий файл выписоквсё в одном местепроисхождение куска теряется на второй неделе, и на вычитке восстанавливать его дольше, чем читать заново
Снимок экрана статьификсирует ровно то, что было на экранене ищется, не цитируется, и подпись автора на нём приходится разбирать глазами
Сервис отложенного чтениятекст без обвязки и с синхронизациейформат чужой, экспорт бывает не всегда, а библиотека живёт по правилам сервиса
Сохранить в приложение заметокудобно и привычнополе автора обычно заполняется первой правдоподобной строкой со страницы, и это заметно не сразу
Clean Clipperтекст, автор, дата и адрес в одном файле у вас на дискебиблиографию не оформляет, факты не проверяет и пустое поле автора не додумывает

Когда атрибуция не сошлась

Почему поле author осталось пустым?

Потому что имя не нашлось там, где его ищут: сначала в структурированных данных, затем в метатегах author, article:author и citation_author, затем в подписях с атрибутами rel="author" и itemprop, в блоках с классами byline и author.

Пустое поле – это результат, а не сбой. Выбор здесь сделан осознанно: неверная подпись дороже отсутствующей, потому что её никто не перепроверяет. Впишите имя руками – файл ваш.

Почему в поле автора оказалось название издания?

Значит, страница объявила его автором сама – например, в структурированных данных. Расширение отсеивает по форме строки: имена крупных площадок, слова «admin», «staff», «team», строки без букв и начинающиеся с даты в поле не попадают. Но если сайт честно подписывает материал названием редакции, это и есть его подпись.

Почему текст обрывается на середине?

Так выглядит пейволл. Расширение снимает то, что браузер отрисовал: если под катом лежит призыв подписаться, а не текст, в клип попадёт ровно видимая часть. Войдите под своей подпиской, дождитесь полной отрисовки и склипайте заново – кнопка «Склипать заново» есть прямо в окне.

Почему дата не совпадает с той, что напечатана на странице?

Дата берётся из метаданных, а не из текста. Расхождение почти всегда означает, что на странице напечатана дата обновления, а в разметке лежит дата первой публикации – или наоборот. Поле extraction подскажет, откуда взят сам текст, а какая дата вам нужна, решаете вы: обе честные.

Чего он не делает

Он не дописывает поле автора, если страница его не даёт: пустое поле лучше выдуманного имени, и выбор сделан в эту сторону. Он не сохраняет ни вёрстку, ни скриншоты – только текст и его структуру. Он не ведёт библиографию и не оформляет ссылки по стилям. И он ничего не проверяет за вас: сомнительный источник, аккуратно склипанный, остаётся сомнительным источником.

Установить – бесплатноБесплатно целиком, без аккаунта и без ограничений.

Вопросы

Сохраняется ли автор?
Когда страница его называет. Расширение читает структурированные данные и подписи и отсеивает ложные срабатывания – названия рубрик, имена изданий, подписи кнопок, – вместо того чтобы класть в поле первую правдоподобную строку.
Можно ли оставить картинки?
Да, ссылками – это режим по умолчанию. Отключить их можно везде или только на тех сайтах, которые вы назовёте.
А статьи по подписке?
Клипаются как обычные, потому что расширение читает ту страницу, которую браузер отрисовал для вас после входа.
Меняется ли текст?
Нет. HTML превращается в Markdown, навигация и рекламные блоки срезаются, но в теле статьи ни одно слово не добавляется, не удаляется и не переставляется.
Найду ли я цитату через полгода?
Да. Это текстовые файлы, поэтому их видит поиск системы и редактора, а адрес источника лежит в начале каждого файла.
А если у материала несколько авторов?
В поле попадёт один – тот, что нашёлся первым в порядке проверки источников. Соавторов расширение не собирает в список: гадать, где кончается имя и начинается должность, оно не берётся. Допишите остальных руками.
Что происходит с врезками и выделенными цитатами?
Они становятся цитатами Markdown – строками, начинающимися с >. Стандартного синтаксиса для врезок в Markdown нет, поэтому оформление теряется, а содержимое остаётся на своём месте в тексте.
Можно ли поправить фронтматтер после сохранения?
Да, это обычный текстовый файл: открывайте и правьте. Расширение к нему после записи не возвращается – ни обновлять, ни перезаписывать поля оно не пытается.
Клипается ли материал, который раскрывается по кнопке «читать дальше»?
Раскройте его до нажатия. Берётся то, что отрисовано в момент клипа, поэтому свёрнутый текст в файл не попадёт – а заметить это по вставленному куску трудно.
Что означает поле `extraction` в моих файлах?
Как получен текст. dom – из того, что браузер отрисовал; jsonld-articlebody – из структурированных данных, когда там лежало тело статьи длиннее видимого; no-article – статьи на странице не нашлось вовсе.