Clean Web Clipper Chrome에 추가 (무료)

누구를 위한 도구인가

게시일이 남는 논문 저장

게시일 없이 저장한 논문은 나중에 다시 복원해야 하는 인용입니다. Clean Web Clipper는 본문이 아니라 페이지 자체의 메타데이터에서 날짜를 읽고, 페이지에 날짜가 없으면 오늘 날짜로 채우지 않고 필드를 비워 둡니다.

저장한 논문이 출처 정보를 잃는 곳

브라우저에서 프리프린트를 읽고 저장했는데, 석 달 뒤 노트에는 언제 게시되었는지도, 어느 버전을 읽었는지도 없습니다. 초록 페이지는 v3로 넘어갔고, 참고문헌 링크는 이미 떠난 페이지를 가리키는 죽은 앵커가 되었으며, 저자 필드에는 “본문 바로가기”가 적혀 있습니다. 클리퍼가 처음 찾은 굵은 문자열을 가져갔기 때문입니다.

가장 나쁜 것은 날짜입니다. 실패가 조용하기 때문입니다. 저장한 날을 노트에 찍는 클리퍼는 맞아 보이지만 틀린 파일을 만듭니다. 1년 뒤에는 노트 200개 중 어느 것이 실제 게시일을, 어느 것이 우연히 읽은 날을 담고 있는지 알 수 없습니다. 파일 안에 둘을 구별할 것이 없습니다.

텍스트와 생각이 서로 다른 곳에 남습니다. 참고문헌 관리 도구에는 메타데이터가, 노트 앱에는 내 코멘트가 있지만, 코멘트를 단 그 문단은 어디에도 없습니다. 원고를 쓸 때 다시 가져오러 가면, 링크의 절반은 이미 만료된 기관 세션으로 읽던 유료 벽으로 이어집니다. 텍스트 자체를 내 노트와 같은 파일에 보관하면 그 왕복이 통째로 사라집니다.

노트에 기록되는 것

페이지에서 읽은 citation_date, 문서 끝의 각주arxiv.org/abs/1706.03762
---
title: "Attention Is All You Need"
source: "https://arxiv.org/abs/1706.03762"
author: "Ashish Vaswani, Noam Shazeer, Niki Parmar"
date: "2017-06-12"
extraction: "dom"
---

The dominant sequence transduction models are based on complex recurrent or
convolutional neural networks.[^1]

[^1]: Submitted 12 June 2017. Comments: 15 pages, 5 figures.

논문 읽기용으로 설정하기

기본 설정은 기사를 빠르게 읽는 데 맞춰져 있습니다. 참고문헌 폴더에는 그 반대가 필요합니다. 모든 메타데이터 필드를 남기고, 저장하기 전에 결과를 한번 확인하는 것입니다.

  1. 확장 프로그램 아이콘에서 옵션을 열고, 저장 위치를 프로젝트의 자료가 있는 폴더로 설정합니다. 원고 옆의 sources/나 vault 안의 폴더가 좋습니다.
  2. 아이콘 클릭은 “폴더에 저장”이 아니라 미리보기 창으로 둡니다. 논문에서는 창이 제 몫을 합니다. 파일이 생기기 전에 날짜와 저자가 제대로 들어왔는지 확인하는 곳이기 때문입니다.
  3. 파일 이름 템플릿은 {domain}-{title}이 맞습니다. 같은 논문의 프리프린트 서버본, 학술지본, 리포지터리 사본은 제목이 같은 서로 다른 문서이고, 폴더 목록에서 이들을 구별하는 것은 도메인입니다.
  4. frontmatter 필드를 extraction까지 모두 켭니다. 마지막 필드는 여기서 어느 곳보다 중요합니다. jsonld-articlebody는 텍스트가 렌더링된 내용이 아니라 페이지의 구조화 데이터에서 왔다는 뜻이고, 둘이 항상 같은 버전은 아닙니다.
  5. 이미지는 링크로 둡니다. 그림이 논증의 핵심인 경우가 많고, 링크라도 있으면 그림이 있었다는 사실은 남습니다. 제외하면 논문에 그림이 있었다는 사실 자체가 조용히 사라집니다.
  6. 초록 페이지와 전문 HTML이 둘 다 있으면 따로 클리핑합니다. 메타데이터가 다릅니다. 초록 페이지에는 대개 citation_date 태그가, 전문에는 참고문헌이 있습니다.
  7. 처음 쓰는 출판사에서 첫 클립을 한 뒤 date 필드를 확인합니다. 비어 있다면 그 사이트는 마크업에 날짜를 내보내지 않으며, 어떤 설정으로도 날짜가 생기지 않습니다.

참고문헌 폴더용 설정

이 표의 주제는 속도가 아닙니다. 2년 뒤에도 파일이 어디서 왔고 어떻게 저장되었는지 말해 주도록 하는 것입니다.

설정여기서 이 값인 이유
아이콘 클릭미리보기 창파일이 되기 전에 날짜와 저자가 살아남았는지 볼 유일한 기회
저장 위치원고 옆의 `sources/` 폴더문단과 그에 대한 글이 한곳, 한 백업에 함께 있습니다
파일 이름 템플릿`{domain}-{title}`프리프린트, 학술지본, 리포지터리 사본은 제목이 같아도 같은 문서가 아닙니다
frontmatter`extraction`까지 모든 필드경로가 중요합니다. 구조화 데이터와 렌더링된 텍스트가 가끔 다른 버전입니다
이미지링크로 유지그림 링크는 그림이 있었다는 기록입니다. 제외하면 그 사실이 가려집니다
사이트별 규칙`arxiv.org` → 하위 폴더 `preprints`프리프린트는 새 버전으로 대체되므로 한 묶음으로 다시 확인할 수 있어야 합니다
선택 영역한 섹션만 선택 영역으로 클리핑방법 섹션은 논문 전체보다 훨씬 자주 인용됩니다
페이지에 날짜가 없으므로 필드는 비어 있습니다마크업에 날짜가 없는 학술지 논문 소개 페이지
---
title: "Reproducibility of variant calling across sequencing platforms"
source: "https://example-journal.org/articles/vc-repro"
author: "M. Ilves, R. Okonkwo"
date: ""
extraction: "jsonld-articlebody"
---

## Abstract

Concordance between platforms fell below 0.90 for indels longer than eight
bases, while substitution calls agreed across all four pipelines tested.

세 가지 활용 장면

인용한 뒤에 바뀌는 프리프린트

3월에 프리프린트의 v1을 읽고 클리핑합니다. 9월에는 초록 페이지가 결과 섹션을 고치고 저자 두 명을 추가한 v3을 보여 줍니다. 다시 클리핑하면 두 번째 파일은 첫 번째를 대체하지 않고 숫자 접미사가 붙습니다.

이제 어떤 diff 도구로든 내가 인용한 버전과 독자가 그 URL에서 찾을 버전 사이에 어떤 주장이 바뀌었는지 정확히 볼 수 있습니다. 3월 파일이 없으면 무언가 바뀌었다는 사실조차 입증할 방법이 없습니다. URL은 똑같아 보이고 페이지는 현재 상태만 보여 주기 때문입니다.

기관 세션 뒤의 전문

교내 네트워크에 있거나 도서관을 통해 로그인했으므로 논문이 표시됩니다. 확장 프로그램은 브라우저가 렌더링한 것을 읽으므로 전문도 다른 페이지처럼 클리핑되며, 참고문헌은 노트 끝에 모인 [^1] 각주 정의가 됩니다.

그것은 여섯 달 뒤 세션이 만료되어 같은 링크가 결제를 요구할 때 중요해집니다. 문단, 저자, 날짜는 내 디스크의 파일에 있고, 그 파일의 어느 부분도 구독이 살아 있는지에 의존하지 않습니다.

같은 폴더에 자료를 두고 원고 쓰기

원고는 paper/에, 클리핑한 자료는 paper/sources/에 있습니다. 초안의 모든 인용문을 브라우저를 열지 않고 원래 파일과 대조할 수 있고, 참고문헌 목록에 필요한 URL과 날짜는 그 파일 맨 위 두 줄에 있습니다.

파일이 일반 텍스트이므로 폴더 전체에 grep을 쓰면 참고문헌 관리 도구가 답하지 못하는 질문에 답할 수 있습니다. 어떤 논문을 저장했는지가 아니라, 그중 어느 논문이 특정 표현을 실제로 썼는지입니다.

흔한 논문 읽기 방식과 비교

대부분은 이미 이 중 두세 가지를 씁니다. 솔직한 비교는 그 방법들이 실패한다는 것이 아니라 각자 다른 것을 빠뜨린다는 것입니다.

지금 쓰는 방법얻는 것치르는 비용
참고문헌 관리 도구의 브라우저 버튼구조화된 메타데이터와 흔히 PDF읽은 텍스트는 데이터베이스 안에 있고, 인용문은 여전히 다시 입력해야 함
PDF 다운로드레이아웃이 잡힌 공식 판본별도 도구 없이는 폴더 전체를 grep할 수 없고, 버전 간 diff도 안 됨
초록 페이지 북마크즉시 만드는 포인터프리프린트는 제자리에서 대체되고, 포인터는 조용히 변경을 따라감
문단 복사해 붙여 넣기필요했던 텍스트날짜, URL, 참고문헌 정의 없이 도착함
Clean Web ClipperHTML 텍스트, 메타데이터, 각주를 파일로HTML만 지원. PDF를 읽지 않고 인용 키를 쓰지 않음

메타데이터가 들어오지 않을 때

날짜 필드가 비어 있습니다

페이지가 확장 프로그램이 인식하는 날짜를 내보내지 않습니다. citation_datecitation_publication_date(arXiv, PubMed, IEEE가 쓰는 태그), 그다음 JSON-LD datePublished, article:published_time, time[datetime], Unix 타임스탬프 순서로 찾습니다. 아무것도 없으면 오늘 날짜로 채우지 않고 비워 둡니다. 참고문헌 폴더에서 그럴듯하게 틀린 날짜는 하필 가장 곤란한 순간에 발견되기 때문입니다.

저자가 분명히 있는 논문인데 저자 필드가 비어 있습니다

저자 추출은 구조화 데이터와 필자 마크업을 읽은 뒤 흔한 오탐을 거릅니다. 섹션 제목, 학술지 이름, “전거 통제” 블록, 버튼 텍스트입니다. 일부 출판사는 필자 마크업 없이 JavaScript로 렌더링되는 위젯에 저자 목록을 넣고, 그러면 필터를 통과하는 것이 없습니다. 빈 필드는 의도된 결과입니다. 저자 필드에 “본문 바로가기”가 들어가는 것이 여러 클리퍼에서 그 대안이었습니다.

논문이 아니라 초록만 들어왔습니다

초록 랜딩 페이지를 클리핑했고, 대부분의 프리프린트 서버와 학술지에서 그 페이지에는 정말 초록만 있습니다. 전문은 별도 URL에 있습니다. 대개 같은 페이지의 “full text”, “HTML”, “reader” 링크입니다. 그것도 클리핑하세요. 두 페이지는 메타데이터가 달라서 두 파일로 보관할 가치가 있습니다.

수식이 빠졌습니다

이미지로 렌더링된 수식은 이미지 링크로 남고, 이미지를 “제외”로 설정했다면 완전히 사라집니다. 출판사가 수식을 텍스트로 렌더링하면 문자가 옮겨집니다. LaTeX 변환은 없습니다. 확장 프로그램은 페이지가 렌더링한 것을 읽을 뿐, 그림에서 표기법을 재구성하지 않습니다.

솔직한 한계

PDF가 아니라 HTML을 읽습니다. PDF로만 존재하는 논문은 확장 프로그램이 변환하지 않습니다. BibTeX를 가져오지 않고 인용 키도 쓰지 않습니다. frontmatter는 메타데이터이지 참고문헌 항목이 아닙니다. 이미지로 렌더링된 수식은 이미지 링크로 남습니다. 그리고 어떤 사이트는 마크업에 날짜를 전혀 게시하지 않습니다. 그런 곳에서는 추측하지 않고 필드를 비워 두는데, 정직한 답이지만 여전히 빈 필드입니다.

Chrome에 추가 (무료)전부 무료입니다. 계정도, 가입도, 제한도 없습니다.

자주 묻는 질문

페이지에 게시일이 없으면 어떻게 되나요?
필드가 비어 있습니다. 우연히 클리핑한 날로 채우는 것은 비워 두는 것보다 나쁩니다. 노트 속에서 조용히 틀린 데이터가 되기 때문입니다.
PDF를 클리핑할 수 있나요?
아니요. 확장 프로그램은 페이지의 렌더링된 HTML에서 작동합니다. 논문이 두 형식으로 모두 있다면 HTML 버전을 클리핑하고, PDF에는 PDF 도구를 쓰세요.
클리핑한 뒤에도 각주 링크가 작동하나요?
네. 표준 Markdown 각주가 되고, Obsidian과 대부분의 Markdown 렌더러가 노트 안에서 작동하는 링크로 바꿉니다.
기관 로그인 뒤의 논문도 캡처할 수 있나요?
네. 브라우저가 이미 렌더링한 페이지를 읽기 때문입니다. 볼 수 있다면 클리핑할 수 있습니다.
저자는 어떻게 판단하나요?
구조화 데이터와 필자 마크업을 읽은 뒤 흔한 오탐을 거릅니다. 섹션 제목, 간행물 이름, “전거 통제” 블록, 버튼 텍스트입니다. 필터를 통과하는 것이 없으면 필드를 비워 둡니다.
데이터 표와 보충 자료 표도 남나요?
대개 남습니다. 표는 범용 변환기가 아니라 확장 프로그램이 직접 직렬화하며, 표 15개짜리 코퍼스에서 12개가 남았고 비교한 엔진은 각각 7개였습니다. 범용 변환기를 깨뜨리는 목록이나 코드 예제가 든 셀도 여기서는 처리됩니다.
DOI, BibTeX, 인용 키를 가져오나요?
아니요. frontmatter는 페이지 메타데이터(제목, 출처 URL, 저자, 날짜, 추출 경로)이지 참고문헌 항목이 아닙니다. 인용 키는 참고문헌 관리 도구에 두고, 텍스트는 여기에 둡니다.
제 노트의 `jsonld-articlebody`는 무슨 뜻인가요?
페이지가 기사를 구조화 데이터로 보냈지만 렌더링을 끝내지 않아서, 본문을 구조화 데이터에서 읽었다는 뜻입니다. 논문에서는 눈여겨볼 만합니다. 출판사가 그 블록에 이전 버전의 텍스트를 남겨 두는 경우가 가끔 있어서, 짐작하지 않고 확인할 수 있도록 값을 기록합니다.
노트에 제가 읽은 프리프린트 버전이 기록되나요?
페이지가 알려 주는 만큼은 기록됩니다. URL에 버전이 있으면 source 줄에도 들어가고, 파일 이름의 {date}가 캡처한 날을 기록합니다. 나중에 같은 논문을 다시 클리핑하면 두 파일을 바로 비교할 수 있습니다. 버전이 바뀌었다는 것을 믿을 만하게 남기는 방법은 그것뿐입니다.
선별 작업을 위해 검색 결과 데이터베이스 전체를 클리핑할 수 있나요?
아니요. 일괄 모드도 크롤러도 없고, 결과 페이지는 확장 프로그램이 거절하는 바로 그런 입력입니다. 대부분 링크 텍스트이므로 “기사 없음”으로 처리됩니다. 선별은 선별 도구가 하고, 이 도구는 읽기로 한 논문을 보관합니다.