누구를 위한 도구인가
게시일이 남는 논문 저장
게시일 없이 저장한 논문은 나중에 다시 복원해야 하는 인용입니다. Clean Web Clipper는 본문이 아니라 페이지 자체의 메타데이터에서 날짜를 읽고, 페이지에 날짜가 없으면 오늘 날짜로 채우지 않고 필드를 비워 둡니다.
저장한 논문이 출처 정보를 잃는 곳
브라우저에서 프리프린트를 읽고 저장했는데, 석 달 뒤 노트에는 언제 게시되었는지도, 어느 버전을 읽었는지도 없습니다. 초록 페이지는 v3로 넘어갔고, 참고문헌 링크는 이미 떠난 페이지를 가리키는 죽은 앵커가 되었으며, 저자 필드에는 “본문 바로가기”가 적혀 있습니다. 클리퍼가 처음 찾은 굵은 문자열을 가져갔기 때문입니다.
가장 나쁜 것은 날짜입니다. 실패가 조용하기 때문입니다. 저장한 날을 노트에 찍는 클리퍼는 맞아 보이지만 틀린 파일을 만듭니다. 1년 뒤에는 노트 200개 중 어느 것이 실제 게시일을, 어느 것이 우연히 읽은 날을 담고 있는지 알 수 없습니다. 파일 안에 둘을 구별할 것이 없습니다.
텍스트와 생각이 서로 다른 곳에 남습니다. 참고문헌 관리 도구에는 메타데이터가, 노트 앱에는 내 코멘트가 있지만, 코멘트를 단 그 문단은 어디에도 없습니다. 원고를 쓸 때 다시 가져오러 가면, 링크의 절반은 이미 만료된 기관 세션으로 읽던 유료 벽으로 이어집니다. 텍스트 자체를 내 노트와 같은 파일에 보관하면 그 왕복이 통째로 사라집니다.
노트에 기록되는 것
citation_date와citation_publication_date(arXiv, PubMed, IEEE가 내보내는 메타 태그)를 바로 읽습니다.- JSON-LD
datePublished,article:published_time,time[datetime], Unix 타임스탬프도 이 우선순위로 읽습니다. - 페이지에 날짜가 없으면 필드는 비어 있습니다. 오늘 날짜로 채우지 않습니다.
- 참조 링크는
[^1]각주가 되고 정의는 노트 끝에 모입니다. - 저자 필드는 걸러집니다. 섹션 제목, 학술지 이름, 버튼 텍스트가 필자로 들어가지 않습니다.
extraction필드가 경로를 기록합니다. 렌더링된 페이지에서 가져오면dom, 렌더링이 끝나지 않은 페이지면jsonld-articlebody.- 게시일과 캡처 날짜는 섞이지 않습니다. 페이지의 날짜는 frontmatter 필드에, 클리핑한 날은 파일 이름의
{date}에 들어가며, 일부러 서로 다른 곳에 둡니다. - 측정한 페이지 512개에서 남은 HTML 태그 0개이므로, 원고에 붙여 넣은 문단에 떠도는
span이나 그림 캡션 조각이 딸려 오지 않습니다.
--- title: "Attention Is All You Need" source: "https://arxiv.org/abs/1706.03762" author: "Ashish Vaswani, Noam Shazeer, Niki Parmar" date: "2017-06-12" extraction: "dom" --- The dominant sequence transduction models are based on complex recurrent or convolutional neural networks.[^1] [^1]: Submitted 12 June 2017. Comments: 15 pages, 5 figures.
논문 읽기용으로 설정하기
기본 설정은 기사를 빠르게 읽는 데 맞춰져 있습니다. 참고문헌 폴더에는 그 반대가 필요합니다. 모든 메타데이터 필드를 남기고, 저장하기 전에 결과를 한번 확인하는 것입니다.
- 확장 프로그램 아이콘에서 옵션을 열고, 저장 위치를 프로젝트의 자료가 있는 폴더로 설정합니다. 원고 옆의
sources/나 vault 안의 폴더가 좋습니다. - 아이콘 클릭은 “폴더에 저장”이 아니라 미리보기 창으로 둡니다. 논문에서는 창이 제 몫을 합니다. 파일이 생기기 전에 날짜와 저자가 제대로 들어왔는지 확인하는 곳이기 때문입니다.
- 파일 이름 템플릿은
{domain}-{title}이 맞습니다. 같은 논문의 프리프린트 서버본, 학술지본, 리포지터리 사본은 제목이 같은 서로 다른 문서이고, 폴더 목록에서 이들을 구별하는 것은 도메인입니다. - frontmatter 필드를
extraction까지 모두 켭니다. 마지막 필드는 여기서 어느 곳보다 중요합니다.jsonld-articlebody는 텍스트가 렌더링된 내용이 아니라 페이지의 구조화 데이터에서 왔다는 뜻이고, 둘이 항상 같은 버전은 아닙니다. - 이미지는 링크로 둡니다. 그림이 논증의 핵심인 경우가 많고, 링크라도 있으면 그림이 있었다는 사실은 남습니다. 제외하면 논문에 그림이 있었다는 사실 자체가 조용히 사라집니다.
- 초록 페이지와 전문 HTML이 둘 다 있으면 따로 클리핑합니다. 메타데이터가 다릅니다. 초록 페이지에는 대개
citation_date태그가, 전문에는 참고문헌이 있습니다. - 처음 쓰는 출판사에서 첫 클립을 한 뒤
date필드를 확인합니다. 비어 있다면 그 사이트는 마크업에 날짜를 내보내지 않으며, 어떤 설정으로도 날짜가 생기지 않습니다.
참고문헌 폴더용 설정
이 표의 주제는 속도가 아닙니다. 2년 뒤에도 파일이 어디서 왔고 어떻게 저장되었는지 말해 주도록 하는 것입니다.
| 설정 | 값 | 여기서 이 값인 이유 |
|---|---|---|
| 아이콘 클릭 | 미리보기 창 | 파일이 되기 전에 날짜와 저자가 살아남았는지 볼 유일한 기회 |
| 저장 위치 | 원고 옆의 `sources/` 폴더 | 문단과 그에 대한 글이 한곳, 한 백업에 함께 있습니다 |
| 파일 이름 템플릿 | `{domain}-{title}` | 프리프린트, 학술지본, 리포지터리 사본은 제목이 같아도 같은 문서가 아닙니다 |
| frontmatter | `extraction`까지 모든 필드 | 경로가 중요합니다. 구조화 데이터와 렌더링된 텍스트가 가끔 다른 버전입니다 |
| 이미지 | 링크로 유지 | 그림 링크는 그림이 있었다는 기록입니다. 제외하면 그 사실이 가려집니다 |
| 사이트별 규칙 | `arxiv.org` → 하위 폴더 `preprints` | 프리프린트는 새 버전으로 대체되므로 한 묶음으로 다시 확인할 수 있어야 합니다 |
| 선택 영역 | 한 섹션만 선택 영역으로 클리핑 | 방법 섹션은 논문 전체보다 훨씬 자주 인용됩니다 |
--- title: "Reproducibility of variant calling across sequencing platforms" source: "https://example-journal.org/articles/vc-repro" author: "M. Ilves, R. Okonkwo" date: "" extraction: "jsonld-articlebody" --- ## Abstract Concordance between platforms fell below 0.90 for indels longer than eight bases, while substitution calls agreed across all four pipelines tested.
세 가지 활용 장면
인용한 뒤에 바뀌는 프리프린트
3월에 프리프린트의 v1을 읽고 클리핑합니다. 9월에는 초록 페이지가 결과 섹션을 고치고 저자 두 명을 추가한 v3을 보여 줍니다. 다시 클리핑하면 두 번째 파일은 첫 번째를 대체하지 않고 숫자 접미사가 붙습니다.
이제 어떤 diff 도구로든 내가 인용한 버전과 독자가 그 URL에서 찾을 버전 사이에 어떤 주장이 바뀌었는지 정확히 볼 수 있습니다. 3월 파일이 없으면 무언가 바뀌었다는 사실조차 입증할 방법이 없습니다. URL은 똑같아 보이고 페이지는 현재 상태만 보여 주기 때문입니다.
기관 세션 뒤의 전문
교내 네트워크에 있거나 도서관을 통해 로그인했으므로 논문이 표시됩니다. 확장 프로그램은 브라우저가 렌더링한 것을 읽으므로 전문도 다른 페이지처럼 클리핑되며, 참고문헌은 노트 끝에 모인 [^1] 각주 정의가 됩니다.
그것은 여섯 달 뒤 세션이 만료되어 같은 링크가 결제를 요구할 때 중요해집니다. 문단, 저자, 날짜는 내 디스크의 파일에 있고, 그 파일의 어느 부분도 구독이 살아 있는지에 의존하지 않습니다.
같은 폴더에 자료를 두고 원고 쓰기
원고는 paper/에, 클리핑한 자료는 paper/sources/에 있습니다. 초안의 모든 인용문을 브라우저를 열지 않고 원래 파일과 대조할 수 있고, 참고문헌 목록에 필요한 URL과 날짜는 그 파일 맨 위 두 줄에 있습니다.
파일이 일반 텍스트이므로 폴더 전체에 grep을 쓰면 참고문헌 관리 도구가 답하지 못하는 질문에 답할 수 있습니다. 어떤 논문을 저장했는지가 아니라, 그중 어느 논문이 특정 표현을 실제로 썼는지입니다.
흔한 논문 읽기 방식과 비교
대부분은 이미 이 중 두세 가지를 씁니다. 솔직한 비교는 그 방법들이 실패한다는 것이 아니라 각자 다른 것을 빠뜨린다는 것입니다.
| 지금 쓰는 방법 | 얻는 것 | 치르는 비용 |
|---|---|---|
| 참고문헌 관리 도구의 브라우저 버튼 | 구조화된 메타데이터와 흔히 PDF | 읽은 텍스트는 데이터베이스 안에 있고, 인용문은 여전히 다시 입력해야 함 |
| PDF 다운로드 | 레이아웃이 잡힌 공식 판본 | 별도 도구 없이는 폴더 전체를 grep할 수 없고, 버전 간 diff도 안 됨 |
| 초록 페이지 북마크 | 즉시 만드는 포인터 | 프리프린트는 제자리에서 대체되고, 포인터는 조용히 변경을 따라감 |
| 문단 복사해 붙여 넣기 | 필요했던 텍스트 | 날짜, URL, 참고문헌 정의 없이 도착함 |
| Clean Web Clipper | HTML 텍스트, 메타데이터, 각주를 파일로 | HTML만 지원. PDF를 읽지 않고 인용 키를 쓰지 않음 |
메타데이터가 들어오지 않을 때
날짜 필드가 비어 있습니다
페이지가 확장 프로그램이 인식하는 날짜를 내보내지 않습니다. citation_date와 citation_publication_date(arXiv, PubMed, IEEE가 쓰는 태그), 그다음 JSON-LD datePublished, article:published_time, time[datetime], Unix 타임스탬프 순서로 찾습니다. 아무것도 없으면 오늘 날짜로 채우지 않고 비워 둡니다. 참고문헌 폴더에서 그럴듯하게 틀린 날짜는 하필 가장 곤란한 순간에 발견되기 때문입니다.
저자가 분명히 있는 논문인데 저자 필드가 비어 있습니다
저자 추출은 구조화 데이터와 필자 마크업을 읽은 뒤 흔한 오탐을 거릅니다. 섹션 제목, 학술지 이름, “전거 통제” 블록, 버튼 텍스트입니다. 일부 출판사는 필자 마크업 없이 JavaScript로 렌더링되는 위젯에 저자 목록을 넣고, 그러면 필터를 통과하는 것이 없습니다. 빈 필드는 의도된 결과입니다. 저자 필드에 “본문 바로가기”가 들어가는 것이 여러 클리퍼에서 그 대안이었습니다.
논문이 아니라 초록만 들어왔습니다
초록 랜딩 페이지를 클리핑했고, 대부분의 프리프린트 서버와 학술지에서 그 페이지에는 정말 초록만 있습니다. 전문은 별도 URL에 있습니다. 대개 같은 페이지의 “full text”, “HTML”, “reader” 링크입니다. 그것도 클리핑하세요. 두 페이지는 메타데이터가 달라서 두 파일로 보관할 가치가 있습니다.
수식이 빠졌습니다
이미지로 렌더링된 수식은 이미지 링크로 남고, 이미지를 “제외”로 설정했다면 완전히 사라집니다. 출판사가 수식을 텍스트로 렌더링하면 문자가 옮겨집니다. LaTeX 변환은 없습니다. 확장 프로그램은 페이지가 렌더링한 것을 읽을 뿐, 그림에서 표기법을 재구성하지 않습니다.
솔직한 한계
PDF가 아니라 HTML을 읽습니다. PDF로만 존재하는 논문은 확장 프로그램이 변환하지 않습니다. BibTeX를 가져오지 않고 인용 키도 쓰지 않습니다. frontmatter는 메타데이터이지 참고문헌 항목이 아닙니다. 이미지로 렌더링된 수식은 이미지 링크로 남습니다. 그리고 어떤 사이트는 마크업에 날짜를 전혀 게시하지 않습니다. 그런 곳에서는 추측하지 않고 필드를 비워 두는데, 정직한 답이지만 여전히 빈 필드입니다.
자주 묻는 질문
페이지에 게시일이 없으면 어떻게 되나요?
PDF를 클리핑할 수 있나요?
클리핑한 뒤에도 각주 링크가 작동하나요?
기관 로그인 뒤의 논문도 캡처할 수 있나요?
저자는 어떻게 판단하나요?
데이터 표와 보충 자료 표도 남나요?
DOI, BibTeX, 인용 키를 가져오나요?
제 노트의 `jsonld-articlebody`는 무슨 뜻인가요?
노트에 제가 읽은 프리프린트 버전이 기록되나요?
source 줄에도 들어가고, 파일 이름의 {date}가 캡처한 날을 기록합니다. 나중에 같은 논문을 다시 클리핑하면 두 파일을 바로 비교할 수 있습니다. 버전이 바뀌었다는 것을 믿을 만하게 남기는 방법은 그것뿐입니다.