Clean Web Clipper Chrome에 추가 (무료)

누구를 위한 도구인가

오래가는 형식으로 웹페이지 저장하기

북마크는 바뀌거나 사라지는 페이지를 가리키고, 나중에 읽기 서비스는 문을 닫거나, 인수되거나, 내보내기에 돈을 받기 시작합니다. 클립은 텍스트 그 자체이며, 업체도 만료일도 없는 형식으로 내가 정한 곳에 보관됩니다.

저장한 읽을거리가 사라지는 이유

오래 읽어 온 사람이라면 서재를 한 번은 잃어 봤습니다. 나중에 읽기 서비스가 문을 닫았는데, 내보내기 파일은 대부분 이미 죽은 URL을 담은 JSON 파일이었습니다. 노트 앱이 형식을 바꿔서 옛 파일을 열려면 옛 버전이 필요했습니다. 2014년의 북마크 폴더는 이제 페이지마다 주차된 도메인이나 누군가의 홈페이지로 리디렉션됩니다.

공통점은 의존입니다. 저장한 읽을거리가 어떤 회사가 계속 존재해야, 계정이 계속 작동해야, 한 프로그램만 이해하는 형식이어야 한다면, 그것은 보관한 것이 아니라 빌린 것입니다. 일반 텍스트에는 그런 의존이 하나도 없고, 그래서 20년 전에 쓴 파일이 오늘도 아무 절차 없이 열립니다.

사람들이 나중에 알아채는 실패는 보관이 아니라 찾기입니다. 아무도 검색할 수 없는 아카이브는 좋은 의도로 만든 매립지입니다. 어떤 주제에 대해, 어느 해에, 이름이 기억나지 않는 사이트에서 무언가를 읽었다는 것은 알지만 들어갈 방법이 없습니다. 일반 텍스트는 어떤 인터페이스도 할 수 없는 방식으로 이를 해결합니다. 모든 운영체제의 모든 도구가 검색할 수 있고, 10년치 읽을거리에 grep 한 번이면 파일이 나오며, 파일 자체의 머리글이 어떤 페이지였고 언제 게시되었는지 말해 줍니다.

클립으로 만든 아카이브의 모습

2000년의 노트가 지금도 열립니다joelonsoftware.com
---
title: "Things You Should Never Do, Part I"
source: "https://www.joelonsoftware.com/2000/04/06/things-you-should-never-do-part-i/"
author: "Joel Spolsky"
date: "2000-04-06"
extraction: "dom"
---

They did it by making the single worst strategic mistake that any software
company can make: they decided to rewrite the code from scratch.

아카이브 폴더 만들기

설정 전체는 한 가지를 참으로 만들기 위해 있습니다. 클리핑이 클리핑할지 결정하는 것보다 저렴해야 한다는 것. 나머지는 모두 거기서 따라 나옵니다.

  1. 폴더 하나를 골라 아카이브로 삼습니다. 문서가 있는 곳의 최상위에 Archive. 주제별 폴더 여러 개가 아니라 하나입니다. 주제는 검색이 하는 일이고, 폴더 트리는 읽는 순간 내려야 하는 분류 결정입니다.
  2. 확장 프로그램 아이콘에서 옵션을 열고, 저장 위치를 거기로 지정한 뒤 아이콘 클릭 동작을 “폴더에 저장”으로 설정합니다. 창도, 대화 상자도, 결정도 없이. 습관 전체가 키 한 번의 비용에 달려 있습니다.
  3. 파일 이름에는 {date}-{domain}-{title} 템플릿을 씁니다. 시간순 정렬, 한눈에 보이는 사이트, 그리고 다른 페이지의 두 클립이 이름을 두고 다투지 않을 만큼의 고유성을 줍니다.
  4. frontmatter의 모든 필드를 활성화합니다. date는 페이지 자체의 게시일, extraction은 텍스트를 얻은 방법이며, 둘 다 나중에 덧붙일 수 없는 정보입니다.
  5. 늘 읽는 몇몇 사이트에 전용 하위 폴더를 둔 사이트별 규칙을 추가합니다. 그러면 가장 많이 클리핑하는 자료, 곧 평평한 폴더가 가장 먼저 다루기 어려워지는 곳이 스스로 정리됩니다.
  6. 문서를 백업하는 곳에 폴더를 포함시키고, 한 번, 정말 한 번은 그 백업에서 파일을 복원해 열어 보세요. 한 번도 복원해 보지 않은 아카이브는 가설입니다.
  7. 정리 시간을 따로 잡지 말고 읽으면서 클리핑하세요. 다시 찾으러 갔을 페이지가 바로 사라져 있을 페이지입니다.

보관을 위한 설정

아래 값은 아카이브가 처음 시작한 컴퓨터보다, 아마 브라우저보다도 오래갈 것이라고 가정합니다. 여기 있는 어떤 것도 함께 살아남아야 하는 의존을 만들지 않습니다.

설정여기서 이 값인 이유
아이콘 클릭폴더에 저장습관은 키 한 번이면 살아남고 세 번이면 죽습니다
저장 위치`Archive` 폴더 하나읽을 때 주제별로 분류하는 것은 셋째 주에 멈추는 단계입니다
파일 이름 템플릿`{date}-{domain}-{title}`색인 없이 한 줄로 시간순, 출처, 고유성
frontmatter모든 필드 켬게시일과 추출 경로는 나중에 재구성할 수 없습니다
사이트별 규칙자주 읽는 도메인 → 하위 폴더가장 많이 클리핑하는 사이트가 평평한 폴더를 가장 먼저 불편하게 만듭니다
이미지링크로 유지사이트가 망가지면 깨지겠지만, 링크는 그림이 있었다는 기록입니다
백업평소 백업에 폴더 포함, 한 번 복원텍스트는 무엇에서든 복원됩니다. 시험하지 않은 백업은 믿음입니다
같은 페이지를 두 번 클리핑하면 두 번 보관됩니다보관 폴더의 파일 목록
Archive/
  2019-08-14-the-website-obesity-crisis.md
  2026-01-07-the-website-obesity-crisis.md
  2026-01-07-the-website-obesity-crisis-2.md

세 번째 파일은 같은 날 두 번째로 한 클립입니다. 이름이 겹치면 덮어쓰지 않고
숫자 접미사가 붙습니다. 2019년 파일은 지금도 어떤 편집기에서나 열리고,
frontmatter에는 여전히 원래 URL이 적혀 있습니다.

같은 습관의 3년

아침에 읽고, 어쩌다 보니 보관

일주일 동안 긴 글 여섯 편을, 다 읽을 때마다 키 한 번으로 클리핑합니다. 창도 열리지 않고, 정리도 하지 않으며, 이것이 보관할 가치가 있는지 결정하지도 않습니다. 바로 그것이 핵심입니다. 그 결정이 아카이브가 생기지 못하게 막기 때문입니다.

쌓이는 것은 파일 이름이 날짜, 사이트, 제목을 알려 주고 각 파일의 첫 네 줄이 URL, 저자, 게시일을 알려 주는 폴더입니다. 아무것도 정리하지 않았는데도 검색이 됩니다. 이름 짓기가 정리를 대신했기 때문입니다.

몇 년 전에 읽은 것 찾기

기억나는 것은 문구 하나뿐입니다. 사이트도, 해도, 저자도 아닙니다. 아카이브 폴더를 한 번 검색하면 파일이 나오고, 머리글이 페이지를 알려 줍니다. 색인을 만든 적도 없고, 어떤 앱이 아직 존재해야 할 필요도 없었으며, 네트워크를 끈 상태에서도 검색이 됐습니다.

이것이 북마크 폴더가 할 수 없는 바로 그 일입니다. 북마크는 무엇이 적혀 있었는지가 아니라 어디에 있었는지를 저장하므로, 북마크 검색은 다른 사람이 정한 제목만 찾을 수 있습니다.

사이트는 내려가고 텍스트는 남는다

몇 년 동안 읽던 블로그의 주소가 더는 열리지 않습니다. 클립은 영향을 받지 않습니다. 텍스트, 저자, 게시일은 내 디스크의 파일에 있고, 이제 아무것도 응답하지 않는 주소도 source 줄에 여전히 기록되어 있습니다.

솔직한 예외는 이미지입니다. 링크였으므로 사이트가 망가지면 함께 망가지고, 사진이 가치의 전부였던 페이지는 이 방식으로 보존되지 않습니다. 텍스트 아카이브가 하는 거래가 그것이고, 내 페이지 중 어느 것이 그 거래의 불리한 쪽에 서는지 알아 둘 가치가 있습니다.

읽을거리를 보관하는 다른 방법과 비교

이 표에서 가장 강한 선택지는 이것이 아닙니다. 완전 충실도 아카이브는 더 많이 보관하지만, 공간, 설정, 계속 작동해야 하는 것의 수에서 비용도 더 큽니다.

지금 쓰는 방법얻는 것치르는 비용
북마크무료로 얻는 주소 목록무엇이 아니라 어디만 저장. 10년 전 폴더는 대부분 주차된 도메인
나중에 읽기 서비스어디서나 동기화되는 깔끔한 읽기서비스가 계속 존재하고, 내보내기를 유지하고, 가격을 유지해야 함
페이지를 HTML로 저장자산과 레이아웃까지 담긴 페이지크고, 전체 검색이 불편하며, 편하게 읽으려면 브라우저가 필요
직접 운영하는 아카이브 서버스크린숏과 자산까지 완전 충실도운영할 소프트웨어, 관리할 저장 공간, 적용할 업데이트가 끝없이
PDF로 인쇄어디서나 열리는 고정 기록폴더 전체를 텍스트로 검색할 수 없고, diff 불가, 읽을 때마다 파일 하나
Clean Web Clipper텍스트와 메타데이터만, 오래도록레이아웃도, 이미지도, 제3자 타임스탬프도 없음. 설계상 텍스트만

몇 년에 걸쳐 생기는 문제

오래된 클립의 이미지가 깨졌습니다

이미지는 링크이고, 가리키던 사이트가 옮겨졌거나, 개편되었거나, 사라졌습니다. 확장 프로그램은 바이너리 자산을 내려받지 않으므로 클립 아카이브는 텍스트 아카이브입니다. 사진이 핵심인 곳(포토 에세이, 도식, 만화)이라면 그때 따로 저장하거나, 이 도구가 그것을 보존하는 도구가 아니라는 점을 받아들이세요.

폴더가 거의 같은 파일로 채워집니다

이름 충돌 규칙이 제 일을 하는 것입니다. 같은 페이지의 두 번째 클립은 첫 번째를 대체하지 않고 숫자 접미사가 붙습니다. 바뀐 페이지를 두 번째로 캡처한 쪽이 더 흥미로운 경우가 많기 때문입니다. 자동으로 중복을 제거하는 것은 없습니다. 일반 텍스트에서 중복을 찾는 것은 흔한 도구 어느 것으로든 한 줄짜리 작업이고, 둘을 비교하는 것은 diff입니다.

아카이브의 절반이 “Home”이나 “Untitled”라는 이름입니다

제목은 페이지 자체의 메타데이터에서 오는데, 어떤 사이트는 모든 페이지에 같은 제목을 줍니다. 파일 이름 템플릿의 {domain}{date}가 그래서 있습니다. 둘 다 이름에 있으면 쓸모없는 제목이라도 찾을 수 있는 파일이 됩니다. 이미 그런 파일이 100개 있다면, 텍스트 파일이니 손이나 스크립트로 이름을 바꾸면 되고, 어느 쪽이든 안의 내용은 잃지 않습니다.

어떤 페이지는 아예 클리핑이 안 됩니다

세 가지 범주입니다. 브라우저가 보호하는 페이지(chrome:// 주소와 확장 프로그램 스토어)에서는 어떤 확장 프로그램도 실행될 수 없습니다. 피드, 쇼핑몰 진열 페이지, 검색 결과처럼 기사 본문이 없는 페이지는 링크 목록으로 돌려주는 대신 “기사 없음”으로 알립니다. 그리고 내게 렌더링되지 않은 모든 것, 내장 뷰어 안의 내용도 포함되는데, 그것은 클립이 닿지 않는 별개의 문서입니다.

보존하지 않는 것

페이지가 아니라 텍스트를 저장합니다. 레이아웃도, 스크린숏도, 글꼴도, 스크립트도, 내려받은 이미지도 없습니다. 이미지 링크는 원래 사이트를 가리키고 그 사이트가 망가지면 함께 망가집니다. 웹 아카이브가 아니며 제3자 타임스탬프도 없습니다. 방문 기록을 읽거나 북마크를 일괄로 가져오지 않습니다. 클리핑 대상은 열려 있는 그 페이지입니다. 그리고 브라우저가 렌더링한 것을 캡처하므로, 내게 렌더링되지 않는 페이지는 보관할 수 없습니다.

Chrome에 추가 (무료)전부 무료입니다. 계정도, 가입도, 제한도 없습니다.

자주 묻는 질문

확장 프로그램 유지보수가 끊기면 어떻게 되나요?
파일은 영향을 받지 않습니다. 내 폴더의 일반 Markdown이고, 기록된 뒤에는 확장 프로그램에 의존하지 않습니다.
이미지도 저장하나요?
원래 사이트를 계속 가리키는 이미지 링크를 저장합니다. 그림 자체가 필요하다면 따로 저장하세요. 확장 프로그램은 바이너리 자산을 내려받지 않습니다.
클리핑할 수 있는 양에 제한이 있나요?
아니요. 페이지 제한도, 일일 할당량도, 계정도, 유료 요금제도 없습니다.
기존 북마크를 한꺼번에 가져올 수 있나요?
아니요. 확장 프로그램은 지금 보고 있는 페이지를 클리핑하므로, 옛 북마크는 하나씩 열어 클리핑해야 합니다. 그중 어느 것이 아직 열리는지 알 수 있는 유일한 방법이기도 합니다.
10년 뒤에도 파일이 열릴까요?
YAML 머리글이 붙은 UTF-8 텍스트이고, 20년 전에 쓰여 오늘도 열리는 파일과 같은 모양입니다. 기록된 뒤에는 파일 안의 어떤 것도 확장 프로그램에 의존하지 않습니다.
완전 충실도 아카이브도 따로 보관해야 하나요?
레이아웃, 이미지, 겉모습이 본질인 페이지라면 그렇습니다. 이것은 텍스트 아카이브이고 그렇다고 밝힙니다. 둘은 대안이 아니라 보완 관계입니다. 검색하고 싶은 읽을거리는 텍스트로, 그때 모습 그대로 다시 보고 싶은 몇 안 되는 페이지는 완전 충실도 사본으로.
휴대폰에서 아카이브를 읽을 수 있나요?
네, 파일 동기화 도구를 통해서요. .md 텍스트 파일이므로 모바일 노트 앱, 텍스트 편집기, Markdown 뷰어로 열리고, 검색도 데스크톱과 같은 방식으로 됩니다.
아카이브는 공간을 얼마나 차지하나요?
텍스트이므로 매우 적습니다. 같은 페이지를 이미지와 스크립트까지 HTML로 저장하면 몇 자릿수 더 크고, 텍스트는 백업에서 가장 잘 압축되고 중복 제거되는 형식이기도 합니다.
몇 년 전에 저장한 HTML 페이지를 변환할 수 있나요?
아니요. 디스크의 파일이 아니라 브라우저가 표시하는 페이지에서 작동합니다. 오래전 저장한 페이지를 브라우저에서 열어 클리핑할 수는 있지만 한 페이지씩입니다. 일괄 변환은 없습니다.
중복을 제거하거나 캡처를 병합하나요?
아니요. 병합도, 교체도, 자동 정리도 없고, 모든 클립은 새 파일입니다. 아카이브에서는 의도된 것입니다. 엉뚱한 사본을 지우는 자동 정리는 되돌릴 수 없는 유일한 실패이기 때문입니다.