Clean Web Clipper Chrome에 추가 (무료)

Chrome 확장 프로그램

다시 손볼 필요 없는 Markdown으로 웹페이지 저장

아이콘을 누르면 클립이 이미 완성되어 있습니다. 제목, 저자, 게시일, 출처는 frontmatter에 모이고, 본문에서는 내비게이션이 걷혀 있습니다. 모든 과정이 브라우저 안에서 일어납니다. 계정이 필요 없고, 클리핑한 내용은 어디에도 업로드되지 않습니다.

클리핑한 위키백과 문서의 Markdown을 보여 주는 Clean Web Clipper 창

Clean Web Clipper는 웹페이지를 깔끔한 Markdown으로 저장하는 무료 Chrome 확장 프로그램입니다. 클립보드, .md 파일, 폴더, 또는 Obsidian vault로 바로 저장하며, 계정도 로그인도 필요 없습니다. 방문자가 가장 많은 사이트의 페이지 512개로 테스트한 결과, 크래시는 없었고 추출된 어떤 기사에도 HTML 태그가 남지 않았습니다.

Chrome에 추가 (무료)전부 무료, 계정도 제한도 없습니다. 추출은 오프라인에서도 작동하며, 사용 이벤트는 온라인일 때 전송되고 스위치 하나로 멈출 수 있습니다.

세계에서 방문자가 가장 많은 사이트의 페이지 512개로 테스트

측정은 두 번 했습니다. 첫 번째는 세계와 러시아에서 방문자가 가장 많은 사이트 100곳에서 페이지 109개를 골라 다른 추출 엔진 세 개와 결과물을 일대일로 비교했습니다. 두 번째는 유럽 12개국 각각의 상위 50개 사이트에서 페이지 403개를 더 가져와, 그 나라 언어로 캡처한 뒤 저희 코어만으로 처리했습니다. 엔진, 버전, 날짜, 뒤처지는 부분

512테스트한 페이지
0크래시
0추출된 기사에 남은 HTML 태그
102109페이지 일대일 비교에서 중복된 메뉴 줄 수(다른 엔진은 282, 478, 491)

문제는 변환이 아닙니다. 변환에 딸려 오는 모든 것입니다.

모든 클리퍼는 HTML을 Markdown으로 바꿉니다. 그런데 노트를 열어 보면 쿠키 배너, 사이드바 메뉴, “함께 읽을 기사” 목록, 옮기는 도중 무너진 표가 들어 있습니다. Clean Web Clipper는 바로 그것을 걷어 내는 데 맞춰 만들어졌고, 걷어 낸 정도는 주장이 아니라 측정으로 보여 드립니다.

다른 클리퍼가 남기는 것

[본문 바로가기](#main) [로그인](/login) [회원가입](/register)
[홈](/) [뉴스](/news) [스포츠](/sport) [문화](/culture) [더보기](/more)

사용자 경험을 개선하기 위해 쿠키 및 유사 기술을 사용합니다.
[모두 허용] [설정 관리]

# 읽으러 온 바로 그 기사

실제 본문의 첫 문단입니다.

<div class="promo-inline">

## 함께 읽을 기사
[다른 헤드라인](/a) [헤드라인 하나 더](/b) [세 번째 헤드라인](/c)

노트에 들어가는 것

# 읽으러 온 바로 그 기사

실제 본문의 첫 문단입니다.
같은 뉴스 페이지: 일반적인 클리퍼가 남기는 것과 Clean Web Clipper가 저장하는 것

결과물이 깔끔한 이유

편집하지 않은 실제 결과물en.wikipedia.org/wiki/Markov_chain
---
title: "Markov chain - Wikipedia"
source: "https://en.wikipedia.org/wiki/Markov_chain"
date: "2002-07-07T05:14:15.000Z"
extraction: "dom"
---

A Markov chain is a stochastic process describing a sequence of possible
events in which the probability of each event depends only on the state
attained in the previous event.[^1]

[^1]: Gagniuc, Paul A. (2017). Markov Chains: From Theory to Implementation
      and Experimentation. USA, NJ: John Wiley & Sons. pp. 1-235.

Chrome에서 웹페이지를 Markdown으로 저장하는 방법

확장 프로그램을 설치한 뒤 세 단계면 됩니다. 미리 설정할 것은 없습니다. 기본적으로 클릭하면 Markdown이 이미 만들어진 미리보기가 열리고, 바로 복사하거나 파일로 저장할 수 있습니다. 나중에는 클릭 한 번으로 미리보기 없이 폴더나 vault에 노트를 바로 쓰도록 바꿀 수 있습니다.

  1. 아이콘을 고정합니다. 주소 표시줄 옆의 퍼즐 조각 메뉴를 열고 Clean Web Clipper를 툴바에 고정하세요.
  2. 보관할 기사를 엽니다. 기사로 연결되는 링크 목록 페이지가 아니라 기사 자체를 여세요.
  3. 아이콘을 누릅니다. 미리보기 창에 Markdown이 나타납니다. 복사하거나 .md 파일로 저장하세요.

저장 위치

아이콘 클릭 동작은 바꿀 수 있습니다. 미리보기 창으로 두거나, 클릭 한 번으로 아무 창도 열지 않고 vault에 노트를 넣도록 할 수 있습니다.

Clean Web Clipper 설정: 아이콘 클릭 동작 선택
클릭 동작은 설정에서 정합니다: 미리보기, 클립보드, 파일, 폴더, 또는 vault로 바로.

출처에 대해 솔직하게

모든 노트에는 extraction 필드가 찍힙니다. dom은 브라우저가 실제로 렌더링한 내용에서 텍스트를 가져왔다는 뜻입니다. jsonld-articlebody는 페이지가 렌더링을 끝내지 않아 페이지 자체의 구조화 데이터에서 본문을 읽었다는 뜻입니다. 그리고 페이지에 기사가 전혀 없을 때, 즉 쇼핑몰 진열 페이지, 피드, 검색 결과에서는 링크 300개를 쏟아 내는 대신 그렇다고 알려 줍니다.

Clean Web Clipper의 사용 효과 화면: 클립 수, 절약한 시간, 자주 쓴 사이트, 실패한 페이지
사용 효과: 성공한 클립 수, 절약한 시간, 그리고 실패한 모든 페이지.
본문이 없는 페이지를 거절하고 주소를 보낼지 묻는 Clean Web Clipper
페이지에 기사가 없음: 메뉴 링크 300개 대신 솔직한 거절.
설정 3단계가 있는 Clean Web Clipper 첫 실행 페이지
첫 실행: 아이콘 고정, 페이지 클리핑, 클릭 동작 선택.

하지 않는 일

사람들이 쓰는 열다섯 가지 방법

개발자코드 블록이 언어 태그를 유지하므로, 붙여 넣은 문서는 들어가는 즉시 구문 강조가 됩니다.

Clean Web Clipper는 코드 블록의 클래스, 부모 요소, 구문 강조기의 마크업에서 언어를 읽어 코드 블록에 적습니다. 9페이지짜리 기술 코퍼스에서 언어 태그는 코드 블록 156개 중 73개에 남았고, 비교한 두 엔진은 20개와 0개였습니다.

  • 코드 블록에 태그가 붙어 나옵니다. 태그 없는 블록이 아니라 ```js이므로, 붙여 넣는 순간 Obsidian, VS Code, GitHub에서 구문 강조가 됩니다.
  • 언어는 추측하지 않고 읽습니다. 사이트의 구문 강조기가 남긴 클래스에서 가져오므로, 태그는 원본 페이지만큼 정확합니다.
  • 셀에 코드가 든 표도 온전하게 남습니다. 기술 코퍼스에서 15개 중 12개가 유지되었고, 비교한 엔진은 각각 7개였습니다.
자세히 보기
Obsidian 사용자vault 안의 폴더를 한 번 고르면, Obsidian이 닫혀 있어도 클릭 한 번으로 노트가 거기에 기록됩니다.

Clean Web Clipper는 브라우저의 File System Access API로 vault에 .md 파일을 직접 씁니다. 커뮤니티 플러그인도, 로컬 REST 서버도, obsidian:// 링크도 거치지 않으며, 노트가 도착하는 데 Obsidian이 실행 중일 필요도 없습니다.

  • 플러그인도, 로컬 서버도, obsidian:// 링크도 없습니다. 브라우저가 허용한 폴더에 파일을 씁니다.
  • Obsidian이 열려 있지 않아도 됩니다. 다음에 열면 노트가 그냥 거기 있습니다.
  • title, source, author, date, extraction이 담긴 YAML frontmatter. 무엇을 남길지는 직접 고릅니다.
자세히 보기
AI와 LLM 컨텍스트페이지에서 반복되는 내비게이션은 돈 내고 쓰는 컨텍스트입니다. 텍스트가 모델에 닿기 전에 제거됩니다.

109페이지 코퍼스(일대일 비교 측정)에서 Clean Web Clipper가 남긴 중복 내비게이션 줄은 102개였고, 다른 추출 엔진 세 개는 282, 478, 491개를 남겼습니다. 남은 HTML 태그는 전혀 없었습니다. 모델에 닿는 것은 기사와, 출처 URL과 게시일을 적은 frontmatter 머리글입니다.

  • 중복 내비게이션이 비교한 엔진 평균보다 약 4분의 1 수준: 반복 줄 102개, 다른 엔진은 282, 478, 491개.
  • 테스트한 페이지 512개에서 남은 HTML 태그 0개: 모델이 헤쳐 나갈 마크업이 없습니다.
  • frontmatter에 출처 URL과 게시일이 적혀 있으므로, 주장의 출처를 추측하지 않고 밝힐 수 있습니다.
자세히 보기
연구자arXiv, PubMed, IEEE가 내보내는 citation_date를 읽고, 참고문헌을 각주로 바꿉니다.

게시일 없이 저장한 논문은 나중에 다시 복원해야 하는 인용입니다. Clean Web Clipper는 본문이 아니라 페이지 자체의 메타데이터에서 날짜를 읽고, 페이지에 날짜가 없으면 오늘 날짜로 채우지 않고 필드를 비워 둡니다.

  • citation_datecitation_publication_date(arXiv, PubMed, IEEE가 내보내는 메타 태그)를 바로 읽습니다.
  • JSON-LD datePublished, article:published_time, time[datetime], Unix 타임스탬프도 이 우선순위로 읽습니다.
  • 페이지에 날짜가 없으면 필드는 비어 있습니다. 오늘 날짜로 채우지 않습니다.
자세히 보기
학생강의, 교재 장, 참고 페이지를 수강 계정이 사라진 뒤에도 남는 Markdown 파일로 클리핑합니다.

강의 자료는 학기가 끝나면 사라집니다. 링크가 끊기고, 과목 페이지는 보관 처리되고, 세미나 읽을거리는 옮겨집니다. 내 디스크의 Markdown 파일은 사라지지 않으며, 10년 뒤에도 어떤 편집기에서나 원래 URL을 담은 채 열립니다.

  • 문단을 선택하면 선택 영역만 클리핑됩니다. 주변 페이지 없이 정의 하나만 가져오는 방법입니다.
  • 모든 노트에 출처 URL이 들어 있어서, 나중에 인용할 때 찾아다닐 필요가 없습니다.
  • 읽기 모드가 저장하기 전에 클립을 Markdown 기호 없는 일반 텍스트로 보여 줍니다.
자세히 보기
작가제목, 저자, 게시일, 출처 URL이 모든 클립에 함께 따라가므로, 인용문의 출처가 남습니다.

스크린숏과 북마크로 모은 자료는 출처를 밝혀야 하는 바로 그 순간 쓸모를 잃습니다. Markdown 파일은 제목, 저자, 날짜, 주소를 텍스트와 같은 파일에 담아 두므로, 사실 확인이 거기에 닿을 수 있습니다.

  • 모든 노트의 frontmatter에 title, author, date, source가 들어 있어, 출처 표기가 텍스트와 함께 있습니다.
  • 저자 필드는 걸러집니다. 섹션 제목, 매체 이름, 버튼 텍스트를 필자로 취급하지 않습니다.
  • 기사 본문만: 뉴스레터 상자, 공유 버튼 줄, “함께 읽을 기사” 띠는 노트에 들어가지 않습니다.
자세히 보기
기자읽은 그대로의 텍스트를 게시일, 주소와 함께 내 디스크의 파일로 남깁니다.

페이지는 수정되고 내려갑니다. 클립은 전문, 출처 URL, 페이지가 스스로 밝힌 게시일을 내가 보관하는 일반 파일에 담습니다. 문을 닫거나 약관을 바꾸거나 기록을 조용히 잃어버릴 수 있는 서비스가 아니라요.

  • 게시일은 본문이 아니라 페이지 자체의 메타데이터에서 읽습니다. JSON-LD, article:published_time, time[datetime].
  • 모든 노트의 frontmatter에 출처 URL이 있습니다.
  • 방문할 때마다 바뀌는 내비게이션과 홍보 블록 없이 기사 전문을 담습니다.
자세히 보기
법률 업무게시된 그대로의 텍스트를 출처 주소, 날짜와 함께 내가 관리하는 파일에 남깁니다.

법령, 서비스 약관, 공식 지침은 예고 없이 바뀝니다. 출처 주소와 페이지가 밝힌 날짜를 담은 Markdown 사본은 내가 읽은 날 그 텍스트가 무엇이라고 했는지의 기록입니다.

  • 문언 그대로: 기사 본문 안의 어떤 것도 요약하거나 고쳐 쓰거나 순서를 바꾸지 않습니다.
  • 모든 노트의 frontmatter에 출처 URL과 페이지가 밝힌 게시일이 들어갑니다.
  • 수수료, 기한, 기준 금액 표는 확장 프로그램이 직접 직렬화합니다. 비교한 엔진이 각각 7개를 지킨 기술 코퍼스의 표 15개 중 12개를 온전히 남겼습니다.
자세히 보기
분석가셀에 코드, 목록, 링크가 있어도 행이 깨지지 않습니다. 표 15개 중 12개가 유지되었습니다.

범용 HTML→Markdown 변환기는 정작 중요한 표, 즉 셀 안에 목록, 링크, 코드 예제가 있는 표에서 깨집니다. Clean Web Clipper는 표를 직접 직렬화하고, 행을 버리는 대신 셀 내용을 평평하게 펼칩니다.

  • 이 용도로 작성한 GFM 표 직렬화기입니다. 범용 변환기 플러그인을 덧붙인 것이 아닙니다.
  • 표 15개 중 12개 유지(기술 코퍼스), 비교한 엔진은 각각 7개.
  • 들쭉날쭉한 2열 표는 깨진 격자 대신 굵은 키와 값의 줄이 됩니다.
자세히 보기
교사사이트 군더더기 없이 자료만: 인쇄된 종이에 메뉴도, 동의 배너도, 광고도 없습니다.

브라우저에서 바로 인쇄한 페이지는 메뉴, 동의 배너, 광고까지 유인물에 싣습니다. 클리핑하면 텍스트만 가져오고, 출처 URL은 파일 안에 남으므로 출처 표기에 추가 작업이 들지 않습니다.

  • 주변 페이지가 아니라 클립을 인쇄하는 인쇄 버튼이 있습니다.
  • 읽기 모드가 인쇄하거나 저장하기 전에 결과를 Markdown 기호 없는 일반 텍스트로 보여 줍니다.
  • 활동 하나, 정의 하나를 선택해 그것만 클리핑합니다.
자세히 보기
번역가메뉴, 배너, 반복되는 내비게이션이 세그먼트 목록에 들어가지 않습니다.

웹페이지에서 붙여 넣은 원문에는 내비게이션이 딸려 오고, 메뉴 항목 하나하나가 건너뛰고, 세고, 결국 견적서에서 설명해야 하는 세그먼트가 됩니다. Clean Web Clipper는 파일이 도구 근처에 가기 전에 그것을 제거합니다.

  • 메뉴, 페이지네이션, 동의 배너, “함께 읽을 기사” 피드는 파일이 생기기 전에 잘려 나갑니다.
  • 중복 내비게이션이 비교한 엔진보다 약 4분의 1로: 반복 줄 102개, 다른 엔진은 282, 478, 491개.
  • 측정한 페이지 512개에서 남은 HTML 태그 0개이므로, 떠도는 마크업이 인라인 태그로 바뀌지 않습니다.
자세히 보기
프로덕트 매니저변경 내역, 문서, 릴리스 노트를 검색하고 diff하고 인용할 수 있는 파일로 클리핑합니다.

북마크로 보관한 경쟁사 조사는 검색할 수 없는 링크 목록으로 퇴화합니다. Markdown으로 클리핑하면 grep하고, 지난 분기 캡처와 diff하고, 날짜를 붙여 의사결정 문서에 인용할 수 있는 코퍼스가 됩니다.

  • 게시일을 페이지에서 읽으므로, 변경 내역 항목이 내가 발견한 날이 아니라 실제 시점을 유지합니다.
  • 사이트별 규칙이 경쟁사마다 전용 폴더로 자동 분류합니다.
  • 요금과 제한 표가 살아남습니다. 측정에서는 표 15개 중 12개가 온전했고, 비교 대상 엔진은 7개씩에 그쳤습니다.
자세히 보기
테크니컬 라이터제목, 표, 코드 블록, 각주는 옮겨지고 사이트의 껍데기는 옮겨지지 않습니다.

문서 이전은 보통 HTML을 변환한 뒤 변환기가 남긴 것을 지우는 데 더 오래 걸립니다. Clean Web Clipper는 바로 그 제거를 중심으로 만들어졌고, 측정한 것도 그 부분입니다. 페이지 512개에서 남은 HTML 태그 0개.

  • 제목, 목록, 표, 코드 블록, 각주가 모두 표준 Markdown으로 대응됩니다.
  • 코드 블록이 언어 태그를 유지합니다. 기술 코퍼스에서 156개 중 73개가 유지되었고, 비교한 엔진은 20개와 0개였습니다.
  • 측정한 페이지 512개에서 남은 HTML 태그 0개.
자세히 보기
개인 아카이브내 디스크의 일반 Markdown 파일입니다. 계정도, 서비스도, 문을 닫을 수 있는 것도 없습니다.

북마크는 바뀌거나 사라지는 페이지를 가리키고, 나중에 읽기 서비스는 문을 닫거나, 인수되거나, 내보내기에 돈을 받기 시작합니다. 클립은 텍스트 그 자체이며, 업체도 만료일도 없는 형식으로 내가 정한 곳에 보관됩니다.

  • 오래가는 개방 형식: YAML frontmatter가 붙은 일반 텍스트로, 어떤 편집기와 grep으로도 읽힙니다.
  • 계정도 업로드도 없습니다. 클리핑한 것은 내 디스크에 남습니다.
  • 게시일과 출처 URL이 텍스트와 함께 캡처되므로, 몇 년 뒤에도 노트가 무엇인지 알 수 있습니다.
자세히 보기
군더더기 없이 읽기메뉴도, 배너도, Markdown 기호도 없는 읽기 모드를 브라우저 자체의 테마로 보여 줍니다.

페이지 부가 요소는 시각적 어수선함만이 아닙니다. 스크린 리더가 읽어 주고 독자가 방문할 때마다 건너뛰어야 하는 텍스트입니다. 클립 창은 페이지 스크립트를 실행하지 않은 채, 브라우저의 라이트 또는 다크 설정으로 기사만 보여 줍니다.

  • 읽기 모드는 클립을 일반 텍스트로 표시합니다. Markdown 기호 없이, 작동하는 링크와 진짜 제목과 함께.
  • 사이트가 아니라 브라우저의 라이트·다크 설정을 따릅니다.
  • 긴 기사에서는 창이 화면의 약 4분의 3까지 커집니다.
자세히 보기
Chrome에 추가 (무료)전부 무료, 계정도 제한도 없습니다. 추출은 오프라인에서도 작동하며, 사용 이벤트는 온라인일 때 전송되고 스위치 하나로 멈출 수 있습니다.

자주 묻는 질문

Clean Web Clipper가 제 페이지를 어딘가로 보내나요?
페이지는 보내지 않습니다. 추출과 변환은 전부 브라우저 안에서 일어납니다. 복사본은 클립보드로, 파일은 디스크로 가며, 페이지 텍스트나 제목은 컴퓨터를 떠나지 않습니다. 저희 통계 서버로 나가는 것은 네 가지입니다. 기사를 찾지 못한 페이지의 주소, 경로를 뺀 성공한 클립의 도메인, 연 확장 프로그램 화면의 이름, 이 이벤트들을 묶는 무작위 설치 번호입니다. 서버는 IP 주소로 알아낸 대략적인 위치(국가, 지역, 도시)도 기록하며, IP 주소 자체는 저장하지 않습니다. 어느 것도 제3자에게 가지 않으며, 설정의 스위치 하나로 모두 멈추고 번호도 지워집니다. 확장 프로그램은 사용자가 읽는 사이트에 대한 권한을 요청하지 않으므로, 클릭하지 않은 페이지는 볼 수 없습니다.
vault에 저장하려면 Obsidian을 실행해 두어야 하나요?
아니요. Clean Web Clipper는 브라우저의 File System Access API로 접근을 허용한 폴더에 파일을 직접 씁니다. Obsidian은 다음에 vault를 볼 때 파일을 읽어 들입니다.
기사가 아닌 페이지에서는 어떻게 되나요?
그렇다고 알려 줍니다. 쇼핑몰 진열 페이지, 피드, 검색 결과에는 추출할 기사가 없으므로, 링크로 가득한 페이지를 돌려주는 대신 클립에 “기사 없음” 표시를 합니다.
어떤 브라우저에서 작동하나요?
Chrome과 다른 Chromium 계열 브라우저입니다. Edge, Brave, Vivaldi, Opera. Manifest V3 확장 프로그램이며, 통신할 수 있는 곳은 저희 통계 주소뿐입니다. 사용자가 읽는 사이트와는 통신하지 않습니다.
무료인가요?
네, 전부 무료입니다. 이 사이트에 설명한 모든 기능이 무료 확장 프로그램에서 작동합니다. 페이지 제한 없는 클리핑, Obsidian vault, 사이트별 규칙, 각주, 표, 코드 언어 태그, 읽기 모드까지. 인터페이스는 19개 언어로 제공되며 브라우저 설정을 따릅니다. 유료 요금제도, 계정도, 가입도 없습니다.