Clean Web Clipper 加到 Chrome(免費)

Chrome 擴充功能

把網頁存成不必再整理的 Markdown

按下圖示,擷取內容就已經準備好:標題、作者、發布日期和來源都收進 frontmatter,內文去掉了導覽列。一切都在你的瀏覽器中進行:不需要帳號,你擷取的內容也不會上傳到任何地方。

Clean Web Clipper 視窗,顯示一篇維基百科文章擷取後的 Markdown

Clean Web Clipper 是一款免費的 Chrome 擴充功能,能把網頁儲存為乾淨的 Markdown:存到剪貼簿、.md 檔案、資料夾,或直接存進 Obsidian vault,不需要帳號,也不需要登入。在最多人造訪的網站上測試了 512 個頁面:沒有當機,擷取出的文章中也沒有任何殘留的 HTML 標籤。

加到 Chrome(免費)完全免費,不需要帳號,沒有限制。擷取可離線運作;使用事件會在連線時送出,關閉一個開關即可停止。

在全球最多人造訪的網站上測試了 512 個頁面

共兩輪測試。第一輪取了全球與俄羅斯前一百大網站的 109 個頁面,把輸出與另外三個擷取引擎逐頁比較。第二輪取了十二個歐洲國家各自的前五十大網站:再加 403 個頁面,每一頁都以該國語言擷取,只用我們的核心執行。引擎、版本、日期,以及我們落後的地方

512個頁面受測
0次當機
0擷取文章中殘留的 HTML 標籤
102在 109 頁的逐頁比較中重複的選單行數,其他引擎分別為 282、478 和 491

問題從來不在轉換,而在轉換時一起帶進來的一切。

每個擷取工具都能把 HTML 轉成 Markdown。然後你打開筆記,看到 Cookie 橫幅、側欄選單、「延伸閱讀」清單,還有一個在途中崩壞的表格。Clean Web Clipper 正是圍繞著移除這些東西而打造的,而且移除的效果經過測量,不只是宣稱。

其他擷取工具保留的內容

[跳到主要內容](#main) [登入](/login) [註冊](/register)
[首頁](/) [新聞](/news) [體育](/sport) [文化](/culture) [更多](/more)

我們使用 Cookie 及類似技術來改善你的使用體驗。
[全部接受] [管理偏好設定]

# 你要看的那篇文章

正文真正的第一段。

<div class="promo-inline">

## 延伸閱讀
[另一則標題](/a) [再一則標題](/b) [還有第三則](/c)

最後存進筆記的內容

# 你要看的那篇文章

正文真正的第一段。
同一個新聞頁面:一般擷取工具保留的內容,以及 Clean Web Clipper 儲存的內容

輸出為什麼乾淨

實際輸出,未經編輯en.wikipedia.org/wiki/Markov_chain
---
title: "Markov chain - Wikipedia"
source: "https://en.wikipedia.org/wiki/Markov_chain"
date: "2002-07-07T05:14:15.000Z"
extraction: "dom"
---

A Markov chain is a stochastic process describing a sequence of possible
events in which the probability of each event depends only on the state
attained in the previous event.[^1]

[^1]: Gagniuc, Paul A. (2017). Markov Chains: From Theory to Implementation
      and Experimentation. USA, NJ: John Wiley & Sons. pp. 1-235.

如何在 Chrome 中把網頁存成 Markdown

安裝擴充功能,然後只要三個步驟。不需要事先設定:預設情況下,按一下會開啟預覽,Markdown 已經產生好,可以直接複製或存成檔案。之後你也可以讓一次點擊直接把筆記寫入資料夾或 vault,跳過預覽。

  1. 釘選圖示。 打開網址列旁邊的拼圖圖示選單,把 Clean Web Clipper 釘選到工具列。
  2. 打開你想保存的文章:是文章本身,而不是列出文章連結的頁面。
  3. 按下圖示。 Markdown 會出現在預覽視窗中:複製它,或儲存 .md 檔案。

存到哪裡

按下圖示的行為可以自訂。可以保留為預覽視窗,也可以讓一次點擊直接把筆記放進 vault,什麼視窗都不開。

Clean Web Clipper 設定:選擇按下圖示時的動作
設定決定一次點擊做什麼:預覽、剪貼簿、檔案、資料夾,或直接存進 vault。

誠實交代來源

每則筆記都帶有 extraction 欄位。dom 表示文字來自瀏覽器實際呈現的內容。jsonld-articlebody 表示頁面始終沒有完成呈現,內文必須從頁面自己的結構化資料讀取。而當頁面上根本沒有文章時,例如商店首頁、資訊流、搜尋結果,擴充功能會直接說明,而不是丟給你三百個連結。

Clean Web Clipper 的「效益」畫面:擷取次數、省下的時間、常用網站和失敗的頁面
效益:成功擷取了幾次、省下多少時間,以及每一個沒有成功的頁面。
Clean Web Clipper 拒絕沒有文章的頁面,並提供傳送網址的選項
頁面上沒有文章:誠實拒絕,而不是三百個選單連結。
Clean Web Clipper 首次執行頁面,包含三個設定步驟
首次執行:釘選圖示、擷取一個頁面、選擇點擊時的動作。

它不做的事

十五種使用方式

開發者程式碼區塊保留語言標籤,貼上的文件一落地就有語法醒目提示。

Clean Web Clipper 從頁面上讀取語言:來自程式碼區塊的 class、父元素,或語法醒目提示工具自己的標記,並把它寫進程式碼區塊。在一份九個頁面的技術語料上,語言標籤在 156 個程式碼區塊中保留了 73 個,比較的兩個引擎分別是 20 個和 0 個。

  • 程式碼區塊帶有標籤。 是 ```js,不是空白的區塊:貼上的那一刻,Obsidian、VS Code 和 GitHub 就能醒目提示語法。
  • 語言是讀出來的,不是猜的。 它來自網站自己的語法醒目提示工具留下的 class,所以標籤和來源頁面一樣正確。
  • 儲存格中有程式碼的表格保持完整:技術語料上保留了 15 個中的 12 個,比較的引擎各保留 7 個。
了解更多
Obsidian 使用者在 vault 裡選好資料夾一次;之後按一下就把筆記寫進去,Obsidian 關著也行。

Clean Web Clipper 透過瀏覽器的 File System Access API,自己把 .md 檔案寫進你的 vault。整條流程中沒有社群外掛、沒有本機 REST 伺服器,也沒有 obsidian:// 連結,筆記送達時 Obsidian 也不必開著。

  • 不需要外掛、不需要本機伺服器、不需要 obsidian:// 連結:瀏覽器把檔案寫進你授權的資料夾。
  • Obsidian 不必開著。 下次開啟時,筆記就在那裡。
  • YAML frontmatter 包含 titlesourceauthordateextraction,你可以選擇保留哪些。
了解更多
AI 與 LLM 上下文頁面上重複的導覽是要付費的上下文。它會在文字送到模型之前被移除。

在一份 109 頁的語料上(逐頁比較那一輪),Clean Web Clipper 留下 102 行重複的導覽,另外三個擷取引擎分別留下 282、478 和 491 行,而且完全沒有殘留的 HTML 標籤。送到模型的是文章本身,加上一個註明來源網址和發布日期的 frontmatter 檔頭。

  • 重複的導覽大約少了四倍,相較於比較引擎的平均:102 行重複,對比 282、478 和 491 行。
  • 在 512 個測試頁面上沒有任何殘留的 HTML 標籤:模型不需要繞過任何東西。
  • frontmatter 註明來源網址和發布日期,所以說法可以歸因,而不是被猜測。
了解更多
研究人員讀取 citation_date(arXiv、PubMed 和 IEEE 輸出的標籤),並把參考文獻變成註腳。

沒有發布日期的論文存檔,是一條你之後得重建的引用。Clean Web Clipper 從頁面自己的中繼資料讀取日期,而不是從內文讀取;頁面沒有日期時,欄位會留空,而不是填上今天。

  • 直接讀取 citation_datecitation_publication_date(arXiv、PubMed 和 IEEE 輸出的 meta 標籤)。
  • 也讀取 JSON-LD datePublishedarticle:published_timetime[datetime] 和 Unix 時間戳,依此優先順序。
  • 頁面上沒有日期,欄位就留空:絕不填上今天的日期。
了解更多
學生把講義、章節和參考頁面擷取成 Markdown 檔案,比課程登入權限還長久。

學期結束時,課程資料就會消失:連結失效、課程頁面被封存、研討課的讀物被搬走。你自己磁碟上的 Markdown 檔案不會,十年後仍能用任何編輯器打開,裡面也還留著來源網址。

  • 選取一段文字,就只擷取選取的部分:這是只拿一個定義、不要周圍整頁的方法。
  • 每則筆記都帶有來源網址,之後引用不必再找。
  • 閱讀檢視以一般文字顯示擷取內容,在儲存之前沒有 Markdown 符號。
了解更多
寫作者標題、作者、發布日期和來源網址隨每次擷取一起保存,引文就不會失去出處。

以截圖和書籤收集的研究資料,在你需要標明出處的那一刻就不能用了。Markdown 檔案把標題、作者、日期和網址和文字放在同一個檔案裡,查核時隨手就能找到。

  • 每則筆記的 frontmatter 都有 titleauthordatesource,出處和文字放在一起。
  • 作者欄位經過過濾:章節標題、刊物名稱和按鈕文字不會被當成署名。
  • 只保留文章內文:電子報訂閱框、分享列和「延伸閱讀」區塊絕不會進入筆記。
了解更多
記者你讀到時的文字,連同發布日期和網址,存在你自己磁碟上的檔案裡。

頁面會被修改,也會被撤下。擷取內容保存完整文字、來源網址和頁面自己宣告的發布日期,存在你保管的純文字檔案裡:而不是在一個可能關閉、更改條款或悄悄遺失紀錄的服務中。

  • 發布日期從頁面自己的中繼資料讀取:JSON-LD、article:published_timetime[datetime],而不是從內文讀取。
  • 來源網址放在每則筆記的 frontmatter 中
  • 完整的文章文字,不含每次造訪都會變的導覽和推廣區塊
了解更多
法律工作以發布時的原文保存,連同來源網址和日期,存在你掌控的檔案裡。

法規、服務條款和官方指引會在沒有通知的情況下改變。帶有來源網址和頁面宣告日期的 Markdown 副本,就是一份紀錄,說明你讀到它的那天,條文寫的是什麼。

  • 逐字保留的文字:文章內文中沒有任何內容被摘要、改寫或重新排序。
  • 來源網址和頁面宣告的發布日期放在每則筆記的 frontmatter 中。
  • 費用、期限和門檻表格由擴充功能自己序列化:技術語料上保留了 15 個中的 12 個,比較的引擎各保留 7 個。
了解更多
分析師儲存格中有程式碼、清單或連結時,這一列不再崩壞:15 個表格保留 12 個。

通用的 HTML 轉 Markdown 工具,偏偏在重要的表格上出錯:儲存格裡有清單、連結或程式碼範例的表格。Clean Web Clipper 自己序列化表格,把儲存格內容攤平,而不是丟掉那一列。

  • 專為此撰寫的 GFM 表格序列化程式,而不是外掛上去的通用轉換器。
  • 15 個表格保留 12 個(技術語料),比較的引擎各保留 7 個。
  • 參差不齊的兩欄表格會變成粗體的鍵和值的行,而不是崩壞的網格。
了解更多
教師只有教材,沒有周圍的網站:印出來的紙上沒有選單、沒有同意橫幅,也沒有廣告。

直接從瀏覽器列印網頁,會把選單、同意橫幅和廣告都印到講義上。擷取只帶走文字,來源網址保留在檔案裡,標明出處不必多花力氣。

  • 列印按鈕印出的是擷取內容,而不是周圍的頁面。
  • 閱讀檢視以一般文字顯示結果,在列印或儲存之前沒有 Markdown 符號。
  • 選取一道練習或一個定義,只擷取那一部分。
了解更多
譯者選單、橫幅和重複的導覽,絕不會進入句段清單。

從網頁貼上的原文會把導覽一起帶進來,每個選單項目都變成一個你得跳過、計算,最後還得在帳單上解釋的句段。Clean Web Clipper 在檔案接近你的工具之前,就把它們移除。

  • 選單、分頁列、同意橫幅和「延伸閱讀」資訊流在檔案產生之前就被刪除。
  • 重複的導覽大約減少四倍,相較於比較的引擎:102 行重複,對比 282、478 和 491 行。
  • 一個殘留的 HTML 標籤都沒有(512 個測量頁面),所以不會有零散的標記變成行內標籤。
了解更多
產品經理把更新紀錄、文件和版本說明擷取成可以搜尋、比對差異和引用的檔案。

以書籤保存的競品研究,會慢慢退化成一串無法搜尋的連結。擷取成 Markdown 後,它就成為一批你能 grep、能和上一季擷取比對差異,並能連同日期引用在決策文件中的資料。

  • 發布日期從頁面讀取,所以更新紀錄條目保留它真正的時間點,而不是你發現它的那天。
  • 個別網站規則會自動把每個競爭對手送進自己的資料夾
  • 價格和限制表格保留下來:技術語料上保留了 15 個中的 12 個,比較的引擎各保留 7 個。
了解更多
技術寫作者標題、表格、程式碼區塊和註腳都會保留;網站的外框則不會。

遷移文件通常意味著先轉換 HTML,再花更久的時間移除轉換器保留下來的東西。這種移除正是 Clean Web Clipper 的設計核心,也是經過測量的部分:在 512 個頁面上沒有任何殘留的 HTML 標籤。

  • 標題、清單、表格、程式碼區塊和註腳,全都對應到標準 Markdown。
  • 程式碼區塊保留語言標籤:技術語料上 156 個保留了 73 個,比較的引擎分別是 20 個和 0 個。
  • 在 512 個測量頁面上沒有任何殘留的 HTML 標籤
了解更多
個人封存存在你自己磁碟上的一般 Markdown 檔案。沒有帳號、沒有服務,沒有會關閉的東西。

書籤指向會改變或消失的頁面,稍後閱讀服務則會關閉、被收購,或開始為匯出收費。擷取內容就是文字本身,採用沒有廠商、不會到期的格式,存在你決定的地方。

  • 耐久、開放的格式:帶有 YAML frontmatter 的純文字,任何編輯器和 grep 都讀得了。
  • 沒有帳號,不上傳任何東西:你擷取的內容留在你自己的磁碟上。
  • 發布日期和來源網址隨文字一起擷取,所以筆記多年後仍能辨識。
了解更多
不受干擾地閱讀沒有選單、沒有橫幅、沒有 Markdown 符號的閱讀檢視,採用你瀏覽器自己的主題。

頁面雜物不只是視覺上的雜亂:它是螢幕閱讀器每次造訪都會唸出來、讀者都得跳過的文字。擷取視窗單獨顯示文章,採用你瀏覽器的淺色或深色設定,而且不執行任何頁面腳本。

  • 閱讀檢視以一般文字呈現擷取內容:沒有 Markdown 符號,連結可用,標題是真正的標題。
  • 它跟隨你瀏覽器的淺色和深色設定,而不是網站的。
  • 視窗可以放大到約四分之三的螢幕,方便閱讀較長的文章。
了解更多
加到 Chrome(免費)完全免費,不需要帳號,沒有限制。擷取可離線運作;使用事件會在連線時送出,關閉一個開關即可停止。

常見問題

Clean Web Clipper 會把我的頁面傳到任何地方嗎?
你的頁面不會。擷取與轉換完全在你的瀏覽器中進行:複製的內容進入剪貼簿,檔案寫入你的磁碟,任何頁面文字或標題都不會離開這台電腦。會送到我們自己統計伺服器的有四項:找不到文章的頁面網址、擷取成功的網域(只有網域)、你開啟的擴充功能畫面名稱,以及一組把這些事件串連起來的隨機安裝編號。伺服器也會記錄由 IP 位址推算出的大致位置(國家、地區和城市);IP 位址本身不會被保存。這些資料都不會交給第三方,在設定中關閉一個開關就能全部停止並清除編號。擴充功能不會在你閱讀的網站上要求任何權限,所以看不到你沒有點擊的頁面。
存進 vault 需要開著 Obsidian 嗎?
不需要。Clean Web Clipper 透過瀏覽器的 File System Access API,把檔案直接寫入你授權它存取的資料夾。Obsidian 下次查看 vault 時就會讀到這個檔案。
在不是文章的頁面上會怎樣?
它會直接說明。在商店首頁、資訊流和搜尋結果頁上沒有文章可擷取,擴充功能會把擷取結果標記為「沒有文章」,而不是交給你滿滿一頁連結。
可以在哪些瀏覽器中使用?
Chrome 和其他 Chromium 瀏覽器:Edge、Brave、Vivaldi、Opera。它是 Manifest V3 擴充功能,唯一可能連線的網站是我們自己的統計位址,絕不是你閱讀的網站。
它免費嗎?
是的,全部免費。本網站描述的每一項功能都能在免費的擴充功能中使用:沒有頁數限制的擷取、Obsidian vault、個別網站規則、註腳、表格、程式碼語言標籤和閱讀檢視。介面提供 19 種語言,並跟隨你瀏覽器的語言設定。沒有付費方案,不需要帳號,也不需要註冊。