Chrome 擴充功能
把網頁存成不必再整理的 Markdown
按下圖示,擷取內容就已經準備好:標題、作者、發布日期和來源都收進 frontmatter,內文去掉了導覽列。一切都在你的瀏覽器中進行:不需要帳號,你擷取的內容也不會上傳到任何地方。

Clean Web Clipper 是一款免費的 Chrome 擴充功能,能把網頁儲存為乾淨的 Markdown:存到剪貼簿、.md 檔案、資料夾,或直接存進 Obsidian vault,不需要帳號,也不需要登入。在最多人造訪的網站上測試了 512 個頁面:沒有當機,擷取出的文章中也沒有任何殘留的 HTML 標籤。
在全球最多人造訪的網站上測試了 512 個頁面
共兩輪測試。第一輪取了全球與俄羅斯前一百大網站的 109 個頁面,把輸出與另外三個擷取引擎逐頁比較。第二輪取了十二個歐洲國家各自的前五十大網站:再加 403 個頁面,每一頁都以該國語言擷取,只用我們的核心執行。引擎、版本、日期,以及我們落後的地方
問題從來不在轉換,而在轉換時一起帶進來的一切。
每個擷取工具都能把 HTML 轉成 Markdown。然後你打開筆記,看到 Cookie 橫幅、側欄選單、「延伸閱讀」清單,還有一個在途中崩壞的表格。Clean Web Clipper 正是圍繞著移除這些東西而打造的,而且移除的效果經過測量,不只是宣稱。
其他擷取工具保留的內容
[跳到主要內容](#main) [登入](/login) [註冊](/register) [首頁](/) [新聞](/news) [體育](/sport) [文化](/culture) [更多](/more) 我們使用 Cookie 及類似技術來改善你的使用體驗。 [全部接受] [管理偏好設定] # 你要看的那篇文章 正文真正的第一段。 <div class="promo-inline"> ## 延伸閱讀 [另一則標題](/a) [再一則標題](/b) [還有第三則](/c)
最後存進筆記的內容
# 你要看的那篇文章 正文真正的第一段。
輸出為什麼乾淨
- 程式碼保留語言標籤。 你得到的是標記為
js的程式碼區塊,而不是沒有標籤的區塊,所以貼上的那一刻語法醒目提示就能運作。 - 表格保持完整。 儲存格中有程式碼或清單時,這一列不會再崩壞。
- 註腳真的能用。 參考連結會變成
[^1],定義放在筆記結尾,而不是失效的錨點。 - 日期是讀出來的,不是猜的。 JSON-LD、
article:published_time、citation_date(arXiv/PubMed/IEEE 標準)、time[datetime]、Unix 時間戳。頁面上沒有日期,欄位就留空,絕不填上今天的日期。 - 選單、橫幅和「延伸閱讀」都會被刪除。 標誌列、分頁列,以及在每個段落重複出現的導覽,都不會進入筆記。
- 一個殘留標籤都沒有。 你的文字中間不會卡著任何
div或table標記。
---
title: "Markov chain - Wikipedia"
source: "https://en.wikipedia.org/wiki/Markov_chain"
date: "2002-07-07T05:14:15.000Z"
extraction: "dom"
---
A Markov chain is a stochastic process describing a sequence of possible
events in which the probability of each event depends only on the state
attained in the previous event.[^1]
[^1]: Gagniuc, Paul A. (2017). Markov Chains: From Theory to Implementation
and Experimentation. USA, NJ: John Wiley & Sons. pp. 1-235.如何在 Chrome 中把網頁存成 Markdown
安裝擴充功能,然後只要三個步驟。不需要事先設定:預設情況下,按一下會開啟預覽,Markdown 已經產生好,可以直接複製或存成檔案。之後你也可以讓一次點擊直接把筆記寫入資料夾或 vault,跳過預覽。
- 釘選圖示。 打開網址列旁邊的拼圖圖示選單,把 Clean Web Clipper 釘選到工具列。
- 打開你想保存的文章:是文章本身,而不是列出文章連結的頁面。
- 按下圖示。 Markdown 會出現在預覽視窗中:複製它,或儲存
.md檔案。
存到哪裡
- 把 Markdown 複製到剪貼簿
- 下載
.md檔案 - 寫入你在磁碟上選定的資料夾
- 直接寫入你的 Obsidian vault:不需要外掛、不需要本機 REST API、不需要 URI 協定;檔案就這樣出現
按下圖示的行為可以自訂。可以保留為預覽視窗,也可以讓一次點擊直接把筆記放進 vault,什麼視窗都不開。

誠實交代來源
每則筆記都帶有 extraction 欄位。dom 表示文字來自瀏覽器實際呈現的內容。jsonld-articlebody 表示頁面始終沒有完成呈現,內文必須從頁面自己的結構化資料讀取。而當頁面上根本沒有文章時,例如商店首頁、資訊流、搜尋結果,擴充功能會直接說明,而不是丟給你三百個連結。



它不做的事
- 不會爬取網站或批次處理:一次一頁,就是你正在看的那一頁
- 不會摘要或改寫:文字只做轉換,不做編輯
- 不會下載圖片:圖片連結指向原始網站
十五種使用方式
開發者程式碼區塊保留語言標籤,貼上的文件一落地就有語法醒目提示。
Clean Web Clipper 從頁面上讀取語言:來自程式碼區塊的 class、父元素,或語法醒目提示工具自己的標記,並把它寫進程式碼區塊。在一份九個頁面的技術語料上,語言標籤在 156 個程式碼區塊中保留了 73 個,比較的兩個引擎分別是 20 個和 0 個。
- 程式碼區塊帶有標籤。 是 ```js,不是空白的區塊:貼上的那一刻,Obsidian、VS Code 和 GitHub 就能醒目提示語法。
- 語言是讀出來的,不是猜的。 它來自網站自己的語法醒目提示工具留下的 class,所以標籤和來源頁面一樣正確。
- 儲存格中有程式碼的表格保持完整:技術語料上保留了 15 個中的 12 個,比較的引擎各保留 7 個。
Obsidian 使用者在 vault 裡選好資料夾一次;之後按一下就把筆記寫進去,Obsidian 關著也行。
Clean Web Clipper 透過瀏覽器的 File System Access API,自己把 .md 檔案寫進你的 vault。整條流程中沒有社群外掛、沒有本機 REST 伺服器,也沒有 obsidian:// 連結,筆記送達時 Obsidian 也不必開著。
- 不需要外掛、不需要本機伺服器、不需要
obsidian://連結:瀏覽器把檔案寫進你授權的資料夾。 - Obsidian 不必開著。 下次開啟時,筆記就在那裡。
- YAML frontmatter 包含
title、source、author、date和extraction,你可以選擇保留哪些。
AI 與 LLM 上下文頁面上重複的導覽是要付費的上下文。它會在文字送到模型之前被移除。
在一份 109 頁的語料上(逐頁比較那一輪),Clean Web Clipper 留下 102 行重複的導覽,另外三個擷取引擎分別留下 282、478 和 491 行,而且完全沒有殘留的 HTML 標籤。送到模型的是文章本身,加上一個註明來源網址和發布日期的 frontmatter 檔頭。
- 重複的導覽大約少了四倍,相較於比較引擎的平均:102 行重複,對比 282、478 和 491 行。
- 在 512 個測試頁面上沒有任何殘留的 HTML 標籤:模型不需要繞過任何東西。
- frontmatter 註明來源網址和發布日期,所以說法可以歸因,而不是被猜測。
研究人員讀取 citation_date(arXiv、PubMed 和 IEEE 輸出的標籤),並把參考文獻變成註腳。
沒有發布日期的論文存檔,是一條你之後得重建的引用。Clean Web Clipper 從頁面自己的中繼資料讀取日期,而不是從內文讀取;頁面沒有日期時,欄位會留空,而不是填上今天。
- 直接讀取
citation_date和citation_publication_date(arXiv、PubMed 和 IEEE 輸出的 meta 標籤)。 - 也讀取 JSON-LD
datePublished、article:published_time、time[datetime]和 Unix 時間戳,依此優先順序。 - 頁面上沒有日期,欄位就留空:絕不填上今天的日期。
學生把講義、章節和參考頁面擷取成 Markdown 檔案,比課程登入權限還長久。
學期結束時,課程資料就會消失:連結失效、課程頁面被封存、研討課的讀物被搬走。你自己磁碟上的 Markdown 檔案不會,十年後仍能用任何編輯器打開,裡面也還留著來源網址。
- 選取一段文字,就只擷取選取的部分:這是只拿一個定義、不要周圍整頁的方法。
- 每則筆記都帶有來源網址,之後引用不必再找。
- 閱讀檢視以一般文字顯示擷取內容,在儲存之前沒有 Markdown 符號。
寫作者標題、作者、發布日期和來源網址隨每次擷取一起保存,引文就不會失去出處。
以截圖和書籤收集的研究資料,在你需要標明出處的那一刻就不能用了。Markdown 檔案把標題、作者、日期和網址和文字放在同一個檔案裡,查核時隨手就能找到。
- 每則筆記的 frontmatter 都有
title、author、date和source,出處和文字放在一起。 - 作者欄位經過過濾:章節標題、刊物名稱和按鈕文字不會被當成署名。
- 只保留文章內文:電子報訂閱框、分享列和「延伸閱讀」區塊絕不會進入筆記。
記者你讀到時的文字,連同發布日期和網址,存在你自己磁碟上的檔案裡。
頁面會被修改,也會被撤下。擷取內容保存完整文字、來源網址和頁面自己宣告的發布日期,存在你保管的純文字檔案裡:而不是在一個可能關閉、更改條款或悄悄遺失紀錄的服務中。
- 發布日期從頁面自己的中繼資料讀取:JSON-LD、
article:published_time、time[datetime],而不是從內文讀取。 - 來源網址放在每則筆記的 frontmatter 中。
- 完整的文章文字,不含每次造訪都會變的導覽和推廣區塊。
法律工作以發布時的原文保存,連同來源網址和日期,存在你掌控的檔案裡。
法規、服務條款和官方指引會在沒有通知的情況下改變。帶有來源網址和頁面宣告日期的 Markdown 副本,就是一份紀錄,說明你讀到它的那天,條文寫的是什麼。
- 逐字保留的文字:文章內文中沒有任何內容被摘要、改寫或重新排序。
- 來源網址和頁面宣告的發布日期放在每則筆記的 frontmatter 中。
- 費用、期限和門檻表格由擴充功能自己序列化:技術語料上保留了 15 個中的 12 個,比較的引擎各保留 7 個。
分析師儲存格中有程式碼、清單或連結時,這一列不再崩壞:15 個表格保留 12 個。
通用的 HTML 轉 Markdown 工具,偏偏在重要的表格上出錯:儲存格裡有清單、連結或程式碼範例的表格。Clean Web Clipper 自己序列化表格,把儲存格內容攤平,而不是丟掉那一列。
- 專為此撰寫的 GFM 表格序列化程式,而不是外掛上去的通用轉換器。
- 15 個表格保留 12 個(技術語料),比較的引擎各保留 7 個。
- 參差不齊的兩欄表格會變成粗體的鍵和值的行,而不是崩壞的網格。
教師只有教材,沒有周圍的網站:印出來的紙上沒有選單、沒有同意橫幅,也沒有廣告。
直接從瀏覽器列印網頁,會把選單、同意橫幅和廣告都印到講義上。擷取只帶走文字,來源網址保留在檔案裡,標明出處不必多花力氣。
- 列印按鈕印出的是擷取內容,而不是周圍的頁面。
- 閱讀檢視以一般文字顯示結果,在列印或儲存之前沒有 Markdown 符號。
- 選取一道練習或一個定義,只擷取那一部分。
譯者選單、橫幅和重複的導覽,絕不會進入句段清單。
從網頁貼上的原文會把導覽一起帶進來,每個選單項目都變成一個你得跳過、計算,最後還得在帳單上解釋的句段。Clean Web Clipper 在檔案接近你的工具之前,就把它們移除。
- 選單、分頁列、同意橫幅和「延伸閱讀」資訊流在檔案產生之前就被刪除。
- 重複的導覽大約減少四倍,相較於比較的引擎:102 行重複,對比 282、478 和 491 行。
- 一個殘留的 HTML 標籤都沒有(512 個測量頁面),所以不會有零散的標記變成行內標籤。
產品經理把更新紀錄、文件和版本說明擷取成可以搜尋、比對差異和引用的檔案。
以書籤保存的競品研究,會慢慢退化成一串無法搜尋的連結。擷取成 Markdown 後,它就成為一批你能 grep、能和上一季擷取比對差異,並能連同日期引用在決策文件中的資料。
- 發布日期從頁面讀取,所以更新紀錄條目保留它真正的時間點,而不是你發現它的那天。
- 個別網站規則會自動把每個競爭對手送進自己的資料夾。
- 價格和限制表格保留下來:技術語料上保留了 15 個中的 12 個,比較的引擎各保留 7 個。
技術寫作者標題、表格、程式碼區塊和註腳都會保留;網站的外框則不會。
遷移文件通常意味著先轉換 HTML,再花更久的時間移除轉換器保留下來的東西。這種移除正是 Clean Web Clipper 的設計核心,也是經過測量的部分:在 512 個頁面上沒有任何殘留的 HTML 標籤。
- 標題、清單、表格、程式碼區塊和註腳,全都對應到標準 Markdown。
- 程式碼區塊保留語言標籤:技術語料上 156 個保留了 73 個,比較的引擎分別是 20 個和 0 個。
- 在 512 個測量頁面上沒有任何殘留的 HTML 標籤。
個人封存存在你自己磁碟上的一般 Markdown 檔案。沒有帳號、沒有服務,沒有會關閉的東西。
書籤指向會改變或消失的頁面,稍後閱讀服務則會關閉、被收購,或開始為匯出收費。擷取內容就是文字本身,採用沒有廠商、不會到期的格式,存在你決定的地方。
- 耐久、開放的格式:帶有 YAML frontmatter 的純文字,任何編輯器和
grep都讀得了。 - 沒有帳號,不上傳任何東西:你擷取的內容留在你自己的磁碟上。
- 發布日期和來源網址隨文字一起擷取,所以筆記多年後仍能辨識。
不受干擾地閱讀沒有選單、沒有橫幅、沒有 Markdown 符號的閱讀檢視,採用你瀏覽器自己的主題。
頁面雜物不只是視覺上的雜亂:它是螢幕閱讀器每次造訪都會唸出來、讀者都得跳過的文字。擷取視窗單獨顯示文章,採用你瀏覽器的淺色或深色設定,而且不執行任何頁面腳本。
- 閱讀檢視以一般文字呈現擷取內容:沒有 Markdown 符號,連結可用,標題是真正的標題。
- 它跟隨你瀏覽器的淺色和深色設定,而不是網站的。
- 視窗可以放大到約四分之三的螢幕,方便閱讀較長的文章。