Clean Web Clipper 加到 Chrome(免費)

適用對象

保存仍能引用的參考資料

以截圖和書籤收集的研究資料,在你需要標明出處的那一刻就不能用了。Markdown 檔案把標題、作者、日期和網址和文字放在同一個檔案裡,查核時隨手就能找到。

無法標明出處的引文

那段話在你的草稿裡,加了引號,而你想不起它從哪裡來。它在四百個書籤的某處,或在一張沒有網址的截圖裡,或在一個之後被改寫的頁面上。重建來源花的時間比寫那段文字還久,有時根本做不到,於是這一句只好從稿子裡拿掉。

從瀏覽器貼上也有它的代價。網站的雜物跟著文字一起進來:夾在兩個分享按鈕之間的署名、段落中間的電子報訂閱框、文章結尾處的「延伸閱讀」清單。每次都要整理這些,正是大多數研究資料夾悄悄變成沒人再打開的半格式化碎片墳場的原因。

接著還得有人查核。編輯或事實查核人員打不開你的書籤,看不到你透過訂閱讀到的內容,也不會接受截圖作為出處,所以查核變成一場對話,由你憑記憶重建每一句從哪裡來。一資料夾的文字檔、每個都內含網址和日期,是可以直接交出去的東西;而能不能交出去,往往決定一個問題要花五分鐘還是一個下午。

研究資料夾會變成什麼

作者跟著段落一起保存gutenberg.org:Moby-Dick 第 1 章
---
title: "Moby-Dick; or, The Whale: Chapter 1: Loomings"
source: "https://www.gutenberg.org/files/2701/2701-h/2701-h.htm"
author: "Herman Melville"
extraction: "dom"
---

Call me Ishmael. Some years ago–never mind how long precisely–having little
or no money in my purse, and nothing particular to interest me on shore, I
thought I would sail about a little and see the watery part of the world.

為一份委託稿設定擷取

每篇稿子一個資料夾,裡面每份擷取內容都帶著自己的出處。重要的設定,是讓這個資料夾能交給別人的那些。

  1. 開始閱讀之前,先為這篇稿子建立研究資料夾 pieces/baltic-charts/sources。收進已經存在的資料夾的出處,才叫出處;事後才收集,就成了考古。
  2. 從擴充功能圖示開啟選項,把存放位置設為你的研究目錄,並在子資料夾欄位填入稿子的名稱。之後換一篇委託稿,只要改這一個欄位。
  3. 把檔名範本設為 {date}-{title}。那個日期是你擷取的時間,也正是頁面之後被改過時,編輯會問的事實。
  4. 開啟每一個 frontmatter 欄位。authordate 是讓擷取內容能被引用的兩個欄位,source 則是事實查核人員真的會點的那一個。
  5. 把按下圖示的動作保留為預覽視窗。確認署名有沒有抓到只要兩秒,而錯誤的署名正是會一路留到印刷版的錯誤。
  6. 只需要一段文字時,先在頁面上選取,再擷取:視窗會開在選取範圍上,頂端的切換鈕會確認你看的是哪一種。
  7. 在讀到頁面的當天就擷取,而不是在動筆那天。頁面會被悄悄修改,而你沒有擷取的那一版,正是編輯會要的那一版。

能交給別人的研究資料設定

下面每一個值的檢驗標準是:一個陌生人拿到這個資料夾,能不能不問你任何問題就核實一段引文。

設定為什麼在這裡用這個值
存放位置每篇稿子一個子資料夾出處以委託稿為單位,共用資料夾正是可以交給事實查核人員的東西
檔名範本`{date}-{title}`記錄你何時擷取:頁面之後被改過時,就會出現這個問題
Frontmatter全部欄位開啟`author`、`date` 和 `source` 就是出處;其餘是背景資訊
按下圖示預覽視窗花兩秒確認署名,免得錯誤的署名進入草稿
圖片保留為連結照片來源往往只能從圖片網址找到
選取範圍先選取段落,再擷取只為一段而引用的長篇專題,不必整篇保留
個別網站規則常用網站 → 各自的子資料夾到了查核階段,背景閱讀和第一手來源是不同的兩堆
拉出的引言仍是引言,署名仍是署名雜誌長篇專題報導
---
title: "The last cartographers of the Baltic"
source: "https://example-magazine.com/features/baltic-charts"
author: "Ingrid Salo"
date: "2025-11-18T06:00:00.000Z"
extraction: "dom"
---

The survey vessel still carries paper charts, folded into a drawer nobody has
opened since the second officer retired.

> We stopped correcting them in 2019. Nobody decided to stop; the corrections
> simply stopped arriving.

The hydrographic office confirmed that paper corrections ended that year.

一篇稿子中的三個時刻

頁面已被改寫的引文

你在十一月擷取了一份公司聲明,並在二月的草稿中引用。頁面還在,但已經不是那樣寫了:措辭被軟化,沒有更正說明,也沒有標示修改時間。你的檔案裡有原本的句子、網址,以及頁面自己宣告的日期。

再擷取一次,任何差異比對工具都能把兩個版本並排顯示。這和「頁面說過這句話」是不同的主張:它是「這是我擷取到的內容,這是現在頁面上的內容」,而這是你能拿到編輯面前的主張。

把出處交給別人

事實查核人員拿到資料夾。每個檔案都能用任何編輯器打開,前幾行就是段落、署名、發布日期和網址,所以原本要問你的查核問題,變成他們自己就能查的事。

這正是截圖最失敗的地方。頁面的圖片沒有網址、沒有日期,也沒有查核人員能搜尋的文字,所以研究資料夾中的每張截圖,都會變成一則詢問「這從哪來」的訊息。

訪談前的背景資料

前一晚,六篇背景讀物被擷取到這篇稿子的資料夾。通話時,你搜尋的是資料夾,而不是八個開著的分頁,搜尋一次涵蓋六篇的全部文字,包括兩篇訂閱內容。

因為檔案是文字,這樣的搜尋毫無成本,在沒有訊號的建築裡、關掉 Wi-Fi 也能用。那些分頁則可能已經過期、被重新載入、再次要求同意 Cookie,或把你登出。

和一般的研究習慣相比

這裡沒有哪一種是壞習慣:每一種都是某個人的工作方法。差別在於哪些東西能留到查核階段。

目前的做法你得到什麼代價是什麼
把頁面加入書籤立刻得到一個指標它指向頁面今天的內容,而不是你讀到時的內容
截圖段落以圖像形式保存的文字沒有網址、沒有日期、沒有可搜尋的文字,查核人員也無法獨自核實
貼進研究文件集中在一處的文字網站雜物跟著進來,出處資訊卻沒有
稍後閱讀服務乾淨、已同步的副本取決於服務是否繼續存在,以及是否讓你匯出
把頁面列印成 PDF固定的版面紀錄附帶同意橫幅,文字無法跨資料夾搜尋,也沒有中繼資料檔頭
Clean Web Clipper文字、署名、日期和網址在同一個檔案沒有版面、沒有截圖,也沒有第三方證明你何時擷取

擷取內容無法引用時

作者欄位是空的

頁面沒有擴充功能能辨識的署名,或者署名所在的標記和章節標題無法區分。作者擷取會讀取結構化資料和署名標記,再過濾已知的誤判(標題、刊物名稱、按鈕文字),沒有任何東西通過過濾時,欄位會留空,而不是填上頁面上第一個粗體字串。你可以自己填上;它是文字檔。

只擷取到前三段

這通常是計量付費牆:頁面確實只呈現了試讀段落,其餘內容只提供給它認為你擁有的工作階段。也可能是延遲載入,內文在你捲動時才出現。捲到文章結尾,確認最後一段顯示在畫面上,再擷取一次。擴充功能擷取的是瀏覽器在那一刻已經呈現的內容。

文章始終沒有出現在同意對話框後面

有些網站在取得同意之前完全不呈現任何內容,所以 DOM 中沒有文章可擷取,擴充功能也會如實回報。照你平常的方式回應對話框,讓頁面呈現後再擷取。無論如何,同意橫幅本身都會從擷取內容中移除。

檔名中的日期和 frontmatter 中的日期不一樣

它們不是同一個日期,本來就不該一樣。檔名中的 {date} 是你擷取頁面的那天;frontmatter 中的 date 欄位是頁面自己宣告的發布日期。把兩者分開,你才能同時說出文章何時發表、你何時看到它;frontmatter 日期是空的,代表頁面沒有宣告任何日期。

它不做的事

它不會保存頁面當時的樣子:沒有截圖、沒有版面、沒有資源檔。它不摘要也不改寫。文章文字只做轉換,不做編輯。圖片保留為指向原始網站的連結,所以那個網站壞掉時,圖片也會壞掉。頁面沒有作者或日期時,欄位會留空,而不是填上一個看似合理的猜測。

加到 Chrome(免費)完全免費。不需要帳號、不需要註冊,也沒有任何限制。

常見問題

它會保留作者嗎?
頁面有標明時會。Clean Web Clipper 讀取結構化資料和署名標記,並過濾誤判(章節標題、刊物名稱、按鈕文字),而不是把第一個看似合理的字串放進欄位。
我付費訂閱的文章呢?
能正常擷取。擴充功能讀取的是瀏覽器為你呈現的頁面,所以畫面上看得到的任何內容都能儲存。
可以保留圖片嗎?
可以,預設保留為連結。你可以全域關閉,也可以只針對某個網站關閉。
它會改動措辭嗎?
不會。結構會改變,HTML 變成 Markdown,但文章內文中的字詞不會增加、刪除或重新排序。
它免費嗎?
是的,全部免費。沒有付費方案、不需要帳號,擷取數量也沒有限制。
引文中的斜體和連結保留得下來嗎?
可以。粗體、斜體、連結、行內程式碼和清單都會對應到 Markdown 的寫法,拉出的引言或引用區塊仍是引用區塊,所以標示為別人說的話,在你的檔案裡看起來依然是別人說的話。
擷取內容能證明頁面說過這句話嗎?
不能,也不應該被當成證據。它是你自己電腦上的檔案,沒有第三方時間戳記:它記錄的是你存下了什麼,足以作為你自己的工作筆記,卻不足以支持有爭議的主張。論點可能被質疑時,請搭配獨立的網頁封存。
可以擷取電子報或電子郵件嗎?
只限以網頁形式發布的內容:許多電子報都有網頁版封存,那些頁面能像其他頁面一樣擷取。郵件用戶端中的電子郵件,不是擴充功能能觸及的網頁。
我可以重新發表擷取的內容嗎?
這是關於來源的著作權問題,和工具無關。擷取是閱讀和做筆記的行為;你可以引用什麼、引用多少,由授權和法律決定,和你手抄那段文字時完全一樣。
事件發展時,可以反覆擷取同一個頁面嗎?
可以,而且每次擷取都是獨立的檔案:檔名衝突時會加上數字後綴,而不是覆寫。持續更新的頁面擷取兩次,用任何差異比對工具比較,就是新增了什麼、悄悄刪掉什麼的紀錄。