Clean Web Clipper 加到 Chrome(免費)

適用對象

在消息來源被修改之前把它存檔

頁面會被修改,也會被撤下。擷取內容保存完整文字、來源網址和頁面自己宣告的發布日期,存在你保管的純文字檔案裡:而不是在一個可能關閉、更改條款或悄悄遺失紀錄的服務中。

昨天還在的那個頁面

一家公司發布了一個說法,你引用了它,等編輯讀到草稿時,那句話已經被悄悄改寫:沒有更正說明、沒有時間戳記,沒有任何可以指證的東西。或者頁面整個不見了,公開的網頁封存從沒抓到它,因為它只在某個星期天下午存在了四個小時。

即使頁面還在,你讀到的版本也不一定是其他人拿到的版本。同意牆、地區版本和 A/B 測試,意味著網址並不是一段文字的穩定參照。你能抓住的,是你閱讀時螢幕上的內容,連同網址和頁面自己宣告的日期一起存下來。

於是剩下實際的問題:擷取必須是即時的,否則就不會發生。一篇報導會碰到四十個頁面,大多是快速瀏覽,其中一半是在沒人會打開第二個工具、貼上網址、等待服務回應的時段讀的。一次擷取只要幾十毫秒,測得的時間會顯示在視窗角落;在這種成本下,你會擷取讀過的所有東西,包括後來證明不重要的三十九頁,和真正重要的那一頁。

紀錄裡有什麼

新聞頁面歸檔時的樣子一篇擷取新聞文章的 frontmatter
---
title: "Regulator opens inquiry into data-sharing arrangement"
source: "https://apnews.com/article/…"
author: "Staff reporter"
date: "2026-03-04T09:12:00.000Z"
extraction: "dom"
---

The inquiry will examine agreements signed between 2023 and 2025, according to
a notice published on Wednesday.

為一篇報導設定擷取

重點在於,閱讀的那一刻擷取不花任何成本。以下每一項,都是為了把一個決定從那一刻移到設定裡。

  1. 從擴充功能圖示開啟選項,把存放位置指向這篇報導的資料夾 stories/data-sharing/sources。每篇報導一個資料夾,只決定一次,之後什麼都不必再歸檔。
  2. 按下圖示時的動作設為「存到資料夾」。和研究流程不同,新聞流程不該開視窗:先擷取、後檢查,因為等你回頭時,頁面可能已經不在了。
  3. 把檔名範本設為 {date}-{domain}-{title}。當一個資料夾裝著兩週內來自四十個頁面的內容時,擷取日期和媒體就是你排序的兩個依據。
  4. 開啟所有 frontmatter 欄位。date 是頁面宣告的發布日期;source 是網址列中的確切網址,包括可能標示地區版本的查詢字串。
  5. chrome://extensions/shortcuts 確認 Alt+Shift+M 已綁定。深夜十一點會用的是按鍵,不會是選單。
  6. 為你經常使用的討論網站新增個別網站規則,例如把 reddit.com 放進專屬子資料夾,線索和已發表的來源就不會混在一起。
  7. 在就某個頁面聯絡任何人之前,先擷取它。請對方回應,是讓頁面改變最可靠的方法,而之後才擷取的,就是錯的那一版。

快速擷取的設定

這裡的每個值,都是用擷取當下的一點點核對,換取「確實擷取到了」的確定。檔案可以之後慢慢檢查;已經消失的頁面卻無法重讀。

設定為什麼在這裡用這個值
按下圖示存到資料夾頁面還在的那一刻,沒有視窗、沒有對話框、不必做決定
存放位置每篇報導一個資料夾出處以報導為單位,資料夾正是可以拿給編輯或律師看的東西
檔名範本`{date}-{domain}-{title}`擷取日期和媒體,是整理四十個來源時的兩個排序軸
Frontmatter全部欄位開啟`source` 保留確切網址,包括標示地區版本的查詢字串
圖片保留為連結圖片網址往往是照片被換掉之前,唯一能看出原本用了哪張的線索
個別網站規則`reddit.com` → 子資料夾 `leads`未經查證的線索和已發表的來源不該放在同一堆
快速鍵`Alt+Shift+M`需要選單的擷取,在非上班時間就不會發生
同一個網址的兩次擷取,相隔三週同一頁面兩次擷取的差異比對
--- 2026-03-04-regulator-opens-inquiry.md
+++ 2026-03-25-regulator-opens-inquiry.md
@@
-date: "2026-03-04T09:12:00.000Z"
+date: "2026-03-04T09:12:00.000Z"
@@
-The inquiry will examine agreements signed between 2023 and 2025.
+The inquiry will examine agreements signed in 2024.
@@
+Updated 25 March: an earlier version misstated the period under review.

三次擷取

只存在了四個小時的頁面

一家公司在星期天下午發布聲明。你讀了它,按下快速鍵,在你決定它重不重要之前,檔案就已經在報導資料夾裡。到了星期一,頁面回傳 404,公開的網頁封存從沒看過它,因為它上線期間沒有人提交那個網址。

你手上握有的是文字、網址和頁面自己宣告的日期:不是證據,但這份紀錄足以向公司提出問題:這份內容曾在這個網址發布,而它是這麼寫的。

兩次擷取和一份差異比對

你在通訊社報導刊出的那天早上擷取它,三週後同事提到報導的框架變了,你又擷取一次。第二個檔案加上數字後綴,而不是取代第一個,所以兩份都在磁碟上。

兩者的差異比對顯示,受審查的期間從「2023 年和 2025 年之間」縮小為「2024 年」,文末還附加了一則更新說明。這兩處改變從網址都看不出來,也都無法從書籤中找回。

當作線索,以討論串形式保存

一個地方論壇的討論串,點名了三位在你詢問的那段期間曾在某個場所工作的人。你擷取它:巢狀結構以巢狀引用區塊呈現,每則留言保留分數,所以大家都認同的回覆,依然能和沒人認同的回覆區分開來。

它依規則而不是依決定,進入 leads 子資料夾,而不是報導資料夾。六個月後,這個區分就是「可以指證的出處」和「只是讀過的資料」之間的差別。

和其他保存頁面的方法相比

這些與其說是替代方案,不如說是不同的保證。請仔細讀第三欄。最強的保證並不是這個擴充功能提供的。

目前的做法你得到什麼代價是什麼
公開的網頁封存服務任何人都能查證、帶時間戳記的獨立副本需要網路和服務;有些網站會封鎖它,而且在你閱讀的那一刻,它是第二個工具
截圖頁面頁面當時的版面沒有可搜尋的文字、圖片裡沒有網址、沒有發布日期
列印成 PDF磁碟上頁面形式的副本附帶同意橫幅,無法比對差異,也無法跨資料夾搜尋
把頁面存成 HTML含資源檔的完整本機副本檔案龐大、難以閱讀,兩次擷取之間的差異比對也無法閱讀
複製到筆記文件快速得到文字雜物一起進來,網址和日期卻沒有
Clean Web Clipper文字、網址和宣告的日期,幾秒內完成沒有版面、沒有資源檔,也沒有第三方時間戳記。它是你的副本,不是證據

擷取結果和預期不同時

同意對話框後面什麼都沒有呈現

有些網站在同意之前完全不送出文章,所以頁面中沒有任何擴充功能能讀取的東西,擷取會回報「沒有文章」。回應對話框,讓頁面呈現後再擷取。無論如何,同意橫幅本身都會從輸出中移除。這也說明了為什麼你擷取的版本,特指提供給你的那個版本:你所在的地區、那一次的工作階段。

它拒絕即時更新頁面或版面首頁

兩者大多是連結文字,而擴充功能會拒絕任何擷取出的字元有超過約四分之一位於連結中的頁面。在即時更新頁面上,如果網站提供個別條目的固定連結,就擷取那一頁。在版面首頁上,擷取報導本身而不是列表。列表正是會以三百個連結形式送達的東西。

留言不見了

留言被視為頁面雜物而刪除,只有一個例外:Reddit 的討論串會保留,並附上每則留言的分數。在其他地方,留言區和周圍的推廣區塊無法區分,保留它就意味著連那些也一起保留。

發布日期不是我預期的日期

欄位保存的是頁面在自己的標記中宣告的日期:JSON-LD datePublishedarticle:published_timetime[datetime]。網站修改文章時若會改寫這個值,就會回報較新的日期,而擴充功能照頁面說的重複,不會自行揣測。這也是擷取日期另外放在檔名中的另一個原因。

它不是什麼

它不是網頁封存。它保存文字和中繼資料,而不是呈現出來的頁面:沒有版面、沒有截圖、沒有資源檔,也沒有證明你何時擷取的第三方時間戳記。需要視覺化、獨立的紀錄時,請使用網頁封存服務;這個工具更快、留在你的磁碟上,回答的是另一個問題。留言被視為頁面雜物而刪除,唯一的例外是 Reddit,討論串會連同每則留言的分數一起保留。

加到 Chrome(免費)完全免費。不需要帳號、不需要註冊,也沒有任何限制。

常見問題

它能取代網頁封存嗎?
不能。它保存文字,而不是呈現出來的頁面:沒有版面、沒有截圖、沒有資源檔。需要視覺紀錄時請使用網頁封存服務;要保存文字和中繼資料,這個工具更快,也留在你自己的磁碟上。
擷取內容能當作證據嗎?
單獨使用不行。它是你電腦上的檔案,沒有第三方時間戳記,所以它記錄的是你存下了什麼,而不是證明外界當時能看到什麼。論點可能被質疑時,請搭配獨立的網頁封存。
它會擷取留言嗎?
在 Reddit 上會:以精簡的討論串形式,附上每則留言的分數。在其他地方,留言被視為頁面雜物而刪除。
它能記錄我何時擷取嗎?
檔名範本支援 {date},也就是擷取日期。發布日期是另一個 frontmatter 欄位,所以兩者絕不會混淆。
擴充功能會把我的擷取內容傳到任何地方嗎?
不會。擷取和轉換都在你的瀏覽器中進行;擷取內容絕不會上傳,背後也沒有帳號。
可以擷取社群媒體貼文嗎?
有時可以。動態消息會被當成「沒有文章」而拒絕,因為它幾乎全是連結文字。單則貼文的固定連結頁面,通常有足夠的內文可以擷取,Reddit 的討論串則會連同分數一起擷取。如果平台只在捲動的動態中呈現貼文,就沒有穩定的東西可以擷取。
檔案裡記錄的是哪個網址?
你擷取那一刻網址列中的網址,包括查詢字串。當網站以帶參數的網址提供地區版本或實驗版本時,這一點很重要:參數是你擷取內容的一部分,會保留在紀錄中。
同事或編輯打得開這些檔案嗎?
打得開。它們是帶有 YAML 檔頭的純文字。不需要擴充功能、不需要帳號,也不需要特定的應用程式就能閱讀,可以像其他文件一樣附加在電子郵件中或放進共用資料夾。
擷取有多快?
一般文章只要幾十毫秒,帶有數百個參考連結的超長頁面則要幾百毫秒。測得的時間會出現在擷取視窗的角落;把按下圖示的動作設為「存到資料夾」時,完全不會開啟視窗。
在無痕視窗中能用嗎?
只有在 Chrome 本身的擴充功能設定中允許它在無痕模式執行時才行。即使如此,資料夾授權在那裡也不會被記住,所以在私密工作階段中,剪貼簿或下載才是可靠的存放方式。