適用對象
保存仍能引用的參考資料
以截圖和書籤收集的研究資料,在你需要標明出處的那一刻就不能用了。Markdown 檔案把標題、作者、日期和網址和文字放在同一個檔案裡,查核時隨手就能找到。
無法標明出處的引文
那段話在你的草稿裡,加了引號,而你想不起它從哪裡來。它在四百個書籤的某處,或在一張沒有網址的截圖裡,或在一個之後被改寫的頁面上。重建來源花的時間比寫那段文字還久,有時根本做不到,於是這一句只好從稿子裡拿掉。
從瀏覽器貼上也有它的代價。網站的雜物跟著文字一起進來:夾在兩個分享按鈕之間的署名、段落中間的電子報訂閱框、文章結尾處的「延伸閱讀」清單。每次都要整理這些,正是大多數研究資料夾悄悄變成沒人再打開的半格式化碎片墳場的原因。
接著還得有人查核。編輯或事實查核人員打不開你的書籤,看不到你透過訂閱讀到的內容,也不會接受截圖作為出處,所以查核變成一場對話,由你憑記憶重建每一句從哪裡來。一資料夾的文字檔、每個都內含網址和日期,是可以直接交出去的東西;而能不能交出去,往往決定一個問題要花五分鐘還是一個下午。
研究資料夾會變成什麼
- 每則筆記的 frontmatter 都有
title、author、date和source,出處和文字放在一起。 - 作者欄位經過過濾:章節標題、刊物名稱和按鈕文字不會被當成署名。
- 只保留文章內文:電子報訂閱框、分享列和「延伸閱讀」區塊絕不會進入筆記。
- 選取一段文字,就只擷取那一段,整頁不值得保留時就這麼做。
- 你付費訂閱的文章能正常擷取,因為擴充功能讀取的是瀏覽器呈現的頁面。
- 檔案落在你自己的資料夾,格式不受任何廠商控制、停產或重新定價。
- 引用區塊和拉出的引言仍是引用區塊,所以在你自己的檔案裡,不能改寫的文字依然明顯是別人的話。
- 發布日期和你擷取的日期分開存放:頁面的日期是 frontmatter 欄位,擷取日期是檔名中的
{date}。
--- title: "Moby-Dick; or, The Whale: Chapter 1: Loomings" source: "https://www.gutenberg.org/files/2701/2701-h/2701-h.htm" author: "Herman Melville" extraction: "dom" --- Call me Ishmael. Some years ago–never mind how long precisely–having little or no money in my purse, and nothing particular to interest me on shore, I thought I would sail about a little and see the watery part of the world.
為一份委託稿設定擷取
每篇稿子一個資料夾,裡面每份擷取內容都帶著自己的出處。重要的設定,是讓這個資料夾能交給別人的那些。
- 開始閱讀之前,先為這篇稿子建立研究資料夾
pieces/baltic-charts/sources。收進已經存在的資料夾的出處,才叫出處;事後才收集,就成了考古。 - 從擴充功能圖示開啟選項,把存放位置設為你的研究目錄,並在子資料夾欄位填入稿子的名稱。之後換一篇委託稿,只要改這一個欄位。
- 把檔名範本設為
{date}-{title}。那個日期是你擷取的時間,也正是頁面之後被改過時,編輯會問的事實。 - 開啟每一個 frontmatter 欄位。
author和date是讓擷取內容能被引用的兩個欄位,source則是事實查核人員真的會點的那一個。 - 把按下圖示的動作保留為預覽視窗。確認署名有沒有抓到只要兩秒,而錯誤的署名正是會一路留到印刷版的錯誤。
- 只需要一段文字時,先在頁面上選取,再擷取:視窗會開在選取範圍上,頂端的切換鈕會確認你看的是哪一種。
- 在讀到頁面的當天就擷取,而不是在動筆那天。頁面會被悄悄修改,而你沒有擷取的那一版,正是編輯會要的那一版。
能交給別人的研究資料設定
下面每一個值的檢驗標準是:一個陌生人拿到這個資料夾,能不能不問你任何問題就核實一段引文。
| 設定 | 值 | 為什麼在這裡用這個值 |
|---|---|---|
| 存放位置 | 每篇稿子一個子資料夾 | 出處以委託稿為單位,共用資料夾正是可以交給事實查核人員的東西 |
| 檔名範本 | `{date}-{title}` | 記錄你何時擷取:頁面之後被改過時,就會出現這個問題 |
| Frontmatter | 全部欄位開啟 | `author`、`date` 和 `source` 就是出處;其餘是背景資訊 |
| 按下圖示 | 預覽視窗 | 花兩秒確認署名,免得錯誤的署名進入草稿 |
| 圖片 | 保留為連結 | 照片來源往往只能從圖片網址找到 |
| 選取範圍 | 先選取段落,再擷取 | 只為一段而引用的長篇專題,不必整篇保留 |
| 個別網站規則 | 常用網站 → 各自的子資料夾 | 到了查核階段,背景閱讀和第一手來源是不同的兩堆 |
--- title: "The last cartographers of the Baltic" source: "https://example-magazine.com/features/baltic-charts" author: "Ingrid Salo" date: "2025-11-18T06:00:00.000Z" extraction: "dom" --- The survey vessel still carries paper charts, folded into a drawer nobody has opened since the second officer retired. > We stopped correcting them in 2019. Nobody decided to stop; the corrections > simply stopped arriving. The hydrographic office confirmed that paper corrections ended that year.
一篇稿子中的三個時刻
頁面已被改寫的引文
你在十一月擷取了一份公司聲明,並在二月的草稿中引用。頁面還在,但已經不是那樣寫了:措辭被軟化,沒有更正說明,也沒有標示修改時間。你的檔案裡有原本的句子、網址,以及頁面自己宣告的日期。
再擷取一次,任何差異比對工具都能把兩個版本並排顯示。這和「頁面說過這句話」是不同的主張:它是「這是我擷取到的內容,這是現在頁面上的內容」,而這是你能拿到編輯面前的主張。
把出處交給別人
事實查核人員拿到資料夾。每個檔案都能用任何編輯器打開,前幾行就是段落、署名、發布日期和網址,所以原本要問你的查核問題,變成他們自己就能查的事。
這正是截圖最失敗的地方。頁面的圖片沒有網址、沒有日期,也沒有查核人員能搜尋的文字,所以研究資料夾中的每張截圖,都會變成一則詢問「這從哪來」的訊息。
訪談前的背景資料
前一晚,六篇背景讀物被擷取到這篇稿子的資料夾。通話時,你搜尋的是資料夾,而不是八個開著的分頁,搜尋一次涵蓋六篇的全部文字,包括兩篇訂閱內容。
因為檔案是文字,這樣的搜尋毫無成本,在沒有訊號的建築裡、關掉 Wi-Fi 也能用。那些分頁則可能已經過期、被重新載入、再次要求同意 Cookie,或把你登出。
和一般的研究習慣相比
這裡沒有哪一種是壞習慣:每一種都是某個人的工作方法。差別在於哪些東西能留到查核階段。
| 目前的做法 | 你得到什麼 | 代價是什麼 |
|---|---|---|
| 把頁面加入書籤 | 立刻得到一個指標 | 它指向頁面今天的內容,而不是你讀到時的內容 |
| 截圖段落 | 以圖像形式保存的文字 | 沒有網址、沒有日期、沒有可搜尋的文字,查核人員也無法獨自核實 |
| 貼進研究文件 | 集中在一處的文字 | 網站雜物跟著進來,出處資訊卻沒有 |
| 稍後閱讀服務 | 乾淨、已同步的副本 | 取決於服務是否繼續存在,以及是否讓你匯出 |
| 把頁面列印成 PDF | 固定的版面紀錄 | 附帶同意橫幅,文字無法跨資料夾搜尋,也沒有中繼資料檔頭 |
| Clean Web Clipper | 文字、署名、日期和網址在同一個檔案 | 沒有版面、沒有截圖,也沒有第三方證明你何時擷取 |
擷取內容無法引用時
作者欄位是空的
頁面沒有擴充功能能辨識的署名,或者署名所在的標記和章節標題無法區分。作者擷取會讀取結構化資料和署名標記,再過濾已知的誤判(標題、刊物名稱、按鈕文字),沒有任何東西通過過濾時,欄位會留空,而不是填上頁面上第一個粗體字串。你可以自己填上;它是文字檔。
只擷取到前三段
這通常是計量付費牆:頁面確實只呈現了試讀段落,其餘內容只提供給它認為你擁有的工作階段。也可能是延遲載入,內文在你捲動時才出現。捲到文章結尾,確認最後一段顯示在畫面上,再擷取一次。擴充功能擷取的是瀏覽器在那一刻已經呈現的內容。
文章始終沒有出現在同意對話框後面
有些網站在取得同意之前完全不呈現任何內容,所以 DOM 中沒有文章可擷取,擴充功能也會如實回報。照你平常的方式回應對話框,讓頁面呈現後再擷取。無論如何,同意橫幅本身都會從擷取內容中移除。
檔名中的日期和 frontmatter 中的日期不一樣
它們不是同一個日期,本來就不該一樣。檔名中的 {date} 是你擷取頁面的那天;frontmatter 中的 date 欄位是頁面自己宣告的發布日期。把兩者分開,你才能同時說出文章何時發表、你何時看到它;frontmatter 日期是空的,代表頁面沒有宣告任何日期。
它不做的事
它不會保存頁面當時的樣子:沒有截圖、沒有版面、沒有資源檔。它不摘要也不改寫。文章文字只做轉換,不做編輯。圖片保留為指向原始網站的連結,所以那個網站壞掉時,圖片也會壞掉。頁面沒有作者或日期時,欄位會留空,而不是填上一個看似合理的猜測。