適用對象
存下論文,並保留它的發布日期
沒有發布日期的論文存檔,是一條你之後得重建的引用。Clean Web Clipper 從頁面自己的中繼資料讀取日期,而不是從內文讀取;頁面沒有日期時,欄位會留空,而不是填上今天。
存下的論文在哪裡失去出處
你在瀏覽器裡讀一篇預印本,把它存下來,三個月後筆記裡完全看不出它何時發表、你讀的是哪個版本。摘要頁已經更新到 v3,參考連結變成指回你早已離開的頁面的失效錨點,作者欄位寫著「Skip to main content」,因為擷取工具抓了它找到的第一個粗體字串。
日期是最糟的部分,因為這種失敗無聲無息。把筆記標上你儲存當天日期的擷取工具,產生的檔案看起來正確,實際上卻是錯的。一年後,你無法分辨兩百則筆記中哪些帶有真正的發布日期、哪些只是你碰巧閱讀的日期:檔案裡沒有任何東西能區分它們。
文字和思考最後落在不同地方。文獻管理工具存著中繼資料,筆記應用程式存著你的評論,兩者都沒有存下你評論的那段原文。到了撰寫時,你回頭去找,一半的連結通往付費牆,而你當初是透過早已過期的機構工作階段讀到的。把原文本身和你的筆記存在同一個檔案裡,就完全省去這趟來回。
筆記記錄了什麼
- 直接讀取
citation_date和citation_publication_date(arXiv、PubMed 和 IEEE 輸出的 meta 標籤)。 - 也讀取 JSON-LD
datePublished、article:published_time、time[datetime]和 Unix 時間戳,依此優先順序。 - 頁面上沒有日期,欄位就留空:絕不填上今天的日期。
- 參考連結變成
[^1]註腳,定義集中在筆記結尾。 - 作者欄位經過過濾:章節標題、期刊名稱和按鈕文字不會變成署名。
extraction欄位記錄擷取路徑:dom來自呈現後的頁面,jsonld-articlebody表示頁面始終沒有完成呈現。- 發布日期和擷取日期絕不混在一起:頁面的日期是 frontmatter 欄位,你擷取的那天是檔名中的
{date},兩者刻意放在不同地方。 - 在 512 個測量頁面上沒有任何殘留的 HTML 標籤,所以貼進稿件的段落不會夾帶零散的
span或圖說片段。
--- title: "Attention Is All You Need" source: "https://arxiv.org/abs/1706.03762" author: "Ashish Vaswani, Noam Shazeer, Niki Parmar" date: "2017-06-12" extraction: "dom" --- The dominant sequence transduction models are based on complex recurrent or convolutional neural networks.[^1] [^1]: Submitted 12 June 2017. Comments: 15 pages, 5 figures.
為閱讀論文設定擷取
預設設定是為快速閱讀文章調整的。參考資料夾需要的正好相反:保留每一個中繼資料欄位,並在歸檔前先看一眼結果。
- 從擴充功能圖示開啟選項,把存放位置設為專案資料來源所在的資料夾:稿件旁邊的
sources/,或 vault 內的某個資料夾。 - 把按下圖示的動作保留為預覽視窗,而不是「存到資料夾」。對論文來說,這個視窗值得存在:在檔案產生之前,你能在這裡看到日期和作者是否真的抓到了。
- 把檔名範本設為
{domain}-{title}。預印本伺服器、期刊和機構典藏中的同一篇論文,是三份標題相同的不同文件,而網域就是在資料夾清單中區分它們的方式。 - 開啟每一個 frontmatter 欄位,包括
extraction。最後這一項在這裡比在任何地方都重要:jsonld-articlebody表示文字來自頁面的結構化資料,而不是呈現出來的內容,兩者不一定是同一個版本。 - 把圖片保留為連結。圖表往往就是論證本身,連結至少說明那裡曾有一張圖;略過圖片則會悄悄抹去論文有圖這件事。
- 摘要頁和全文 HTML 都存在時,分別擷取。它們帶有不同的中繼資料:摘要頁通常有
citation_date標籤,全文則有參考文獻。 - 第一次從沒用過的出版商擷取後,看一下
date欄位。如果是空的,代表那個網站的標記中沒有輸出日期,任何設定都變不出來。
參考資料夾的設定
這張表的重點不是速度,而是確保兩年後,檔案仍然說得出它從哪裡來、怎麼來的。
| 設定 | 值 | 為什麼在這裡用這個值 |
|---|---|---|
| 按下圖示 | 預覽視窗 | 在變成檔案之前,唯一能確認日期和作者是否保留下來的機會 |
| 存放位置 | 稿件旁的 `sources/` 資料夾 | 原文段落和關於它的寫作放在同一處、同一份備份裡 |
| 檔名範本 | `{domain}-{title}` | 預印本、期刊版本和典藏副本標題相同,卻不是同一份文件 |
| Frontmatter | 全部欄位,包括 `extraction` | 擷取路徑很重要:結構化資料和呈現的文字偶爾是不同版本 |
| 圖片 | 保留為連結 | 圖表連結記錄了圖表曾經存在;略過則會隱藏這件事 |
| 個別網站規則 | `arxiv.org` → 子資料夾 `preprints` | 預印本會被取代,值得能整批重新檢查 |
| 選取範圍 | 針對單一章節擷取選取範圍 | 研究方法章節被引用的次數,遠多於整篇論文被讀完的次數 |
--- title: "Reproducibility of variant calling across sequencing platforms" source: "https://example-journal.org/articles/vc-repro" author: "M. Ilves, R. Okonkwo" date: "" extraction: "jsonld-articlebody" --- ## Abstract Concordance between platforms fell below 0.90 for indels longer than eight bases, while substitution calls agreed across all four pipelines tested.
三種使用方式
在引用底下改變的預印本
你在三月讀了一篇預印本的 v1 並擷取下來。到了九月,摘要頁提供的是 v3,結果章節重寫,還多了兩位作者。你再擷取一次;第二個檔案加上數字後綴,而不是取代第一個。
現在任何差異比對工具都能準確顯示,你引用的版本和讀者在那個網址會看到的版本之間,哪些論點變了。沒有三月的檔案,就根本無法證明有任何改變。網址看起來一模一樣,頁面也只顯示目前的狀態。
機構工作階段背後的全文
文章能為你呈現,是因為你在校園網路上,或透過圖書館登入。擴充功能讀取瀏覽器呈現的內容,所以全文和其他頁面一樣能擷取,參考文獻會變成集中在筆記結尾的 [^1] 註腳定義。
六個月後這就很重要了:工作階段已經過期,同一個連結開始要你付錢。那段文字、作者和日期都在你磁碟上的檔案裡,這個檔案沒有任何部分依賴訂閱是否仍然有效。
撰寫時,來源就在同一個資料夾
稿件在 paper/,擷取的來源在 paper/sources/。草稿中的每一段引文,不必開瀏覽器就能和它的來源檔案核對,參考文獻清單需要的網址和日期,就是那個檔案最上方的兩行。
因為檔案是純文字,在資料夾中 grep 就能回答文獻管理工具回答不了的問題:不是你存了哪些論文,而是其中哪些真的用了某個詞組。
和一般的閱讀流程相比
大多數人已經在做其中兩三種。誠實的比較不是說它們會失敗,而是說它們各自漏掉不同的東西。
| 目前的做法 | 你得到什麼 | 代價是什麼 |
|---|---|---|
| 文獻管理工具的瀏覽器按鈕 | 結構化中繼資料,通常還有 PDF | 閱讀的文字在資料庫裡;引文仍然得重新打字 |
| 下載 PDF | 正式出版版本,保留版面 | 沒有額外工具就無法在資料夾中 grep,也無法比對版本差異 |
| 把摘要頁加入書籤 | 立刻得到一個指標 | 預印本會在原處被取代;指標會悄悄跟著改變 |
| 複製貼上段落 | 你需要的文字 | 沒有日期、網址和參考文獻定義 |
| Clean Web Clipper | HTML 文字、中繼資料和註腳,存成一個檔案 | 只支援 HTML。它不讀 PDF,也不寫入引用鍵 |
中繼資料沒有抓到時
日期欄位是空的
頁面沒有輸出擴充功能能辨識的日期。它依序尋找 citation_date 和 citation_publication_date(arXiv、PubMed 和 IEEE 使用的標籤),接著是 JSON-LD datePublished、article:published_time、time[datetime] 和 Unix 時間戳。全都沒有時,欄位會留空而不是填上今天,因為參考資料夾中看似合理的錯誤日期,總會在最糟的時刻被發現。
明明有作者的論文,作者欄位卻是空的
作者擷取會讀取結構化資料和署名標記,然後過濾常見的誤判:章節標題、期刊名稱、「authority control」區塊和按鈕文字。有些出版商把作者清單放在 JavaScript 呈現的元件中,完全沒有署名標記,於是沒有任何東西通過過濾。空欄位是刻意的結果:在不只一個擷取工具上,另一種結果是作者欄位寫著「Skip to main content」。
只擷取到摘要,沒有論文本身
你擷取的是摘要登陸頁,對大多數預印本伺服器和期刊來說,那一頁確實只有摘要。全文在另一個網址,通常是同一頁上的「full text」、「HTML」或「reader」連結。那一頁也擷取下來;兩個頁面帶有不同的中繼資料,值得存成兩個檔案。
方程式不見了
以圖片呈現的數學式仍是圖片連結,如果你把圖片設為「略過」,它就會完全消失。出版商以文字呈現公式時,字元會被擷取下來。不會轉換成 LaTeX:擴充功能讀取頁面呈現的內容,不會從公式的圖片重建符號。
誠實的限制
它讀取 HTML,不讀 PDF:只以 PDF 形式存在的論文,擴充功能無法轉換。它不會抓取 BibTeX,也不會寫入引用鍵。frontmatter 是中繼資料,不是書目條目。以圖片呈現的數學式仍是圖片連結。有些網站的標記中根本沒有發布日期;在這些網站上,欄位會留空而不是用猜的,這是誠實的答案,但終究還是空欄位。
常見問題
頁面沒有發布日期怎麼辦?
可以擷取 PDF 嗎?
擷取後註腳連結還能用嗎?
可以擷取需要機構登入的論文嗎?
它怎麼判斷誰是作者?
資料表和補充表格保留得下來嗎?
它會抓取 DOI、BibTeX 或引用鍵嗎?
我某則筆記上的 `jsonld-articlebody` 是什麼意思?
筆記會記錄我讀的是預印本的哪個版本嗎?
source 行也會帶有;檔名中的 {date} 則記錄你擷取的時間。之後再擷取同一篇論文,兩個檔案就能直接比較。這是證明版本改變唯一可靠的紀錄。