Clean Web Clipper 加到 Chrome(免費)

適用對象

存下論文,並保留它的發布日期

沒有發布日期的論文存檔,是一條你之後得重建的引用。Clean Web Clipper 從頁面自己的中繼資料讀取日期,而不是從內文讀取;頁面沒有日期時,欄位會留空,而不是填上今天。

存下的論文在哪裡失去出處

你在瀏覽器裡讀一篇預印本,把它存下來,三個月後筆記裡完全看不出它何時發表、你讀的是哪個版本。摘要頁已經更新到 v3,參考連結變成指回你早已離開的頁面的失效錨點,作者欄位寫著「Skip to main content」,因為擷取工具抓了它找到的第一個粗體字串。

日期是最糟的部分,因為這種失敗無聲無息。把筆記標上你儲存當天日期的擷取工具,產生的檔案看起來正確,實際上卻是錯的。一年後,你無法分辨兩百則筆記中哪些帶有真正的發布日期、哪些只是你碰巧閱讀的日期:檔案裡沒有任何東西能區分它們。

文字和思考最後落在不同地方。文獻管理工具存著中繼資料,筆記應用程式存著你的評論,兩者都沒有存下你評論的那段原文。到了撰寫時,你回頭去找,一半的連結通往付費牆,而你當初是透過早已過期的機構工作階段讀到的。把原文本身和你的筆記存在同一個檔案裡,就完全省去這趟來回。

筆記記錄了什麼

從頁面讀取的 citation_date,註腳放在結尾arxiv.org/abs/1706.03762
---
title: "Attention Is All You Need"
source: "https://arxiv.org/abs/1706.03762"
author: "Ashish Vaswani, Noam Shazeer, Niki Parmar"
date: "2017-06-12"
extraction: "dom"
---

The dominant sequence transduction models are based on complex recurrent or
convolutional neural networks.[^1]

[^1]: Submitted 12 June 2017. Comments: 15 pages, 5 figures.

為閱讀論文設定擷取

預設設定是為快速閱讀文章調整的。參考資料夾需要的正好相反:保留每一個中繼資料欄位,並在歸檔前先看一眼結果。

  1. 從擴充功能圖示開啟選項,把存放位置設為專案資料來源所在的資料夾:稿件旁邊的 sources/,或 vault 內的某個資料夾。
  2. 把按下圖示的動作保留為預覽視窗,而不是「存到資料夾」。對論文來說,這個視窗值得存在:在檔案產生之前,你能在這裡看到日期和作者是否真的抓到了。
  3. 把檔名範本設為 {domain}-{title}。預印本伺服器、期刊和機構典藏中的同一篇論文,是三份標題相同的不同文件,而網域就是在資料夾清單中區分它們的方式。
  4. 開啟每一個 frontmatter 欄位,包括 extraction。最後這一項在這裡比在任何地方都重要:jsonld-articlebody 表示文字來自頁面的結構化資料,而不是呈現出來的內容,兩者不一定是同一個版本。
  5. 把圖片保留為連結。圖表往往就是論證本身,連結至少說明那裡曾有一張圖;略過圖片則會悄悄抹去論文有圖這件事。
  6. 摘要頁和全文 HTML 都存在時,分別擷取。它們帶有不同的中繼資料:摘要頁通常有 citation_date 標籤,全文則有參考文獻。
  7. 第一次從沒用過的出版商擷取後,看一下 date 欄位。如果是空的,代表那個網站的標記中沒有輸出日期,任何設定都變不出來。

參考資料夾的設定

這張表的重點不是速度,而是確保兩年後,檔案仍然說得出它從哪裡來、怎麼來的。

設定為什麼在這裡用這個值
按下圖示預覽視窗在變成檔案之前,唯一能確認日期和作者是否保留下來的機會
存放位置稿件旁的 `sources/` 資料夾原文段落和關於它的寫作放在同一處、同一份備份裡
檔名範本`{domain}-{title}`預印本、期刊版本和典藏副本標題相同,卻不是同一份文件
Frontmatter全部欄位,包括 `extraction`擷取路徑很重要:結構化資料和呈現的文字偶爾是不同版本
圖片保留為連結圖表連結記錄了圖表曾經存在;略過則會隱藏這件事
個別網站規則`arxiv.org` → 子資料夾 `preprints`預印本會被取代,值得能整批重新檢查
選取範圍針對單一章節擷取選取範圍研究方法章節被引用的次數,遠多於整篇論文被讀完的次數
頁面沒有發布日期,所以欄位留空標記中沒有日期的期刊登陸頁面
---
title: "Reproducibility of variant calling across sequencing platforms"
source: "https://example-journal.org/articles/vc-repro"
author: "M. Ilves, R. Okonkwo"
date: ""
extraction: "jsonld-articlebody"
---

## Abstract

Concordance between platforms fell below 0.90 for indels longer than eight
bases, while substitution calls agreed across all four pipelines tested.

三種使用方式

在引用底下改變的預印本

你在三月讀了一篇預印本的 v1 並擷取下來。到了九月,摘要頁提供的是 v3,結果章節重寫,還多了兩位作者。你再擷取一次;第二個檔案加上數字後綴,而不是取代第一個。

現在任何差異比對工具都能準確顯示,你引用的版本和讀者在那個網址會看到的版本之間,哪些論點變了。沒有三月的檔案,就根本無法證明有任何改變。網址看起來一模一樣,頁面也只顯示目前的狀態。

機構工作階段背後的全文

文章能為你呈現,是因為你在校園網路上,或透過圖書館登入。擴充功能讀取瀏覽器呈現的內容,所以全文和其他頁面一樣能擷取,參考文獻會變成集中在筆記結尾的 [^1] 註腳定義。

六個月後這就很重要了:工作階段已經過期,同一個連結開始要你付錢。那段文字、作者和日期都在你磁碟上的檔案裡,這個檔案沒有任何部分依賴訂閱是否仍然有效。

撰寫時,來源就在同一個資料夾

稿件在 paper/,擷取的來源在 paper/sources/。草稿中的每一段引文,不必開瀏覽器就能和它的來源檔案核對,參考文獻清單需要的網址和日期,就是那個檔案最上方的兩行。

因為檔案是純文字,在資料夾中 grep 就能回答文獻管理工具回答不了的問題:不是你存了哪些論文,而是其中哪些真的用了某個詞組。

和一般的閱讀流程相比

大多數人已經在做其中兩三種。誠實的比較不是說它們會失敗,而是說它們各自漏掉不同的東西。

目前的做法你得到什麼代價是什麼
文獻管理工具的瀏覽器按鈕結構化中繼資料,通常還有 PDF閱讀的文字在資料庫裡;引文仍然得重新打字
下載 PDF正式出版版本,保留版面沒有額外工具就無法在資料夾中 grep,也無法比對版本差異
把摘要頁加入書籤立刻得到一個指標預印本會在原處被取代;指標會悄悄跟著改變
複製貼上段落你需要的文字沒有日期、網址和參考文獻定義
Clean Web ClipperHTML 文字、中繼資料和註腳,存成一個檔案只支援 HTML。它不讀 PDF,也不寫入引用鍵

中繼資料沒有抓到時

日期欄位是空的

頁面沒有輸出擴充功能能辨識的日期。它依序尋找 citation_datecitation_publication_date(arXiv、PubMed 和 IEEE 使用的標籤),接著是 JSON-LD datePublishedarticle:published_timetime[datetime] 和 Unix 時間戳。全都沒有時,欄位會留空而不是填上今天,因為參考資料夾中看似合理的錯誤日期,總會在最糟的時刻被發現。

明明有作者的論文,作者欄位卻是空的

作者擷取會讀取結構化資料和署名標記,然後過濾常見的誤判:章節標題、期刊名稱、「authority control」區塊和按鈕文字。有些出版商把作者清單放在 JavaScript 呈現的元件中,完全沒有署名標記,於是沒有任何東西通過過濾。空欄位是刻意的結果:在不只一個擷取工具上,另一種結果是作者欄位寫著「Skip to main content」。

只擷取到摘要,沒有論文本身

你擷取的是摘要登陸頁,對大多數預印本伺服器和期刊來說,那一頁確實只有摘要。全文在另一個網址,通常是同一頁上的「full text」、「HTML」或「reader」連結。那一頁也擷取下來;兩個頁面帶有不同的中繼資料,值得存成兩個檔案。

方程式不見了

以圖片呈現的數學式仍是圖片連結,如果你把圖片設為「略過」,它就會完全消失。出版商以文字呈現公式時,字元會被擷取下來。不會轉換成 LaTeX:擴充功能讀取頁面呈現的內容,不會從公式的圖片重建符號。

誠實的限制

它讀取 HTML,不讀 PDF:只以 PDF 形式存在的論文,擴充功能無法轉換。它不會抓取 BibTeX,也不會寫入引用鍵。frontmatter 是中繼資料,不是書目條目。以圖片呈現的數學式仍是圖片連結。有些網站的標記中根本沒有發布日期;在這些網站上,欄位會留空而不是用猜的,這是誠實的答案,但終究還是空欄位。

加到 Chrome(免費)完全免費。不需要帳號、不需要註冊,也沒有任何限制。

常見問題

頁面沒有發布日期怎麼辦?
欄位會留空。填上你碰巧擷取頁面的日期比留空更糟,因為它會悄悄變成你筆記中的錯誤資料。
可以擷取 PDF 嗎?
不行。擴充功能處理的是頁面呈現後的 HTML。文章同時有兩種形式時,請擷取 HTML 版本;PDF 請用 PDF 工具。
擷取後註腳連結還能用嗎?
能:它們會變成標準的 Markdown 註腳,Obsidian 和大多數 Markdown 轉譯器都會把它們變成筆記內可用的連結。
可以擷取需要機構登入的論文嗎?
可以,因為它讀取的是瀏覽器已經呈現的頁面。你看得到,就能擷取。
它怎麼判斷誰是作者?
它讀取結構化資料和署名標記,然後過濾常見的誤判:章節標題、刊物名稱、「authority control」區塊和按鈕文字。沒有任何東西通過過濾時,欄位會留空。
資料表和補充表格保留得下來嗎?
通常可以。表格由擴充功能自己序列化,而不是交給通用轉換器;在一份包含十五個表格的語料上,這裡保留了十二個,比較的引擎各保留七個。儲存格裡有清單或程式碼範例,正是會讓通用轉換器出錯、而這裡能處理的情況。
它會抓取 DOI、BibTeX 或引用鍵嗎?
不會。frontmatter 是頁面中繼資料:標題、來源網址、作者、日期、擷取路徑,不是書目條目。引用鍵仍然放在你的文獻管理工具裡;這裡放的是文字。
我某則筆記上的 `jsonld-articlebody` 是什麼意思?
代表頁面把文章放在結構化資料中,始終沒有完成呈現,所以內文改從結構化資料讀取。在論文上值得留意:出版商偶爾會在那個區塊留下較早版本的文字,記錄這個值,是讓你能去核對而不是直接假設。
筆記會記錄我讀的是預印本的哪個版本嗎?
在頁面提供的範圍內會。如果網址帶有版本,source 行也會帶有;檔名中的 {date} 則記錄你擷取的時間。之後再擷取同一篇論文,兩個檔案就能直接比較。這是證明版本改變唯一可靠的紀錄。
可以為了文獻篩選,擷取整個資料庫的搜尋結果嗎?
不行。沒有批次模式也沒有爬蟲,而結果頁正是擴充功能會拒絕的輸入:大多是連結文字,回報為「沒有文章」。篩選交給篩選工具;這個工具保存你決定要讀的論文。