Clean Web Clipper 加到 Chrome(免費)

實測 ·

測了什麼、用什麼測、結果如何

在 512 個頁面上測試:其中 109 頁與另外三個引擎逐頁比較,403 頁只用我們的核心。沒有當機,擷取出的文章中也沒有任何殘留的 HTML 標籤。語料和腳本會隨下一輪測試公開;在那之前,這個頁面就是執行內容與結果的完整紀錄。

第一輪:109 個頁面,四個引擎逐頁比較

語料是全球前一百大網站和俄羅斯前一百大網站。非內容網域(通訊軟體、銀行、串流、政府入口網站)事先排除。頁面以真實瀏覽器擷取,若首頁上有內容連結,就從首頁解析出一個內容頁面。

四個引擎處理同樣的 109 個擷取頁面:Defuddle 0.19.3 搭配 Turndown 7.2.4(官方 Obsidian Web Clipper 的核心)、Mozilla Readability 0.6.0 搭配同一個 Turndown(MarkDownload 的核心)、MarkSnip 5.2.0(從其 Chrome 線上應用程式商店版本解開的實際發布程式碼),以及 Clean Web Clipper 0.1.0。

指標Defuddle 0.19.3Mozilla Readability 0.6.0MarkSnip 5.2.0Clean Web Clipper 0.1.0
頁數109107107109
當機0220
殘留 HTML53271820
重複的選單行491282478102
短行比例0.2780.2620.2630.221
找到的作者23272828
找到的發布日期28131324
擷取的表格(共 56 個)38115
有用文字比例0.8780.9310.9340.890

Clean Web Clipper 落後的地方

第二輪:十二種歐洲語言的 403 個頁面,只用我們的核心

十二個國家各自的前五十大網站,以設定為該國語言的瀏覽器擷取,因為不這麼做的話,其中一半會提供英文頁面,測到的就是別的東西了。

403 個頁面中有 152 個回應「沒有文章」:商店首頁、入口網站首頁和資訊流,這些頁面上沒有文章可擷取。這個回應是刻意的,所以這些頁面計為「已測試」,而不是「已擷取」。

語言頁數當機殘留 HTML連結比例
德文40000.058
法文39000.050
西班牙文40000.060
義大利文40000.036
波蘭文30000.064
葡萄牙文36000.060
荷蘭文37000.049
土耳其文31000.042
烏克蘭文13000.054
捷克文28000.039
瑞典文28000.036
羅馬尼亞文41000.039

每次擷取的時間:4 分 38 秒

lessroutinemorelife.com 上的計數器把每次擷取計為 4 分 38 秒。這個時間是擁有者在超過 1,000 個不同的內容頁面上親手測得的:複製文字、貼上、整理、加上標題和來源,然後檢查有沒有殘留的 HTML 標記。平均數和中位數都計算過。

因此計數器是擷取次數乘以這個時間,而不是每次擷取的碼錶讀數總和。它並不測量任何一次特定擷取原本會花你多少時間。

這些數字代表什麼

這次測量的誠實限制

加到 Chrome(免費)完全免費,不需要帳號,沒有限制。擷取可離線運作;使用事件會在連線時送出,關閉一個開關即可停止。

常見問題

我可以重現這些結果嗎?
目前還無法自行重現。語料清單、擷取腳本和評分腳本會隨下一輪測試公開。在那之前,這個頁面列出引擎版本和日期,讓之後的測試可以對照。擷取依賴線上網站,所以隨著這些網站改變,確切數字會有所變動。
為什麼這裡點名其他產品,商店頁面卻沒有?
商店頁面不點名其他產品;這個頁面會。隱藏比較對象的比較無法查證,所以這裡每個引擎都標示名稱和版本。
擷取出的文字越多越好嗎?
不一定。傳回滿是連結的資訊流頁面的引擎,在數量上得分高,在有用程度上得分低。這就是上面的表格測量雜訊而不是大小的原因。