實測 ·
測了什麼、用什麼測、結果如何
在 512 個頁面上測試:其中 109 頁與另外三個引擎逐頁比較,403 頁只用我們的核心。沒有當機,擷取出的文章中也沒有任何殘留的 HTML 標籤。語料和腳本會隨下一輪測試公開;在那之前,這個頁面就是執行內容與結果的完整紀錄。
第一輪:109 個頁面,四個引擎逐頁比較
語料是全球前一百大網站和俄羅斯前一百大網站。非內容網域(通訊軟體、銀行、串流、政府入口網站)事先排除。頁面以真實瀏覽器擷取,若首頁上有內容連結,就從首頁解析出一個內容頁面。
四個引擎處理同樣的 109 個擷取頁面:Defuddle 0.19.3 搭配 Turndown 7.2.4(官方 Obsidian Web Clipper 的核心)、Mozilla Readability 0.6.0 搭配同一個 Turndown(MarkDownload 的核心)、MarkSnip 5.2.0(從其 Chrome 線上應用程式商店版本解開的實際發布程式碼),以及 Clean Web Clipper 0.1.0。
| 指標 | Defuddle 0.19.3 | Mozilla Readability 0.6.0 | MarkSnip 5.2.0 | Clean Web Clipper 0.1.0 |
|---|---|---|---|---|
| 頁數 | 109 | 107 | 107 | 109 |
| 當機 | 0 | 2 | 2 | 0 |
| 殘留 HTML | 532 | 718 | 2 | 0 |
| 重複的選單行 | 491 | 282 | 478 | 102 |
| 短行比例 | 0.278 | 0.262 | 0.263 | 0.221 |
| 找到的作者 | 23 | 27 | 28 | 28 |
| 找到的發布日期 | 28 | 13 | 13 | 24 |
| 擷取的表格(共 56 個) | 3 | 8 | 11 | 5 |
| 有用文字比例 | 0.878 | 0.931 | 0.934 | 0.890 |
Clean Web Clipper 落後的地方
- 表格:5 對 11(MarkSnip)。56 個來源表格中有 41 個集中在同一個頁面上,屬於版面配置而不是內容,任何引擎都不該擷取;真正的差距是少數幾個頁面,我們的根節點選擇挑了太窄的區塊。
- 有用文字比例:0.890 對 0.934。 其中一部分是刻意的:它會拒絕其他引擎照樣傳回的資訊流頁面;另一部分則是同樣過窄的根節點。
- 發布日期:24 對 28(Defuddle)。
- 作者:與最佳者持平,28 對 28(MarkSnip),這是重做作者擷取之後的結果。這份語料第一次評分時是 20。
第二輪:十二種歐洲語言的 403 個頁面,只用我們的核心
十二個國家各自的前五十大網站,以設定為該國語言的瀏覽器擷取,因為不這麼做的話,其中一半會提供英文頁面,測到的就是別的東西了。
403 個頁面中有 152 個回應「沒有文章」:商店首頁、入口網站首頁和資訊流,這些頁面上沒有文章可擷取。這個回應是刻意的,所以這些頁面計為「已測試」,而不是「已擷取」。
| 語言 | 頁數 | 當機 | 殘留 HTML | 連結比例 |
|---|---|---|---|---|
| 德文 | 40 | 0 | 0 | 0.058 |
| 法文 | 39 | 0 | 0 | 0.050 |
| 西班牙文 | 40 | 0 | 0 | 0.060 |
| 義大利文 | 40 | 0 | 0 | 0.036 |
| 波蘭文 | 30 | 0 | 0 | 0.064 |
| 葡萄牙文 | 36 | 0 | 0 | 0.060 |
| 荷蘭文 | 37 | 0 | 0 | 0.049 |
| 土耳其文 | 31 | 0 | 0 | 0.042 |
| 烏克蘭文 | 13 | 0 | 0 | 0.054 |
| 捷克文 | 28 | 0 | 0 | 0.039 |
| 瑞典文 | 28 | 0 | 0 | 0.036 |
| 羅馬尼亞文 | 41 | 0 | 0 | 0.039 |
每次擷取的時間:4 分 38 秒
lessroutinemorelife.com 上的計數器把每次擷取計為 4 分 38 秒。這個時間是擁有者在超過 1,000 個不同的內容頁面上親手測得的:複製文字、貼上、整理、加上標題和來源,然後檢查有沒有殘留的 HTML 標記。平均數和中位數都計算過。
因此計數器是擷取次數乘以這個時間,而不是每次擷取的碼錶讀數總和。它並不測量任何一次特定擷取原本會花你多少時間。
這些數字代表什麼
- 當機:引擎在頁面上拋出錯誤,什麼都沒有傳回。沒有當機的一輪測試,結果仍可能充滿選單;那是其他各列在測量的東西。
- 殘留 HTML 標籤:有多少原始標記留在 Markdown 中。任何大於零的數字都是缺陷。
- 重複的選單行:長度超過十二個字元、出現不只一次的行。這是在每個段落重複出現的導覽。
- 短行比例:少於二十五個字元的行所占的比例。比例高代表擷取到的是連結清單,而不是正文。
- 連結比例:位於連結文字中的字元所占的比例。比例高代表選單也被帶進來了。
- 「沒有文章」:頁面上沒有文章內文,所以擴充功能直接說明,而不是傳回連結。這既不是當機,也不是一次擷取。
這次測量的誠實限制
- 烏克蘭文樣本是 13 頁,不是 40 頁:大部分語料無法從擷取地點回應。請把那一列僅當作參考。
- 土耳其和捷克的前五十大清單偏向商店和時刻表,這些網站根本不帶發布日期。這是語料的特性,不是擷取的問題。
- 競爭引擎只在第一份語料上執行過。歐洲那一輪只測量 Clean Web Clipper。
- 所有引擎都傳回不到 500 個字元的頁面已被排除:那是驗證碼或封鎖,不是擷取品質。
- 兩輪測試都是 2026 年 8 月底對線上網站的快照。之後用同樣的腳本執行,隨著這些網站改變,數字會有些不同。