Clean Web Clipper Chrome に追加(無料)

測定 ·

何を、何で測り、どんな結果が出たか

512 ページでテストしました。109 ページはほかの 3 つのエンジンと直接比較し、403 ページは私たちのコアだけで処理しました。クラッシュは 0、抽出したどの記事にも HTML タグは残りませんでした。コーパスとスクリプトは次回の測定と一緒に公開します。それまでは、このページが実行した内容と結果の完全な記録です。

1 回目:109 ページ、4 つのエンジンで直接比較

コーパスは、世界で最も訪問者の多い 100 サイトと、ロシアで最も訪問者の多い 100 サイトです。本文のないドメイン(メッセンジャー、銀行、動画配信、行政ポータル)は事前に除外しました。ページは実際のブラウザで取得し、トップページに本文へのリンクがあればそれをたどりました。

同じ 109 ページに対して 4 つのエンジンを実行しました。Defuddle 0.19.3 と Turndown 7.2.4(公式の Obsidian Web Clipper の中核)、Mozilla Readability 0.6.0 と同じ Turndown(MarkDownload の中核)、Chrome ウェブストアのビルドから取り出した実際の配布コードである MarkSnip 5.2.0、そして Clean Web Clipper 0.1.0 です。

指標Defuddle 0.19.3Mozilla Readability 0.6.0MarkSnip 5.2.0Clean Web Clipper 0.1.0
ページ109107107109
クラッシュ0220
残った HTML53271820
重複したメニューの行491282478102
短い行の割合0.2780.2620.2630.221
見つかった著者23272828
見つかった公開日28131324
抽出した表(56 個中)38115
有用なテキストの割合0.8780.9310.9340.890

Clean Web Clipper が劣っている点

2 回目:ヨーロッパの 12 言語で 403 ページ、私たちのコアだけ

12 か国それぞれの上位 50 サイトを、ブラウザをその国の言語に設定して取得しました。そうしないと半数が英語のページを返し、別のものを測ることになるからです。

403 ページのうち 152 ページは「記事なし」と答えました。ショップのトップ、ポータルのトップページ、フィードで、抽出すべき記事がないページです。この答えは意図的なもので、これらのページを「テストしたページ」として数えているのはそのためです。

言語ページクラッシュ残った HTMLリンクの割合
ドイツ語40000.058
フランス語39000.050
スペイン語40000.060
イタリア語40000.036
ポーランド語30000.064
ポルトガル語36000.060
オランダ語37000.049
トルコ語31000.042
ウクライナ語13000.054
チェコ語28000.039
スウェーデン語28000.036
ルーマニア語41000.039

1 クリップあたりの時間:4 分 38 秒

lessroutinemorelife.com のカウンターは、1 クリップを 4 分 38 秒として数えます。この時間は、運営者が 1,000 を超えるさまざまな内容のページで手作業で計測したものです。テキストをコピーし、貼り付け、整え、タイトルと出典を加え、残った HTML のマークアップがないか確認する。平均値と中央値の両方を計算しました。

したがってカウンターは、クリップの回数にその時間を掛けたもので、各クリップをストップウォッチで計った合計ではありません。特定のクリップにあなたがどれだけ時間をかけたはずかを測るものではありません。

数字の意味

この測定の正直な限界

Chrome に追加(無料)すべて無料、アカウント不要、制限なし。抽出はオフラインで動作します。利用イベントはオンライン時に送信され、スイッチ 1 つで止められます。

よくある質問

この測定を再現できますか?
まだご自身ではできません。コーパスの一覧、取得スクリプト、採点スクリプトは次回の測定と一緒に公開します。それまでは、このページにエンジンのバージョンと日付を載せているので、後日の測定と照合できます。取得は実際のサイトに依存するため、サイトが変われば数字は正確には一致しなくなります。
なぜここではほかの製品の名前を出し、ストアの掲載ページでは出さないのですか?
ストアの掲載ページではほかの製品の名前を挙げませんが、このページでは挙げます。何と比べたかを隠した比較は検証できないので、ここではすべてのエンジンに名前とバージョンを付けています。
抽出したテキストは多いほどよいのですか?
それだけでは決まりません。リンクだらけのフィードのページを返すエンジンは、量では高得点でも有用性では低得点になります。上の表が大きさではなくノイズを測っているのはそのためです。