Clean Web Clipper Thêm vào Chrome (miễn phí)

Phép đo ·

Đo cái gì, trên dữ liệu nào, và kết quả ra sao

Đã thử trên 512 trang: 109 trang so sánh trực tiếp với ba công cụ trích xuất khác, và 403 trang chỉ với lõi của chúng tôi. Không có lỗi sập, và không còn thẻ HTML sót lại trong bất kỳ bài viết nào được trích xuất. Bộ dữ liệu và các script sẽ được công bố cùng lượt đo tiếp theo; cho tới lúc đó, trang này là bản ghi đầy đủ về những gì đã chạy và kết quả thu được.

Lượt một: 109 trang, bốn công cụ so sánh trực tiếp

Bộ dữ liệu là một trăm trang web được truy cập nhiều nhất thế giới và một trăm trang được truy cập nhiều nhất ở Nga. Các tên miền không phải nội dung (ứng dụng nhắn tin, ngân hàng, dịch vụ phát trực tuyến, cổng thông tin chính phủ) được loại từ trước. Các trang được chụp bằng trình duyệt thật, đi theo một liên kết nội dung từ trang chủ nếu có.

Bốn công cụ chạy trên cùng 109 trang đã chụp: Defuddle 0.19.3 với Turndown 7.2.4 (lõi của Obsidian Web Clipper chính thức), Mozilla Readability 0.6.0 với cùng Turndown (lõi của MarkDownload), MarkSnip 5.2.0 – mã thật đang phát hành, giải nén từ bản trên Chrome Web Store – và Clean Web Clipper 0.1.0.

Chỉ sốDefuddle 0.19.3Mozilla Readability 0.6.0MarkSnip 5.2.0Clean Web Clipper 0.1.0
Trang109107107109
Lỗi sập0220
HTML sót lại53271820
Dòng menu lặp lại491282478102
Tỷ lệ dòng ngắn0.2780.2620.2630.221
Tìm được tác giả23272828
Tìm được ngày đăng28131324
Bảng trích xuất được (trên 56)38115
Tỷ lệ văn bản hữu ích0.8780.9310.9340.890

Clean Web Clipper còn thua ở đâu

Lượt hai: 403 trang bằng mười hai ngôn ngữ châu Âu, chỉ lõi của chúng tôi

Năm mươi trang web hàng đầu ở mỗi nước trong mười hai nước, chụp bằng trình duyệt đặt ngôn ngữ của nước đó, vì nếu không, một nửa trong số đó trả về trang tiếng Anh và phép đo sẽ đo một thứ khác.

152 trong 403 trang trả lời “không có bài viết”: trang cửa hàng, trang chủ cổng thông tin và trang tin, nơi không có bài viết nào để trích xuất. Câu trả lời đó là cố ý, và đó là lý do các trang này được tính là đã thử chứ không phải đã trích xuất.

Ngôn ngữTrangLỗi sậpHTML sót lạiTỷ lệ liên kết
Tiếng Đức40000.058
Tiếng Pháp39000.050
Tiếng Tây Ban Nha40000.060
Tiếng Ý40000.036
Tiếng Ba Lan30000.064
Tiếng Bồ Đào Nha36000.060
Tiếng Hà Lan37000.049
Tiếng Thổ Nhĩ Kỳ31000.042
Tiếng Ukraina13000.054
Tiếng Séc28000.039
Tiếng Thụy Điển28000.036
Tiếng Romania41000.039

Thời gian cho mỗi bản trích: 4 phút 38 giây

Bộ đếm trên lessroutinemorelife.com tính mỗi bản trích là 4 phút 38 giây. Thời gian này do chủ sở hữu tự đo bằng tay trên hơn 1.000 trang nội dung đa dạng: sao chép văn bản, dán, dọn dẹp, thêm tiêu đề và nguồn, rồi kiểm tra mã HTML sót lại. Cả giá trị trung bình và trung vị đều đã được tính.

Vì vậy bộ đếm là số bản trích nhân với thời gian đó, không phải tổng thời gian bấm giờ cho từng bản trích. Nó không đo việc một bản trích cụ thể lẽ ra sẽ tốn của bạn bao lâu.

Các con số có nghĩa gì

Giới hạn thật của phép đo này

Thêm vào Chrome (miễn phí)Miễn phí hoàn toàn, không tài khoản, không giới hạn. Việc trích xuất chạy được khi ngoại tuyến; sự kiện sử dụng được gửi đi khi bạn trực tuyến, và một công tắc sẽ dừng chúng.

Câu hỏi

Tôi có thể tự lặp lại phép đo này không?
Hiện chưa tự làm được. Danh sách bộ dữ liệu, script chụp trang và script chấm điểm sẽ được công bố cùng lượt đo tiếp theo. Cho tới lúc đó, trang này ghi rõ phiên bản công cụ và ngày đo, để lượt đo sau có thể đối chiếu. Việc chụp trang phụ thuộc vào các trang web đang hoạt động, nên con số chính xác sẽ dịch chuyển khi các trang đó thay đổi.
Vì sao ở đây nêu tên sản phẩm khác nhưng trong cửa hàng tiện ích thì không?
Trang giới thiệu trong cửa hàng không nêu tên sản phẩm khác; trang này thì có. Một phép so sánh giấu tên đối tượng được so sánh thì không kiểm chứng được, nên ở đây mỗi công cụ đều kèm tên và phiên bản.
Trích xuất được nhiều văn bản hơn có tốt hơn không?
Tự nó thì không. Một công cụ trả về trang tin đầy liên kết sẽ được điểm cao về khối lượng và điểm thấp về độ hữu ích. Vì vậy các bảng ở trên đo độ nhiễu chứ không đo kích thước.