Clean Web Clipper Thêm vào Chrome (miễn phí)

Bên trong

Cách nó hoạt động, và nó dừng ở đâu

Không có phép màu nào ở đây. Quy trình trích xuất không bao giờ gọi tới máy chủ; địa chỉ duy nhất tiện ích liên lạc là điểm nhận thống kê của chúng tôi. Toàn bộ quy trình chạy ngay trong trang bạn đang xem, trong vài chục mili giây.

Tìm bài viết

Trước tiên, tiện ích tìm các khối chứa quen thuộc mà bài viết thường nằm trong đó. Khi không có khối như vậy – và trên rất nhiều trang web thật thì không có – nó chuyển sang đo mật độ văn bản: khối nào chứa nhiều văn bản đoạn văn nhất mà không nằm trong liên kết. Khối hẹp nhất vẫn chứa gần như toàn bộ văn bản đó sẽ được chọn.

Một khối mà phần lớn văn bản là nhãn liên kết thì là menu hoặc trang tin, không phải bài viết, và bị loại – trừ khi nó chứa hơn khoảng 1200 ký tự văn bản thật, vì bài viết dài vốn có nhiều liên kết.

Dọn bỏ phần phụ

Sau đó các phần tử không phải nội dung bị loại: thanh điều hướng, banner, thanh chia sẻ, thông báo cookie, phân trang, mục “đọc tiếp” và dải logo. Các dòng lặp lại bị xóa, vì thanh điều hướng lặp lại ở mỗi mục là nguồn nhiễu lớn nhất trong một trang đã trích xuất.

những gì web clipper khác giữ lại

[Bỏ qua, tới nội dung](#main) [Đăng nhập](/login) [Đăng ký](/register)
[Trang chủ](/) [Tin tức](/news) [Thể thao](/sport) [Văn hóa](/culture) [Thêm](/more)

Chúng tôi dùng cookie và các công nghệ tương tự để cải thiện trải nghiệm của bạn.
[Chấp nhận tất cả] [Quản lý tùy chọn]

# Bài viết bạn muốn đọc

Đoạn văn đầu tiên thật sự của bài.

<div class="promo-inline">

## Đọc tiếp
[Một tiêu đề khác](/a) [Thêm một tiêu đề](/b) [Và tiêu đề thứ ba](/c)

những gì vào ghi chú

# Bài viết bạn muốn đọc

Đoạn văn đầu tiên thật sự của bài.
Cùng một trang tin: web clipper thông thường giữ lại gì, và Clean Web Clipper lưu gì

Chuyển đổi

Bảng được chính tiện ích chuyển đổi thay vì một plugin chung, vì các bộ chuyển đổi chung hỏng khi gặp ô chứa danh sách hoặc khối mã. Khối mã lấy ngôn ngữ từ mã đánh dấu của chính trang. Liên kết tham chiếu được gom thành chú thích cuối trang Markdown trước khi bộ lọc xóa các id mà chúng dựa vào – thứ tự này quan trọng, và làm sai thì mọi chú thích đều mất một cách âm thầm.

Nó dừng ở đâu

Trên trang cửa hàng, trang tin hoặc trang kết quả tìm kiếm không có bài viết. Tiện ích kiểm tra Markdown đã hoàn tất – nếu hơn một phần tư nằm trong nhãn liên kết, nó báo “không có bài viết” thay vì đưa bạn ba trăm liên kết. Việc từ chối đó là cố ý, và đó là lý do số ký tự ở đây thấp hơn các công cụ luôn trả về một thứ gì đó.

Những gì nó không làm

Câu hỏi

Một lần trích xuất mất bao lâu?
Vài chục mili giây với một bài viết thông thường; một trang rất dài với hàng trăm chú thích mất vài trăm. Thời gian được hiển thị ở góc cửa sổ trích xuất.
Nó có chạy trên ứng dụng một trang (SPA) không?
Có. Nó đọc DOM sau khi trang hiển thị, nên một trang tài liệu dựng bằng JavaScript được chụp lại đúng như bạn thấy.
Chế độ trích xuất jsonld-articlebody là gì?
Một số trang gửi kèm văn bản bài viết trong dữ liệu có cấu trúc nhưng không bao giờ hiển thị xong. Khi dữ liệu có cấu trúc chứa nhiều văn bản hơn đáng kể so với DOM, tiện ích dùng nó và ghi lại rằng đã làm vậy.