Clean Web Clipper
Câu hỏi, trả lời thẳng thắn
Phần lớn câu hỏi này đến từ những gì mọi người phàn nàn về các web clipper khác. Nếu câu hỏi của bạn không có ở đây, hãy viết tới cws@lessroutinemorelife.com.
Câu hỏi
Bản trích có thể bị mất mà tôi không biết không?
Không. Tệp được ghi thẳng vào thư mục bạn đã chọn, và nếu tên đã có, tệp mới thành Article-2.md thay vì ghi đè lên bất cứ thứ gì. Không có trình xử lý giao thức hay hộp thoại trình duyệt nào ở giữa, nên không có bước nào mà một cú nhấp nhầm làm rơi bản trích. Trang cài đặt cũng đếm số lần bạn nhấn nút và bao nhiêu lần trong số đó tạo ra ghi chú, nên một khoảng hụt âm thầm sẽ lộ ra.
Tôi có cần mở Obsidian không?
Không. Clean Web Clipper ghi tệp .md thẳng vào thư mục bạn đã chọn một lần, bằng API truy cập tệp của trình duyệt. Obsidian có thể đang đóng, đã gỡ cài đặt hoặc hoàn toàn không có – tệp vẫn xuất hiện trong thư mục, và Obsidian sẽ nhận nó vào lần mở vault tiếp theo.
Vì sao với công cụ khác đôi khi tôi nhận được ghi chú chỉ có tiêu đề, không có nội dung?
Vì nhiều web clipper chuyển ghi chú qua bảng tạm, và trên Linux với Wayland chỉ cửa sổ đang được chọn mới đọc được bảng tạm. Nếu ứng dụng đích không được chọn đúng lúc đó, nội dung không bao giờ tới. Clean Web Clipper không bao giờ đặt ghi chú lên bảng tạm để lưu, nên kiểu lỗi đó không tồn tại ở đây.
Nó có chạy trên Linux không?
Có, như ở mọi nơi khác. Trình quản lý cửa sổ, bảng tạm và môi trường desktop không tham gia vào việc lưu, vì tệp do chính trình duyệt ghi.
Bảng có được xử lý đúng không?
Có, và điều này đã được đo. Trên bộ mẫu mười lăm bảng, mười hai bảng giữ nguyên vẹn, so với bảy của các công cụ trích xuất được so sánh. Bảng được chuyển đổi bằng mã của chính chúng tôi thay vì một bộ chuyển đổi chung, nên ô chứa danh sách hoặc đoạn mã không còn làm vỡ hàng. Ô gộp được trải phẳng, vì Markdown không có cách nào biểu diễn ô gộp.
Hình ảnh có bị hỏng không?
Không. Hình ảnh được giữ dưới dạng liên kết Markdown thông thường, không có ký tự thoát thừa, nên chúng hiển thị ngay khi bạn dán. Điều tiện ích không làm là tải tệp hình về cạnh ghi chú – liên kết trỏ tới bản gốc.
Chuyện gì xảy ra trên trang không phải bài viết?
Nó nói rõ như vậy. Trên trang cửa hàng, trang tin và trang kết quả tìm kiếm không có bài viết nào để trích xuất, và thay vì đưa bạn ba trăm nhãn liên kết, tiện ích ghi dấu extraction: no-article rồi dừng. Quyết định dựa trên một ngưỡng đã đo – khi hơn một phần tư văn bản nằm trong nhãn liên kết, đó là điều hướng, không phải bài văn.
Nó có gửi các trang của tôi đi đâu không?
Các trang của bạn thì không. Việc trích xuất và chuyển đổi diễn ra hoàn toàn trong trình duyệt, và không có văn bản hay tiêu đề trang nào rời khỏi đó. Có bốn thứ được gửi tới máy chủ thống kê của chính chúng tôi: địa chỉ của trang không tìm thấy bài viết, để có thể dạy tiện ích xử lý trang đó; tên miền trần của bản trích thành công, không bao giờ kèm đường dẫn; tên màn hình tiện ích bạn đã mở; và một mã số cài đặt ngẫu nhiên liên kết các sự kiện này với nhau. Máy chủ cũng ghi vị trí gần đúng – quốc gia, vùng và thành phố – suy ra từ địa chỉ IP; bản thân địa chỉ không được lưu. Tất cả dừng lại ngay khi bạn tắt nó trong cài đặt. Quyền truy cập một trang được cấp bằng chính cú nhấp của bạn và chỉ cho thẻ đó.
Vậy báo cáo sử dụng trong cài đặt là gì?
Là các bộ đếm nằm trong trình duyệt của bạn. Chúng ghi bạn đã trích xuất bao nhiêu lần, tiết kiệm được bao nhiêu thời gian, bạn dùng nơi lưu nào và ở đâu không tìm được bài viết. Bản báo cáo được hiển thị đầy đủ cho bạn và chỉ rời khỏi trình duyệt nếu bạn tự sao chép và gửi email; bảng điều khiển cũng cho thấy đã gửi bao nhiêu địa chỉ, nên những gì được gửi đi không bao giờ khuất khỏi tầm mắt.
Nó có lưu danh sách các trang tôi truy cập không?
Không. Một bản trích thành công chỉ để lại tên miền và không gì hơn – không đường dẫn, không tham số truy vấn, không tiêu đề, nên danh sách không thể cho thấy bạn đọc gì trên một trang web, chỉ cho thấy bạn đã trích xuất ở đó. Địa chỉ đầy đủ chỉ được giữ trong một trường hợp: trang trích xuất thất bại, vì đó là thứ không thể thiếu để viết bản sửa. Mọi thứ được giữ đều hiện trong bảng điều khiển và có thể xóa bằng một nút.
Ngày đăng có được lấy đúng không?
Khi trang có khai báo ngày, có. Ngày được đọc từ JSON-LD, article:published_time, citation_date (chuẩn của arXiv, PubMed và IEEE), time[datetime] và dấu thời gian Unix, theo thứ tự đó. Khi trang không có ngày nào, trường này để trống thay vì điền ngày hôm nay. Một số loại trang – đặc biệt là cửa hàng và lịch trình – đơn giản là không bao giờ công bố ngày.
Tôi có thể chỉ trích xuất phần mình đã chọn không?
Có. Chọn một đoạn trên trang thì đoạn đó được trích xuất; không chọn gì thì bạn nhận toàn trang. Công tắc ở đầu cửa sổ luôn cho biết bạn đang xem cái nào, và có thể tắt hành vi này trong cài đặt.
Nó có xử lý nhiều thẻ cùng lúc được không?
Không. Clean Web Clipper làm việc với từng trang một và không có trình thu thập hay chế độ hàng loạt. Nếu bạn cần hàng chục trang trong một lần, đây không phải công cụ phù hợp.
Nó có tô sáng đoạn văn trên trang như bút đánh dấu không?
Không. Không có bút tô sáng và không có lớp chú giải. Tiện ích chuyển đổi những gì đã có trên trang và không thêm gì vào đó.
Nó có tóm tắt hay viết lại văn bản không?
Không. Văn bản được chuyển đổi, không bị biên tập: không tóm tắt, không sắp xếp lại, không viết lại. Trang viết gì thì ghi chú viết đúng như vậy.
Nó chạy trên những trình duyệt nào?
Chrome và các trình duyệt Chromium khác: Edge, Brave, Vivaldi, Opera, Arc. Nó được xây dựng trên Manifest V3, nên sẽ không ngừng hoạt động khi định dạng tiện ích cũ bị tắt.
Có miễn phí không?
Có, hoàn toàn. Mọi tính năng được mô tả ở đây đều có trong tiện ích đã cài: không giới hạn trang, không tài khoản, không đăng ký, không có gói trả phí.
Nếu nó hỏng trên một trang tôi cần thì sao?
Hãy viết tới cws@lessroutinemorelife.com kèm địa chỉ trang. Trang cài đặt có một báo cáo đã liệt kê sẵn các trang trích xuất thất bại, nên chỉ cần sao chép nó vào email – không cần mô tả gì thêm. Trên trang bị từ chối, nút “Tôi cần trang web này” đưa địa chỉ đó lên đầu hàng đợi sửa lỗi.