Clean Web Clipper Thêm vào Chrome (miễn phí)

Tiện ích Chrome

Lưu trang web thành Markdown, không phải dọn dẹp lại

Nhấp vào biểu tượng là bản trích đã sẵn sàng – tiêu đề, tác giả, ngày đăng và nguồn được gom vào frontmatter, phần nội dung đã bỏ thanh điều hướng. Mọi thứ diễn ra trong trình duyệt của bạn: không cần tài khoản, và không nội dung nào bạn trích xuất bị tải lên bất cứ đâu.

Cửa sổ Clean Web Clipper hiển thị Markdown của một bài viết Wikipedia đã trích xuất

Clean Web Clipper là tiện ích Chrome miễn phí giúp lưu trang web thành Markdown sạch – vào bảng tạm, tệp .md, một thư mục hoặc thẳng vào vault Obsidian – không cần tài khoản, không cần đăng nhập. Đã thử trên 512 trang từ các trang web được truy cập nhiều nhất: không có lỗi sập, và không còn thẻ HTML sót lại trong bất kỳ bài viết nào được trích xuất.

Thêm vào Chrome (miễn phí)Miễn phí hoàn toàn, không tài khoản, không giới hạn. Việc trích xuất chạy được khi ngoại tuyến; sự kiện sử dụng được gửi đi khi bạn trực tuyến, và một công tắc sẽ dừng chúng.

Đã thử trên 512 trang từ các trang web được truy cập nhiều nhất thế giới

Hai lượt đo. Lượt đầu lấy 109 trang từ một trăm trang web được truy cập nhiều nhất thế giới và ở Nga, rồi so sánh kết quả trực tiếp với ba công cụ trích xuất khác. Lượt thứ hai lấy năm mươi trang web hàng đầu ở mỗi nước trong mười hai nước châu Âu: thêm 403 trang, mỗi trang được chụp bằng ngôn ngữ của nước đó và chỉ chạy qua lõi của chúng tôi. Công cụ, phiên bản, ngày đo và chỗ còn thua

512trang đã thử
0lỗi sập
0thẻ HTML sót lại trong bài viết đã trích xuất
102dòng menu lặp lại trong phép so sánh trực tiếp trên 109 trang, so với 282, 478 và 491 của các công cụ khác

Vấn đề không bao giờ nằm ở việc chuyển đổi. Mà ở mọi thứ đi kèm với nó.

Web clipper nào cũng chuyển HTML thành Markdown. Rồi bạn mở ghi chú ra và thấy thanh cookie, menu bên cạnh, danh sách “đọc tiếp” và một cái bảng đã vỡ trên đường vào. Clean Web Clipper được làm ra để loại bỏ đúng những thứ đó, và việc loại bỏ được đo chứ không chỉ được tuyên bố.

những gì web clipper khác giữ lại

[Bỏ qua, tới nội dung](#main) [Đăng nhập](/login) [Đăng ký](/register)
[Trang chủ](/) [Tin tức](/news) [Thể thao](/sport) [Văn hóa](/culture) [Thêm](/more)

Chúng tôi dùng cookie và các công nghệ tương tự để cải thiện trải nghiệm của bạn.
[Chấp nhận tất cả] [Quản lý tùy chọn]

# Bài viết bạn muốn đọc

Đoạn văn đầu tiên thật sự của bài.

<div class="promo-inline">

## Đọc tiếp
[Một tiêu đề khác](/a) [Thêm một tiêu đề](/b) [Và tiêu đề thứ ba](/c)

những gì vào ghi chú

# Bài viết bạn muốn đọc

Đoạn văn đầu tiên thật sự của bài.
Cùng một trang tin: web clipper thông thường giữ lại gì, và Clean Web Clipper lưu gì

Điều gì làm kết quả sạch

Kết quả thật, không chỉnh sửaen.wikipedia.org/wiki/Markov_chain
---
title: "Markov chain - Wikipedia"
source: "https://en.wikipedia.org/wiki/Markov_chain"
date: "2002-07-07T05:14:15.000Z"
extraction: "dom"
---

A Markov chain is a stochastic process describing a sequence of possible
events in which the probability of each event depends only on the state
attained in the previous event.[^1]

[^1]: Gagniuc, Paul A. (2017). Markov Chains: From Theory to Implementation
      and Experimentation. USA, NJ: John Wiley & Sons. pp. 1-235.

Cách lưu trang web thành Markdown trong Chrome

Cài tiện ích, rồi làm ba bước. Không cần cấu hình gì trước: mặc định, một cú nhấp sẽ mở cửa sổ xem trước với Markdown đã tạo sẵn, để sao chép hoặc lưu thành tệp. Sau này bạn có thể đặt để một cú nhấp lưu ghi chú thẳng vào thư mục hoặc vault và bỏ qua bước xem trước.

  1. Ghim biểu tượng. Mở menu hình mảnh ghép cạnh thanh địa chỉ và ghim Clean Web Clipper lên thanh công cụ.
  2. Mở bài viết bạn muốn giữ – chính bài viết, không phải trang chứa liên kết tới nó.
  3. Nhấp vào biểu tượng. Markdown hiện ra trong cửa sổ xem trước: sao chép nó, hoặc lưu tệp .md.

Lưu vào đâu

Cú nhấp vào biểu tượng có thể tùy chỉnh. Để nó mở cửa sổ xem trước, hoặc đặt để một cú nhấp đưa ghi chú vào vault mà không mở gì cả.

Cài đặt Clean Web Clipper: chọn việc cú nhấp vào biểu tượng sẽ làm
Phần cài đặt quyết định một cú nhấp làm gì: xem trước, bảng tạm, tệp, thư mục hay thẳng vào vault.

Trung thực về nguồn

Mỗi ghi chú đều được đóng dấu bằng trường extraction. dom nghĩa là văn bản lấy từ những gì trình duyệt thật sự hiển thị. jsonld-articlebody nghĩa là trang không hiển thị xong và nội dung phải đọc từ dữ liệu có cấu trúc của chính trang. Còn khi trang hoàn toàn không có bài viết – trang cửa hàng, trang tin, trang kết quả tìm kiếm – tiện ích nói rõ thay vì đổ ba trăm liên kết lên bạn.

Màn hình Lợi ích của Clean Web Clipper: số bản trích, thời gian tiết kiệm, trang web hay dùng và trang thất bại
Lợi ích: bao nhiêu bản trích thành công, tiết kiệm bao nhiêu thời gian, và mọi trang không thành công.
Clean Web Clipper từ chối một trang không có bài viết và đề nghị gửi địa chỉ của trang
Trang không có bài viết – từ chối thẳng thắn thay vì ba trăm liên kết menu.
Trang chạy lần đầu của Clean Web Clipper với ba bước thiết lập
Lần chạy đầu: ghim biểu tượng, trích xuất một trang, chọn việc cú nhấp sẽ làm.

Những gì nó không làm

Mười lăm cách mọi người dùng nó

Lập trình viênKhối mã giữ nhãn ngôn ngữ, nên tài liệu vừa dán vào đã được tô màu cú pháp.

Clean Web Clipper đọc ngôn ngữ ngay trên trang: từ class của khối mã, phần tử cha hoặc mã đánh dấu riêng của trình tô màu cú pháp, rồi ghi nó vào khối mã. Trên bộ mẫu kỹ thuật chín trang, nhãn được giữ ở 73 trên 156 khối mã, so với 20 và 0 của hai công cụ trích xuất được so sánh.

  • Khối mã có nhãn. ```js, không trơn – tô màu cú pháp hoạt động trong Obsidian, VS Code và GitHub ngay khi bạn dán.
  • Ngôn ngữ được đọc, không đoán. Nó lấy từ class mà trình tô màu của chính trang để lại, nên nhãn chính xác như trang nguồn.
  • Bảng có mã trong ô vẫn nguyên vẹn: giữ được 12 trên 15 trong bộ mẫu kỹ thuật, so với 7 của mỗi công cụ được so sánh.
Xem thêm
Người dùng ObsidianChọn một thư mục trong vault một lần; một cú nhấp sẽ lưu ghi chú vào đó, kể cả khi Obsidian đang đóng.

Clean Web Clipper tự ghi tệp .md vào vault của bạn qua File System Access API của trình duyệt. Không có plugin cộng đồng, không có máy chủ REST cục bộ và không có liên kết obsidian:// nào trong chuỗi, và Obsidian không cần đang chạy để ghi chú tới nơi.

  • Không plugin, không máy chủ cục bộ, không liên kết obsidian:// – trình duyệt ghi tệp vào thư mục bạn đã cấp quyền.
  • Obsidian không cần đang mở. Lần tới mở ra, ghi chú đã nằm sẵn ở đó.
  • Frontmatter YAML với title, source, author, dateextraction – và bạn chọn giữ trường nào.
Xem thêm
Ngữ cảnh cho AI và LLMThanh điều hướng lặp lại của trang là ngữ cảnh bị tính tiền. Nó bị loại bỏ trước khi văn bản tới mô hình.

Trên bộ mẫu 109 trang (lượt so sánh trực tiếp), Clean Web Clipper để lại 102 dòng điều hướng lặp lại, trong khi ba công cụ trích xuất khác để lại 282, 478 và 491 – và hoàn toàn không có thẻ HTML sót lại. Thứ tới được mô hình là bài viết cùng một phần đầu frontmatter ghi URL nguồn và ngày đăng.

  • Điều hướng lặp lại ít hơn khoảng bốn lần so với trung bình của các công cụ được so sánh: 102 dòng lặp lại so với 282, 478 và 491.
  • Không có thẻ HTML sót lại trên 512 trang đã thử: không có gì để mô hình phải phân tích vòng qua.
  • Frontmatter ghi URL nguồn và ngày đăng, nên một nhận định có thể được quy nguồn thay vì phỏng đoán.
Xem thêm
Nhà nghiên cứuĐọc citation_date (thẻ mà arXiv, PubMed và IEEE xuất ra) và biến tài liệu tham khảo thành chú thích.

Một bài báo được lưu mà thiếu ngày công bố là một trích dẫn bạn sẽ phải dựng lại sau này. Clean Web Clipper đọc ngày từ siêu dữ liệu của chính trang chứ không phải từ phần văn bản, và khi trang không có ngày, trường này để trống thay vì điền ngày hôm nay.

  • citation_datecitation_publication_date (các thẻ meta mà arXiv, PubMed và IEEE xuất ra) được đọc trực tiếp.
  • Cả JSON-LD datePublished, article:published_time, time[datetime] và dấu thời gian Unix, theo thứ tự ưu tiên đó.
  • Trang không có ngày thì trường để trống – không bao giờ điền ngày hôm nay.
Xem thêm
Sinh viênTrích xuất bài giảng, chương sách và trang tham khảo thành tệp Markdown sống lâu hơn tài khoản khóa học.

Tài liệu khóa học biến mất khi học kỳ kết thúc: liên kết hỏng, trang học phần bị lưu trữ, bài đọc của seminar đổi chỗ. Tệp Markdown trên ổ đĩa của chính bạn thì không, và mười năm nữa chúng vẫn mở được trong bất kỳ trình soạn thảo nào, với URL nguồn vẫn nằm bên trong.

  • Chọn một đoạn thì chỉ phần đã chọn được trích xuất – cách lấy một định nghĩa mà không kèm cả trang xung quanh.
  • Mỗi ghi chú mang URL nguồn, nên trích dẫn về sau không cần tìm kiếm.
  • Chế độ đọc hiển thị bản trích như văn bản thông thường, không có ký hiệu Markdown, trước khi bạn lưu.
Xem thêm
Người viếtTiêu đề, tác giả, ngày đăng và URL nguồn đi cùng mỗi bản trích, nên trích dẫn luôn giữ được nguồn gốc.

Tư liệu thu thập bằng ảnh chụp màn hình và dấu trang trở nên vô dụng đúng lúc bạn cần ghi nguồn. Một tệp Markdown giữ tiêu đề, tác giả, ngày và địa chỉ trong cùng tệp với văn bản, nơi người kiểm chứng có thể tìm tới.

  • title, author, datesource trong frontmatter của mọi ghi chú, nên thông tin nguồn nằm cùng văn bản.
  • Trường tác giả được lọc: tiêu đề mục, tên ấn phẩm và nhãn nút không bị coi là dòng tác giả.
  • Chỉ phần thân bài viết: ô đăng ký bản tin, thanh chia sẻ và dải “đọc tiếp” không bao giờ vào ghi chú.
Xem thêm
Nhà báoVăn bản đúng như lúc bạn đọc, kèm ngày đăng và địa chỉ, trong một tệp trên ổ đĩa của chính bạn.

Trang web bị sửa và bị gỡ. Một bản trích giữ toàn văn, URL nguồn và ngày đăng mà chính trang khai báo, trong một tệp thuần bạn tự giữ: không phải trong một dịch vụ có thể đóng cửa, đổi điều khoản hay lặng lẽ làm mất bản ghi.

  • Ngày đăng đọc từ siêu dữ liệu của chính trang – JSON-LD, article:published_time, time[datetime] – không phải từ phần văn bản.
  • URL nguồn nằm trong frontmatter của mọi ghi chú.
  • Toàn văn bài viết không kèm thanh điều hướng và khối quảng bá vốn thay đổi giữa các lượt truy cập.
Xem thêm
Công việc pháp lýVăn bản đúng như khi được công bố, kèm địa chỉ nguồn và ngày, trong một tệp bạn tự kiểm soát.

Văn bản quy phạm, điều khoản dịch vụ và hướng dẫn chính thức thay đổi mà không báo trước. Một bản sao Markdown mang địa chỉ nguồn và ngày trang khai báo là bản ghi những gì văn bản nói vào ngày bạn đọc.

  • Văn bản nguyên văn – không có gì trong phần thân bài viết bị tóm tắt, viết lại hay đảo thứ tự.
  • URL nguồn và ngày đăng mà trang khai báo trong frontmatter của mọi ghi chú.
  • Bảng phí, thời hạn và ngưỡng được chính tiện ích chuyển đổi: giữ được 12 trên 15 trong bộ mẫu kỹ thuật, so với 7 của mỗi công cụ được so sánh.
Xem thêm
Nhà phân tíchÔ chứa mã, danh sách hay liên kết không còn làm vỡ hàng: giữ được 12 trên 15 bảng.

Các bộ chuyển đổi HTML sang Markdown thông thường hỏng đúng ở những bảng quan trọng: bảng có danh sách, liên kết hoặc đoạn mã mẫu trong ô. Clean Web Clipper tự chuyển đổi bảng và trải phẳng nội dung ô thay vì làm rơi cả hàng.

  • Bộ chuyển đổi bảng GFM viết riêng cho việc này, không phải một plugin chuyển đổi chung gắn thêm vào.
  • Giữ được 12 trên 15 bảng trong bộ mẫu kỹ thuật, so với 7 của mỗi công cụ được so sánh.
  • Bảng hai cột lộn xộn thành các dòng khóa in đậm và giá trị thay vì một lưới vỡ.
Xem thêm
Giáo viênTài liệu không kèm trang web xung quanh: không menu, không thanh đồng ý cookie, không quảng cáo trên bản in.

Một trang in thẳng từ trình duyệt mang cả menu, thanh đồng ý cookie và quảng cáo lên tài liệu phát tay. Trích xuất chỉ mang văn bản, với URL nguồn được giữ trong tệp nên việc ghi nguồn không tốn thêm công sức.

  • Nút in in bản trích, không phải trang bao quanh nó.
  • Chế độ đọc hiển thị kết quả như văn bản thông thường, không có ký hiệu Markdown, trước khi bạn in hoặc lưu.
  • Chọn một bài tập hoặc một định nghĩa và chỉ trích xuất phần đó.
Xem thêm
Biên dịch viênMenu, banner và thanh điều hướng lặp lại không bao giờ vào danh sách phân đoạn.

Văn bản nguồn dán từ trang web mang theo thanh điều hướng, và mỗi mục menu thành một phân đoạn bạn phải bỏ qua, đếm và rốt cuộc giải thích trên hóa đơn. Clean Web Clipper loại bỏ nó trước khi tệp tới gần công cụ của bạn.

  • Menu, phân trang, thanh đồng ý cookie và mục “đọc tiếp” bị cắt trước khi tệp tồn tại.
  • Thanh điều hướng lặp lại giảm khoảng bốn lần so với các công cụ được so sánh: 102 dòng lặp lại so với 282, 478 và 491.
  • Không một thẻ HTML nào sót lại trên 512 trang đã đo, nên không có mã đánh dấu lạc nào biến thành thẻ trong dòng.
Xem thêm
Quản lý sản phẩmTrích xuất changelog, tài liệu và ghi chú phát hành thành tệp bạn tìm kiếm, diff và trích dẫn được.

Nghiên cứu cạnh tranh lưu dưới dạng dấu trang dần mục thành một danh sách liên kết không tìm kiếm được. Trích xuất thành Markdown, nó trở thành một kho dữ liệu bạn grep được, diff được với bản chụp quý trước, và trích dẫn được trong tài liệu quyết định kèm theo ngày.

  • Ngày đăng đọc từ trang, nên một mục changelog giữ đúng thời điểm thật chứ không phải ngày bạn tìm thấy nó.
  • Quy tắc theo trang web tự động đưa mỗi đối thủ vào thư mục riêng.
  • Bảng giá và giới hạn còn nguyên: giữ được 12 trên 15 trong bộ mẫu kỹ thuật, so với 7 của mỗi công cụ được so sánh.
Xem thêm
Người viết tài liệu kỹ thuậtTiêu đề mục, bảng, khối mã và chú thích được chuyển sang; phần vỏ của trang thì không.

Chuyển đổi tài liệu thường nghĩa là chuyển HTML rồi mất thời gian hơn để gỡ những gì bộ chuyển đổi giữ lại. Việc gỡ bỏ đó là thứ Clean Web Clipper được xây dựng xoay quanh, và là phần đã được đo: không có thẻ HTML sót lại trên 512 trang.

  • Tiêu đề mục, danh sách, bảng, khối mã và chú thích đều chuyển sang Markdown chuẩn.
  • Khối mã giữ nhãn ngôn ngữ: giữ được 73 trên 156 trong bộ mẫu kỹ thuật, so với 20 và 0 của các công cụ được so sánh.
  • Không có thẻ HTML sót lại trên 512 trang đã đo.
Xem thêm
Lưu trữ cá nhânTệp Markdown thuần trên ổ đĩa của chính bạn. Không tài khoản, không dịch vụ, không gì có thể đóng cửa.

Dấu trang trỏ tới những trang thay đổi hoặc biến mất, còn dịch vụ đọc sau thì đóng cửa, bị mua lại hoặc bắt đầu tính phí cho việc xuất dữ liệu. Một bản trích là chính văn bản, ở định dạng không có nhà cung cấp và không hết hạn, lưu ở nơi bạn quyết định.

  • Định dạng bền và mở: văn bản thuần với frontmatter YAML, đọc được bằng mọi trình soạn thảo và bằng grep.
  • Không tài khoản và không tải lên gì: những gì bạn trích xuất ở lại trên ổ đĩa của bạn.
  • Ngày đăng và URL nguồn được chụp cùng văn bản, nên một ghi chú vẫn nhận diện được nhiều năm sau.
Xem thêm
Đọc không bị nhiễuChế độ đọc không menu, không banner và không ký hiệu Markdown, theo giao diện sáng tối của trình duyệt.

Phần phụ của trang không chỉ là sự rối mắt – đó là văn bản trình đọc màn hình đọc to và người đọc phải bỏ qua mỗi lần truy cập. Cửa sổ trích xuất hiển thị riêng bài viết, theo cài đặt sáng hoặc tối của trình duyệt, không có script nào của trang chạy.

  • Chế độ đọc hiển thị bản trích như văn bản thông thường – không có ký hiệu Markdown, với liên kết hoạt động và tiêu đề mục thật.
  • Nó theo cài đặt sáng và tối của trình duyệt, không theo trang web.
  • Cửa sổ mở rộng tới khoảng ba phần tư màn hình cho bài viết dài.
Xem thêm
Thêm vào Chrome (miễn phí)Miễn phí hoàn toàn, không tài khoản, không giới hạn. Việc trích xuất chạy được khi ngoại tuyến; sự kiện sử dụng được gửi đi khi bạn trực tuyến, và một công tắc sẽ dừng chúng.

Câu hỏi

Clean Web Clipper có gửi các trang của tôi đi đâu không?
Các trang của bạn thì không. Việc trích xuất và chuyển đổi diễn ra hoàn toàn trong trình duyệt của bạn: bản sao vào bảng tạm, tệp vào ổ đĩa, và không có văn bản hay tiêu đề trang nào rời khỏi máy. Có bốn thứ được gửi đi, tới máy chủ thống kê của chính chúng tôi: địa chỉ của trang không tìm thấy bài viết, tên miền trần của bản trích thành công, tên màn hình tiện ích bạn đã mở, và một mã số cài đặt ngẫu nhiên liên kết các sự kiện này với nhau. Máy chủ cũng ghi vị trí gần đúng – quốc gia, vùng và thành phố – suy ra từ địa chỉ IP; bản thân địa chỉ không được lưu. Không thứ nào được chuyển cho bên thứ ba, và một công tắc trong cài đặt sẽ dừng tất cả và xóa mã số. Tiện ích không xin quyền nào trên các trang bạn đọc, nên nó không thể nhìn vào trang bạn chưa nhấp vào.
Tôi có cần mở Obsidian để lưu vào vault không?
Không. Clean Web Clipper ghi tệp thẳng vào thư mục bạn cấp quyền truy cập, bằng File System Access API của trình duyệt. Obsidian sẽ nhận tệp vào lần tiếp theo nó quét vault.
Chuyện gì xảy ra trên trang không phải bài viết?
Nó nói rõ như vậy. Trên trang cửa hàng, trang tin và trang kết quả tìm kiếm không có bài viết nào để trích xuất, và tiện ích đánh dấu bản trích là “không có bài viết” thay vì trả về một trang đầy liên kết.
Nó chạy trên những trình duyệt nào?
Chrome và các trình duyệt Chromium khác: Edge, Brave, Vivaldi, Opera. Đây là tiện ích Manifest V3, và địa chỉ duy nhất nó có thể liên lạc là địa chỉ thống kê của chính chúng tôi – không bao giờ là các trang bạn đọc.
Có miễn phí không?
Có – toàn bộ. Mọi tính năng mô tả trên trang web này đều chạy trong tiện ích miễn phí – trích xuất không giới hạn trang, vault Obsidian, quy tắc theo trang web, chú thích cuối trang, bảng, nhãn ngôn ngữ của mã và chế độ đọc. Giao diện có 19 ngôn ngữ và theo cài đặt trình duyệt của bạn. Không có gói trả phí, không tài khoản và không cần đăng ký.