Tiện ích Chrome
Lưu trang web thành Markdown, không phải dọn dẹp lại
Nhấp vào biểu tượng là bản trích đã sẵn sàng – tiêu đề, tác giả, ngày đăng và nguồn được gom vào frontmatter, phần nội dung đã bỏ thanh điều hướng. Mọi thứ diễn ra trong trình duyệt của bạn: không cần tài khoản, và không nội dung nào bạn trích xuất bị tải lên bất cứ đâu.

Clean Web Clipper là tiện ích Chrome miễn phí giúp lưu trang web thành Markdown sạch – vào bảng tạm, tệp .md, một thư mục hoặc thẳng vào vault Obsidian – không cần tài khoản, không cần đăng nhập. Đã thử trên 512 trang từ các trang web được truy cập nhiều nhất: không có lỗi sập, và không còn thẻ HTML sót lại trong bất kỳ bài viết nào được trích xuất.
Đã thử trên 512 trang từ các trang web được truy cập nhiều nhất thế giới
Hai lượt đo. Lượt đầu lấy 109 trang từ một trăm trang web được truy cập nhiều nhất thế giới và ở Nga, rồi so sánh kết quả trực tiếp với ba công cụ trích xuất khác. Lượt thứ hai lấy năm mươi trang web hàng đầu ở mỗi nước trong mười hai nước châu Âu: thêm 403 trang, mỗi trang được chụp bằng ngôn ngữ của nước đó và chỉ chạy qua lõi của chúng tôi. Công cụ, phiên bản, ngày đo và chỗ còn thua
Vấn đề không bao giờ nằm ở việc chuyển đổi. Mà ở mọi thứ đi kèm với nó.
Web clipper nào cũng chuyển HTML thành Markdown. Rồi bạn mở ghi chú ra và thấy thanh cookie, menu bên cạnh, danh sách “đọc tiếp” và một cái bảng đã vỡ trên đường vào. Clean Web Clipper được làm ra để loại bỏ đúng những thứ đó, và việc loại bỏ được đo chứ không chỉ được tuyên bố.
những gì web clipper khác giữ lại
[Bỏ qua, tới nội dung](#main) [Đăng nhập](/login) [Đăng ký](/register) [Trang chủ](/) [Tin tức](/news) [Thể thao](/sport) [Văn hóa](/culture) [Thêm](/more) Chúng tôi dùng cookie và các công nghệ tương tự để cải thiện trải nghiệm của bạn. [Chấp nhận tất cả] [Quản lý tùy chọn] # Bài viết bạn muốn đọc Đoạn văn đầu tiên thật sự của bài. <div class="promo-inline"> ## Đọc tiếp [Một tiêu đề khác](/a) [Thêm một tiêu đề](/b) [Và tiêu đề thứ ba](/c)
những gì vào ghi chú
# Bài viết bạn muốn đọc Đoạn văn đầu tiên thật sự của bài.
Điều gì làm kết quả sạch
- Mã giữ nhãn ngôn ngữ. Bạn nhận khối mã gắn nhãn
js, không phải khối trơn, nên tô màu cú pháp hoạt động ngay khi dán. - Bảng giữ nguyên vẹn. Ô chứa mã hoặc danh sách không còn làm vỡ hàng.
- Chú thích cuối trang dùng được thật. Liên kết tham chiếu thành
[^1]với phần định nghĩa ở cuối ghi chú, không phải neo chết. - Ngày được đọc, không đoán. JSON-LD,
article:published_time,citation_date(chuẩn arXiv / PubMed / IEEE),time[datetime], dấu thời gian Unix. Trang không có ngày thì trường để trống – không bao giờ điền ngày hôm nay. - Menu, banner và “đọc tiếp” bị cắt bỏ. Dải logo, phân trang và thanh điều hướng lặp lại ở mỗi mục không bao giờ vào ghi chú.
- Không sót một thẻ nào. Không có mảnh
divhaytablenào mắc kẹt giữa văn bản của bạn.
---
title: "Markov chain - Wikipedia"
source: "https://en.wikipedia.org/wiki/Markov_chain"
date: "2002-07-07T05:14:15.000Z"
extraction: "dom"
---
A Markov chain is a stochastic process describing a sequence of possible
events in which the probability of each event depends only on the state
attained in the previous event.[^1]
[^1]: Gagniuc, Paul A. (2017). Markov Chains: From Theory to Implementation
and Experimentation. USA, NJ: John Wiley & Sons. pp. 1-235.Cách lưu trang web thành Markdown trong Chrome
Cài tiện ích, rồi làm ba bước. Không cần cấu hình gì trước: mặc định, một cú nhấp sẽ mở cửa sổ xem trước với Markdown đã tạo sẵn, để sao chép hoặc lưu thành tệp. Sau này bạn có thể đặt để một cú nhấp lưu ghi chú thẳng vào thư mục hoặc vault và bỏ qua bước xem trước.
- Ghim biểu tượng. Mở menu hình mảnh ghép cạnh thanh địa chỉ và ghim Clean Web Clipper lên thanh công cụ.
- Mở bài viết bạn muốn giữ – chính bài viết, không phải trang chứa liên kết tới nó.
- Nhấp vào biểu tượng. Markdown hiện ra trong cửa sổ xem trước: sao chép nó, hoặc lưu tệp
.md.
Lưu vào đâu
- Sao chép Markdown vào bảng tạm
- Tải xuống tệp
.md - Ghi vào thư mục bạn đã chọn trên ổ đĩa
- Ghi thẳng vào vault Obsidian – không plugin, không REST API cục bộ, không URI scheme; tệp cứ thế xuất hiện
Cú nhấp vào biểu tượng có thể tùy chỉnh. Để nó mở cửa sổ xem trước, hoặc đặt để một cú nhấp đưa ghi chú vào vault mà không mở gì cả.

Trung thực về nguồn
Mỗi ghi chú đều được đóng dấu bằng trường extraction. dom nghĩa là văn bản lấy từ những gì trình duyệt thật sự hiển thị. jsonld-articlebody nghĩa là trang không hiển thị xong và nội dung phải đọc từ dữ liệu có cấu trúc của chính trang. Còn khi trang hoàn toàn không có bài viết – trang cửa hàng, trang tin, trang kết quả tìm kiếm – tiện ích nói rõ thay vì đổ ba trăm liên kết lên bạn.



Những gì nó không làm
- Không thu thập hàng loạt – mỗi lần một trang, đúng trang bạn đang mở
- Không tóm tắt hay viết lại – văn bản được chuyển đổi, không bị biên tập
- Không tải hình ảnh xuống – liên kết hình vẫn trỏ tới trang gốc
Mười lăm cách mọi người dùng nó
Lập trình viênKhối mã giữ nhãn ngôn ngữ, nên tài liệu vừa dán vào đã được tô màu cú pháp.
Clean Web Clipper đọc ngôn ngữ ngay trên trang: từ class của khối mã, phần tử cha hoặc mã đánh dấu riêng của trình tô màu cú pháp, rồi ghi nó vào khối mã. Trên bộ mẫu kỹ thuật chín trang, nhãn được giữ ở 73 trên 156 khối mã, so với 20 và 0 của hai công cụ trích xuất được so sánh.
- Khối mã có nhãn. ```js, không trơn – tô màu cú pháp hoạt động trong Obsidian, VS Code và GitHub ngay khi bạn dán.
- Ngôn ngữ được đọc, không đoán. Nó lấy từ class mà trình tô màu của chính trang để lại, nên nhãn chính xác như trang nguồn.
- Bảng có mã trong ô vẫn nguyên vẹn: giữ được 12 trên 15 trong bộ mẫu kỹ thuật, so với 7 của mỗi công cụ được so sánh.
Người dùng ObsidianChọn một thư mục trong vault một lần; một cú nhấp sẽ lưu ghi chú vào đó, kể cả khi Obsidian đang đóng.
Clean Web Clipper tự ghi tệp .md vào vault của bạn qua File System Access API của trình duyệt. Không có plugin cộng đồng, không có máy chủ REST cục bộ và không có liên kết obsidian:// nào trong chuỗi, và Obsidian không cần đang chạy để ghi chú tới nơi.
- Không plugin, không máy chủ cục bộ, không liên kết
obsidian://– trình duyệt ghi tệp vào thư mục bạn đã cấp quyền. - Obsidian không cần đang mở. Lần tới mở ra, ghi chú đã nằm sẵn ở đó.
- Frontmatter YAML với
title,source,author,datevàextraction– và bạn chọn giữ trường nào.
Ngữ cảnh cho AI và LLMThanh điều hướng lặp lại của trang là ngữ cảnh bị tính tiền. Nó bị loại bỏ trước khi văn bản tới mô hình.
Trên bộ mẫu 109 trang (lượt so sánh trực tiếp), Clean Web Clipper để lại 102 dòng điều hướng lặp lại, trong khi ba công cụ trích xuất khác để lại 282, 478 và 491 – và hoàn toàn không có thẻ HTML sót lại. Thứ tới được mô hình là bài viết cùng một phần đầu frontmatter ghi URL nguồn và ngày đăng.
- Điều hướng lặp lại ít hơn khoảng bốn lần so với trung bình của các công cụ được so sánh: 102 dòng lặp lại so với 282, 478 và 491.
- Không có thẻ HTML sót lại trên 512 trang đã thử: không có gì để mô hình phải phân tích vòng qua.
- Frontmatter ghi URL nguồn và ngày đăng, nên một nhận định có thể được quy nguồn thay vì phỏng đoán.
Nhà nghiên cứuĐọc citation_date (thẻ mà arXiv, PubMed và IEEE xuất ra) và biến tài liệu tham khảo thành chú thích.
Một bài báo được lưu mà thiếu ngày công bố là một trích dẫn bạn sẽ phải dựng lại sau này. Clean Web Clipper đọc ngày từ siêu dữ liệu của chính trang chứ không phải từ phần văn bản, và khi trang không có ngày, trường này để trống thay vì điền ngày hôm nay.
citation_datevàcitation_publication_date(các thẻ meta mà arXiv, PubMed và IEEE xuất ra) được đọc trực tiếp.- Cả JSON-LD
datePublished,article:published_time,time[datetime]và dấu thời gian Unix, theo thứ tự ưu tiên đó. - Trang không có ngày thì trường để trống – không bao giờ điền ngày hôm nay.
Sinh viênTrích xuất bài giảng, chương sách và trang tham khảo thành tệp Markdown sống lâu hơn tài khoản khóa học.
Tài liệu khóa học biến mất khi học kỳ kết thúc: liên kết hỏng, trang học phần bị lưu trữ, bài đọc của seminar đổi chỗ. Tệp Markdown trên ổ đĩa của chính bạn thì không, và mười năm nữa chúng vẫn mở được trong bất kỳ trình soạn thảo nào, với URL nguồn vẫn nằm bên trong.
- Chọn một đoạn thì chỉ phần đã chọn được trích xuất – cách lấy một định nghĩa mà không kèm cả trang xung quanh.
- Mỗi ghi chú mang URL nguồn, nên trích dẫn về sau không cần tìm kiếm.
- Chế độ đọc hiển thị bản trích như văn bản thông thường, không có ký hiệu Markdown, trước khi bạn lưu.
Người viếtTiêu đề, tác giả, ngày đăng và URL nguồn đi cùng mỗi bản trích, nên trích dẫn luôn giữ được nguồn gốc.
Tư liệu thu thập bằng ảnh chụp màn hình và dấu trang trở nên vô dụng đúng lúc bạn cần ghi nguồn. Một tệp Markdown giữ tiêu đề, tác giả, ngày và địa chỉ trong cùng tệp với văn bản, nơi người kiểm chứng có thể tìm tới.
title,author,datevàsourcetrong frontmatter của mọi ghi chú, nên thông tin nguồn nằm cùng văn bản.- Trường tác giả được lọc: tiêu đề mục, tên ấn phẩm và nhãn nút không bị coi là dòng tác giả.
- Chỉ phần thân bài viết: ô đăng ký bản tin, thanh chia sẻ và dải “đọc tiếp” không bao giờ vào ghi chú.
Nhà báoVăn bản đúng như lúc bạn đọc, kèm ngày đăng và địa chỉ, trong một tệp trên ổ đĩa của chính bạn.
Trang web bị sửa và bị gỡ. Một bản trích giữ toàn văn, URL nguồn và ngày đăng mà chính trang khai báo, trong một tệp thuần bạn tự giữ: không phải trong một dịch vụ có thể đóng cửa, đổi điều khoản hay lặng lẽ làm mất bản ghi.
- Ngày đăng đọc từ siêu dữ liệu của chính trang – JSON-LD,
article:published_time,time[datetime]– không phải từ phần văn bản. - URL nguồn nằm trong frontmatter của mọi ghi chú.
- Toàn văn bài viết không kèm thanh điều hướng và khối quảng bá vốn thay đổi giữa các lượt truy cập.
Công việc pháp lýVăn bản đúng như khi được công bố, kèm địa chỉ nguồn và ngày, trong một tệp bạn tự kiểm soát.
Văn bản quy phạm, điều khoản dịch vụ và hướng dẫn chính thức thay đổi mà không báo trước. Một bản sao Markdown mang địa chỉ nguồn và ngày trang khai báo là bản ghi những gì văn bản nói vào ngày bạn đọc.
- Văn bản nguyên văn – không có gì trong phần thân bài viết bị tóm tắt, viết lại hay đảo thứ tự.
- URL nguồn và ngày đăng mà trang khai báo trong frontmatter của mọi ghi chú.
- Bảng phí, thời hạn và ngưỡng được chính tiện ích chuyển đổi: giữ được 12 trên 15 trong bộ mẫu kỹ thuật, so với 7 của mỗi công cụ được so sánh.
Nhà phân tíchÔ chứa mã, danh sách hay liên kết không còn làm vỡ hàng: giữ được 12 trên 15 bảng.
Các bộ chuyển đổi HTML sang Markdown thông thường hỏng đúng ở những bảng quan trọng: bảng có danh sách, liên kết hoặc đoạn mã mẫu trong ô. Clean Web Clipper tự chuyển đổi bảng và trải phẳng nội dung ô thay vì làm rơi cả hàng.
- Bộ chuyển đổi bảng GFM viết riêng cho việc này, không phải một plugin chuyển đổi chung gắn thêm vào.
- Giữ được 12 trên 15 bảng trong bộ mẫu kỹ thuật, so với 7 của mỗi công cụ được so sánh.
- Bảng hai cột lộn xộn thành các dòng khóa in đậm và giá trị thay vì một lưới vỡ.
Giáo viênTài liệu không kèm trang web xung quanh: không menu, không thanh đồng ý cookie, không quảng cáo trên bản in.
Một trang in thẳng từ trình duyệt mang cả menu, thanh đồng ý cookie và quảng cáo lên tài liệu phát tay. Trích xuất chỉ mang văn bản, với URL nguồn được giữ trong tệp nên việc ghi nguồn không tốn thêm công sức.
- Nút in in bản trích, không phải trang bao quanh nó.
- Chế độ đọc hiển thị kết quả như văn bản thông thường, không có ký hiệu Markdown, trước khi bạn in hoặc lưu.
- Chọn một bài tập hoặc một định nghĩa và chỉ trích xuất phần đó.
Biên dịch viênMenu, banner và thanh điều hướng lặp lại không bao giờ vào danh sách phân đoạn.
Văn bản nguồn dán từ trang web mang theo thanh điều hướng, và mỗi mục menu thành một phân đoạn bạn phải bỏ qua, đếm và rốt cuộc giải thích trên hóa đơn. Clean Web Clipper loại bỏ nó trước khi tệp tới gần công cụ của bạn.
- Menu, phân trang, thanh đồng ý cookie và mục “đọc tiếp” bị cắt trước khi tệp tồn tại.
- Thanh điều hướng lặp lại giảm khoảng bốn lần so với các công cụ được so sánh: 102 dòng lặp lại so với 282, 478 và 491.
- Không một thẻ HTML nào sót lại trên 512 trang đã đo, nên không có mã đánh dấu lạc nào biến thành thẻ trong dòng.
Quản lý sản phẩmTrích xuất changelog, tài liệu và ghi chú phát hành thành tệp bạn tìm kiếm, diff và trích dẫn được.
Nghiên cứu cạnh tranh lưu dưới dạng dấu trang dần mục thành một danh sách liên kết không tìm kiếm được. Trích xuất thành Markdown, nó trở thành một kho dữ liệu bạn grep được, diff được với bản chụp quý trước, và trích dẫn được trong tài liệu quyết định kèm theo ngày.
- Ngày đăng đọc từ trang, nên một mục changelog giữ đúng thời điểm thật chứ không phải ngày bạn tìm thấy nó.
- Quy tắc theo trang web tự động đưa mỗi đối thủ vào thư mục riêng.
- Bảng giá và giới hạn còn nguyên: giữ được 12 trên 15 trong bộ mẫu kỹ thuật, so với 7 của mỗi công cụ được so sánh.
Người viết tài liệu kỹ thuậtTiêu đề mục, bảng, khối mã và chú thích được chuyển sang; phần vỏ của trang thì không.
Chuyển đổi tài liệu thường nghĩa là chuyển HTML rồi mất thời gian hơn để gỡ những gì bộ chuyển đổi giữ lại. Việc gỡ bỏ đó là thứ Clean Web Clipper được xây dựng xoay quanh, và là phần đã được đo: không có thẻ HTML sót lại trên 512 trang.
- Tiêu đề mục, danh sách, bảng, khối mã và chú thích đều chuyển sang Markdown chuẩn.
- Khối mã giữ nhãn ngôn ngữ: giữ được 73 trên 156 trong bộ mẫu kỹ thuật, so với 20 và 0 của các công cụ được so sánh.
- Không có thẻ HTML sót lại trên 512 trang đã đo.
Lưu trữ cá nhânTệp Markdown thuần trên ổ đĩa của chính bạn. Không tài khoản, không dịch vụ, không gì có thể đóng cửa.
Dấu trang trỏ tới những trang thay đổi hoặc biến mất, còn dịch vụ đọc sau thì đóng cửa, bị mua lại hoặc bắt đầu tính phí cho việc xuất dữ liệu. Một bản trích là chính văn bản, ở định dạng không có nhà cung cấp và không hết hạn, lưu ở nơi bạn quyết định.
- Định dạng bền và mở: văn bản thuần với frontmatter YAML, đọc được bằng mọi trình soạn thảo và bằng
grep. - Không tài khoản và không tải lên gì: những gì bạn trích xuất ở lại trên ổ đĩa của bạn.
- Ngày đăng và URL nguồn được chụp cùng văn bản, nên một ghi chú vẫn nhận diện được nhiều năm sau.
Đọc không bị nhiễuChế độ đọc không menu, không banner và không ký hiệu Markdown, theo giao diện sáng tối của trình duyệt.
Phần phụ của trang không chỉ là sự rối mắt – đó là văn bản trình đọc màn hình đọc to và người đọc phải bỏ qua mỗi lần truy cập. Cửa sổ trích xuất hiển thị riêng bài viết, theo cài đặt sáng hoặc tối của trình duyệt, không có script nào của trang chạy.
- Chế độ đọc hiển thị bản trích như văn bản thông thường – không có ký hiệu Markdown, với liên kết hoạt động và tiêu đề mục thật.
- Nó theo cài đặt sáng và tối của trình duyệt, không theo trang web.
- Cửa sổ mở rộng tới khoảng ba phần tư màn hình cho bài viết dài.