Clean Web Clipper Thêm vào Chrome (miễn phí)

Dành cho ai

Lưu bài báo khoa học mà vẫn giữ ngày công bố

Một bài báo được lưu mà thiếu ngày công bố là một trích dẫn bạn sẽ phải dựng lại sau này. Clean Web Clipper đọc ngày từ siêu dữ liệu của chính trang chứ không phải từ phần văn bản, và khi trang không có ngày, trường này để trống thay vì điền ngày hôm nay.

Bài báo đã lưu mất nguồn gốc ở đâu

Bạn đọc một bản preprint trong trình duyệt, lưu lại, và ba tháng sau ghi chú không nói gì về thời điểm công bố hay phiên bản bạn đã đọc. Trang tóm tắt đã chuyển sang v3, các liên kết tài liệu tham khảo đã thành neo chết trỏ về một trang bạn đã rời đi, và trường tác giả ghi “Skip to main content” vì web clipper lấy chuỗi in đậm đầu tiên nó tìm thấy.

Ngày tháng là phần tệ nhất, vì lỗi xảy ra âm thầm. Một web clipper đóng dấu ghi chú bằng ngày bạn lưu sẽ tạo ra một tệp trông đúng mà thật ra sai. Một năm sau, bạn không thể biết trong hai trăm ghi chú, cái nào mang ngày công bố thật và cái nào mang ngày bạn tình cờ đọc – không có gì trong tệp phân biệt được chúng.

Văn bản và suy nghĩ rốt cuộc nằm ở những nơi khác nhau. Trình quản lý tài liệu tham khảo giữ siêu dữ liệu, ứng dụng ghi chú giữ bình luận của bạn, và không nơi nào giữ đoạn văn bạn đang bình luận. Tới lúc viết bài, bạn quay lại tìm nó, và một nửa số liên kết dẫn tới tường phí mà trước đó bạn đọc qua một phiên truy cập của trường, nay đã hết hạn. Giữ chính văn bản trong cùng tệp với ghi chú của bạn về nó sẽ loại bỏ hoàn toàn chuyến quay lại đó.

Ghi chú lưu lại những gì

citation_date đọc từ trang, chú thích ở cuốiarxiv.org/abs/1706.03762
---
title: "Attention Is All You Need"
source: "https://arxiv.org/abs/1706.03762"
author: "Ashish Vaswani, Noam Shazeer, Niki Parmar"
date: "2017-06-12"
extraction: "dom"
---

The dominant sequence transduction models are based on complex recurrent or
convolutional neural networks.[^1]

[^1]: Submitted 12 June 2017. Comments: 15 pages, 5 figures.

Thiết lập để đọc bài báo

Cài đặt mặc định được chỉnh để đọc bài viết nhanh. Một thư mục tài liệu tham khảo cần điều ngược lại – giữ mọi trường siêu dữ liệu, và xem kết quả trước khi lưu.

  1. Mở Tùy chọn từ biểu tượng tiện ích và đặt nơi lưu là thư mục chứa nguồn của dự án – sources/ cạnh bản thảo, hoặc một thư mục trong vault.
  2. Để cú nhấp vào biểu tượng mở cửa sổ xem trước thay vì “lưu vào thư mục”. Với bài báo, cửa sổ này đáng giá – đó là nơi bạn thấy ngày và tác giả có thật sự được lấy ra hay không, trước khi tệp tồn tại.
  3. Đặt mẫu tên tệp là {domain}-{title}. Một máy chủ preprint, một tạp chí và một bản lưu trong kho của cùng một bài báo là ba tài liệu khác nhau có cùng tiêu đề, và tên miền là thứ phân biệt chúng trong danh sách thư mục.
  4. Bật mọi trường frontmatter, kể cả extraction. Trường cuối này quan trọng ở đây hơn ở đâu hết – jsonld-articlebody nghĩa là văn bản lấy từ dữ liệu có cấu trúc của trang chứ không phải từ những gì đã hiển thị, và hai thứ đó không phải lúc nào cũng là cùng một phiên bản.
  5. Giữ hình ảnh dưới dạng liên kết. Hình minh họa thường là lập luận chính, và một liên kết ít nhất cho biết đã có một hình ở đó; bỏ qua chúng sẽ lặng lẽ xóa đi sự thật rằng bài báo có hình.
  6. Trích xuất riêng trang tóm tắt và trang HTML toàn văn khi có cả hai. Chúng mang siêu dữ liệu khác nhau – trang tóm tắt thường chứa thẻ citation_date, trang toàn văn chứa danh sách tài liệu tham khảo.
  7. Sau lần trích xuất đầu tiên từ một nhà xuất bản bạn chưa dùng, hãy xem trường date. Nếu nó trống, trang đó không xuất ngày trong mã đánh dấu, và không cài đặt nào tạo ra được ngày.

Cài đặt cho thư mục tài liệu tham khảo

Chủ đề của bảng này không phải tốc độ. Mà là đảm bảo hai năm sau tệp vẫn cho biết nó từ đâu tới và tới bằng cách nào.

Cài đặtGiá trịVì sao chọn giá trị này
Cú nhấp vào biểu tượngCửa sổ xem trướcCơ hội duy nhất để xem ngày và tác giả có còn không, trước khi thành tệp
Nơi lưuThư mục `sources/` cạnh bản thảoĐoạn văn và phần viết về nó ở cùng một chỗ, trong cùng một bản sao lưu
Mẫu tên tệp`{domain}-{title}`Preprint, bản trên tạp chí và bản trong kho có cùng tiêu đề nhưng không phải cùng một tài liệu
FrontmatterMọi trường, kể cả `extraction`Đường đi quan trọng – dữ liệu có cấu trúc và văn bản đã hiển thị đôi khi là hai phiên bản khác nhau
Hình ảnhGiữ liên kếtLiên kết hình ghi lại rằng hình đã tồn tại; bỏ qua sẽ giấu điều đó
Quy tắc theo trang web`arxiv.org` → thư mục con `preprints`Preprint bị thay thế và đáng được kiểm tra lại theo nhóm
Phần đã chọnTrích xuất phần đã chọn cho một mụcPhần phương pháp được trích dẫn thường xuyên hơn nhiều so với việc cả bài báo được đọc
Trang không công bố ngày, nên trường để trốngtrang giới thiệu bài báo khoa học không có ngày trong mã đánh dấu
---
title: "Reproducibility of variant calling across sequencing platforms"
source: "https://example-journal.org/articles/vc-repro"
author: "M. Ilves, R. Okonkwo"
date: ""
extraction: "jsonld-articlebody"
---

## Abstract

Concordance between platforms fell below 0.90 for indels longer than eight
bases, while substitution calls agreed across all four pipelines tested.

Ba cách sử dụng

Bản preprint thay đổi dưới trích dẫn

Bạn đọc v1 của một bản preprint vào tháng Ba và trích xuất nó. Tháng Chín, trang tóm tắt phục vụ v3, với phần kết quả được viết lại và hai tác giả mới. Bạn trích xuất lại; tệp thứ hai được thêm hậu tố số thay vì thay thế tệp đầu.

Giờ bất kỳ công cụ diff nào cũng cho thấy chính xác những nhận định nào đã dịch chuyển giữa phiên bản bạn trích dẫn và phiên bản người đọc sẽ thấy ở URL đó. Không có tệp tháng Ba thì không có cách nào chứng minh là đã có gì thay đổi. URL trông y hệt và trang chỉ hiển thị trạng thái hiện tại.

Toàn văn sau phiên truy cập của trường

Bài báo hiển thị cho bạn vì bạn đang dùng mạng của trường hoặc đăng nhập qua thư viện. Tiện ích đọc những gì trình duyệt đã hiển thị, nên toàn văn được trích xuất như mọi trang khác, với tài liệu tham khảo thành các định nghĩa chú thích [^1] gom ở cuối ghi chú.

Điều đó quan trọng sáu tháng sau, khi phiên đã hết hạn và cùng liên kết đó đòi tiền. Đoạn văn, tác giả và ngày của nó nằm trong một tệp trên ổ đĩa của bạn, và không phần nào của tệp phụ thuộc vào việc gói đăng ký còn hiệu lực.

Viết bài, với nguồn trong cùng thư mục

Bản thảo nằm trong paper/, các nguồn đã trích xuất trong paper/sources/. Mọi trích dẫn trong bản nháp đều kiểm tra được với tệp gốc mà không cần mở trình duyệt, và URL cùng ngày cần cho danh sách tài liệu tham khảo là hai dòng ở đầu tệp đó.

Vì các tệp là văn bản thuần, grep trên thư mục trả lời được câu hỏi mà trình quản lý tài liệu tham khảo không trả lời được – không phải bạn đã lưu những bài báo nào, mà bài nào trong số đó thực sự dùng một cụm từ cụ thể.

So với cách đọc thông thường

Phần lớn mọi người đã làm hai hoặc ba cách dưới đây. So sánh trung thực không phải là chúng thất bại, mà là mỗi cách làm rơi một thứ khác nhau.

Cách đang làmBạn nhận được gìCái giá phải trả
Nút trình duyệt của trình quản lý tài liệu tham khảoSiêu dữ liệu có cấu trúc và thường có cả PDFVăn bản đọc nằm trong một cơ sở dữ liệu; trích dẫn vẫn phải gõ lại
Tải PDFPhiên bản chính thức, đã dàn trangKhông grep được trên cả thư mục nếu không có công cụ thêm, và không diff được giữa các phiên bản
Lưu dấu trang tóm tắtMột con trỏ, ngay lập tứcPreprint bị thay thế tại chỗ; con trỏ lặng lẽ đi theo thay đổi
Sao chép và dán đoạn vănVăn bản bạn cầnTới nơi mà không có ngày, URL hay phần định nghĩa tài liệu tham khảo
Clean Web ClipperVăn bản HTML, siêu dữ liệu và chú thích của nó, dưới dạng tệpChỉ HTML. Nó không đọc PDF và không ghi citation key

Khi siêu dữ liệu không được lấy ra

Trường ngày bị trống

Trang không xuất ngày nào mà tiện ích nhận ra. Nó tìm citation_datecitation_publication_date (các thẻ arXiv, PubMed và IEEE dùng), rồi JSON-LD datePublished, article:published_time, time[datetime] và dấu thời gian Unix, theo thứ tự đó. Khi không có thẻ nào, trường để trống thay vì điền ngày hôm nay, vì một ngày sai nghe hợp lý trong thư mục tài liệu tham khảo sẽ bị phát hiện đúng vào lúc tệ nhất.

Trường tác giả trống dù bài báo rõ ràng có tác giả

Việc trích xuất tác giả đọc dữ liệu có cấu trúc và mã đánh dấu dòng tác giả, rồi lọc các trường hợp nhận nhầm thường gặp: tiêu đề mục, tên tạp chí, khối “authority control” và nhãn nút. Một số nhà xuất bản đặt danh sách tác giả trong widget hiển thị bằng JavaScript, hoàn toàn không có mã đánh dấu dòng tác giả, và không gì qua được bộ lọc. Trường trống là kết quả có chủ ý – “Skip to main content” trong trường tác giả là thứ đã xảy ra với không chỉ một web clipper.

Chỉ có phần tóm tắt, không có bài báo

Bạn đã trích xuất trang tóm tắt, mà với phần lớn máy chủ preprint và tạp chí, trang đó thật sự chỉ chứa phần tóm tắt. Toàn văn nằm ở một URL riêng – thường là liên kết “full text”, “HTML” hoặc “reader” trên cùng trang. Hãy trích xuất cả trang đó; hai trang mang siêu dữ liệu khác nhau và đáng giữ thành hai tệp.

Thiếu công thức

Công thức toán hiển thị bằng hình ảnh vẫn là liên kết hình, và nếu bạn đặt hình ảnh là “bỏ qua” thì nó biến mất hoàn toàn. Khi nhà xuất bản hiển thị công thức bằng văn bản, các ký tự sẽ được chuyển sang. Không có chuyển đổi sang LaTeX – tiện ích đọc những gì trang đã hiển thị và không dựng lại ký hiệu từ một bức ảnh của nó.

Giới hạn thật

Nó đọc HTML, không đọc PDF – một bài báo chỉ tồn tại dưới dạng PDF không phải thứ tiện ích chuyển đổi được. Nó không tải BibTeX và không ghi citation key. Frontmatter là siêu dữ liệu, không phải một mục thư mục tài liệu. Công thức toán hiển thị bằng hình ảnh vẫn là liên kết hình. Và một số trang hoàn toàn không công bố ngày trong mã đánh dấu; trên những trang đó trường được để trống thay vì đoán, đó là câu trả lời trung thực nhưng vẫn là một trường trống.

Thêm vào Chrome (miễn phí)Miễn phí hoàn toàn. Không cần tài khoản, không cần đăng ký, không giới hạn.

Câu hỏi

Nếu trang không có ngày công bố thì sao?
Trường để trống. Điền ngày bạn tình cờ trích xuất trang còn tệ hơn để trống, vì nó âm thầm biến thành dữ liệu sai trong ghi chú của bạn.
Nó có trích xuất được PDF không?
Không. Tiện ích làm việc với HTML đã hiển thị của trang. Khi một bài viết có cả hai dạng, hãy trích xuất bản HTML; với PDF, hãy dùng công cụ dành cho PDF.
Liên kết chú thích có còn dùng được sau khi trích xuất không?
Có: chúng thành chú thích Markdown chuẩn, mà Obsidian và phần lớn trình hiển thị Markdown biến thành liên kết hoạt động bên trong ghi chú.
Nó có lấy được bài báo sau đăng nhập của trường không?
Có, vì nó đọc trang mà trình duyệt đã hiển thị. Nếu bạn nhìn thấy, nó trích xuất được.
Nó quyết định ai là tác giả như thế nào?
Nó đọc dữ liệu có cấu trúc và mã đánh dấu dòng tác giả, rồi lọc các trường hợp nhận nhầm thường gặp: tiêu đề mục, tên ấn phẩm, khối “authority control” và nhãn nút. Khi không gì qua được bộ lọc, trường để trống.
Bảng dữ liệu và bảng bổ sung có giữ được không?
Thường là có. Bảng được chính tiện ích chuyển đổi thay vì một bộ chuyển đổi chung, và trên bộ mẫu mười lăm bảng, mười hai bảng giữ được trong khi các công cụ được so sánh giữ bảy bảng mỗi công cụ. Ô chứa danh sách hoặc đoạn mã là trường hợp làm hỏng bộ chuyển đổi chung và được xử lý ở đây.
Nó có lấy DOI, BibTeX hay citation key không?
Không. Frontmatter là siêu dữ liệu của trang – tiêu đề, URL nguồn, tác giả, ngày, đường trích xuất – không phải một mục thư mục tài liệu. Trình quản lý tài liệu tham khảo vẫn là nơi giữ citation key; đây là nơi giữ văn bản.
`jsonld-articlebody` trên một ghi chú của tôi nghĩa là gì?
Là trang đã gửi bài viết trong dữ liệu có cấu trúc mà không bao giờ hiển thị xong, nên phần thân được đọc từ dữ liệu có cấu trúc. Với bài báo, điều này đáng để ý – nhà xuất bản đôi khi để một phiên bản cũ hơn của văn bản trong khối đó, và giá trị được ghi lại để bạn kiểm tra thay vì mặc định tin.
Ghi chú có ghi lại tôi đã đọc phiên bản nào của bản preprint không?
Trong phạm vi trang cho biết. Nếu URL mang số phiên bản, dòng source cũng mang nó, và {date} trong tên tệp ghi lại lúc bạn chụp. Trích xuất lại cùng bài báo sau đó, hai tệp có thể so sánh trực tiếp. Đó là bằng chứng đáng tin cậy duy nhất cho thấy một phiên bản đã thay đổi.
Tôi có trích xuất cả cơ sở dữ liệu kết quả tìm kiếm để sàng lọc được không?
Không. Không có chế độ hàng loạt và không có trình thu thập, và trang kết quả chính là loại đầu vào tiện ích từ chối – phần lớn là nhãn liên kết, được báo là “không có bài viết”. Công cụ sàng lọc làm việc đó; công cụ này giữ những bài báo bạn đã quyết định đọc.