Clean Web Clipper Adaugă în Chrome – gratuit

Extensie Chrome ·

Salvează pagina web în Markdown pe care nu mai trebuie să-l cureți

Clean Web Clipper salvează pagina web în Markdown dintr-un singur clic: titlul, autorul, data publicării și adresa sursei ajung în frontmatter, iar textul rămâne fără navigație. Totul se petrece în browserul dumneavoastră: fără cont, iar textul paginii nu părăsește niciodată browserul.

Adaugă în Chrome – gratuitGratuit în întregime, fără cont și fără limite. Extragerea merge offline; evenimentele de utilizare pleacă atunci când sunteți online, iar un singur comutator le oprește.For Chrome on a computer
Fereastra Clean Web Clipper cu Markdownul unui articol preluat de pe Wikipedia

Clean Web Clipper este o extensie Chrome gratuită care salvează o pagină web ca Markdown curat – în clipboard, într-un fișier .md, într-un dosar sau direct într-un vault Obsidian – fără cont și fără autentificare. Testată pe 512 pagini de pe cele mai vizitate site-uri: nicio eroare fatală și nicio etichetă HTML rămasă în vreun articol extras.

Testat pe 512 pagini de pe cele mai vizitate site-uri din lume

Două rulări. Prima a luat 109 pagini de pe cele o sută de site-uri cele mai vizitate din lume și din Rusia și a comparat rezultatul direct cu alte trei motoare de extragere. A doua a luat primele cincizeci de site-uri din fiecare dintre douăsprezece țări europene: încă 403 pagini, fiecare preluată în limba țării respective și trecută doar prin nucleul nostru. Motoare, versiuni, date și unde rămâne în urmă

512pagini testate
0erori fatale
0etichete HTML rămase în articolele extrase
102linii de meniu duplicate în comparația directă pe 109 pagini, față de 282, 478 și 491 la celelalte motoare

Problema nu este niciodată conversia. Este tot ce vine odată cu ea.

Orice clipper transformă HTML în Markdown. Apoi deschideți notița și găsiți bara de cookie-uri, meniul lateral, o listă „citește și” și un tabel care s-a rupt pe drum. Clean Web Clipper este construit exact în jurul scoaterii lor, iar scoaterea este măsurată, nu doar afirmată.

ce păstrează celelalte clippere

[Sari la conținut](#main) [Autentificare](/login) [Cont nou](/inregistrare)
[Acasă](/) [Știri](/stiri) [Sport](/sport) [Cultură](/cultura) [Mai mult](/mai-mult)

Folosim cookie-uri și tehnologii similare ca să vă îmbunătățim experiența.
[Accept toate] [Setări]

# Articolul pentru care ați venit

Primul paragraf adevărat al textului.

<div class="promo-inline">

## Citește și
[Alt titlu](/a) [Încă un titlu](/b) [Și un al treilea](/c)

ce ajunge în notiță

# Articolul pentru care ați venit

Primul paragraf adevărat al textului.
Aceeași pagină de știri: ce păstrează un clipper obișnuit și ce salvează Clean Web Clipper

Ce face rezultatul curat

Rezultat real, needitatro.wikipedia.org/wiki/Lanț_Markov
---
title: "Lanț Markov - Wikipedia"
source: "https://ro.wikipedia.org/wiki/Lanț_Markov"
date: "2008-03-19T14:22:08.000Z"
extraction: "dom"
---

Un lanț Markov este un proces stocastic care descrie o succesiune de evenimente
posibile, în care probabilitatea fiecărui eveniment depinde numai de starea
atinsă la evenimentul precedent.[^1]

[^1]: Gagniuc, Paul A. (2017). Markov Chains: From Theory to Implementation
      and Experimentation. USA, NJ: John Wiley & Sons. pp. 1-235.

Cum salvați o pagină web în Markdown în Chrome

Instalați extensia, apoi trei pași. Nu trebuie configurat nimic dinainte: implicit, un clic deschide o previzualizare cu Markdownul deja gata, de copiat sau de salvat ca fișier. Mai târziu puteți face ca un singur clic să scrie notița direct într-un dosar sau în vault, fără previzualizare.

  1. Fixați pictograma. Deschideți meniul cu piesa de puzzle de lângă bara de adrese și fixați Clean Web Clipper în bara de instrumente.
  2. Deschideți articolul pe care vreți să-l păstrați – articolul însuși, nu o pagină cu linkuri spre el.
  3. Apăsați pictograma. Markdownul apare în fereastra de previzualizare: copiați-l sau salvați fișierul .md.

Unde se salvează

Clicul pe pictogramă se poate configura. Îl puteți lăsa să deschidă fereastra de previzualizare sau puteți face ca un singur clic să lase notița în vault și să nu deschidă nimic.

Setările Clean Web Clipper: alegerea a ceea ce face clicul pe pictogramă
Setările decid ce face un clic – previzualizare, clipboard, fișier, dosar sau direct vaultul.

Sincer în privința sursei

Fiecare notiță poartă un câmp extraction. dom înseamnă că textul vine din ceea ce browserul a randat efectiv. jsonld-articlebody înseamnă că pagina nu a terminat randarea și corpul a trebuit citit din datele structurate ale paginii. Iar când pe pagină nu există niciun articol – o vitrină, un flux, o listă de rezultate – extensia o spune, în loc să vă arunce trei sute de linkuri.

Ecranul Folos din Clean Web Clipper: preluări, timp economisit, site-uri preferate și pagini care au eșuat
Folos: câte preluări au mers, cât timp au economisit și fiecare pagină care nu a mers.
Clean Web Clipper refuză o pagină fără articol și se oferă să-i trimită adresa
Nu există articol pe pagină – un refuz sincer în loc de trei sute de linkuri din meniu.
Pagina de primă pornire a Clean Web Clipper, cu trei pași de configurare
Prima pornire: fixați pictograma, preluați o pagină, alegeți ce face clicul.

Ce nu face

Cincisprezece feluri în care este folosită

ProgramatoriBlocurile de cod își păstrează eticheta de limbaj: evidențierea funcționează din clipa în care lipiți.

Clean Web Clipper citește limbajul de pe pagina însăși – clasa blocului, elementul părinte, marcajul lăsat de evidențiatorul site-ului – și îl scrie pe gard. Pe un corpus tehnic de nouă pagini, eticheta a supraviețuit în 73 de blocuri din 156, față de 20 și 0 la celelalte două motoare măsurate. Restul paginii ajunge în Markdown obișnuit, fără bara laterală.

  • Blocul iese ca ```js, nu gol – evidențierea funcționează în Obsidian, VS Code și pe GitHub din clipa în care lipiți
  • Limbajul este citit de pe pagină – clasa blocului, elementul părinte, marcajul evidențiatorului – niciodată ghicit din cod
  • Un tabel de parametri cu cod într-o celulă își păstrează rândurile, în loc să se turtească
Află mai multe
Utilizatori ObsidianAlegeți un dosar din vault: un clic scrie notița acolo, iar Obsidian nici nu trebuie să ruleze.

Extensia scrie fișierul .md ea însăși, într-un dosar pentru care îi dați acces o singură dată. Nu există plugin din comunitate, nici server local, nici link obsidian:// de întreținut. Notița este pur și simplu acolo data următoare când deschideți vaultul.

  • Fără plugin, fără server local, fără linkuri obsidian://
  • Obsidian nu trebuie să fie deschis – fișierul apare în dosar, iar indexul îl preia mai târziu
  • Frontmatter YAML cu title, source, author, published și extraction, iar dumneavoastră alegeți ce câmpuri rămân
Află mai multe
Fluxuri cu IANavigația repetată este context irosit. Este scoasă înainte ca textul să ajungă la model.

Când o pagină web este lipită într-un model, fiecare linie de meniu duplicată și fiecare banner intră la socoteala contextului și concurează cu textul care vă interesează. Pe un corpus de 109 pagini (comparația directă), Clean Web Clipper a lăsat 102 linii de navigație repetate, acolo unde celelalte trei motoare au lăsat 282, 478 și 491 – și nicio etichetă HTML rămasă. Frontmatterul dă pe deasupra adresa sursei și data publicării.

  • De aproximativ patru ori mai puține linii de navigație repetate decât media motoarelor comparate: 102 linii repetate față de 282, 478 și 491
  • Niciun rest de etichete HTML în niciun articol extras, pe cele 512 pagini testate – modelul nu are de ocolit marcaj rătăcit
  • Frontmatterul dă explicit adresa sursei și data publicării, în loc să le lase de ghicit
Află mai multe
CercetătoriData este citită din metadate, inclusiv citation_date, standardul folosit de arXiv, PubMed și IEEE.

Un articol salvat fără data publicării devine o referință pe care va trebui să o reconstituiți mai târziu. Extensia citește data din metadatele paginii, în loc să o caute prin text, și lasă câmpul gol atunci când pagina nu poartă niciuna. Linkurile de referință, la rândul lor, devin note Markdown adevărate, adunate la finalul fișierului.

  • Citește citation_date și citation_publication_date – metaetichetele emise de arXiv, PubMed și IEEE
  • Citește și JSON-LD datePublished, article:published_time, time[datetime] și marcajele Unix
  • Nicio dată pe pagină înseamnă câmp gol, niciodată data de azi
Află mai multe
StudențiCursuri, capitole și pagini de referință devin fișiere Markdown pe care le păstrați.

Materialele dispar la sfârșitul semestrului și linkurile putrezesc; un fișier Markdown de pe discul dumneavoastră, nu. O preluare ia textul, adresa sursei și data, și se deschide în orice editor, cu sau fără rețea. Tot ce este descris aici este gratuit și nu cere niciun cont.

  • Selectați un pasaj și se preia doar selecția – util pentru o definiție sau un enunț
  • Fiecare notiță poartă adresa sursei, așa că citarea ei mai târziu nu cere nicio căutare
  • Fișierele se deschid offline, în Obsidian, Logseq, Joplin sau într-un simplu editor de text
Află mai multe
AutoriFiecare preluare păstrează adresa sursei, autorul și data publicării: atribuirea nu se pierde.

Documentarea strânsă din capturi de ecran și semne de carte încetează să fie utilă exact în clipa în care trebuie indicată sursa. Un fișier Markdown cu frontmatter ține titlul, autorul, data publicării și adresa originală chiar în fișier. Rămâne lizibil și căutabil peste ani, fără să depindă de vreun serviciu.

  • Titlu, autor, dată a publicării și adresa sursei în frontmatterul fiecărui fișier
  • Autorul este căutat în datele structurate și în semnăturile de articol, iar potrivirile false sunt înlăturate
  • Corpul articolului fără navigație și fără blocuri promoționale, gata de citat
Află mai multe
JurnaliștiTextul așa cum l-ați citit, cu data publicării și adresa, într-un fișier pe propriul disc.

Paginile sunt rescrise, corectate și retrase, adesea fără nicio mențiune despre schimbare. O preluare care poartă adresa sursei, data publicării și textul întreg este o urmă pe care o puteți arăta mai târziu. Ea stă pe discul dumneavoastră, în Markdown, nu într-un serviciu care se poate închide.

  • Data publicării citită din metadatele paginii – JSON-LD, article:published_time, time[datetime] –, nu căutată prin text
  • Adresa sursei în frontmatterul fiecărei notițe, cu titlul așa cum era atunci
  • Textul întreg al articolului, fără blocurile de navigație și de promovare care se schimbă de la o vizită la alta
Află mai multe
Muncă juridicăTextul așa cum a fost publicat, cu adresa și data lui, într-un fișier care vă aparține.

Normele, condițiile generale și ghidurile se schimbă fără preaviz și fără istoric vizibil. O copie în Markdown care poartă adresa de unde vine și data pe care o afișa este urma a ceea ce spunea textul în ziua în care l-ați citit. Nimic nu este rezumat sau reformulat pe drum.

  • Text cuvânt cu cuvânt – în corpul articolului nimic nu este rezumat, rescris sau reordonat
  • Adresa sursei și data publicării declarată de pagină, în frontmatterul fiecărei notițe
  • Tabelele de taxe, termene și praguri sunt serializate de extensia însăși: 12 din 15 păstrate pe corpusul tehnic, față de câte 7 la fiecare motor comparat
Află mai multe
AnaliștiSerializatorul de tabele este al extensiei: o celulă cu cod nu mai rupe rândul.

Convertoarele generice din HTML în Markdown se rup exact la tabelele care contează, cele cu o listă, un link sau o mostră de cod într-o celulă. Extensia scrie tabelul ea însăși și aplatizează conținutul celulei, în loc să piardă rândul. Pe un corpus de cincisprezece tabele, douăsprezece au trecut întregi, față de câte șapte la fiecare motor comparat.

  • Serializator propriu de tabele GFM, nu o bibliotecă generică lipită deasupra
  • Douăsprezece tabele din cincisprezece păstrate pe corpusul tehnic, față de câte șapte la fiecare motor comparat
  • O celulă cu o listă, un link sau cod este aplatizată curat, în loc să rupă rândul
Află mai multe
ProfesoriPreluați materialul, păstrați sursa, tipăriți-l sau puneți-l în notițe, fără ambalajul site-ului.

O pagină tipărită direct din browser își aduce pe foaie meniurile, bara de cookie-uri și reclamele. O preluare aduce textul, cu titlurile, exercițiile și tabelele lui, plus adresa sursei în frontmatter. Butonul de tipărire din fereastră tipărește preluarea, nu pagina.

  • Un buton de tipărire care tipărește preluarea, nu pagina cu tot cu meniuri
  • Modul de citire arată rezultatul fără simboluri Markdown, așa cum va ieși pe foaie
  • Adresa sursei rămâne în notiță, așa că indicarea ei nu cere niciun efort
Află mai multe
TraducătoriNavigația, bannerele și meniurile repetate nu ajung niciodată în lista de segmente.

Textul-sursă lipit dintr-o pagină web își aduce navigația cu el, iar fiecare element de meniu devine un segment pe care trebuie să îl săriți. Extensia taie ambalajul înainte de export, așa că lista de segmente începe direct cu textul. Formatarea din interiorul frazei – aldin, cursiv, linkuri, cod – trece ca echivalent Markdown.

  • Meniurile, paginarea și fluxurile „citește și” sunt tăiate înainte de export
  • Liniile de navigație repetate scad de aproximativ patru ori față de motoarele comparate
  • Markdownul obișnuit se importă în orice unealtă CAT importantă, fără conversie intermediară
Află mai multe
Product manageriListe de modificări, documentație și note de versiune devin notițe datate și căutabile.

Documentarea despre concurență ținută în semne de carte se transformă într-o listă de linkuri prin care nu se poate căuta. Preluată în Markdown, devine un corpus prin care dați grep, pe care îl comparați și pe care îl citați într-un document de decizie. Data publicării este citită de pe pagină, așa că o intrare din lista de modificări își păstrează momentul real.

  • Data publicării citită din pagină, așa că o intrare din lista de modificări își păstrează momentul real
  • Regulile pe site trimit fiecare concurent în dosarul lui, cu propriul frontmatter
  • Tabelele cu funcții și limite trec conversia întregi, gata de pus alături într-o comparație
Află mai multe
Redactori tehniciStructura, blocurile de cod și tabelele trec dincolo; ambalajul site-ului, nu.

Mutarea unei documentații înseamnă de obicei să convertiți HTML și apoi să pierdeți mai mult timp scoțând ce a păstrat convertorul. Scoaterea este exact partea pentru care a fost construită extensia, și partea care a fost testată: niciun rest de etichete HTML în niciun articol extras, pe cele 512 pagini testate. Titlurile, listele, tabelele, gardurile de cod și notele ajung în Markdown standard.

  • Titlurile, listele, tabelele, blocurile de cod și notele de subsol ajung toate în Markdown standard
  • Etichetele de limbaj rămân pe garduri: 73 de blocuri din 156 pe corpusul tehnic, față de 20 și 0
  • Niciun rest de etichete HTML în niciun articol extras, pe cele 512 pagini testate
Află mai multe
Arhivă personalăFișiere Markdown obișnuite, pe discul dumneavoastră. Fără cont și fără serviciu care se poate închide.

Semnele de carte trimit la pagini care se schimbă sau dispar. O preluare este textul însuși, într-un format fără furnizor și fără termen de expirare, păstrat unde hotărâți dumneavoastră. Fiecare fișier își poartă adresa sursei, data publicării și felul în care a fost obținut.

  • Format deschis și durabil – text obișnuit cu frontmatter YAML, citit de orice editor
  • Fără cont: textul paginilor nu părăsește niciodată browserul
  • Data publicării și adresa sursei prinse odată cu textul, nu adăugate ulterior de mână
Află mai multe
Citit fără zgomotUn mod de citire care arată textul fără meniuri, bannere și simboluri Markdown.

Ambalajul unei pagini nu este doar dezordine vizuală: este text pe care un cititor de ecran trebuie să îl rostească și pe care omul trebuie să îl sară. Fereastra preluării arată articolul singur, în tema deschisă sau întunecată a browserului dumneavoastră, iar fișierul salvat este text obișnuit, pe care îl citește orice unealtă de asistare.

  • Modul de citire afișează preluarea ca text obișnuit, fără simboluri Markdown
  • Urmează setarea de temă deschisă sau întunecată a browserului, fără un comutator separat
  • Fereastra se extinde cât trei sferturi din ecran, pentru citit în tihnă
Află mai multe
Adaugă în Chrome – gratuitGratuit în întregime, fără cont și fără limite. Extragerea merge offline; evenimentele de utilizare pleacă atunci când sunteți online, iar un singur comutator le oprește.For Chrome on a computer

Întrebări

În ce browsere funcționează?
Chrome și celelalte browsere Chromium: Edge, Brave, Vivaldi, Opera. Este o extensie Manifest V3, iar singura adresă cu care poate vorbi este propria noastră adresă de statistici – niciodată site-urile pe care le citiți.
Este gratuită?
Da, în întregime. Tot ce este descris pe acest site funcționează în extensia gratuită: preluare fără limită de pagini, vaultul Obsidian, regulile pe site, notele de subsol, tabelele, etichetele de limbaj la blocurile de cod și modul de citire. Interfața este în 19 limbi și urmează setarea browserului dumneavoastră. Nu există versiune cu plată, cont sau înregistrare.
Trebuie să am Obsidian pornit ca să salvez în vault?
Nu. Clean Web Clipper scrie fișierul direct într-un dosar pentru care i-ați dat acces, prin File System Access API din browser. Obsidian îl preia data următoare când se uită în vault.
Ce se întâmplă pe o pagină care nu este un articol?
O spune. Pe vitrine, fluxuri și pagini de rezultate nu există articol de extras, iar extensia marchează clipul cu „nu există articol”, în loc să întoarcă o pagină plină de linkuri.
Trimite Clean Web Clipper paginile mele undeva?
Paginile dumneavoastră, nu. Extragerea și conversia se petrec integral în browserul dumneavoastră: copia ajunge în clipboard, fișierul pe disc, iar niciun text sau titlu de pagină nu părăsește calculatorul. Către propriul nostru server de statistici pleacă totuși patru lucruri: adresa unei pagini pe care nu s-a găsit niciun articol, doar domeniul unei preluări reușite, numele ecranului extensiei pe care l-ați deschis și un număr de instalare aleatoriu care leagă aceste evenimente. Serverul înregistrează și o locație aproximativă – țara, regiunea și orașul – dedusă din adresa IP; adresa în sine nu este stocată. Nimic din toate acestea nu ajunge la terți, iar un singur comutator din setări oprește totul și șterge numărul. Extensia nu cere nicio permisiune pentru site-urile pe care le citiți, deci nu poate privi o pagină pe care nu ați apăsat.