Clean Clipper Adaugă în Chrome – gratuit

Sub capotă

Cum funcționează și unde se oprește

Nimic din ce urmează nu este magie și nimic nu apelează un server. Tot procesul rulează în pagina pe care o priviți, în câteva zeci de milisecunde.

Găsirea articolului

Întâi extensia caută containerele evidente în care stă de obicei un articol. Când un astfel de container nu există – și pe multe site-uri reale nu există – trece la măsurarea densității textului: care bloc conține cel mai mult text de paragraf care nu stă într-un link. Câștigă cel mai îngust bloc care păstrează aproape tot acel text.

Un bloc al cărui text este în cea mai mare parte etichete de link este un meniu sau un flux, nu un articol, și este respins – dacă nu cumva conține peste vreo 1200 de caractere de text real, pentru că articolele lungi chiar au multe linkuri.

Scoaterea elementelor de serviciu

Apoi pleacă elementele cunoscute care nu sunt conținut: navigația, bannerele, barele de distribuire, notificările despre cookie-uri, paginarea, fluxurile „citește și” și benzile de logouri. Liniile repetate sunt eliminate, pentru că navigația reluată în fiecare secțiune este cea mai mare sursă de zgomot dintr-o pagină preluată.

ce păstrează celelalte clippere

[Sari la conținut](#main) [Autentificare](/login) [Cont nou](/inregistrare)
[Acasă](/) [Știri](/stiri) [Sport](/sport) [Cultură](/cultura) [Mai mult](/mai-mult)

Folosim cookie-uri și tehnologii similare ca să vă îmbunătățim experiența.
[Accept toate] [Setări]

# Articolul pentru care ați venit

Primul paragraf adevărat al textului.

<div class="promo-inline">

## Citește și
[Alt titlu](/a) [Încă un titlu](/b) [Și un al treilea](/c)

ce ajunge în notiță

# Articolul pentru care ați venit

Primul paragraf adevărat al textului.

Conversia

Tabelele sunt serializate chiar de extensie, nu de o bibliotecă generică, pentru că un convertor generic se rupe la o celulă care conține o listă sau un bloc de cod. Blocurile de cod își iau limbajul din marcajul paginii. Linkurile de referință sunt adunate în note de subsol Markdown înainte ca filtrul de curățare să șteargă identificatorii de care depind – ordinea contează, iar dacă este greșită se pierd în tăcere toate notele.

Unde se oprește

Pe o vitrină, pe un flux sau pe o pagină de rezultate nu există articol. Extensia verifică Markdownul terminat: dacă mai mult de un sfert din el stă în etichete de link, raportează „nu există articol”, în loc să vă dea trei sute de linkuri. Refuzul este intenționat și de aceea numărul de caractere este aici mai mic decât la unelte care întorc mereu ceva.

Ce nu face

Întrebări

Cât durează o preluare?
Zeci de milisecunde pentru un articol obișnuit; o pagină foarte lungă, cu sute de note, ia câteva sute. Timpul este afișat în colțul ferestrei.
Funcționează pe aplicații de tip single-page?
Da. Citește DOM-ul după randare, așa că un site de documentație construit în JavaScript este preluat exact așa cum îl vedeți.
Ce este modul de extragere jsonld-articlebody?
Unele pagini livrează textul articolului în datele lor structurate, dar nu îl randează niciodată complet. Când datele structurate conțin semnificativ mai mult text decât DOM-ul, extensia le folosește și consemnează acest lucru.