Clean Clipper Aggiungi a Chrome – gratis

Sotto il cofano

Come funziona, e dove si ferma

Qui non c’è nessuna magia e non si chiama nessun server. L’intera catena gira dentro la pagina che stai guardando, in qualche decina di millisecondi.

Trovare l’articolo

Prima l’estensione cerca i contenitori ovvi in cui un articolo di solito sta. Quando quel contenitore non c’è – e su molti siti veri non c’è – passa a misurare la densità del testo: quale blocco contiene più testo di paragrafo che non stia dentro un link. Vince il blocco più stretto che tiene ancora quasi tutto quel testo.

Un blocco il cui testo è fatto quasi solo di etichette di link è un menu o un feed, non un articolo, e viene scartato – a meno che non contenga più di circa 1200 caratteri di testo vero, perché gli articoli lunghi contengono legittimamente molti link.

Togliere gli elementi di servizio

Poi se ne vanno gli elementi che non sono contenuto: navigazione, banner, barre di condivisione, avvisi sui cookie, paginatori, feed «leggi anche» e fasce di loghi. Le righe ripetute vengono eliminate, perché la navigazione duplicata in ogni sezione è la prima fonte di rumore in una pagina salvata.

quello che tengono gli altri clipper

[Vai al contenuto](#main) [Accedi](/login) [Registrati](/registrazione)
[Home](/) [Cronaca](/cronaca) [Sport](/sport) [Cultura](/cultura) [Altro](/altro)

Usiamo cookie e tecnologie simili per migliorare la tua esperienza.
[Accetta tutti] [Gestisci preferenze]

# L’articolo per cui sei venuto

Il primo, vero paragrafo del testo.

<div class="promo-inline">

## Leggi anche
[Un altro titolo](/a) [Un altro ancora](/b) [E un terzo](/c)

quello che finisce nella nota

# L’articolo per cui sei venuto

Il primo, vero paragrafo del testo.

Convertire

Le tabelle le serializza l’estensione stessa, non un plugin generico, perché i convertitori generici si rompono su una cella che contiene un elenco o un blocco di codice. I blocchi di codice prendono il linguaggio dal markup della pagina. I rimandi vengono raccolti in note Markdown prima che il sanificatore tolga gli id su cui si appoggiano: l’ordine conta, e sbagliarlo fa sparire in silenzio tutte le note.

Dove si ferma

Su una vetrina, un feed o una pagina di risultati non c’è nessun articolo. L’estensione controlla il Markdown finito: se più di un quarto sta dentro etichette di link, dichiara «nessun articolo» invece di consegnarti trecento link. È un rifiuto voluto, ed è il motivo per cui qui i conteggi di caratteri sono più bassi che negli strumenti che restituiscono sempre qualcosa.

Cosa non fa

Domande

Quanto ci mette a salvare una pagina?
Decine di millisecondi per un articolo normale; una pagina lunghissima con centinaia di note arriva a qualche centinaio. Il tempo è scritto nell’angolo della finestra.
Funziona sulle single-page application?
Sì. Legge il DOM dopo il rendering, quindi un sito di documentazione costruito in JavaScript viene catturato come lo vedi.
Che cos’è la modalità di estrazione jsonld-articlebody?
Certe pagine portano il testo dell’articolo nei propri dati strutturati ma non finiscono mai di disegnarlo. Quando i dati strutturati contengono molto più testo del DOM, l’estensione usa quelli e lo registra.