Clean Clipper Instalar no Chrome – grátis

Por dentro

Como funciona, e onde ele para

Não há mágica nenhuma aqui e nada chama um servidor. O processo inteiro roda dentro da página que você está olhando, em algumas dezenas de milissegundos.

Achar o artigo

Primeiro a extensão procura os contêineres óbvios em que um artigo costuma morar. Quando não existe contêiner desses – e em muito site de verdade não existe – ela recorre a medir a densidade de texto: qual bloco concentra mais texto de parágrafo que não está dentro de link. Ganha o bloco mais estreito que ainda contém quase todo esse texto.

Um bloco cujo texto é quase só rótulo de link é menu ou feed, não artigo, e é rejeitado – a não ser que tenha mais de uns 1200 caracteres de texto real, porque artigo longo legitimamente tem muito link.

Tirar a mobília

Depois saem os elementos que sabidamente não são conteúdo: navegação, banners, barras de compartilhamento, avisos de cookies, paginadores, listas de “leia também” e faixas de logotipo. Linhas repetidas são removidas, porque navegação duplicada em cada seção é a maior fonte de ruído de uma página capturada.

o que os outros clippers guardam

[Pular para o conteúdo](#main) [Entrar](/login) [Assine](/assine)
[Início](/) [Notícias](/noticias) [Esporte](/esporte) [Cultura](/cultura) [Mais](/mais)

Usamos cookies e tecnologias semelhantes para melhorar a sua experiência.
[Aceitar todos] [Gerenciar preferências]

# O artigo que você veio ler

O primeiro parágrafo de verdade do texto.

<div class="promo-inline">

## Leia também
[Outra manchete](/a) [Mais uma manchete](/b) [E uma terceira](/c)

o que sobra na nota

# O artigo que você veio ler

O primeiro parágrafo de verdade do texto.

Converter

As tabelas são serializadas pela própria extensão, e não por um plugin genérico, porque conversor genérico quebra em célula com lista ou bloco de código dentro. Os blocos de código pegam a linguagem da marcação da própria página. Os links de referência são reunidos em notas de rodapé do Markdown antes de o sanitizador tirar os ids de que elas dependem – a ordem importa, e errar nela perde todas as notas em silêncio.

Onde ele para

Em loja, feed ou página de busca não há artigo. A extensão confere o Markdown pronto: se mais de um quarto dele estiver dentro de rótulo de link, ela informa “não há artigo” em vez de te entregar trezentos links. Essa recusa é deliberada, e é por isso que a contagem de caracteres aqui é menor que a de ferramentas que devolvem alguma coisa sempre.

O que ele não faz

Perguntas

Quanto tempo leva uma captura?
Dezenas de milissegundos num artigo comum; uma página muito longa, com centenas de notas de rodapé, leva algumas centenas. O tempo aparece no canto da janela de captura.
Funciona em aplicações de página única?
Funciona. Ele lê o DOM depois da renderização, então um site de documentação feito em JavaScript é capturado do jeito que você vê.
O que é o modo de extração jsonld-articlebody?
Algumas páginas trazem o texto do artigo nos dados estruturados mas nunca terminam de renderizá-lo. Quando os dados estruturados têm bem mais texto que o DOM, a extensão usa eles e registra que fez isso.