Clean Clipper Instalar no Chrome – grátis

Para quem é

Arquive a fonte antes que ela mude

Página é editada e sai do ar. Uma captura com o endereço, a data de publicação e o texto inteiro é um registro que você pode mostrar depois, e ele fica no seu disco, não num serviço que pode fechar. O campo extraction registra por onde o texto foi obtido, então a nota conta a própria procedência.

A página que mudou no meio da apuração

Você cita uma nota oficial e, três dias depois, o texto no site está diferente. Sumiu o parágrafo que sustentava a matéria, e não há aviso de correção. O link continua funcionando e apontando para outra coisa, o que é pior do que se tivesse quebrado. Sem uma cópia datada, a sua palavra vira a única prova.

A alternativa habitual é o print. Ele mostra a tela, mas não dá para buscar dentro, ocupa espaço, corta o texto que estava fora do enquadramento e não carrega o endereço nem a data. Meses depois, uma pasta com quarenta imagens numeradas é um arquivo que ninguém consulta, inclusive você.

O terceiro caso é o pior porque acontece de uma vez só: o site inteiro muda de lugar. Órgão reformula o portal, veículo migra de plataforma, blog institucional é desativado – e todos os endereços que você guardou quebram no mesmo dia. Não é uma matéria que sumiu: é o arquivo de referência de uma editoria inteira. Um acervo de texto no seu disco atravessa isso sem perceber, porque nunca dependeu de aquele endereço continuar respondendo.

O que muda no seu arquivo

O campo extraction registra por onde o texto veioagenciabrasil.ebc.com.br
---
title: "Conab divulga o balanço da safra de grãos"
source: "https://agenciabrasil.ebc.com.br/economia/noticia/"
author: "Agência Brasil"
date: "2026-02-11T13:20:00.000Z"
extraction: "jsonld-articlebody"
---

Montar o arquivo da editoria

A configuração é uma vez só e vale para todas as pautas. O que ela resolve é o problema de sempre: você precisa da cópia antes de saber que vai precisar dela.

  1. Instale a extensão e fixe o ícone. Confira em chrome://extensions/shortcuts que Alt+Shift+M está livre – numa apuração, capturar sem procurar o ícone é o que faz você capturar de verdade.
  2. Aponte a pasta de destino para o diretório da editoria, e use o campo de subpasta para a pauta em andamento. Uma pasta por pauta é o que permite ler o arquivo inteiro depois, e não só pesquisar dentro dele.
  3. Coloque {date}-{domain}-{title} no modelo de nome. A data da captura na frente é o que transforma duas capturas da mesma página em dois arquivos comparáveis lado a lado.
  4. Ligue todos os campos do frontmatter, extraction inclusive. Numa disputa sobre o que a página dizia, o caminho de extração é parte da resposta: ele diz se o texto veio da página renderizada ou dos dados estruturados.
  5. Em o que o clique no ícone faz, escolha “salvar na pasta”. Numa apuração quente, a janela de pré-visualização é um clique a mais entre você e o registro.
  6. Estabeleça o gesto: capture no momento em que a fonte aparece, antes de escrever. Depois de publicado, se a página mudou, não há mais o que capturar.

Ajustes de quem apura

Estes valores partem de uma regra prática do ofício: o registro precisa existir antes da dúvida, porque depois da dúvida a página já mudou.

ConfiguraçãoValorPor que esse valor aqui
Clique no íconeSalvar na pastaNuma apuração quente, cada clique a mais é um registro que não foi feito
Pasta e subpastaEditoria, com subpasta por pautaPermite ler o arquivo da pauta inteiro, e não só pesquisar dentro dele
Modelo de nome`{date}-{domain}-{title}`Duas capturas da mesma página viram dois arquivos comparáveis
FrontmatterTodos os campos, `extraction` inclusiveO caminho de extração faz parte da resposta sobre o que a página dizia
Atalho`Alt+Shift+M`Capturar sem procurar o ícone é o que faz a captura acontecer
ImagensManter como linkA legenda e o crédito da foto às vezes são a informação que interessa
Duas capturas do mesmo endereço, com três semanas de distânciacomparação entre dois arquivos da mesma página
--- 2026-03-04-orgao-abre-apuracao.md
+++ 2026-03-25-orgao-abre-apuracao.md
@@
-date: "2026-03-04T09:12:00.000Z"
+date: "2026-03-04T09:12:00.000Z"
@@
-A apuração vai examinar contratos assinados entre 2023 e 2025.
+A apuração vai examinar contratos assinados em 2024.
@@
+Atualizado em 25 de março: uma versão anterior informava período diferente.

Três momentos da apuração

A nota oficial que some do ar

Um órgão publica uma nota às onze da noite. Você captura na hora, e o arquivo cai na pasta da pauta com a data de publicação declarada, o endereço e o texto integral.

Na manhã seguinte a nota foi substituída por outra, mais curta, no mesmo endereço. Você tem as duas, com datas de captura diferentes, e a matéria pode dizer o que mudou em vez de dizer que algo mudou.

A tabela que estava dentro da matéria

Um relatório publicado como reportagem traz uma tabela de dezoito linhas com valores por município. Você seleciona a tabela e captura a seleção; ela chega como tabela GFM, com o cabeçalho no lugar.

Dali ela vai direto para a planilha da apuração sem digitação, e sem a checagem dupla que digitação exige. Onde os conversores genéricos quebram é exatamente na célula com nota de rodapé ou faixa de valores dentro.

O arquivo que responde uma pergunta de dois anos atrás

Uma editoria acumulou capturas ao longo de dois anos, cada uma com endereço, data e caminho de extração no cabeçalho. São arquivos de texto numa pasta, sem serviço nenhum no meio.

Quando aparece a pergunta “desde quando eles falam nisso”, a busca por palavra dentro da pasta responde em segundos e devolve a data de cada ocorrência. Nenhuma parte disso depende de os endereços originais ainda estarem no ar – e boa parte já não está.

Comparado com os métodos de arquivo

Cada um destes é usado em redação hoje, e vários deles em conjunto. A terceira coluna diz o que cada um cobra, sem poupar esta extensão.

Como se registra hojeO que fica registradoO que custa
Print da telaA aparência da página naquele momentoNão entra em busca, corta o que estava fora do enquadramento e não traz endereço
Serviço de arquivamento da webA página com carimbo de tempo de terceiroDepende do serviço aceitar a página, e material atrás de login não entra
Salvar a página como HTMLA página com o layout e os arquivosUma pasta por página, difícil de comparar e de pesquisar em conjunto
Copiar para um documentoO texto, com a mobília do site juntoA data de publicação se perde e a limpeza custa minutos por matéria
Guardar nos favoritosUm ponteiro, imediatoO ponteiro resolve para o texto de hoje, que é justamente o que está em disputa
Clean ClipperTexto integral com data, endereço e caminho de extraçãoSem carimbo de tempo de terceiro, sem assinatura, sem registro da aparência – e sem monitoramento: quem captura é você

Quando o registro sai falho

Por que a matéria veio só com os primeiros parágrafos?

Porque o resto não estava na página. Em veículo com assinatura, o texto completo só entra no DOM depois que o navegador confirma a sessão; sem isso, o que existe é a chamada. Logue, confirme na tela que a matéria está inteira e capture então. A extensão converte o que está renderizado, e nada além disso.

Por que a data continua igual se a matéria foi atualizada?

Porque o campo date traz a data de publicação declarada nos metadados, e muitos veículos mantêm essa data fixa e registram a atualização em outro lugar. Isso é uma vantagem para o arquivo: as duas capturas do mesmo endereço mantêm a data de publicação idêntica, e a diferença aparece no corpo do texto, que é onde a mudança realmente está.

Por que ele recusa a capa do portal?

Porque capa é feita de rótulo de link. Quando mais ou menos um quarto dos caracteres extraídos está dentro de link, a extensão avisa “não há artigo” em vez de devolver uma lista de manchetes. Capture a matéria em si; a capa nunca teve texto para arquivar.

Isso vale como prova de que a página dizia aquilo?

Não como prova pericial. Não há carimbo de tempo de terceiro, não há assinatura e o arquivo é editável como qualquer outro no seu computador. O que ele é: um registro de trabalho consistente, datado, com o endereço e o caminho de extração. Para validade probatória, ata notarial continua sendo o caminho, e ela custa tempo e dinheiro que nem toda pauta comporta.

O que ele não faz

Ele não substitui um arquivo da web: salva o texto, não a página como ela aparece – sem layout, sem print, sem os arquivos de mídia. Não é prova pericial: é um arquivo no seu disco, sem carimbo de tempo de terceiro e sem assinatura, então quem quiser contestar pode contestar. Não captura vídeo nem áudio. Para registro visual ou com fé pública, use um serviço de arquivamento ou uma ata notarial; para o texto e os metadados, isto é mais rápido e fica com você.

Instalar no Chrome – grátisExtensão gratuita por inteiro, sem conta e sem cadastro.

Perguntas

Isso substitui um arquivo da web?
Não. Ele salva o texto, não a página como ela aparece. Para registro visual use um serviço de arquivamento; para o texto e os metadados isto é mais rápido e fica no seu disco.
Serve como prova?
Serve como registro de trabalho, não como prova pericial. Não há carimbo de tempo de um terceiro nem assinatura: é um arquivo seu, com a data que a página trazia e o endereço de onde veio.
Ele captura os comentários?
No Reddit, sim – como uma thread compacta com a pontuação de cada comentário. Fora dali, comentário é tratado como mobília da página e é cortado.
Ele registra quando eu capturei?
O modelo de nome de arquivo aceita {date}, que é a data da captura. A data de publicação segue como campo separado, então as duas nunca se confundem.
Funciona em portal de notícia pesado, com muito anúncio?
Funciona. Nas 512 páginas medidas, boa parte é portal de grande audiência: zero falhas e zero resto de tag HTML na saída.
Dá para comparar duas capturas da mesma página?
Dá, com qualquer ferramenta de comparação de texto, inclusive a do seu editor. Como os dois arquivos são texto puro com a mesma estrutura, a comparação mostra o parágrafo alterado e não o layout que mudou em volta.
A extensão avisa quando a página muda?
Não. Não existe monitoramento, alerta nem fila: quem decide o momento de capturar é você. O que ela garante é que o momento capturado fica registrado do jeito que estava.
O que exatamente significa `extraction: "jsonld-articlebody"`?
Que o texto veio dos dados estruturados da página, e não do corpo renderizado – acontece quando o site publica a matéria nos metadados mas não termina de desenhar na tela. Vale registrar porque as duas versões às vezes divergem, e num arquivo jornalístico essa diferença é informação.
Ele captura os comentários da matéria?
No Reddit, sim, com a estrutura e a pontuação de cada comentário. Nos demais sites, comentário é tratado como mobília da página e fica de fora, porque na maioria dos portais aquele bloco carrega depois e muda a cada visita.
Dá para arquivar material de sistema interno da redação?
Dá, desde que abra no navegador com você logado. A extensão lê a página já renderizada para a sua sessão e não faz requisição de rede nenhuma, então nada daquele sistema sai da sua máquina.