Para quem é
Arquive a fonte antes que ela mude
Página é editada e sai do ar. Uma captura com o endereço, a data de publicação e o texto inteiro é um registro que você pode mostrar depois, e ele fica no seu disco, não num serviço que pode fechar. O campo extraction registra por onde o texto foi obtido, então a nota conta a própria procedência.
A página que mudou no meio da apuração
Você cita uma nota oficial e, três dias depois, o texto no site está diferente. Sumiu o parágrafo que sustentava a matéria, e não há aviso de correção. O link continua funcionando e apontando para outra coisa, o que é pior do que se tivesse quebrado. Sem uma cópia datada, a sua palavra vira a única prova.
A alternativa habitual é o print. Ele mostra a tela, mas não dá para buscar dentro, ocupa espaço, corta o texto que estava fora do enquadramento e não carrega o endereço nem a data. Meses depois, uma pasta com quarenta imagens numeradas é um arquivo que ninguém consulta, inclusive você.
O terceiro caso é o pior porque acontece de uma vez só: o site inteiro muda de lugar. Órgão reformula o portal, veículo migra de plataforma, blog institucional é desativado – e todos os endereços que você guardou quebram no mesmo dia. Não é uma matéria que sumiu: é o arquivo de referência de uma editoria inteira. Um acervo de texto no seu disco atravessa isso sem perceber, porque nunca dependeu de aquele endereço continuar respondendo.
O que muda no seu arquivo
- Data de publicação lida nos metadados da própria página, e não deduzida do texto
- Endereço da fonte no frontmatter de toda nota, junto com o título como estava naquele momento
- Texto integral sem a navegação e os blocos promocionais que mudam a cada visita
- Arquivo comum – sem formato proprietário, sem conta, sem serviço que possa cortar o seu acesso
- O campo
extractionregistra como o texto foi obtido, então a nota é auditável - Dá para buscar por palavra dentro de todo o arquivo, coisa que print nenhum permite
- Zero falhas e zero resto de tag HTML nas 512 páginas medidas, boa parte delas portais de grande audiência, que são os mais pesados de converter
- Tabela de dados dentro da matéria atravessa inteira: doze de quinze no corpus técnico, contra sete de cada motor comparado
--- title: "Conab divulga o balanço da safra de grãos" source: "https://agenciabrasil.ebc.com.br/economia/noticia/" author: "Agência Brasil" date: "2026-02-11T13:20:00.000Z" extraction: "jsonld-articlebody" ---
Montar o arquivo da editoria
A configuração é uma vez só e vale para todas as pautas. O que ela resolve é o problema de sempre: você precisa da cópia antes de saber que vai precisar dela.
- Instale a extensão e fixe o ícone. Confira em
chrome://extensions/shortcutsqueAlt+Shift+Mestá livre – numa apuração, capturar sem procurar o ícone é o que faz você capturar de verdade. - Aponte a pasta de destino para o diretório da editoria, e use o campo de subpasta para a pauta em andamento. Uma pasta por pauta é o que permite ler o arquivo inteiro depois, e não só pesquisar dentro dele.
- Coloque
{date}-{domain}-{title}no modelo de nome. A data da captura na frente é o que transforma duas capturas da mesma página em dois arquivos comparáveis lado a lado. - Ligue todos os campos do frontmatter,
extractioninclusive. Numa disputa sobre o que a página dizia, o caminho de extração é parte da resposta: ele diz se o texto veio da página renderizada ou dos dados estruturados. - Em o que o clique no ícone faz, escolha “salvar na pasta”. Numa apuração quente, a janela de pré-visualização é um clique a mais entre você e o registro.
- Estabeleça o gesto: capture no momento em que a fonte aparece, antes de escrever. Depois de publicado, se a página mudou, não há mais o que capturar.
Ajustes de quem apura
Estes valores partem de uma regra prática do ofício: o registro precisa existir antes da dúvida, porque depois da dúvida a página já mudou.
| Configuração | Valor | Por que esse valor aqui |
|---|---|---|
| Clique no ícone | Salvar na pasta | Numa apuração quente, cada clique a mais é um registro que não foi feito |
| Pasta e subpasta | Editoria, com subpasta por pauta | Permite ler o arquivo da pauta inteiro, e não só pesquisar dentro dele |
| Modelo de nome | `{date}-{domain}-{title}` | Duas capturas da mesma página viram dois arquivos comparáveis |
| Frontmatter | Todos os campos, `extraction` inclusive | O caminho de extração faz parte da resposta sobre o que a página dizia |
| Atalho | `Alt+Shift+M` | Capturar sem procurar o ícone é o que faz a captura acontecer |
| Imagens | Manter como link | A legenda e o crédito da foto às vezes são a informação que interessa |
--- 2026-03-04-orgao-abre-apuracao.md +++ 2026-03-25-orgao-abre-apuracao.md @@ -date: "2026-03-04T09:12:00.000Z" +date: "2026-03-04T09:12:00.000Z" @@ -A apuração vai examinar contratos assinados entre 2023 e 2025. +A apuração vai examinar contratos assinados em 2024. @@ +Atualizado em 25 de março: uma versão anterior informava período diferente.
Três momentos da apuração
A nota oficial que some do ar
Um órgão publica uma nota às onze da noite. Você captura na hora, e o arquivo cai na pasta da pauta com a data de publicação declarada, o endereço e o texto integral.
Na manhã seguinte a nota foi substituída por outra, mais curta, no mesmo endereço. Você tem as duas, com datas de captura diferentes, e a matéria pode dizer o que mudou em vez de dizer que algo mudou.
A tabela que estava dentro da matéria
Um relatório publicado como reportagem traz uma tabela de dezoito linhas com valores por município. Você seleciona a tabela e captura a seleção; ela chega como tabela GFM, com o cabeçalho no lugar.
Dali ela vai direto para a planilha da apuração sem digitação, e sem a checagem dupla que digitação exige. Onde os conversores genéricos quebram é exatamente na célula com nota de rodapé ou faixa de valores dentro.
O arquivo que responde uma pergunta de dois anos atrás
Uma editoria acumulou capturas ao longo de dois anos, cada uma com endereço, data e caminho de extração no cabeçalho. São arquivos de texto numa pasta, sem serviço nenhum no meio.
Quando aparece a pergunta “desde quando eles falam nisso”, a busca por palavra dentro da pasta responde em segundos e devolve a data de cada ocorrência. Nenhuma parte disso depende de os endereços originais ainda estarem no ar – e boa parte já não está.
Comparado com os métodos de arquivo
Cada um destes é usado em redação hoje, e vários deles em conjunto. A terceira coluna diz o que cada um cobra, sem poupar esta extensão.
| Como se registra hoje | O que fica registrado | O que custa |
|---|---|---|
| Print da tela | A aparência da página naquele momento | Não entra em busca, corta o que estava fora do enquadramento e não traz endereço |
| Serviço de arquivamento da web | A página com carimbo de tempo de terceiro | Depende do serviço aceitar a página, e material atrás de login não entra |
| Salvar a página como HTML | A página com o layout e os arquivos | Uma pasta por página, difícil de comparar e de pesquisar em conjunto |
| Copiar para um documento | O texto, com a mobília do site junto | A data de publicação se perde e a limpeza custa minutos por matéria |
| Guardar nos favoritos | Um ponteiro, imediato | O ponteiro resolve para o texto de hoje, que é justamente o que está em disputa |
| Clean Clipper | Texto integral com data, endereço e caminho de extração | Sem carimbo de tempo de terceiro, sem assinatura, sem registro da aparência – e sem monitoramento: quem captura é você |
Quando o registro sai falho
Por que a matéria veio só com os primeiros parágrafos?
Porque o resto não estava na página. Em veículo com assinatura, o texto completo só entra no DOM depois que o navegador confirma a sessão; sem isso, o que existe é a chamada. Logue, confirme na tela que a matéria está inteira e capture então. A extensão converte o que está renderizado, e nada além disso.
Por que a data continua igual se a matéria foi atualizada?
Porque o campo date traz a data de publicação declarada nos metadados, e muitos veículos mantêm essa data fixa e registram a atualização em outro lugar. Isso é uma vantagem para o arquivo: as duas capturas do mesmo endereço mantêm a data de publicação idêntica, e a diferença aparece no corpo do texto, que é onde a mudança realmente está.
Por que ele recusa a capa do portal?
Porque capa é feita de rótulo de link. Quando mais ou menos um quarto dos caracteres extraídos está dentro de link, a extensão avisa “não há artigo” em vez de devolver uma lista de manchetes. Capture a matéria em si; a capa nunca teve texto para arquivar.
Isso vale como prova de que a página dizia aquilo?
Não como prova pericial. Não há carimbo de tempo de terceiro, não há assinatura e o arquivo é editável como qualquer outro no seu computador. O que ele é: um registro de trabalho consistente, datado, com o endereço e o caminho de extração. Para validade probatória, ata notarial continua sendo o caminho, e ela custa tempo e dinheiro que nem toda pauta comporta.
O que ele não faz
Ele não substitui um arquivo da web: salva o texto, não a página como ela aparece – sem layout, sem print, sem os arquivos de mídia. Não é prova pericial: é um arquivo no seu disco, sem carimbo de tempo de terceiro e sem assinatura, então quem quiser contestar pode contestar. Não captura vídeo nem áudio. Para registro visual ou com fé pública, use um serviço de arquivamento ou uma ata notarial; para o texto e os metadados, isto é mais rápido e fica com você.
Perguntas
Isso substitui um arquivo da web?
Serve como prova?
Ele captura os comentários?
Ele registra quando eu capturei?
{date}, que é a data da captura. A data de publicação segue como campo separado, então as duas nunca se confundem.