Clean Clipper Instalar no Chrome – grátis

Para quem é

Artigos com a data de publicação de verdade

Um artigo salvo sem a data de publicação é uma citação que você vai ter que remontar depois. O Clean Clipper lê a data nos metadados da própria página, e não no texto, e quando a página não traz data o campo fica vazio em vez de receber a data de hoje. As notas de rodapé viram notas de Markdown de verdade, com as definições no fim do arquivo.

A citação que você remonta depois

Você está fechando a revisão e precisa da data de um texto que salvou há oito meses. O arquivo tem o título e tem o texto, mas a data está errada: é o dia em que você capturou, não o dia em que o artigo saiu. Como isso foi preenchido em silêncio, você nem desconfiou até bater o olho numa referência de 2019 datada de 2026. Aí não sobra alternativa: volta ao site, procura de novo, confere na mão.

O segundo problema aparece nas notas. Numa página, as referências são âncoras que pulam para o rodapé do HTML. Convertidas por um clipper comum, viram links mortos apontando para um #ref-12 que não existe no seu arquivo. Você fica com o texto sem as fontes e com o trabalho de reconstituir a lista que já estava pronta na página.

E existe o texto que muda debaixo do endereço. Preprint ganha versão nova, repositório institucional reorganiza a coleção, periódico troca de plataforma e o endereço antigo passa a redirecionar para outro lugar. A página de resumo quase sempre mostra a versão mais recente, então o trecho que você citou pode simplesmente não estar mais lá – sem aviso de correção, sem histórico visível. Uma cópia com a data que a página trazia é o que permite dizer qual versão você leu.

O que muda no seu arquivo

A data vem dos metadados da página; as notas vão para o fimscielo.br/j/rsp
---
title: "Determinantes sociais da saúde e cobertura vacinal na infância"
source: "https://www.scielo.br/j/rsp/"
date: "2023-04-28T00:00:00.000Z"
extraction: "dom"
---

A cobertura vacinal na infância é um indicador sensível ao acesso aos serviços
de atenção primária.[^3]

[^3]: BARATA, R. B. Como e por que as desigualdades sociais fazem mal à saúde.
      Rio de Janeiro: Editora Fiocruz, 2009.

Preparar para uma revisão

Uma revisão de literatura é dezenas de leituras ao longo de meses, e o que decide se elas serão citáveis depois são três campos e um nome de arquivo. Configure antes da primeira busca.

  1. Instale a extensão e abra as opções pelo botão direito no ícone. Nenhuma etapa aqui pede conta, e-mail ou cadastro.
  2. Aponte a pasta de destino para o diretório da revisão em andamento, e não para uma pasta genérica de downloads. Uma pasta por revisão é o que mantém a busca por palavra útil quando o corpus passar de cem textos.
  3. Coloque {date}-{domain}-{title} no modelo de nome de arquivo. A data da captura na frente ordena a pasta pela sua leitura, e o domínio distingue o mesmo título indexado em duas bases.
  4. Ligue todos os campos do frontmatter, inclusive author e extraction. Numa revisão, o caminho de extração é metadado de método: ele diz se o texto veio da página renderizada ou dos dados estruturados.
  5. Deixe as imagens como link, e não em “ignorar”. Gráfico e figura de artigo não são baixados de qualquer forma, mas o link preservado mantém a referência de qual figura sustentava o argumento.
  6. Capture uma página de teste do periódico que você mais usa e confira o campo date. Se vier vazio, aquela base não publica data nos metadados, e você já sabe que ali a data precisa ser anotada à mão.

Ajustes para trabalho acadêmico

Estes valores partem da exigência que separa nota de pesquisa de nota comum: cada arquivo precisa se sustentar sozinho numa citação, meses depois, sem voltar ao navegador.

ConfiguraçãoValorPor que esse valor aqui
PastaUma por revisão, dentro do projetoBusca por palavra só continua útil se o corpus tiver limite temático
Modelo de nome`{date}-{domain}-{title}`Ordena pela sua leitura e distingue o mesmo título em duas bases
FrontmatterTodos os campos ligados`extraction` é metadado de método: diz de onde o texto foi lido
ImagensManter como linkA figura não é baixada de qualquer jeito; o link preserva qual figura era
Clique no íconeAbrir a janela de capturaConferir data e autor antes de gravar custa três segundos e evita citação errada
Regra por siteBase de preprint → subpasta `preprints`Preprint ganha versão nova sem aviso e merece ficar separado do publicado
A página não publicou data, e o campo fica vazio em vez de receber hojea página de um repositório institucional, sem data nos metadados
---
title: "Cobertura vacinal e desigualdade territorial em municípios de pequeno porte"
source: "https://repositorio.exemplo.br/handle/123456789/4821"
author: "M. Ilves, R. Okonkwo"
date: ""
extraction: "jsonld-articlebody"
---

## Resumo

A concordância entre as bases caiu abaixo de 0,90 nos municípios com menos de
vinte mil habitantes, enquanto as capitais mantiveram convergência em todas as
séries analisadas.

Três momentos da revisão

A triagem de sessenta resumos numa tarde

Você roda a busca na base, abre os resultados em abas e vai lendo resumo por resumo. O que passa na triagem é capturado com Alt+Shift+M antes de a aba fechar. Cada arquivo cai na pasta da revisão com título, autores, endereço e a data que a página declarou.

No fim da tarde a pasta tem os que passaram, e não trinta abas mais uma planilha de links. A busca por palavra dentro da pasta responde “quais destes falam de coorte retrospectiva” sem abrir nenhum deles de novo.

A tabela do material suplementar

O dado que sustenta o seu argumento está numa tabela do material suplementar, publicada em HTML fora do PDF. Você seleciona a tabela e captura só a seleção; ela chega como tabela GFM, com o cabeçalho no lugar e as notas de rodapé preservadas.

No corpus de quinze tabelas este serializador manteve doze, contra sete de cada motor comparado. As que quebram os conversores genéricos são justamente estas: célula com lista, com nota ou com faixa de valores dentro.

A citação conferida oito meses depois

Na revisão final, o parecerista questiona um número. Você abre o arquivo capturado, confere o trecho, e o campo source leva ao endereço exato. O campo date mostra a data que a página trazia quando você leu, separada da data em que você capturou.

O endereço no ar agora serve uma versão posterior do preprint, com aquele número corrigido. A captura mostra o que estava publicado no momento da leitura, e a nota de rodapé sobre a mudança passa a ser uma frase honesta em vez de uma discussão sem prova.

Comparado com o método atual

Cada uma destas rotas é usada por alguém em algum grupo de pesquisa agora. A terceira coluna diz o que cada uma cobra, sem abrir exceção para esta extensão.

Como se guarda hojeO que fica guardadoO que custa
Baixar o PDFO artigo como publicado, paginadoNão entra em busca por palavra com as suas ferramentas, e o material em HTML fica de fora
Guardar o DOI ou o endereçoUm ponteiro estávelO ponteiro resolve para a versão de hoje, que pode não ser a que você leu
Copiar e colar no editorO texto, com o menu do periódico juntoNotas de rodapé viram âncora morta e a data se perde no caminho
Imprimir em PDFUma cópia com o layout congeladoSem metadado separado, sem busca dentro de várias, e o banner de cookies vai junto
Gerenciador de referênciasMetadado bem organizado e citação formatadaGuarda a ficha, não o texto: o parágrafo que você queria reler continua no site
Clean ClipperMarkdown com endereço, data, autor e notas de rodapé de verdadeNão gera ABNT nem APA, não fala com gerenciador, e é a página HTML, não o PDF

Quando a nota sai incompleta

Por que o campo date ficou vazio?

Porque a página não declarou data nos metadados. A extensão lê citation_date, citation_publication_date, datePublished do JSON-LD, article:published_time e time[datetime], e quando nada disso existe ela deixa em branco. Preencher com o dia da captura transformaria a sua revisão num lugar onde um dado errado entrou calado, e esse é o pior tipo de erro num corpus de citações.

Por que veio só o resumo, e não o artigo?

Porque o texto completo daquele periódico está no PDF, e a página em HTML só tem o resumo. A extensão trabalha sobre o DOM: quando a página é um visualizador de PDF embutido, não há texto no DOM para extrair. Baixe o PDF pelo próprio site e capture a página de resumo para o registro dos metadados.

Por que o campo author veio vazio ou estranho?

A extensão lê a autoria dos dados estruturados e das assinaturas da página, e filtra os falsos positivos conhecidos: nome do periódico, título de seção e rótulo de botão. Quando nada passa no filtro, o campo fica vazio. Em base que publica os autores só dentro de uma tabela de metadados na página, é comum ficar em branco mesmo com os nomes visíveis na tela.

Por que as notas de rodapé não estão funcionando na minha nota?

Elas viram notas de rodapé padrão do Markdown, com [^1] no texto e as definições no fim do arquivo. Quem transforma isso em link é o renderizador: o Obsidian e a maioria dos leitores fazem, mas editor de texto simples mostra a sintaxe crua. Quando a página usava âncora para um rodapé que não estava no corpo extraído, a definição pode faltar, e aí o [^1] fica sem par.

Os limites, ditos na cara

Ele não gera referência formatada em ABNT, APA ou Vancouver, e não fala com Zotero nem com Mendeley: o que sai é Markdown com metadados no frontmatter. Não baixa PDF – numa página que é só um leitor de PDF embutido não há texto no DOM para extrair. Não lê fórmula em imagem, que continua como link de imagem. E quando o periódico não publica data nos metadados, o campo fica vazio, porque preencher com o dia da captura seria inventar dado dentro da sua revisão.

Instalar no Chrome – grátisExtensão gratuita por inteiro, sem conta e sem cadastro.

Perguntas

E se a página não tiver data de publicação?
O campo fica vazio. Preencher com o dia em que você capturou é pior que deixar em branco, porque vira dado errado calado no meio das suas notas.
As notas de rodapé continuam funcionando depois da captura?
Continuam. Viram notas de rodapé padrão do Markdown, que o Obsidian e a maioria dos renderizadores transformam em links funcionais dentro da própria nota.
Dá para capturar artigo atrás do login da universidade?
Dá, porque ele lê a página que o seu navegador já renderizou. Se você está vendo na tela, dá para capturar.
Ele baixa o PDF do artigo?
Não. Ele trabalha com o HTML da página. Em periódico que publica a versão em HTML, o texto vem inteiro; quando só existe PDF, baixe o PDF pelo próprio site.
Serve para material suplementar com tabela grande?
Serve. As tabelas são serializadas pela própria extensão, e num corpus de quinze tabelas ela manteve doze, contra sete de cada motor comparado.
Ele gera referência em ABNT ou APA?
Não. O que sai é metadado bruto no frontmatter: título, autores, endereço e data. A formatação continua sendo do seu editor ou do seu gerenciador de referências, e o arquivo traz tudo que eles precisam receber.
Dá para exportar as capturas para um gerenciador de referências?
Não existe integração direta. Os arquivos são Markdown com YAML, então quem quiser montar um script de conversão tem todos os campos ali; o que a extensão não faz é falar com esses programas por conta própria.
Como eu diferencio a data de publicação da data em que eu capturei?
São coisas separadas por construção. A data de publicação vive no campo date do frontmatter e vem da página; a data da captura entra no nome do arquivo pelo {date} do modelo. Uma nunca é escrita no lugar da outra.
Fórmula matemática sobrevive?
Depende de como o periódico publica. Fórmula em texto, inclusive quando marcada em MathML, chega como texto; fórmula desenhada em imagem continua sendo link de imagem, e some de vez se você tiver colocado imagens em “ignorar”.
Isso serve para registrar a data de acesso exigida na norma?
Serve como registro do seu lado: o arquivo tem a data da captura no nome e a data de publicação no cabeçalho. O que ele não é: um carimbo de tempo de terceiro. É um arquivo seu, editável como qualquer outro no seu computador.