Para quem é
Artigos com a data de publicação de verdade
Um artigo salvo sem a data de publicação é uma citação que você vai ter que remontar depois. O Clean Clipper lê a data nos metadados da própria página, e não no texto, e quando a página não traz data o campo fica vazio em vez de receber a data de hoje. As notas de rodapé viram notas de Markdown de verdade, com as definições no fim do arquivo.
A citação que você remonta depois
Você está fechando a revisão e precisa da data de um texto que salvou há oito meses. O arquivo tem o título e tem o texto, mas a data está errada: é o dia em que você capturou, não o dia em que o artigo saiu. Como isso foi preenchido em silêncio, você nem desconfiou até bater o olho numa referência de 2019 datada de 2026. Aí não sobra alternativa: volta ao site, procura de novo, confere na mão.
O segundo problema aparece nas notas. Numa página, as referências são âncoras que pulam para o rodapé do HTML. Convertidas por um clipper comum, viram links mortos apontando para um #ref-12 que não existe no seu arquivo. Você fica com o texto sem as fontes e com o trabalho de reconstituir a lista que já estava pronta na página.
E existe o texto que muda debaixo do endereço. Preprint ganha versão nova, repositório institucional reorganiza a coleção, periódico troca de plataforma e o endereço antigo passa a redirecionar para outro lugar. A página de resumo quase sempre mostra a versão mais recente, então o trecho que você citou pode simplesmente não estar mais lá – sem aviso de correção, sem histórico visível. Uma cópia com a data que a página trazia é o que permite dizer qual versão você leu.
O que muda no seu arquivo
- Lê
citation_dateecitation_publication_date– as meta tags que arXiv, PubMed e IEEE publicam - Também JSON-LD
datePublished,article:published_time,time[datetime]e marcas Unix - Página sem data significa campo vazio, nunca a data de hoje disfarçada de data de publicação
- Links de referência viram notas
[^1]com as definições no fim da nota, e não âncoras mortas - O autor passa por filtro: título de seção e rótulo de botão não acabam no campo author
- O endereço da fonte entra no frontmatter, então a nota se sustenta sozinha numa citação
- Tabela de material suplementar atravessa a conversão: doze de quinze no corpus técnico, contra sete de cada motor comparado
- A extração roda sobre a página que o seu navegador já renderizou, então artigo aberto pelo acesso da universidade captura igual a um artigo em acesso livre
---
title: "Determinantes sociais da saúde e cobertura vacinal na infância"
source: "https://www.scielo.br/j/rsp/"
date: "2023-04-28T00:00:00.000Z"
extraction: "dom"
---
A cobertura vacinal na infância é um indicador sensível ao acesso aos serviços
de atenção primária.[^3]
[^3]: BARATA, R. B. Como e por que as desigualdades sociais fazem mal à saúde.
Rio de Janeiro: Editora Fiocruz, 2009.Preparar para uma revisão
Uma revisão de literatura é dezenas de leituras ao longo de meses, e o que decide se elas serão citáveis depois são três campos e um nome de arquivo. Configure antes da primeira busca.
- Instale a extensão e abra as opções pelo botão direito no ícone. Nenhuma etapa aqui pede conta, e-mail ou cadastro.
- Aponte a pasta de destino para o diretório da revisão em andamento, e não para uma pasta genérica de downloads. Uma pasta por revisão é o que mantém a busca por palavra útil quando o corpus passar de cem textos.
- Coloque
{date}-{domain}-{title}no modelo de nome de arquivo. A data da captura na frente ordena a pasta pela sua leitura, e o domínio distingue o mesmo título indexado em duas bases. - Ligue todos os campos do frontmatter, inclusive
authoreextraction. Numa revisão, o caminho de extração é metadado de método: ele diz se o texto veio da página renderizada ou dos dados estruturados. - Deixe as imagens como link, e não em “ignorar”. Gráfico e figura de artigo não são baixados de qualquer forma, mas o link preservado mantém a referência de qual figura sustentava o argumento.
- Capture uma página de teste do periódico que você mais usa e confira o campo
date. Se vier vazio, aquela base não publica data nos metadados, e você já sabe que ali a data precisa ser anotada à mão.
Ajustes para trabalho acadêmico
Estes valores partem da exigência que separa nota de pesquisa de nota comum: cada arquivo precisa se sustentar sozinho numa citação, meses depois, sem voltar ao navegador.
| Configuração | Valor | Por que esse valor aqui |
|---|---|---|
| Pasta | Uma por revisão, dentro do projeto | Busca por palavra só continua útil se o corpus tiver limite temático |
| Modelo de nome | `{date}-{domain}-{title}` | Ordena pela sua leitura e distingue o mesmo título em duas bases |
| Frontmatter | Todos os campos ligados | `extraction` é metadado de método: diz de onde o texto foi lido |
| Imagens | Manter como link | A figura não é baixada de qualquer jeito; o link preserva qual figura era |
| Clique no ícone | Abrir a janela de captura | Conferir data e autor antes de gravar custa três segundos e evita citação errada |
| Regra por site | Base de preprint → subpasta `preprints` | Preprint ganha versão nova sem aviso e merece ficar separado do publicado |
--- title: "Cobertura vacinal e desigualdade territorial em municípios de pequeno porte" source: "https://repositorio.exemplo.br/handle/123456789/4821" author: "M. Ilves, R. Okonkwo" date: "" extraction: "jsonld-articlebody" --- ## Resumo A concordância entre as bases caiu abaixo de 0,90 nos municípios com menos de vinte mil habitantes, enquanto as capitais mantiveram convergência em todas as séries analisadas.
Três momentos da revisão
A triagem de sessenta resumos numa tarde
Você roda a busca na base, abre os resultados em abas e vai lendo resumo por resumo. O que passa na triagem é capturado com Alt+Shift+M antes de a aba fechar. Cada arquivo cai na pasta da revisão com título, autores, endereço e a data que a página declarou.
No fim da tarde a pasta tem os que passaram, e não trinta abas mais uma planilha de links. A busca por palavra dentro da pasta responde “quais destes falam de coorte retrospectiva” sem abrir nenhum deles de novo.
A tabela do material suplementar
O dado que sustenta o seu argumento está numa tabela do material suplementar, publicada em HTML fora do PDF. Você seleciona a tabela e captura só a seleção; ela chega como tabela GFM, com o cabeçalho no lugar e as notas de rodapé preservadas.
No corpus de quinze tabelas este serializador manteve doze, contra sete de cada motor comparado. As que quebram os conversores genéricos são justamente estas: célula com lista, com nota ou com faixa de valores dentro.
A citação conferida oito meses depois
Na revisão final, o parecerista questiona um número. Você abre o arquivo capturado, confere o trecho, e o campo source leva ao endereço exato. O campo date mostra a data que a página trazia quando você leu, separada da data em que você capturou.
O endereço no ar agora serve uma versão posterior do preprint, com aquele número corrigido. A captura mostra o que estava publicado no momento da leitura, e a nota de rodapé sobre a mudança passa a ser uma frase honesta em vez de uma discussão sem prova.
Comparado com o método atual
Cada uma destas rotas é usada por alguém em algum grupo de pesquisa agora. A terceira coluna diz o que cada uma cobra, sem abrir exceção para esta extensão.
| Como se guarda hoje | O que fica guardado | O que custa |
|---|---|---|
| Baixar o PDF | O artigo como publicado, paginado | Não entra em busca por palavra com as suas ferramentas, e o material em HTML fica de fora |
| Guardar o DOI ou o endereço | Um ponteiro estável | O ponteiro resolve para a versão de hoje, que pode não ser a que você leu |
| Copiar e colar no editor | O texto, com o menu do periódico junto | Notas de rodapé viram âncora morta e a data se perde no caminho |
| Imprimir em PDF | Uma cópia com o layout congelado | Sem metadado separado, sem busca dentro de várias, e o banner de cookies vai junto |
| Gerenciador de referências | Metadado bem organizado e citação formatada | Guarda a ficha, não o texto: o parágrafo que você queria reler continua no site |
| Clean Clipper | Markdown com endereço, data, autor e notas de rodapé de verdade | Não gera ABNT nem APA, não fala com gerenciador, e é a página HTML, não o PDF |
Quando a nota sai incompleta
Por que o campo date ficou vazio?
Porque a página não declarou data nos metadados. A extensão lê citation_date, citation_publication_date, datePublished do JSON-LD, article:published_time e time[datetime], e quando nada disso existe ela deixa em branco. Preencher com o dia da captura transformaria a sua revisão num lugar onde um dado errado entrou calado, e esse é o pior tipo de erro num corpus de citações.
Por que veio só o resumo, e não o artigo?
Porque o texto completo daquele periódico está no PDF, e a página em HTML só tem o resumo. A extensão trabalha sobre o DOM: quando a página é um visualizador de PDF embutido, não há texto no DOM para extrair. Baixe o PDF pelo próprio site e capture a página de resumo para o registro dos metadados.
Por que o campo author veio vazio ou estranho?
A extensão lê a autoria dos dados estruturados e das assinaturas da página, e filtra os falsos positivos conhecidos: nome do periódico, título de seção e rótulo de botão. Quando nada passa no filtro, o campo fica vazio. Em base que publica os autores só dentro de uma tabela de metadados na página, é comum ficar em branco mesmo com os nomes visíveis na tela.
Por que as notas de rodapé não estão funcionando na minha nota?
Elas viram notas de rodapé padrão do Markdown, com [^1] no texto e as definições no fim do arquivo. Quem transforma isso em link é o renderizador: o Obsidian e a maioria dos leitores fazem, mas editor de texto simples mostra a sintaxe crua. Quando a página usava âncora para um rodapé que não estava no corpo extraído, a definição pode faltar, e aí o [^1] fica sem par.
Os limites, ditos na cara
Ele não gera referência formatada em ABNT, APA ou Vancouver, e não fala com Zotero nem com Mendeley: o que sai é Markdown com metadados no frontmatter. Não baixa PDF – numa página que é só um leitor de PDF embutido não há texto no DOM para extrair. Não lê fórmula em imagem, que continua como link de imagem. E quando o periódico não publica data nos metadados, o campo fica vazio, porque preencher com o dia da captura seria inventar dado dentro da sua revisão.
Perguntas
E se a página não tiver data de publicação?
As notas de rodapé continuam funcionando depois da captura?
Dá para capturar artigo atrás do login da universidade?
Ele baixa o PDF do artigo?
Serve para material suplementar com tabela grande?
Ele gera referência em ABNT ou APA?
Dá para exportar as capturas para um gerenciador de referências?
Como eu diferencio a data de publicação da data em que eu capturei?
date do frontmatter e vem da página; a data da captura entra no nome do arquivo pelo {date} do modelo. Uma nunca é escrita no lugar da outra.