Extensão do Chrome
Salvar página web em Markdown que você não precisa limpar
Um clique salva a página web em Markdown já pronto: título, autor, data de publicação e endereço da fonte entram no frontmatter, e o texto chega sem a navegação, sem o aviso de cookies e sem a lista de “leia também”. Tudo acontece dentro do seu navegador – sem conta, sem servidor, sem telemetria.

O problema nunca é a conversão. É tudo o que vem junto.
Todo clipper transforma HTML em Markdown. Aí você abre a nota e encontra o aviso de cookies, o menu lateral, uma lista de “leia também” e uma tabela que desabou no caminho. O Clean Clipper foi construído em volta de tirar exatamente isso, e essa remoção está medida, não prometida.
o que os outros clippers guardam
[Pular para o conteúdo](#main) [Entrar](/login) [Assine](/assine) [Início](/) [Notícias](/noticias) [Esporte](/esporte) [Cultura](/cultura) [Mais](/mais) Usamos cookies e tecnologias semelhantes para melhorar a sua experiência. [Aceitar todos] [Gerenciar preferências] # O artigo que você veio ler O primeiro parágrafo de verdade do texto. <div class="promo-inline"> ## Leia também [Outra manchete](/a) [Mais uma manchete](/b) [E uma terceira](/c)
o que sobra na nota
# O artigo que você veio ler O primeiro parágrafo de verdade do texto.
O que deixa a saída limpa
- O código mantém a linguagem. O bloco sai marcado como
js, e não pelado, então o destaque de sintaxe funciona no instante em que você cola. - As tabelas ficam inteiras. Célula com código ou lista dentro não quebra mais a linha.
- As notas de rodapé funcionam de verdade. Links de referência viram
[^1]com as definições no fim da nota, e não âncoras mortas. - A data é lida, não adivinhada. JSON-LD,
article:published_time,citation_date(o padrão de arXiv, PubMed e IEEE),time[datetime], marcas Unix. Página sem data significa campo vazio, nunca a data de hoje. - Menus, banners e “leia também” são cortados. Faixas de logotipo, paginadores e a navegação repetida em cada seção não chegam à nota.
- Nenhum resto de tag. Nada de
divoutablelargados no meio do seu texto.
---
title: "Cadeia de Markov – Wikipédia, a enciclopédia livre"
source: "https://pt.wikipedia.org/wiki/Cadeia_de_Markov"
date: "2004-11-19T14:38:02.000Z"
extraction: "dom"
---
Uma cadeia de Markov é um processo estocástico em que a probabilidade de cada
evento depende apenas do estado atingido no evento anterior.[^1]
[^1]: Markov, A. A. (1906). Extensão da lei dos grandes números a grandezas
dependentes entre si. Kazan, 2ª série, tomo 15.Medido em 512 páginas dos sites mais acessados do mundo
Foram duas rodadas. A primeira pegou 109 páginas das cem mais acessadas do mundo e da Rússia e comparou a saída com três outros motores de extração. A segunda pegou os cinquenta sites mais acessados de cada um de doze países europeus – mais 403 páginas, cada uma capturada no idioma do país.
Para onde ele salva
- Copiar o Markdown para a área de transferência
- Baixar o arquivo
.md - Gravar numa pasta que você escolheu no disco
- Gravar direto no seu vault do Obsidian – sem plugin, sem REST API local, sem esquema de URI; o arquivo simplesmente aparece
O clique no ícone é configurável. Deixe como janela de prévia, ou faça um clique só largar a nota no vault sem abrir nada.

Honesto sobre a origem
Toda nota é carimbada com um campo extraction. dom quer dizer que o texto veio do que o navegador de fato renderizou. jsonld-articlebody quer dizer que a página nunca terminou de renderizar e o corpo teve que ser lido dos dados estruturados dela mesma. E quando não há artigo nenhum na página – uma loja, um feed, uma busca – a extensão diz isso em vez de despejar trezentos links na sua frente.
Quinze jeitos de usar isso
DesenvolvedoresO bloco de código mantém a marca da linguagem, e a documentação colada já sai com destaque.
Documentação é quase toda código, e é justamente essa parte que a maioria dos clippers perde. O Clean Clipper lê a linguagem na própria página – na classe do bloco, no elemento pai ou na marcação do destacador de sintaxe – e escreve isso no bloco. Num corpus técnico de nove páginas a marca sobreviveu em 73 de 156 blocos, contra 20 e 0 dos dois motores comparados.
- O bloco sai como ```js, e não pelado – o destaque funciona no Obsidian, no VS Code e no GitHub assim que você cola
- A linguagem vem da própria página: da classe do bloco, do elemento pai ou da marcação do destacador, nunca de um chute em cima do código
- Tabela de parâmetros com código, lista ou link dentro da célula não desaba mais em uma linha só
Quem usa ObsidianEscolha uma pasta dentro do vault e um clique grava a nota lá. O Obsidian nem precisa estar aberto.
Quase todo caminho até o Obsidian passa por um plugin da comunidade, uma REST API local ou um esquema de URI, e cada um deles é mais uma peça para manter funcionando. O Clean Clipper grava o arquivo sozinho, numa pasta à qual você deu acesso uma vez, usando a File System Access API do navegador. O arquivo simplesmente aparece lá.
- Sem plugin, sem servidor local, sem links
obsidian://– a extensão grava o arquivo ela mesma - O Obsidian não precisa estar aberto: o arquivo já está lá quando você abrir
- Frontmatter YAML com title, source, author, data e método de extração, e você escolhe o que fica
Fluxos com IA e LLMNavegação repetida é contexto jogado fora. O corte acontece antes de o texto chegar ao modelo.
Quando você cola uma página web num modelo, cada linha de menu repetida, cada aviso de cookies e cada lista de “leia também” entra na conta como contexto e ainda disputa a atenção do modelo. Num corpus de 109 páginas o Clean Clipper deixou 102 linhas de navegação duplicadas, contra 282, 478 e 491 dos três outros motores medidos.
- Quatro vezes menos navegação duplicada que a média dos motores comparados
- Zero resto de tag HTML nas 512 páginas medidas – o modelo não precisa contornar marcação solta
- O frontmatter YAML entrega o endereço da fonte e a data de publicação de forma explícita, sem o modelo precisar deduzir
PesquisadoresLê citation_date, o padrão de arXiv, PubMed e IEEE, e leva as notas de rodapé para o fim da nota.
Um artigo salvo sem a data de publicação é uma citação que você vai ter que remontar depois. O Clean Clipper lê a data nos metadados da própria página, e não no texto, e quando a página não traz data o campo fica vazio em vez de receber a data de hoje. As notas de rodapé viram notas de Markdown de verdade, com as definições no fim do arquivo.
- Lê
citation_dateecitation_publication_date– as meta tags que arXiv, PubMed e IEEE publicam - Também JSON-LD
datePublished,article:published_time,time[datetime]e marcas Unix - Página sem data significa campo vazio, nunca a data de hoje disfarçada de data de publicação
EstudantesCapture aulas, capítulos e páginas de referência em arquivos Markdown que ficam com você.
Material de disciplina some quando o semestre acaba e os links apodrecem. Arquivos Markdown no seu próprio disco não somem, abrem em qualquer editor daqui a dez anos e funcionam sem internet. Cada nota já sai com o endereço da fonte, então citar depois não dá trabalho de procurar.
- Selecione um trecho e só a seleção é capturada – bom para guardar uma definição ou uma citação
- Toda nota carrega o endereço da fonte, então citar depois não dá trabalho de procurar
- Funciona com Obsidian, Logseq, Joplin ou uma pasta de arquivos comum no seu computador
EscritoresCada captura guarda a fonte, o autor e a data, então a citação nunca perde a origem.
Pesquisa guardada em print de tela ou em favorito deixa de servir na hora em que você precisa dar o crédito. O Clean Clipper salva o texto do artigo em Markdown com título, autor, data de publicação e endereço no frontmatter, num arquivo que é seu. A citação chega ao texto final com a origem colada nela.
- Título, autor, data de publicação e endereço da fonte no frontmatter de toda nota
- O texto do artigo sem a navegação, pronto para você tirar a citação de dentro
- Captura por seleção quando você quer só um parágrafo, e não a matéria inteira
JornalistasRegistre a página como você viu, com a data de publicação, num formato que dura mais que o site.
Página é editada e sai do ar. Uma captura com o endereço, a data de publicação e o texto inteiro é um registro que você pode mostrar depois, e ele fica no seu disco, não num serviço que pode fechar. O campo extraction registra por onde o texto foi obtido, então a nota conta a própria procedência.
- Data de publicação lida nos metadados da própria página, e não deduzida do texto
- Endereço da fonte no frontmatter de toda nota, junto com o título como estava naquele momento
- Texto integral sem a navegação e os blocos promocionais que mudam a cada visita
Trabalho jurídicoO texto como foi publicado, com o endereço da fonte e a data, num arquivo que é seu.
Norma, termos de uso e orientação de órgão mudam sem aviso. Uma cópia em Markdown com o endereço de onde veio e a data que ela trazia é o registro do que o texto dizia quando você leu. A extensão não resume, não reescreve e não reordena nada dentro do corpo do texto.
- Texto literal – a extensão não resume, não reescreve e não reordena nada dentro do artigo
- Endereço da fonte e data de publicação no frontmatter, junto com o campo
extraction - Tabelas de prazos, custas e faixas atravessam a conversão inteiras: doze de quinze no corpus técnico, contra sete de cada motor comparado
AnalistasA serialização de tabela é própria: célula com código ou lista não quebra mais a linha.
Conversor genérico de HTML para Markdown quebra justamente nas tabelas que importam – as que têm lista, link ou trecho de código dentro da célula. O Clean Clipper escreve a tabela por conta própria e achata o conteúdo da célula em vez de derrubar a linha. Num corpus de quinze tabelas ele manteve doze, contra sete de cada motor comparado.
- Serializador de tabela GFM próprio, e não um plugin genérico de conversão
- Doze tabelas de quinze mantidas no corpus técnico, contra sete de cada motor comparado
- Célula com lista, link ou trecho de código é achatada em texto, e não derruba a linha
ProfessoresCapture o conteúdo, guarde a fonte, imprima ou jogue nas suas notas – sem a mobília do site.
Página impressa direto do navegador leva os menus, o aviso de cookies e os anúncios junto para a folha. Uma captura leva o texto, com o endereço da fonte guardado na nota. O modo de leitura mostra como vai ficar antes de você imprimir ou salvar.
- Um botão de imprimir que imprime a captura, e não a página com toda a mobília do site
- O modo de leitura mostra o resultado sem os símbolos do Markdown, do jeito que o aluno vai ler
- Endereço da fonte guardado na nota, então dar o crédito não custa nada
TradutoresNavegação, banners e menus repetidos não chegam à lista de segmentos.
Texto de origem colado de uma página web vem com a navegação junto, e cada item de menu vira um segmento que você tem que pular. Tirar isso antes de importar é mais rápido que filtrar depois. Num corpus de 109 páginas sobraram 102 linhas de navegação repetida, contra 282, 478 e 491 dos motores comparados.
- Menus, paginadores e listas de “leia também” cortados antes da exportação
- Linhas de navegação duplicadas reduzidas cerca de quatro vezes frente aos motores comparados
- Markdown comum importa em toda CAT tool relevante, sem conversor no meio
Gerentes de produtoCapture changelogs, docs e notas de versão em notas datadas e pesquisáveis.
Pesquisa de concorrência guardada em favorito apodrece até virar uma lista de links em que não dá para buscar. Capturada em Markdown, ela vira um acervo onde você faz busca por palavra, compara versões e cita num documento de decisão. Cada nota carrega a data que a página trazia.
- Data de publicação lida na página, então a entrada do changelog mantém o momento real
- Regras por site mandam cada concorrente para a sua própria pasta, com configuração própria
- Tabelas de planos, limites e comparação atravessam a conversão inteiras
Redatores técnicosEstrutura, blocos de código e tabelas atravessam; a mobília do site não.
Migrar documentação costuma ser converter o HTML e depois gastar mais tempo tirando o que o conversor manteve. Essa remoção é justamente para o que o Clean Clipper foi feito, e é a parte que está medida: zero resto de tag HTML nas 512 páginas do corpus, em doze idiomas.
- Títulos, listas, tabelas, blocos de código e notas de rodapé viram Markdown padrão
- A marca de linguagem é preservada nos blocos de código: 73 de 156 no corpus técnico, contra 20 e 0
- Zero resto de tag HTML nas 512 páginas medidas, em doze idiomas
Arquivo pessoalArquivos Markdown comuns no seu disco. Sem conta, sem serviço, sem nada que possa fechar.
Favorito aponta para página que muda ou some. Uma captura é o texto em si, num formato sem dono e sem prazo de validade, guardado onde você decidir. A extensão não faz nenhuma requisição de rede, então não existe conta para expirar nem servidor para desligar.
- Formato aberto e durável – texto puro com frontmatter YAML, que qualquer editor abre
- Sem conta e sem servidor: a extensão não faz nenhuma requisição de rede em momento nenhum
- Data de publicação e endereço da fonte capturados junto com o texto
Ler sem o barulhoUm modo de leitura que mostra o texto sem menus, sem banners e sem símbolo de Markdown.
Mobília de página não é só bagunça visual: é texto que o leitor de tela tem que ler em voz alta e que a pessoa tem que pular. A janela de captura mostra o artigo sozinho, no tema claro ou escuro do seu navegador, e o arquivo salvo é texto puro que qualquer ferramenta assistiva lê sem tropeçar.
- O modo de leitura mostra a captura como texto comum, sem símbolo de Markdown no meio
- Segue a configuração de tema claro e escuro do seu navegador, sem ajuste nenhum
- Amplie para uma janela de três quartos da tela e leia com folga, com a página parada atrás