Clean Web Clipper
Perguntas, respondidas sem rodeio
A maioria vem do que as pessoas reclamam em outros clippers. Se a sua pergunta não está aqui, escreva para cws@lessroutinemorelife.com.
Perguntas
Uma captura pode se perder sem eu perceber?
Não. O arquivo é gravado direto na pasta que você escolheu, e se o nome já existe ele vira Artigo-2.md em vez de sobrescrever alguma coisa. Não há manipulador de protocolo nem diálogo do navegador no meio, então não existe um passo em que um clique errado jogue a captura fora. A página de configurações também conta quantas vezes você apertou o botão e quantas delas geraram uma nota, então uma falha silenciosa ficaria visível.
Preciso do Obsidian aberto?
Não. O Clean Web Clipper grava o arquivo .md direto numa pasta que você escolheu uma vez, usando a API de acesso a arquivos do navegador. O Obsidian pode estar fechado, desinstalado ou nem existir – o arquivo aparece na pasta de qualquer jeito, e o Obsidian o encontra na próxima vez que abrir o vault.
Por que em outras ferramentas às vezes a nota chega só com o título e sem o corpo?
Porque muitos clippers entregam a nota pela área de transferência, e no Linux com Wayland só a janela em foco pode ler a área de transferência. Se o aplicativo de destino não estiver em foco naquele momento, o corpo nunca chega. O Clean Web Clipper nunca coloca a nota na área de transferência para salvá-la, então esse tipo de falha não existe aqui.
Funciona no Linux?
Funciona, igual a qualquer outro sistema. O gerenciador de janelas, a área de transferência e o ambiente de desktop não participam do salvamento, porque o arquivo é gravado pelo próprio navegador.
As tabelas saem direito?
Saem, e isso foi medido. Num corpus de quinze tabelas, doze sobreviveram inteiras, contra sete dos motores comparados. As tabelas são serializadas pelo nosso próprio código, e não por um conversor genérico, então uma célula com uma lista ou um trecho de código não desmancha mais a linha. Células mescladas são achatadas, porque o Markdown não tem como expressar mesclagem.
As imagens vão sair quebradas?
Não. As imagens ficam como links comuns de Markdown, sem escape perdido no meio, então aparecem assim que você cola. O que a extensão não faz é baixar os arquivos de imagem para perto da nota – o link aponta para o original.
O que acontece numa página que não é artigo?
Ele avisa. Em loja, feed e resultado de busca não há artigo para extrair, e em vez de te entregar trezentos rótulos de link a extensão grava a marca extraction: no-article e para. A decisão vem de um limite medido: quando mais de um quarto do texto está dentro de rótulos de link, aquilo é navegação, não texto corrido.
Ele manda as minhas páginas para algum lugar?
As suas páginas, não. A extração e a conversão acontecem inteiramente dentro do navegador, e nenhum texto ou título de página sai dele. Quatro coisas saem, para o nosso próprio servidor de estatísticas: o endereço de uma página em que nenhum artigo foi encontrado, para que o site possa ser ensinado; só o domínio de uma captura bem-sucedida, nunca o caminho; o nome da tela da extensão que você abriu; e um número de instalação aleatório que liga esses eventos entre si. O servidor também registra uma localização aproximada – país, região e cidade – deduzida do endereço IP; o endereço em si não é armazenado. Tudo isso para no momento em que você desliga nas configurações. O acesso à página em si é dado pelo seu próprio clique, e só para aquela aba.
Então o que é o relatório de uso nas configurações?
Contadores que ficam no seu navegador. Eles registram quantas capturas você fez, quanto tempo isso economizou, qual destino você usou e onde não foi possível encontrar um artigo. O relatório em si é mostrado inteiro para você e só sai se você copiar e mandar por e-mail por conta própria; o painel também mostra quantos endereços já foram enviados, então o que sai nunca fica fora da vista.
Ele guarda uma lista das páginas que eu visito?
Não. Uma captura bem-sucedida deixa para trás o domínio e nada mais – sem caminho, sem parâmetros, sem título, então a lista não mostra o que você leu num site, só que você capturou algo lá. Endereços completos são guardados num caso só: páginas em que a extração falhou, porque é a única coisa sem a qual não dá para escrever uma correção. Tudo o que fica guardado aparece no painel e pode ser apagado com um botão.
A data de publicação sai certa?
Quando a página declara uma, sim. Ela é lida de JSON-LD, article:published_time, citation_date (o padrão de arXiv, PubMed e IEEE), time[datetime] e marcas Unix, nessa ordem. Quando a página não traz data nenhuma, o campo fica vazio em vez de receber a data de hoje. Alguns tipos de site – lojas e tabelas de horários, principalmente – simplesmente nunca publicam data.
Dá para capturar só o trecho que eu selecionei?
Dá. Selecione algo na página e é isso que vai ser capturado; sem seleção, vem a página inteira. O botão no topo da janela sempre mostra qual dos dois você está vendo, e esse comportamento pode ser desligado nas configurações.
Ele processa várias abas de uma vez?
Não. O Clean Web Clipper trabalha com uma página por vez e não tem rastreador nem modo em lote. Se você precisa de dezenas de páginas de uma só vez, esta não é a ferramenta certa.
Dá para marcar trechos na página, como um marca-texto?
Não. Não há marca-texto nem camada de anotação. A extensão converte o que já está na página e não acrescenta nada a ela.
Ele resume ou reescreve o texto?
Não. O texto é convertido, não editado: nada de resumo, de reordenação ou de reescrita. O que a página dizia é o que a nota diz.
Em quais navegadores funciona?
Chrome e os outros navegadores Chromium: Edge, Brave, Vivaldi, Opera, Arc. Ele é feito em Manifest V3, então não vai parar de funcionar quando o formato antigo de extensão for desligado.
É de graça?
É, por inteiro. Todos os recursos descritos aqui estão na extensão instalada: sem limite de páginas, sem conta, sem cadastro e sem versão paga.
E se ele quebrar num site de que eu preciso?
Escreva para cws@lessroutinemorelife.com com o endereço. A página de configurações tem um relatório que já lista os sites em que a extração falhou, então basta copiá-lo para o e-mail – não precisa descrever nada. Na página em que ele recusou, o botão “Preciso deste site” coloca aquele endereço no topo da fila de correções.