Clean Clipper Instalar no Chrome – grátis

Para quem é

Pare de pagar quarenta vezes pelo mesmo menu

Quando você cola uma página web num modelo, cada linha de menu repetida, cada aviso de cookies e cada lista de “leia também” entra na conta como contexto e ainda disputa a atenção do modelo. Num corpus de 109 páginas o Clean Clipper deixou 102 linhas de navegação duplicadas, contra 282, 478 e 491 dos três outros motores medidos.

O ruído que você paga duas vezes

Você cola uma página de documentação no chat e a resposta ignora metade do que você perguntou. Não é burrice do modelo: das quatro mil palavras que você mandou, mil e duzentas são o menu lateral repetido em cada seção, o rodapé institucional e uma faixa de “leia também”. O modelo lê tudo aquilo, tenta achar sentido e dilui a atenção entre o que importa e o que é mobília.

Numa conversa longa isso se acumula. Cinco páginas coladas, cinco menus, cinco rodapés – e a janela de contexto acaba antes da terceira pergunta. Quando você usa API, o mesmo lixo aparece na fatura. E o pior é que não dá para limpar rápido: apagar menu à mão em texto colado leva mais tempo do que reler a página.

O que sobra ainda contamina a resposta. O modelo não sabe distinguir o corpo do artigo da mobília em volta dele, então a lista de “leia também” entra no resumo como se fosse conteúdo, e o aviso de direitos autorais no rodapé vira a data de publicação quando você pergunta de quando é o texto. Um cabeçalho com title, source e date separados resolve isso sem instrução nenhuma: o modelo recebe o metadado como metadado, em vez de precisar deduzir do meio do texto.

O que chega ao modelo

O que chega ao modelo: texto e metadados, nenhuma linha de menupt.wikipedia.org/wiki/Aprendizado_de_máquina
---
title: "Aprendizado de máquina – Wikipédia, a enciclopédia livre"
source: "https://pt.wikipedia.org/wiki/Aprendizado_de_máquina"
date: "2005-08-16T20:19:04.000Z"
extraction: "dom"
---

Aprendizado de máquina é um subcampo da inteligência artificial dedicado ao
desenvolvimento de algoritmos e técnicas que permitem ao computador aprender a
partir de dados.

Deixar pronto para colar no chat

Aqui a configuração é quase o oposto da de quem arquiva: você quer o mínimo de caracteres com o máximo de procedência. Cinco minutos nas opções e o atalho passa a entregar exatamente isso.

  1. Instale a extensão e abra as opções pelo botão direito no ícone. Elas abrem numa aba, e nada aqui exige conta ou cadastro.
  2. Em o que o clique no ícone faz, escolha “copiar para a área de transferência”. Assim a captura não vira arquivo: ela vai direto para o Ctrl+V do chat.
  3. Coloque imagens em ignorar. Link de imagem não diz nada ao modelo de texto e, em página de notícia, chega a ser um quinto dos caracteres que você está mandando.
  4. No frontmatter, deixe title, source e date ligados e desligue o resto. São os três que impedem o modelo de deduzir a procedência do meio do texto, e nenhum deles custa mais que uma linha.
  5. Confira uma captura no modo de leitura antes de confiar no atalho: ele mostra o que foi extraído sem os símbolos do Markdown, e é ali que você percebe se um bloco de navegação escapou.
  6. Se você usa um chat específico todo dia, deixe o botão de mandar para a IA apontado para ele. O botão copia a captura e abre a aba; a colagem continua sendo sua, e é de propósito.

Ajustes para contexto de modelo

Estes valores partem de um objetivo só: entregar o texto do artigo e a procedência dele, sem nenhum caractere a mais na janela de contexto.

ConfiguraçãoValorPor que esse valor aqui
Clique no íconeCopiar para a área de transferênciaO destino é o campo do chat, não uma pasta; arquivo aqui é um passo a mais sem função
ImagensIgnorarLink de imagem não é lido por modelo de texto e ainda ocupa contexto
Frontmatter`title`, `source` e `date` ligados; o resto desligadoTrês linhas evitam que o modelo deduza data e origem do rodapé da página
Modo de leituraConferir antes de colarÉ onde você vê se algum bloco de navegação escapou, antes de gastar a chamada
Atalho`Alt+Shift+M`Capturar sem abrir janela mantém o ritmo de quem está no meio de uma conversa
Regra por sitePortal de notícia → imagens ignoradasNesses sites o link de imagem é a maior fatia de ruído por caractere
O que uma capa de portal devolve em vez de trezentos linksa janela de captura numa página de listagem
Não há artigo nesta página.

Mais de um quarto do texto extraído estava dentro de rótulo de link, que é a
cara de um feed, de uma vitrine ou de uma página de busca. Nada foi copiado
para a área de transferência.

  Blocos examinados    41
  Bloco escolhido      <section class="cards">
  Fatia de links       0.71
  Texto real           740 caracteres

Três conversas de verdade

Uma pergunta sobre documentação que você não quer que o modelo invente

Você precisa que o modelo compare o comportamento de dois parâmetros descritos numa página de documentação longa. Em vez de colar o endereço, aperta Alt+Shift+M e cola o Markdown. O modelo recebe título, endereço, data e o texto do artigo, com os blocos de código ainda marcados com a linguagem.

A diferença aparece na resposta: ela cita o nome exato do parâmetro como está no texto, e não uma variação plausível. Quando você pergunta de qual versão é aquilo, a resposta vem do campo source, que aponta para o endereço com a versão dentro, e não de um palpite.

Cinco fontes na mesma conversa, sem estourar a janela

A pauta exige comparar o que cinco órgãos publicaram sobre o mesmo tema. Cada página capturada chega sem menu, sem rodapé institucional e sem lista de “leia também”. Nas 109 páginas medidas sobraram 102 linhas de navegação repetida, contra 282, 478 e 491 dos outros motores.

Na prática é a diferença entre a quinta fonte caber ou não na conversa. E quando ela cabe, o modelo consegue relacionar as cinco, em vez de responder sobre as duas últimas porque as três primeiras já saíram da janela.

O material que não estava na web aberta

O documento está atrás do login de um sistema interno. Modelo nenhum alcança aquilo, e mandar o endereço não adianta. Você abre a página como já abriria, captura e cola: a extensão lê o que o seu navegador renderizou para a sua sessão.

Vale saber exatamente o que isso significa em termos de privacidade. A extensão não faz requisição de rede alguma; quem envia o texto para o serviço de IA é você, no momento em que cola. O que sai da sua máquina é o que você colou, e nada além disso.

Comparado com os jeitos usuais

Todos estes caminhos levam uma página web até um modelo, e cada um deles é usado todo dia. A terceira coluna é o custo real, o desta extensão junto.

Como se faz hojeO que o modelo recebeO que custa
Colar só o endereçoUm link, e a esperança de que ele alcanceMuitos modelos não alcançam, e os que alcançam recebem a versão servida para robô
Copiar e colar a página inteiraO texto, com menu, rodapé e “leia também”Contexto gasto com mobília, e resumo que às vezes cita o menu como conteúdo
Anexar a página impressa em PDFUm documento com o layout congeladoA leitura do PDF vira mais uma etapa, e o aviso de cookies vai junto
Copiar do modo de leitura do navegadorTexto limpo, sem estruturaPerde tabela, marca de linguagem no bloco de código e o endereço da fonte
Outra extensão de capturaMarkdown, com menos podaNas 512 páginas medidas: 282 a 491 linhas de menu repetidas, contra 102 aqui
Clean ClipperMarkdown sem mobília, com título, endereço e dataUma página por vez; não conta token e não corta nada – texto muito longo continua muito longo

Quando o contexto sai errado

Por que ele avisou que não há artigo?

Porque a página é feita de rótulo de link. Quando mais ou menos um quarto dos caracteres extraídos está dentro de link – capa de portal, vitrine, resultado de busca, índice de categoria –, a extensão recusa em vez de devolver uma lista. Abra a matéria em si e capture dela; a capa nunca teve o texto que você queria mandar ao modelo.

Por que o modelo diz que o texto está incompleto?

Provavelmente ele está mesmo, e por dois motivos diferentes. Ou a página guarda parte do conteúdo em abas e sanfonas que só entram no DOM quando você clica – nesse caso expanda e capture de novo –, ou o texto é longo demais para a janela do modelo. A extensão não corta e não conta token de propósito: cortar em silêncio seria decidir por você qual metade importa.

Por que a data que o modelo citou não bate?

Olhe o campo date da captura. Quando ele está vazio é porque a página não publicou data nos metadados, e a extensão prefere deixar em branco a colocar o dia de hoje; sem esse campo, o modelo tenta deduzir a data do texto e costuma pegar o ano do rodapé. Quando o campo está preenchido e a resposta diverge, o modelo ignorou o cabeçalho – vale perguntar de novo apontando para o campo.

Cliquei no botão de mandar para a IA e nada apareceu no chat. Por quê?

Porque ele copia a captura e abre a aba do serviço, e a colagem é sua. Isso é de propósito: enviar sozinho significaria a extensão fazer requisição de rede, e ela não faz nenhuma. Se a área de transferência veio vazia, a página provavelmente foi recusada por não ter artigo – a janela de captura diz isso na hora.

O que ele não faz

Ele não resume e não reescreve: entrega o texto do artigo convertido, e quem interpreta é o seu modelo. Não conta tokens nem corta o texto para caber numa janela de contexto. Não manda nada para serviço de IA por conta própria – a extensão não faz requisição de rede, e o botão de chat só copia e abre a aba. E em loja, feed ou busca não existe artigo: nesses casos ele avisa “não há artigo” em vez de te entregar trezentos links para colar.

Instalar no Chrome – grátisExtensão gratuita por inteiro, sem conta e sem cadastro.

Perguntas

Por que não colar só o link e deixar o modelo buscar?
Muitos modelos nem alcançam a página, e os que alcançam costumam receber a versão servida para robô, não a que você está lendo. A captura pega exatamente o que estava na sua tela, inclusive o que está atrás de um login que você já usava.
A extensão manda alguma coisa para um serviço de IA?
Não por conta própria. A extração roda dentro do navegador e não há requisição de rede nenhuma. O botão de chat copia a captura e abre a aba do serviço que você escolheu.
Quanto de contexto isso economiza de verdade?
Depende da página. A medida publicada é indireta e honesta: 102 linhas de navegação repetida em 109 páginas, contra 282, 478 e 491 dos outros motores. Em página de portal a diferença é grande; em artigo simples, pequena.
Dá para tirar as imagens e economizar contexto?
Dá. Coloque imagens em “ignorar” e o Markdown sai sem nenhum link de imagem.
Serve para montar base de RAG?
Serve como fonte, uma página por vez. Não existe rastreador nem fila: você captura as páginas que quer e os arquivos .md ficam na sua pasta, prontos para o seu próprio processo de indexação.
Ele conta os tokens ou corta o texto para caber?
Não faz nem uma coisa nem outra. Cortar em silêncio seria escolher por você qual metade do artigo importa, e essa escolha muda a resposta do modelo. O que ele faz é tirar o que não é artigo, e o que sobra é o artigo inteiro.
Por que o Markdown ajuda mais que texto puro?
Porque a estrutura sobrevive. Título vira título, tabela vira tabela e bloco de código continua marcado com a linguagem, então o modelo enxerga hierarquia e limite de trecho em vez de um parágrafo de quatro mil palavras.
Dá para usar as capturas com um modelo rodando na minha máquina?
Dá, e é o mesmo arquivo. São .md comuns numa pasta sua, sem nada específico de serviço nenhum, então servem igual para colar num chat, alimentar um script local ou entrar num índice que você mesmo montou.
O que aparece no campo `extraction` e por que isso importa aqui?
Aparece dom quando o texto veio da página renderizada e jsonld-articlebody quando veio dos dados estruturados. Importa porque as duas versões às vezes divergem, e quando o modelo responde algo estranho esse campo é a primeira pista de onde o texto saiu.
Funciona em página que só carrega o conteúdo depois de rolar?
Funciona sobre o que já foi renderizado. Se o site carrega parágrafos conforme você desce, role até o fim antes de capturar: o que ainda não entrou no DOM não existe para a extensão, e ela não simula rolagem.