Para quem é
Pare de pagar quarenta vezes pelo mesmo menu
Quando você cola uma página web num modelo, cada linha de menu repetida, cada aviso de cookies e cada lista de “leia também” entra na conta como contexto e ainda disputa a atenção do modelo. Num corpus de 109 páginas o Clean Clipper deixou 102 linhas de navegação duplicadas, contra 282, 478 e 491 dos três outros motores medidos.
O ruído que você paga duas vezes
Você cola uma página de documentação no chat e a resposta ignora metade do que você perguntou. Não é burrice do modelo: das quatro mil palavras que você mandou, mil e duzentas são o menu lateral repetido em cada seção, o rodapé institucional e uma faixa de “leia também”. O modelo lê tudo aquilo, tenta achar sentido e dilui a atenção entre o que importa e o que é mobília.
Numa conversa longa isso se acumula. Cinco páginas coladas, cinco menus, cinco rodapés – e a janela de contexto acaba antes da terceira pergunta. Quando você usa API, o mesmo lixo aparece na fatura. E o pior é que não dá para limpar rápido: apagar menu à mão em texto colado leva mais tempo do que reler a página.
O que sobra ainda contamina a resposta. O modelo não sabe distinguir o corpo do artigo da mobília em volta dele, então a lista de “leia também” entra no resumo como se fosse conteúdo, e o aviso de direitos autorais no rodapé vira a data de publicação quando você pergunta de quando é o texto. Um cabeçalho com title, source e date separados resolve isso sem instrução nenhuma: o modelo recebe o metadado como metadado, em vez de precisar deduzir do meio do texto.
O que chega ao modelo
- Quatro vezes menos navegação duplicada que a média dos motores comparados
- Zero resto de tag HTML nas 512 páginas medidas – o modelo não precisa contornar marcação solta
- O frontmatter YAML entrega o endereço da fonte e a data de publicação de forma explícita, sem o modelo precisar deduzir
- Um atalho copia a página inteira em Markdown, pronta para colar em qualquer chat
- O botão de mandar para a IA copia e abre o chat no mesmo movimento
- Imagens em “ignorar” tiram os links de imagem, que em página de notícia chegam a ser um quinto do texto
- A fatia de texto curto e solto ficou em 0.220 nas 109 páginas medidas, contra 0.278, 0.262 e 0.263 dos motores comparados – menos fragmento sem contexto para o modelo interpretar
- A conversão acontece dentro do seu navegador, sem requisição de rede nenhuma: a página não passa por servidor de terceiro antes de você decidir o que vai para o modelo
--- title: "Aprendizado de máquina – Wikipédia, a enciclopédia livre" source: "https://pt.wikipedia.org/wiki/Aprendizado_de_máquina" date: "2005-08-16T20:19:04.000Z" extraction: "dom" --- Aprendizado de máquina é um subcampo da inteligência artificial dedicado ao desenvolvimento de algoritmos e técnicas que permitem ao computador aprender a partir de dados.
Deixar pronto para colar no chat
Aqui a configuração é quase o oposto da de quem arquiva: você quer o mínimo de caracteres com o máximo de procedência. Cinco minutos nas opções e o atalho passa a entregar exatamente isso.
- Instale a extensão e abra as opções pelo botão direito no ícone. Elas abrem numa aba, e nada aqui exige conta ou cadastro.
- Em o que o clique no ícone faz, escolha “copiar para a área de transferência”. Assim a captura não vira arquivo: ela vai direto para o
Ctrl+Vdo chat. - Coloque imagens em ignorar. Link de imagem não diz nada ao modelo de texto e, em página de notícia, chega a ser um quinto dos caracteres que você está mandando.
- No frontmatter, deixe
title,sourceedateligados e desligue o resto. São os três que impedem o modelo de deduzir a procedência do meio do texto, e nenhum deles custa mais que uma linha. - Confira uma captura no modo de leitura antes de confiar no atalho: ele mostra o que foi extraído sem os símbolos do Markdown, e é ali que você percebe se um bloco de navegação escapou.
- Se você usa um chat específico todo dia, deixe o botão de mandar para a IA apontado para ele. O botão copia a captura e abre a aba; a colagem continua sendo sua, e é de propósito.
Ajustes para contexto de modelo
Estes valores partem de um objetivo só: entregar o texto do artigo e a procedência dele, sem nenhum caractere a mais na janela de contexto.
| Configuração | Valor | Por que esse valor aqui |
|---|---|---|
| Clique no ícone | Copiar para a área de transferência | O destino é o campo do chat, não uma pasta; arquivo aqui é um passo a mais sem função |
| Imagens | Ignorar | Link de imagem não é lido por modelo de texto e ainda ocupa contexto |
| Frontmatter | `title`, `source` e `date` ligados; o resto desligado | Três linhas evitam que o modelo deduza data e origem do rodapé da página |
| Modo de leitura | Conferir antes de colar | É onde você vê se algum bloco de navegação escapou, antes de gastar a chamada |
| Atalho | `Alt+Shift+M` | Capturar sem abrir janela mantém o ritmo de quem está no meio de uma conversa |
| Regra por site | Portal de notícia → imagens ignoradas | Nesses sites o link de imagem é a maior fatia de ruído por caractere |
Não há artigo nesta página. Mais de um quarto do texto extraído estava dentro de rótulo de link, que é a cara de um feed, de uma vitrine ou de uma página de busca. Nada foi copiado para a área de transferência. Blocos examinados 41 Bloco escolhido <section class="cards"> Fatia de links 0.71 Texto real 740 caracteres
Três conversas de verdade
Uma pergunta sobre documentação que você não quer que o modelo invente
Você precisa que o modelo compare o comportamento de dois parâmetros descritos numa página de documentação longa. Em vez de colar o endereço, aperta Alt+Shift+M e cola o Markdown. O modelo recebe título, endereço, data e o texto do artigo, com os blocos de código ainda marcados com a linguagem.
A diferença aparece na resposta: ela cita o nome exato do parâmetro como está no texto, e não uma variação plausível. Quando você pergunta de qual versão é aquilo, a resposta vem do campo source, que aponta para o endereço com a versão dentro, e não de um palpite.
Cinco fontes na mesma conversa, sem estourar a janela
A pauta exige comparar o que cinco órgãos publicaram sobre o mesmo tema. Cada página capturada chega sem menu, sem rodapé institucional e sem lista de “leia também”. Nas 109 páginas medidas sobraram 102 linhas de navegação repetida, contra 282, 478 e 491 dos outros motores.
Na prática é a diferença entre a quinta fonte caber ou não na conversa. E quando ela cabe, o modelo consegue relacionar as cinco, em vez de responder sobre as duas últimas porque as três primeiras já saíram da janela.
O material que não estava na web aberta
O documento está atrás do login de um sistema interno. Modelo nenhum alcança aquilo, e mandar o endereço não adianta. Você abre a página como já abriria, captura e cola: a extensão lê o que o seu navegador renderizou para a sua sessão.
Vale saber exatamente o que isso significa em termos de privacidade. A extensão não faz requisição de rede alguma; quem envia o texto para o serviço de IA é você, no momento em que cola. O que sai da sua máquina é o que você colou, e nada além disso.
Comparado com os jeitos usuais
Todos estes caminhos levam uma página web até um modelo, e cada um deles é usado todo dia. A terceira coluna é o custo real, o desta extensão junto.
| Como se faz hoje | O que o modelo recebe | O que custa |
|---|---|---|
| Colar só o endereço | Um link, e a esperança de que ele alcance | Muitos modelos não alcançam, e os que alcançam recebem a versão servida para robô |
| Copiar e colar a página inteira | O texto, com menu, rodapé e “leia também” | Contexto gasto com mobília, e resumo que às vezes cita o menu como conteúdo |
| Anexar a página impressa em PDF | Um documento com o layout congelado | A leitura do PDF vira mais uma etapa, e o aviso de cookies vai junto |
| Copiar do modo de leitura do navegador | Texto limpo, sem estrutura | Perde tabela, marca de linguagem no bloco de código e o endereço da fonte |
| Outra extensão de captura | Markdown, com menos poda | Nas 512 páginas medidas: 282 a 491 linhas de menu repetidas, contra 102 aqui |
| Clean Clipper | Markdown sem mobília, com título, endereço e data | Uma página por vez; não conta token e não corta nada – texto muito longo continua muito longo |
Quando o contexto sai errado
Por que ele avisou que não há artigo?
Porque a página é feita de rótulo de link. Quando mais ou menos um quarto dos caracteres extraídos está dentro de link – capa de portal, vitrine, resultado de busca, índice de categoria –, a extensão recusa em vez de devolver uma lista. Abra a matéria em si e capture dela; a capa nunca teve o texto que você queria mandar ao modelo.
Por que o modelo diz que o texto está incompleto?
Provavelmente ele está mesmo, e por dois motivos diferentes. Ou a página guarda parte do conteúdo em abas e sanfonas que só entram no DOM quando você clica – nesse caso expanda e capture de novo –, ou o texto é longo demais para a janela do modelo. A extensão não corta e não conta token de propósito: cortar em silêncio seria decidir por você qual metade importa.
Por que a data que o modelo citou não bate?
Olhe o campo date da captura. Quando ele está vazio é porque a página não publicou data nos metadados, e a extensão prefere deixar em branco a colocar o dia de hoje; sem esse campo, o modelo tenta deduzir a data do texto e costuma pegar o ano do rodapé. Quando o campo está preenchido e a resposta diverge, o modelo ignorou o cabeçalho – vale perguntar de novo apontando para o campo.
Cliquei no botão de mandar para a IA e nada apareceu no chat. Por quê?
Porque ele copia a captura e abre a aba do serviço, e a colagem é sua. Isso é de propósito: enviar sozinho significaria a extensão fazer requisição de rede, e ela não faz nenhuma. Se a área de transferência veio vazia, a página provavelmente foi recusada por não ter artigo – a janela de captura diz isso na hora.
O que ele não faz
Ele não resume e não reescreve: entrega o texto do artigo convertido, e quem interpreta é o seu modelo. Não conta tokens nem corta o texto para caber numa janela de contexto. Não manda nada para serviço de IA por conta própria – a extensão não faz requisição de rede, e o botão de chat só copia e abre a aba. E em loja, feed ou busca não existe artigo: nesses casos ele avisa “não há artigo” em vez de te entregar trezentos links para colar.
Perguntas
Por que não colar só o link e deixar o modelo buscar?
A extensão manda alguma coisa para um serviço de IA?
Quanto de contexto isso economiza de verdade?
Dá para tirar as imagens e economizar contexto?
Serve para montar base de RAG?
.md ficam na sua pasta, prontos para o seu próprio processo de indexação.Ele conta os tokens ou corta o texto para caber?
Por que o Markdown ajuda mais que texto puro?
Dá para usar as capturas com um modelo rodando na minha máquina?
.md comuns numa pasta sua, sem nada específico de serviço nenhum, então servem igual para colar num chat, alimentar um script local ou entrar num índice que você mesmo montou.O que aparece no campo `extraction` e por que isso importa aqui?
dom quando o texto veio da página renderizada e jsonld-articlebody quando veio dos dados estruturados. Importa porque as duas versões às vezes divergem, e quando o modelo responde algo estranho esse campo é a primeira pista de onde o texto saiu.