Clean Clipper Instalar no Chrome – grátis

Medição

O que foi medido, em cima do quê, e o que deu

Falar em saída limpa não vale nada sem corpus e sem script. Os dois estão publicados.

Rodada um: 109 páginas, quatro motores

O corpus são as cem páginas mais acessadas do mundo e as cem mais acessadas da Rússia. Domínios sem conteúdo de leitura – mensageiros, bancos, streaming, portais de governo – foram excluídos de antemão. As páginas foram capturadas com um navegador de verdade, seguindo um link de conteúdo a partir da home quando existia um.

Quatro motores rodaram em cima do mesmo DOM capturado: Defuddle (o núcleo do clipper oficial do Obsidian), Mozilla Readability, o código realmente publicado de um terceiro clipper de Markdown, desempacotado da build da loja, e o Clean Clipper.

MétricaMotor AMotor BMotor CClean Clipper
Páginas109107107109
Falhas0220
Restos de HTML53271820
Linhas de menu duplicadas491282478102
Proporção de linhas curtas0.2780.2620.2630.220

Onde o Clean Clipper fica atrás: ele achou 20 autores contra 28 do melhor motor, e extraiu 4 tabelas contra 11 – embora 41 das 56 tabelas de origem estejam numa página só e sejam layout, não conteúdo, que motor nenhum deveria extrair. A fatia de “texto útil” dele é menor porque ele recusa páginas de feed que os outros devolvem sem pensar.

Rodada dois: 403 páginas em doze idiomas europeus

Os cinquenta sites mais acessados de cada um de doze países, capturados com o navegador configurado no idioma do país, porque senão metade deles entrega uma página em inglês e a medição vira outra coisa.

IdiomaPáginasFalhasRestos de HTMLFatia em links
Alemão40000.058
Francês39000.050
Espanhol40000.060
Italiano40000.036
Polonês30000.064
Português36000.060
Holandês37000.049
Turco31000.042
Ucraniano13000.054
Tcheco28000.039
Sueco28000.036
Romeno41000.039

O que os números querem dizer

Limites honestos desta medição

Perguntas

Dá para eu reproduzir isso?
Dá. As listas do corpus, o script de captura e o script de pontuação estão no repositório. A captura depende de sites no ar, então os números exatos vão variar conforme esses sites mudam.
Por que os motores concorrentes não são citados pelo nome aqui?
Citar concorrente pelo nome em página de loja vai contra a política da Chrome Web Store, e a mesma contenção vale para este site. O repositório cita, porque lá dá para conferir a afirmação.
Extrair mais texto é melhor?
Não por si só. Um motor que devolve uma página de feed cheia de links pontua bem em volume e mal em utilidade. É por isso que as tabelas acima medem ruído, e não tamanho.