Clean Web Clipper Instalar no Chrome – grátis

Medição · ·

O que foi medido, em cima do quê, e o que deu

Testado em 512 páginas: 109 lado a lado com três outros motores, e 403 só com o nosso núcleo. Nenhum erro fatal e nenhum resto de tag HTML em nenhum artigo extraído. O corpus e os scripts serão publicados junto com a próxima rodada; até lá, esta página é o registro completo do que rodou e do que deu.

Rodada um: 109 páginas, quatro motores lado a lado

O corpus são as cem páginas mais acessadas do mundo e as cem mais acessadas da Rússia. Domínios sem conteúdo de leitura – mensageiros, bancos, streaming, portais de governo – foram excluídos de antemão. As páginas foram capturadas com um navegador de verdade, seguindo um link de conteúdo a partir da home quando existia um.

Quatro motores rodaram sobre as mesmas 109 páginas capturadas: Defuddle 0.19.3 com Turndown 7.2.4 (o núcleo do Obsidian Web Clipper oficial), Mozilla Readability 0.6.0 com o mesmo Turndown (o núcleo do MarkDownload), MarkSnip 5.2.0 – o código realmente publicado, desempacotado da build da Chrome Web Store – e Clean Web Clipper 0.1.0.

MétricaDefuddle 0.19.3Mozilla Readability 0.6.0MarkSnip 5.2.0Clean Web Clipper 0.1.0
Páginas109107107109
Erros fatais0220
Restos de HTML53271820
Linhas de menu duplicadas491282478102
Proporção de linhas curtas0.2780.2620.2630.221
Autores encontrados23272828
Datas de publicação encontradas28131324
Tabelas extraídas (de 56)38115
Fatia de texto útil0.8780.9310.9340.890
Instalar no Chrome – grátisGratuita por inteiro, sem conta e sem limites. A extração funciona offline; os eventos de uso saem quando você está online, e um interruptor os interrompe.For Chrome on a computer

Onde o Clean Web Clipper fica atrás

Rodada dois: 403 páginas em doze idiomas europeus, só o nosso núcleo

Os cinquenta sites mais acessados de cada um de doze países, capturados com o navegador configurado no idioma do país, porque senão metade deles entrega uma página em inglês e a medição vira outra coisa.

152 das 403 páginas responderam “não há artigo”: vitrines de loja, capas de portal e feeds, onde não há artigo para extrair. Essa resposta é deliberada, e é por isso que essas páginas contam como testadas, e não como capturadas.

IdiomaPáginasErros fataisRestos de HTMLFatia em links
Alemão40000.058
Francês39000.050
Espanhol40000.060
Italiano40000.036
Polonês30000.064
Português36000.060
Holandês37000.049
Turco31000.042
Ucraniano13000.054
Tcheco28000.039
Sueco28000.036
Romeno41000.039

Tempo por captura: 4 min 38 s

O contador em lessroutinemorelife.com conta cada captura como 4 min 38 s. Esse tempo foi medido à mão pelo dono em mais de 1.000 páginas de conteúdo variado: copiar o texto, colar, limpar, acrescentar o título e a fonte, e depois conferir se sobrou marcação HTML. Foram calculadas tanto a média quanto a mediana.

O contador é, portanto, o número de capturas multiplicado por esse tempo, e não uma soma de cronometragens de cada captura. Ele não mede quanto tempo uma captura específica teria levado para você.

O que os números querem dizer

Limites honestos desta medição

Instalar no Chrome – grátisGratuita por inteiro, sem conta e sem limites. A extração funciona offline; os eventos de uso saem quando você está online, e um interruptor os interrompe.For Chrome on a computer

Perguntas

Dá para eu reproduzir isso?
Por conta própria, ainda não. As listas do corpus, o script de captura e o script de pontuação serão publicados junto com a próxima rodada. Até lá, esta página traz as versões dos motores e as datas, para que uma rodada futura possa ser comparada com elas. A captura depende de sites no ar, então os números exatos vão variar conforme esses sites mudam.
Por que outros produtos são citados pelo nome aqui, mas não na página da loja?
A página da loja não cita outros produtos; esta página cita. Uma comparação que esconde quem foi comparado não pode ser conferida, então aqui cada motor aparece com o nome e a versão.
Extrair mais texto é melhor?
Não por si só. Um motor que devolve uma página de feed cheia de links pontua bem em volume e mal em utilidade. É por isso que as tabelas acima medem ruído, e não tamanho.