Medição · ·
O que foi medido, em cima do quê, e o que deu
Testado em 512 páginas: 109 lado a lado com três outros motores, e 403 só com o nosso núcleo. Nenhum erro fatal e nenhum resto de tag HTML em nenhum artigo extraído. O corpus e os scripts serão publicados junto com a próxima rodada; até lá, esta página é o registro completo do que rodou e do que deu.
Rodada um: 109 páginas, quatro motores lado a lado
O corpus são as cem páginas mais acessadas do mundo e as cem mais acessadas da Rússia. Domínios sem conteúdo de leitura – mensageiros, bancos, streaming, portais de governo – foram excluídos de antemão. As páginas foram capturadas com um navegador de verdade, seguindo um link de conteúdo a partir da home quando existia um.
Quatro motores rodaram sobre as mesmas 109 páginas capturadas: Defuddle 0.19.3 com Turndown 7.2.4 (o núcleo do Obsidian Web Clipper oficial), Mozilla Readability 0.6.0 com o mesmo Turndown (o núcleo do MarkDownload), MarkSnip 5.2.0 – o código realmente publicado, desempacotado da build da Chrome Web Store – e Clean Web Clipper 0.1.0.
| Métrica | Defuddle 0.19.3 | Mozilla Readability 0.6.0 | MarkSnip 5.2.0 | Clean Web Clipper 0.1.0 |
|---|---|---|---|---|
| Páginas | 109 | 107 | 107 | 109 |
| Erros fatais | 0 | 2 | 2 | 0 |
| Restos de HTML | 532 | 718 | 2 | 0 |
| Linhas de menu duplicadas | 491 | 282 | 478 | 102 |
| Proporção de linhas curtas | 0.278 | 0.262 | 0.263 | 0.221 |
| Autores encontrados | 23 | 27 | 28 | 28 |
| Datas de publicação encontradas | 28 | 13 | 13 | 24 |
| Tabelas extraídas (de 56) | 3 | 8 | 11 | 5 |
| Fatia de texto útil | 0.878 | 0.931 | 0.934 | 0.890 |
Onde o Clean Web Clipper fica atrás
- Tabelas: 5 contra 11 do MarkSnip. 41 das 56 tabelas de origem estão numa página só e são layout, não conteúdo, que motor nenhum deveria extrair; a diferença real é um punhado de páginas em que a nossa escolha da raiz pega um bloco estreito demais.
- Fatia de texto útil: 0.890 contra 0.934. Parte disso é deliberada – ele recusa páginas de feed que os outros motores devolvem – e parte é a mesma raiz estreita demais.
- Datas de publicação: 24 contra 28 do Defuddle.
- Autores: empatado com o melhor, 28 contra 28 do MarkSnip, depois que a extração de autor foi refeita. Na primeira pontuação deste corpus eram 20.
Rodada dois: 403 páginas em doze idiomas europeus, só o nosso núcleo
Os cinquenta sites mais acessados de cada um de doze países, capturados com o navegador configurado no idioma do país, porque senão metade deles entrega uma página em inglês e a medição vira outra coisa.
152 das 403 páginas responderam “não há artigo”: vitrines de loja, capas de portal e feeds, onde não há artigo para extrair. Essa resposta é deliberada, e é por isso que essas páginas contam como testadas, e não como capturadas.
| Idioma | Páginas | Erros fatais | Restos de HTML | Fatia em links |
|---|---|---|---|---|
| Alemão | 40 | 0 | 0 | 0.058 |
| Francês | 39 | 0 | 0 | 0.050 |
| Espanhol | 40 | 0 | 0 | 0.060 |
| Italiano | 40 | 0 | 0 | 0.036 |
| Polonês | 30 | 0 | 0 | 0.064 |
| Português | 36 | 0 | 0 | 0.060 |
| Holandês | 37 | 0 | 0 | 0.049 |
| Turco | 31 | 0 | 0 | 0.042 |
| Ucraniano | 13 | 0 | 0 | 0.054 |
| Tcheco | 28 | 0 | 0 | 0.039 |
| Sueco | 28 | 0 | 0 | 0.036 |
| Romeno | 41 | 0 | 0 | 0.039 |
Tempo por captura: 4 min 38 s
O contador em lessroutinemorelife.com conta cada captura como 4 min 38 s. Esse tempo foi medido à mão pelo dono em mais de 1.000 páginas de conteúdo variado: copiar o texto, colar, limpar, acrescentar o título e a fonte, e depois conferir se sobrou marcação HTML. Foram calculadas tanto a média quanto a mediana.
O contador é, portanto, o número de capturas multiplicado por esse tempo, e não uma soma de cronometragens de cada captura. Ele não mede quanto tempo uma captura específica teria levado para você.
O que os números querem dizer
- Erros fatais – o motor deu erro na página e não devolveu nada. Uma rodada sem erros fatais ainda pode vir cheia de menus; é isso que as outras linhas medem.
- Restos de tag HTML – quanta marcação bruta sobreviveu dentro do Markdown. Qualquer coisa acima de zero é defeito.
- Linhas de menu duplicadas – linhas com mais de doze caracteres que aparecem mais de uma vez. Isso é navegação repetida em cada seção.
- Proporção de linhas curtas – a fatia de linhas com menos de vinte e cinco caracteres. Alta quer dizer lista de links capturada, e não texto corrido.
- Fatia em links – a fatia de caracteres que está dentro de rótulo de link. Alta quer dizer que veio menu junto.
- “Não há artigo” – a página não tinha corpo de artigo, então a extensão avisou isso em vez de devolver links. Não é erro fatal nem captura.
Limites honestos desta medição
- A amostra ucraniana tem 13 páginas, não 40 – a maior parte do corpus não respondeu do ponto de captura. Trate aquela linha como indicativa.
- As listas dos cinquenta mais acessados na Turquia e na Tchéquia pendem para lojas e horários, que não trazem data de publicação nenhuma. Isso é propriedade do corpus, não da extração.
- Os motores concorrentes rodaram só no primeiro corpus. A rodada europeia mede apenas o Clean Web Clipper.
- Páginas em que todos os motores devolveram menos de 500 caracteres ficaram de fora: isso é captcha ou bloqueio, não qualidade de extração.
- As duas rodadas são retratos de sites no ar tirados no fim de agosto de 2026. Os mesmos scripts rodados depois vão dar números um pouco diferentes, conforme esses sites mudam.