Medição
O que foi medido, em cima do quê, e o que deu
Falar em saída limpa não vale nada sem corpus e sem script. Os dois estão publicados.
Rodada um: 109 páginas, quatro motores
O corpus são as cem páginas mais acessadas do mundo e as cem mais acessadas da Rússia. Domínios sem conteúdo de leitura – mensageiros, bancos, streaming, portais de governo – foram excluídos de antemão. As páginas foram capturadas com um navegador de verdade, seguindo um link de conteúdo a partir da home quando existia um.
Quatro motores rodaram em cima do mesmo DOM capturado: Defuddle (o núcleo do clipper oficial do Obsidian), Mozilla Readability, o código realmente publicado de um terceiro clipper de Markdown, desempacotado da build da loja, e o Clean Clipper.
| Métrica | Motor A | Motor B | Motor C | Clean Clipper |
|---|---|---|---|---|
| Páginas | 109 | 107 | 107 | 109 |
| Falhas | 0 | 2 | 2 | 0 |
| Restos de HTML | 532 | 718 | 2 | 0 |
| Linhas de menu duplicadas | 491 | 282 | 478 | 102 |
| Proporção de linhas curtas | 0.278 | 0.262 | 0.263 | 0.220 |
Onde o Clean Clipper fica atrás: ele achou 20 autores contra 28 do melhor motor, e extraiu 4 tabelas contra 11 – embora 41 das 56 tabelas de origem estejam numa página só e sejam layout, não conteúdo, que motor nenhum deveria extrair. A fatia de “texto útil” dele é menor porque ele recusa páginas de feed que os outros devolvem sem pensar.
Rodada dois: 403 páginas em doze idiomas europeus
Os cinquenta sites mais acessados de cada um de doze países, capturados com o navegador configurado no idioma do país, porque senão metade deles entrega uma página em inglês e a medição vira outra coisa.
| Idioma | Páginas | Falhas | Restos de HTML | Fatia em links |
|---|---|---|---|---|
| Alemão | 40 | 0 | 0 | 0.058 |
| Francês | 39 | 0 | 0 | 0.050 |
| Espanhol | 40 | 0 | 0 | 0.060 |
| Italiano | 40 | 0 | 0 | 0.036 |
| Polonês | 30 | 0 | 0 | 0.064 |
| Português | 36 | 0 | 0 | 0.060 |
| Holandês | 37 | 0 | 0 | 0.049 |
| Turco | 31 | 0 | 0 | 0.042 |
| Ucraniano | 13 | 0 | 0 | 0.054 |
| Tcheco | 28 | 0 | 0 | 0.039 |
| Sueco | 28 | 0 | 0 | 0.036 |
| Romeno | 41 | 0 | 0 | 0.039 |
O que os números querem dizer
- Restos de tag HTML – quanta marcação bruta sobreviveu dentro do Markdown. Qualquer coisa acima de zero é defeito.
- Linhas de menu duplicadas – linhas com mais de doze caracteres que aparecem mais de uma vez. Isso é navegação repetida em cada seção.
- Proporção de linhas curtas – a fatia de linhas com menos de vinte e cinco caracteres. Alta quer dizer lista de links capturada, e não texto corrido.
- Fatia em links – a fatia de caracteres que está dentro de rótulo de link. Alta quer dizer que veio menu junto.
Limites honestos desta medição
- A amostra ucraniana tem 13 páginas, não 40 – a maior parte do corpus não respondeu do ponto de captura. Trate aquela linha como indicativa.
- As listas dos cinquenta mais acessados na Turquia e na Tchéquia pendem para lojas e horários, que não trazem data de publicação nenhuma. Isso é propriedade do corpus, não da extração.
- Os motores concorrentes rodaram só no primeiro corpus. A rodada europeia mede apenas o Clean Clipper.
- Páginas em que todos os motores devolveram menos de 500 caracteres ficaram de fora: isso é captcha ou bloqueio, não qualidade de extração.