Clean Clipper Añadir a Chrome – gratis

Medición

Qué se midió, sobre qué y qué salió

Afirmar que la salida es limpia no vale nada sin un corpus y un script. Los dos están publicados.

Pasada uno: 109 páginas, cuatro motores

El corpus son los cien sitios más visitados del mundo y los cien más visitados de Rusia. Los dominios sin contenido –mensajería, banca, streaming, portales de la administración– se excluyeron de antemano. Las páginas se capturaron con un navegador real, siguiendo desde cada portada un enlace a contenido cuando lo había.

Cuatro motores recorrieron el mismo DOM capturado: Defuddle (el núcleo del clipper oficial de Obsidian), Mozilla Readability, el código real de un tercer clipper de Markdown desempaquetado de su compilación de la tienda, y Clean Clipper.

MétricaMotor AMotor BMotor CClean Clipper
Páginas109107107109
Fallos0220
HTML sobrante53271820
Líneas de menú duplicadas491282478102
Proporción de líneas cortas0.2780.2620.2630.220

Dónde va por detrás Clean Clipper: encontró 20 autores frente a los 28 del mejor motor y extrajo 4 tablas frente a 11 – aunque 41 de las 56 tablas de origen están en una sola página y son de maquetación, no de contenido, y ningún motor debería extraerlas. Su proporción de «texto útil» es menor porque rechaza páginas de tablón que otros motores devuelven sin más.

Pasada dos: 403 páginas en doce idiomas europeos

Los cincuenta sitios más visitados de cada uno de doce países, capturados con el navegador puesto en el idioma de ese país, porque si no la mitad sirven una página en inglés y lo que se mide es otra cosa.

IdiomaPáginasFallosHTML sobranteProporción de enlaces
Alemán40000.058
Francés39000.050
Español40000.060
Italiano40000.036
Polaco30000.064
Portugués36000.060
Neerlandés37000.049
Turco31000.042
Ucraniano13000.054
Checo28000.039
Sueco28000.036
Rumano41000.039

Qué significan los números

Límites honestos de esta medición

Preguntas

¿Puedo reproducir esto?
Sí. Las listas del corpus, el script de captura y el de puntuación están en el repositorio. La captura depende de sitios vivos, así que las cifras exactas irán variando a medida que esos sitios cambien.
¿Por qué no se nombra aquí a los motores competidores?
Nombrar a la competencia en las fichas de la tienda va contra la política de Chrome Web Store, y en este sitio se aplica la misma contención. El repositorio sí los nombra, porque allí la afirmación se puede comprobar.
¿Extraer más texto es mejor?
Por sí solo, no. Un motor que devuelve una página de tablón llena de enlaces puntúa bien en volumen y mal en utilidad. Por eso las tablas de arriba miden ruido y no tamaño.