Medición
Qué se midió, sobre qué y qué salió
Afirmar que la salida es limpia no vale nada sin un corpus y un script. Los dos están publicados.
Pasada uno: 109 páginas, cuatro motores
El corpus son los cien sitios más visitados del mundo y los cien más visitados de Rusia. Los dominios sin contenido –mensajería, banca, streaming, portales de la administración– se excluyeron de antemano. Las páginas se capturaron con un navegador real, siguiendo desde cada portada un enlace a contenido cuando lo había.
Cuatro motores recorrieron el mismo DOM capturado: Defuddle (el núcleo del clipper oficial de Obsidian), Mozilla Readability, el código real de un tercer clipper de Markdown desempaquetado de su compilación de la tienda, y Clean Clipper.
| Métrica | Motor A | Motor B | Motor C | Clean Clipper |
|---|---|---|---|---|
| Páginas | 109 | 107 | 107 | 109 |
| Fallos | 0 | 2 | 2 | 0 |
| HTML sobrante | 532 | 718 | 2 | 0 |
| Líneas de menú duplicadas | 491 | 282 | 478 | 102 |
| Proporción de líneas cortas | 0.278 | 0.262 | 0.263 | 0.220 |
Dónde va por detrás Clean Clipper: encontró 20 autores frente a los 28 del mejor motor y extrajo 4 tablas frente a 11 – aunque 41 de las 56 tablas de origen están en una sola página y son de maquetación, no de contenido, y ningún motor debería extraerlas. Su proporción de «texto útil» es menor porque rechaza páginas de tablón que otros motores devuelven sin más.
Pasada dos: 403 páginas en doce idiomas europeos
Los cincuenta sitios más visitados de cada uno de doce países, capturados con el navegador puesto en el idioma de ese país, porque si no la mitad sirven una página en inglés y lo que se mide es otra cosa.
| Idioma | Páginas | Fallos | HTML sobrante | Proporción de enlaces |
|---|---|---|---|---|
| Alemán | 40 | 0 | 0 | 0.058 |
| Francés | 39 | 0 | 0 | 0.050 |
| Español | 40 | 0 | 0 | 0.060 |
| Italiano | 40 | 0 | 0 | 0.036 |
| Polaco | 30 | 0 | 0 | 0.064 |
| Portugués | 36 | 0 | 0 | 0.060 |
| Neerlandés | 37 | 0 | 0 | 0.049 |
| Turco | 31 | 0 | 0 | 0.042 |
| Ucraniano | 13 | 0 | 0 | 0.054 |
| Checo | 28 | 0 | 0 | 0.039 |
| Sueco | 28 | 0 | 0 | 0.036 |
| Rumano | 41 | 0 | 0 | 0.039 |
Qué significan los números
- Etiquetas HTML sobrantes – cuánto marcado en bruto sobrevivió dentro del Markdown. Cualquier cifra por encima de cero es un defecto.
- Líneas de menú duplicadas – líneas de más de doce caracteres que aparecen más de una vez. Es la navegación repetida en cada sección.
- Proporción de líneas cortas – la parte de líneas de menos de veinticinco caracteres. Alta significa listas de enlaces capturadas en lugar de prosa.
- Proporción de enlaces – la parte de caracteres que quedan dentro de etiquetas de enlace. Alta significa que se coló un menú.
Límites honestos de esta medición
- La muestra ucraniana son 13 páginas, no 40: la mayor parte del corpus no respondió desde el punto de captura. Esa fila es solo indicativa.
- Las listas de los cincuenta primeros sitios turcos y checos se inclinan hacia tiendas y horarios, que no llevan ninguna fecha de publicación. Es una propiedad del corpus, no de la extracción.
- Los motores competidores solo se ejecutaron sobre el primer corpus. La pasada europea mide únicamente a Clean Clipper.
- Se excluyeron las páginas en las que todos los motores devolvieron menos de 500 caracteres: eso es un captcha o un bloqueo, no calidad de extracción.