Clean Web Clipper Añadir a Chrome – gratis

Medición · ·

Defuddle vs Readability vs MarkSnip: qué se midió y qué salió

Clean Web Clipper se probó en 512 páginas a finales de agosto de 2026: 109 frente a frente con otros tres motores y 403 solo con nuestro núcleo. Ninguna caída y ninguna etiqueta HTML sobrante en ningún artículo extraído. El corpus y los scripts se publicarán con la próxima pasada; hasta entonces, esta página es el registro completo.

¿Cómo se compararon cuatro motores sobre las mismas 109 páginas?

Sobre las mismas 109 páginas, Clean Web Clipper dejó menos líneas de menú duplicadas que ningún otro motor: 102, frente a 282–491 de los otros tres, y sin caídas. El corpus son los cien sitios más visitados del mundo y los cien más visitados de Rusia, sin los dominios sin contenido (mensajería, banca, streaming, portales de la administración). Las páginas se capturaron con un navegador real, siguiendo desde cada portada un enlace a contenido.

Cuatro motores recorrieron las mismas 109 páginas capturadas: Defuddle 0.19.3 con Turndown 7.2.4 (el núcleo del Obsidian Web Clipper oficial), Mozilla Readability 0.6.0 con el mismo Turndown (el núcleo de MarkDownload), MarkSnip 5.2.0 – su código real, desempaquetado de su compilación para Chrome Web Store – y Clean Web Clipper 0.1.0.

MétricaDefuddle 0.19.3Mozilla Readability 0.6.0MarkSnip 5.2.0Clean Web Clipper 0.1.0
Páginas109107107109
Caídas0220
HTML sobrante53271820
Líneas de menú duplicadas491282478102
Proporción de líneas cortas0.2780.2620.2630.221
Autores encontrados23272828
Fechas de publicación encontradas28131324
Tablas extraídas (de 56)38115
Proporción de texto útil0.8780.9310.9340.890

Cada motor de la comparación se puede comprobar en su origen. Defuddle 0.19.3, el núcleo del Obsidian Web Clipper oficial, está en github.com/kepano/defuddle; Mozilla Readability 0.6.0, el núcleo de MarkDownload, está en github.com/mozilla/readability; los dos se ejecutaron con Turndown 7.2.4 para el paso a Markdown. MarkSnip 5.2.0 se ejecutó como el código real de su compilación de Chrome Web Store, desempaquetado y con sustitutos en lugar de la API del navegador. El primer corpus es el top 100 mundial de Similarweb (mayo de 2026) y el top 100 de Runet según Similarweb, Semrush y Mediascope (2026); el segundo, los cincuenta sitios más visitados de cada uno de doce países europeos.

Añadir a Chrome – gratisGratis y sin cuenta · probada en 512 páginas en agosto de 2026, 0 caídas. La extracción funciona sin conexión; un interruptor en los ajustes detiene los eventos de uso.For Chrome on a computer

Mira dónde va por detrás Clean Web Clipper

Resumen de la medición: 512 páginas probadas, 0 caídas, 0 etiquetas sobrantes y 102 líneas de menú duplicadas frente a 282–491 de otros tres motores en 109 páginas
Una página de Wikipedia con su cabecera y su banner marcados, junto a la ventana de captura que muestra solo el artículo en Markdown
Una página de MDN capturada en Markdown: un bloque de código etiquetado como html y una tabla conservada como filas de Markdown

Consulta el resultado del núcleo en 403 páginas de doce idiomas europeos

Los cincuenta sitios más visitados de cada uno de doce países, capturados con el navegador puesto en el idioma de ese país, porque si no la mitad sirven una página en inglés y lo que se mide es otra cosa.

152 de las 403 páginas respondieron «sin artículo»: escaparates de tiendas, portadas de portales y tablones, donde no hay artículo que extraer. Esa respuesta es deliberada, y por eso estas páginas cuentan como probadas y no como capturadas. En un artículo que necesitas, una negativa es un error: así se informa de la página.

IdiomaPáginasCaídasHTML sobranteProporción de enlaces
Alemán40000.058
Francés39000.050
Español40000.060
Italiano40000.036
Polaco30000.064
Portugués36000.060
Neerlandés37000.049
Turco31000.042
Ucraniano13000.054
Checo28000.039
Sueco28000.036
Rumano41000.039

¿Cómo se cuenta el tiempo por página de 4 min 38 s?

El contador de lessroutinemorelife.com cuenta 4 min 38 s por cada página con la que hiciste algo – copiarla, guardarla, imprimirla o mandarla a un chat de IA –, una vez al día por página. Abrir la ventana no es un ahorro y no cuenta. Ese tiempo lo cronometró a mano el propietario (2026, más de 1000 páginas de contenido variado): copiar el texto, pegarlo, limpiarlo, añadir el título y el origen, y revisar si quedaba marcado HTML.

Se calcularon la media y la mediana. Por tanto, el contador es el número de esas páginas multiplicado por ese tiempo, no una suma de cronometrajes de cada una. No mide cuánto te habría llevado a ti una página concreta.

Entiende qué significan las métricas

Conoce los límites de esta medición

Reproduce la medición

La primera pasada se capturó y puntuó el 30 de agosto de 2026 y la segunda el 31 de agosto de 2026, con Node 24, jsdom 29.1.1 y Playwright 1.62.1 (Chromium). Versiones: Defuddle 0.19.3, Mozilla Readability 0.6.0, MarkSnip 5.2.0, Turndown 7.2.4 con turndown-plugin-gfm 1.0.2 y Clean Web Clipper 0.1.0. La primera pasada son tres scripts en orden – capture-top.mjs, run-engines.mjs, score-top.mjs – y la segunda es capture-eu.mjs seguido de score-eu.mjs. Los scripts aún no son públicos: se publicarán como repositorio con la próxima pasada, sin las páginas de terceros capturadas. Los resultados agregados ya están disponibles en benchmark.json.

Añadir a Chrome – gratisGratis y sin cuenta · probada en 512 páginas en agosto de 2026, 0 caídas. La extracción funciona sin conexión; un interruptor en los ajustes detiene los eventos de uso.For Chrome on a computer

Encuentra respuestas a las preguntas frecuentes

¿Puedo reproducir esto?
Por tu cuenta, todavía no. Las listas del corpus, el script de captura y el de puntuación se publicarán con la próxima pasada. Hasta entonces, esta página da las versiones de los motores y las fechas, para que una pasada posterior pueda cotejarse con ellas. La captura depende de sitios vivos, así que las cifras exactas irán variando a medida que esos sitios cambien.
¿Por qué aquí se nombra a otros productos y en la ficha de la tienda no?
La ficha de la tienda no nombra otros productos; esta página, sí. Una comparación que oculta con quién se compara no se puede comprobar, así que aquí cada motor lleva su nombre y su versión.
¿Extraer más texto es mejor?
Por sí solo, no. Un motor que devuelve una página de tablón llena de enlaces puntúa bien en volumen y mal en utilidad. Por eso las tablas de arriba miden ruido y no tamaño.