Clean Web Clipper Añadir a Chrome – gratis

Por dentro · ·

Cómo extrae Clean Web Clipper un artículo y dónde se detiene

Clean Web Clipper extrae un artículo en cuatro pasos que se ejecutan dentro de la página que estás mirando: encontrar el artículo, quitar el mobiliario, convertir a Markdown y rechazar una página sin artículo. La cadena de extracción nunca llama a un servidor; la única dirección con la que habla la extensión es nuestra dirección de estadísticas.

¿Cómo encuentra el artículo en una página?

Primero la extensión busca los contenedores evidentes en los que suele vivir un artículo. Cuando no hay ninguno –y en muchos sitios reales no lo hay– pasa a medir la densidad de texto: qué bloque contiene más texto de párrafo que no esté dentro de un enlace. Gana el bloque más estrecho que aún conserva casi todo ese texto.

Un bloque cuyo texto son sobre todo etiquetas de enlace es un menú o un tablón, no un artículo, y se descarta – salvo que contenga más de unos 1200 caracteres de texto real, porque los artículos largos llevan legítimamente muchos enlaces.

La ventana de Clean Web Clipper con un artículo de Wikipedia en Markdown: frontmatter con título, origen, fecha y extraction: dom
El mismo artículo de Wikipedia en la vista de lectura de Clean Web Clipper, con 13 001 palabras, 4 tablas y 99 notas al pie encontradas
Clean Web Clipper rechaza una página con el aviso de que aún no puede leerla, la dirección de la página y un botón «Necesito este sitio»
Añadir a Chrome – gratisGratis y sin cuenta · probada en 512 páginas en agosto de 2026, 0 caídas. La extracción funciona sin conexión; un interruptor en los ajustes detiene los eventos de uso.For Chrome on a computer

Quita menús, banners y navegación repetida

Después se van los elementos que se sabe que no son contenido: navegación, banners, barras para compartir, avisos de cookies, paginadores, listas de «lo más leído» y tiras de logotipos. Las líneas repetidas se eliminan, porque la navegación duplicada en cada sección es la mayor fuente de ruido de una página capturada.

lo que conservan otros clippers

[Saltar al contenido](#main) [Iniciar sesión](/login) [Registrarse](/registro)
[Portada](/) [Actualidad](/actualidad) [Deportes](/deportes) [Cultura](/cultura) [Más](/mas)

Usamos cookies y tecnologías similares para mejorar tu experiencia.
[Aceptar todo] [Configurar]

# El artículo que venías a leer

El primer párrafo de verdad del texto.

<div class="promo-inline">

## Lo más leído
[Otro titular](/a) [Un titular más](/b) [Y un tercero](/c)

lo que acaba en la nota

# El artículo que venías a leer

El primer párrafo de verdad del texto.
La misma página de noticias: lo que conserva un clipper cualquiera y lo que guarda Clean Web Clipper

Convierte tablas, código y notas al pie a Markdown

Las tablas las serializa la propia extensión y no un plugin genérico, porque los conversores genéricos se rompen con una celda que contiene una lista o un bloque de código. Los bloques de código toman el lenguaje del marcado de la propia página. Los enlaces de referencia se recogen como notas al pie de Markdown antes de que el saneador elimine los identificadores de los que dependen: el orden importa, y equivocarse ahí pierde todas las notas sin decir nada. Cuántas tablas conservó cada motor en las mismas 109 páginas está contado en la página de la medición.

¿Cuándo responde «sin artículo»?

En una tienda, un tablón de titulares o un resultado de búsqueda no hay artículo. La extensión revisa el Markdown terminado: si más de una cuarta parte está dentro de etiquetas de enlace, responde «sin artículo» en lugar de entregarte trescientos enlaces. La negativa es deliberada y explica por qué los recuentos de caracteres son más bajos que los de herramientas que siempre devuelven algo.

Si rechaza un artículo de verdad, envíanos la dirección de esa página.

Comprueba lo que no hace

Encuentra respuestas a las preguntas frecuentes

¿Cuánto tarda una captura?
En una prueba sobre 17 páginas reales el 12 de septiembre de 2026, la vista previa del Markdown estuvo lista en 90–820 ms desde que se abrió la ventana: los artículos normales tardaron 123–400 ms, y la más lenta fue un hilo de Stack Overflow de 86 000 caracteres. El tiempo aparece en la esquina de la ventana de captura.
¿Funciona en aplicaciones de una sola página?
Sí. Lee el DOM después del renderizado, así que un sitio de documentación construido en JavaScript se captura tal como lo ves.
¿Qué es el modo de extracción jsonld-articlebody?
Algunas páginas traen el texto del artículo en sus datos estructurados pero nunca terminan de mostrarlo. Cuando los datos estructurados contienen bastante más texto que el DOM, la extensión los usa y deja constancia de que lo hizo.
Añadir a Chrome – gratisGratis y sin cuenta · probada en 512 páginas en agosto de 2026, 0 caídas. La extracción funciona sin conexión; un interruptor en los ajustes detiene los eventos de uso.For Chrome on a computer