Por dentro · ·
Cómo extrae Clean Web Clipper un artículo y dónde se detiene
Clean Web Clipper extrae un artículo en cuatro pasos que se ejecutan dentro de la página que estás mirando: encontrar el artículo, quitar el mobiliario, convertir a Markdown y rechazar una página sin artículo. La cadena de extracción nunca llama a un servidor; la única dirección con la que habla la extensión es nuestra dirección de estadísticas.
¿Cómo encuentra el artículo en una página?
Primero la extensión busca los contenedores evidentes en los que suele vivir un artículo. Cuando no hay ninguno –y en muchos sitios reales no lo hay– pasa a medir la densidad de texto: qué bloque contiene más texto de párrafo que no esté dentro de un enlace. Gana el bloque más estrecho que aún conserva casi todo ese texto.
Un bloque cuyo texto son sobre todo etiquetas de enlace es un menú o un tablón, no un artículo, y se descarta – salvo que contenga más de unos 1200 caracteres de texto real, porque los artículos largos llevan legítimamente muchos enlaces.



Quita menús, banners y navegación repetida
Después se van los elementos que se sabe que no son contenido: navegación, banners, barras para compartir, avisos de cookies, paginadores, listas de «lo más leído» y tiras de logotipos. Las líneas repetidas se eliminan, porque la navegación duplicada en cada sección es la mayor fuente de ruido de una página capturada.
lo que conservan otros clippers
[Saltar al contenido](#main) [Iniciar sesión](/login) [Registrarse](/registro) [Portada](/) [Actualidad](/actualidad) [Deportes](/deportes) [Cultura](/cultura) [Más](/mas) Usamos cookies y tecnologías similares para mejorar tu experiencia. [Aceptar todo] [Configurar] # El artículo que venías a leer El primer párrafo de verdad del texto. <div class="promo-inline"> ## Lo más leído [Otro titular](/a) [Un titular más](/b) [Y un tercero](/c)
lo que acaba en la nota
# El artículo que venías a leer El primer párrafo de verdad del texto.
Convierte tablas, código y notas al pie a Markdown
Las tablas las serializa la propia extensión y no un plugin genérico, porque los conversores genéricos se rompen con una celda que contiene una lista o un bloque de código. Los bloques de código toman el lenguaje del marcado de la propia página. Los enlaces de referencia se recogen como notas al pie de Markdown antes de que el saneador elimine los identificadores de los que dependen: el orden importa, y equivocarse ahí pierde todas las notas sin decir nada. Cuántas tablas conservó cada motor en las mismas 109 páginas está contado en la página de la medición.
¿Cuándo responde «sin artículo»?
En una tienda, un tablón de titulares o un resultado de búsqueda no hay artículo. La extensión revisa el Markdown terminado: si más de una cuarta parte está dentro de etiquetas de enlace, responde «sin artículo» en lugar de entregarte trescientos enlaces. La negativa es deliberada y explica por qué los recuentos de caracteres son más bajos que los de herramientas que siempre devuelven algo.
Si rechaza un artículo de verdad, envíanos la dirección de esa página.
Comprueba lo que no hace
- No descarga imágenes, vídeo ni otros archivos binarios: los enlaces de imagen apuntan al sitio original
- No rastrea: una página cada vez, la que tienes delante; capturar varias pestañas a la vez está en la lista de deseos
- No resume ni reescribe: el texto del artículo se convierte, no se edita
- No se ejecuta en páginas que el navegador protege, como
chrome://o la propia tienda de extensiones