Clean Clipper Añadir a Chrome – gratis

Por dentro

Cómo funciona y dónde se detiene

Aquí no hay magia y nada llama a un servidor. Toda la cadena se ejecuta en la página que estás mirando, en unas pocas decenas de milisegundos.

Encontrar el artículo

Primero la extensión busca los contenedores evidentes en los que suele vivir un artículo. Cuando no hay ninguno –y en muchos sitios reales no lo hay– pasa a medir la densidad de texto: qué bloque contiene más texto de párrafo que no esté dentro de un enlace. Gana el bloque más estrecho que aún conserva casi todo ese texto.

Un bloque cuyo texto son sobre todo etiquetas de enlace es un menú o un tablón, no un artículo, y se descarta – salvo que contenga más de unos 1200 caracteres de texto real, porque los artículos largos llevan legítimamente muchos enlaces.

Quitar el mobiliario

Después se van los elementos que se sabe que no son contenido: navegación, banners, barras para compartir, avisos de cookies, paginadores, listas de «lo más leído» y tiras de logotipos. Las líneas repetidas se eliminan, porque la navegación duplicada en cada sección es la mayor fuente de ruido de una página capturada.

lo que conservan otros clippers

[Saltar al contenido](#main) [Iniciar sesión](/login) [Registrarse](/registro)
[Portada](/) [Actualidad](/actualidad) [Deportes](/deportes) [Cultura](/cultura) [Más](/mas)

Usamos cookies y tecnologías similares para mejorar tu experiencia.
[Aceptar todo] [Configurar]

# El artículo que venías a leer

El primer párrafo de verdad del texto.

<div class="promo-inline">

## Lo más leído
[Otro titular](/a) [Un titular más](/b) [Y un tercero](/c)

lo que acaba en la nota

# El artículo que venías a leer

El primer párrafo de verdad del texto.

Convertir

Las tablas las serializa la propia extensión y no un plugin genérico, porque los conversores genéricos se rompen con una celda que contiene una lista o un bloque de código. Los bloques de código toman el lenguaje del marcado de la propia página. Los enlaces de referencia se recogen como notas al pie de Markdown antes de que el saneador elimine los identificadores de los que dependen: el orden importa, y equivocarse ahí pierde todas las notas sin decir nada.

Dónde se detiene

En una tienda, un tablón de titulares o un resultado de búsqueda no hay artículo. La extensión revisa el Markdown terminado: si más de una cuarta parte está dentro de etiquetas de enlace, informa de «sin artículo» en lugar de entregarte trescientos enlaces. Esa negativa es deliberada, y por eso los recuentos de caracteres de aquí son más bajos que los de herramientas que siempre devuelven algo.

Lo que no hace

Preguntas

¿Cuánto tarda una captura?
Decenas de milisegundos en un artículo normal; una página muy larga con cientos de notas al pie tarda unos pocos cientos. El tiempo aparece en la esquina de la ventana de captura.
¿Funciona en aplicaciones de una sola página?
Sí. Lee el DOM después del renderizado, así que un sitio de documentación construido en JavaScript se captura tal como lo ves.
¿Qué es el modo de extracción jsonld-articlebody?
Algunas páginas traen el texto del artículo en sus datos estructurados pero nunca terminan de mostrarlo. Cuando los datos estructurados contienen bastante más texto que el DOM, la extensión los usa y deja constancia de que lo hizo.