Clean Clipper Añadir a Chrome – gratis

Extensión de Chrome

Guardar una página web en Markdown que no tendrás que limpiar

Guardar una página web en Markdown son dos segundos: haces clic en el icono y la captura ya está lista – el título, el autor, la fecha de publicación y la dirección de origen recogidos en el frontmatter, y el cuerpo sin navegación. Todo ocurre dentro de tu navegador: sin cuenta, sin servidor, sin telemetría.

La ventana de Clean Clipper con el Markdown de un artículo de Wikipedia capturado
Añadir a Chrome – gratisGratis del todo: sin cuenta y sin límite de páginas.

El problema nunca es la conversión. Es todo lo que viene con ella.

Cualquier clipper convierte HTML en Markdown. Luego abres la nota y ahí están el aviso de cookies, el menú lateral, una lista de «lo más leído» y una tabla que se deshizo por el camino. Clean Clipper está construido justo alrededor de quitar eso, y ese recorte está medido, no prometido.

lo que conservan otros clippers

[Saltar al contenido](#main) [Iniciar sesión](/login) [Registrarse](/registro)
[Portada](/) [Actualidad](/actualidad) [Deportes](/deportes) [Cultura](/cultura) [Más](/mas)

Usamos cookies y tecnologías similares para mejorar tu experiencia.
[Aceptar todo] [Configurar]

# El artículo que venías a leer

El primer párrafo de verdad del texto.

<div class="promo-inline">

## Lo más leído
[Otro titular](/a) [Un titular más](/b) [Y un tercero](/c)

lo que acaba en la nota

# El artículo que venías a leer

El primer párrafo de verdad del texto.

Qué hace que la salida esté limpia

Salida real, sin retocares.wikipedia.org/wiki/Cadena_de_Márkov
---
title: "Cadena de Márkov - Wikipedia, la enciclopedia libre"
source: "https://es.wikipedia.org/wiki/Cadena_de_Márkov"
date: "2004-11-21T19:32:08.000Z"
extraction: "dom"
---

Una cadena de Márkov es un proceso estocástico que describe una secuencia de
posibles sucesos en la que la probabilidad de cada uno depende únicamente del
estado alcanzado en el suceso anterior.[^1]

[^1]: Márkov, A. A. (1906). Extensión de la ley de los grandes números a
      magnitudes dependientes entre sí.

Medido sobre 512 páginas de los sitios más visitados del mundo

Dos pasadas. La primera tomó 109 páginas de los cien sitios más visitados del mundo y de Rusia y comparó la salida con otros tres motores de extracción. La segunda tomó los cincuenta sitios más visitados de doce países europeos: 403 páginas más, cada una capturada en el idioma del país.

512páginas capturadas en total
0fallos
0etiquetas HTML sobrantes
102líneas de menú duplicadas, frente a 282, 478 y 491 de los otros tres motores

Dónde guarda

El clic en el icono es configurable. Puedes dejarlo como ventana de vista previa o hacer que un solo clic deje la nota en el vault y no abra nada.

Ajustes de Clean Clipper: qué hace el clic en el icono
Los ajustes deciden qué hace un clic: vista previa, portapapeles, archivo, carpeta o directamente el vault.

Honesto sobre el origen

Cada nota lleva un campo extraction. dom significa que el texto salió de lo que el navegador renderizó de verdad. jsonld-articlebody significa que la página nunca terminó de renderizarse y el cuerpo hubo que leerlo de sus propios datos estructurados. Y cuando en la página no hay artículo ninguno –una tienda, un tablón de titulares, un resultado de búsqueda– la extensión lo dice en vez de soltarte trescientos enlaces.

Quince formas de usarlo

DesarrolladoresLos bloques conservan su etiqueta de lenguaje: la documentación pegada sale resaltada.

Clean Clipper lee el lenguaje del marcado de la propia página –la clase del bloque, el elemento padre o lo que dejó el resaltador– y lo escribe en el bloque de Markdown. Al pegar la nota en Obsidian, VS Code o GitHub el resaltado ya funciona, sin tocar nada. En un corpus técnico de nueve páginas la etiqueta sobrevivió en 73 de 156 bloques, frente a 20 y 0 de los dos motores comparados.

  • El bloque sale como ```js, no desnudo: el resaltado funciona en Obsidian, VS Code y GitHub nada más pegar
  • La etiqueta se lee del marcado del sitio; la extensión no adivina el lenguaje a partir del código
  • Las tablas con código o con una lista dentro de una celda mantienen la fila en su sitio
Más información
Usuarios de ObsidianEliges una carpeta dentro del vault y un clic escribe la nota ahí. Obsidian no tiene que estar abierto.

Clean Clipper escribe el archivo .md por su cuenta, con la File System Access API del navegador, en una carpeta a la que le das acceso una sola vez. No hay plugin de la comunidad, ni servidor local, ni enlaces obsidian:// que mantener vivos. Obsidian recoge la nota la próxima vez que mira el vault.

  • Sin plugin, sin servidor local, sin enlaces obsidian://
  • Obsidian no necesita estar abierto: el archivo está ahí la próxima vez que lo abras
  • Frontmatter YAML con title, source, author, published y extraction, y eliges cuáles conservar
Más información
Flujos con IALa navegación repetida es contexto tirado. Se corta antes de que el texto llegue a tu modelo.

Cuando pegas una página web en un modelo, cada línea de menú duplicada, cada aviso de cookies y cada lista de «lo más leído» ocupa contexto y compite por la atención del modelo. En un corpus de 109 páginas Clean Clipper dejó 102 líneas de navegación duplicadas donde los otros tres motores dejaron 282, 478 y 491. Lo que llega al chat es el artículo, con su dirección de origen y su fecha en el frontmatter.

  • Cuatro veces menos navegación duplicada que la media de los motores comparados
  • Cero etiquetas HTML sobrantes en las 512 páginas medidas
  • El frontmatter le da al modelo la dirección de origen y la fecha de publicación de forma explícita
Más información
InvestigaciónLee citation_date, el estándar de arXiv, PubMed e IEEE, y agrupa las notas al final del archivo.

Clean Clipper toma la fecha de los metadatos de la propia página en vez de deducirla del texto, y si la página no declara ninguna, deja el campo vacío. Los enlaces de referencia se convierten en notas al pie de Markdown con sus definiciones al final del archivo. La dirección de origen viaja en el frontmatter, así que la nota se puede citar sin volver a buscarla.

  • Lee citation_date y citation_publication_date, las etiquetas meta que emiten arXiv, PubMed e IEEE
  • También JSON-LD datePublished, article:published_time, time[datetime] y marcas de tiempo Unix
  • Si la página no declara fecha, el campo queda vacío; nunca se rellena con la de hoy
Más información
EstudiantesCaptura clases, capítulos y páginas de referencia en archivos que se quedan contigo.

Una página guardada en Markdown es un archivo de texto en tu disco: se abre sin conexión, se busca con cualquier buscador del sistema y sigue abriéndose dentro de diez años. Puedes capturar la página entera o solo el párrafo que has seleccionado. Cada archivo lleva la dirección de origen, así que citarlo después no cuesta ninguna búsqueda.

  • Seleccionas un pasaje y solo se captura la selección: útil para quedarte con una definición
  • Cada archivo lleva la dirección de origen, así que citarlo después no cuesta ninguna búsqueda
  • Funciona con Obsidian, Logseq, Joplin o una carpeta de archivos sin más
Más información
AutoresCada captura conserva título, autor, fecha y dirección, así que una cita no pierde su procedencia.

El material reunido en capturas de pantalla o en marcadores deja de servir justo cuando hay que atribuirlo. Clean Clipper guarda una página web en Markdown con esos cuatro datos en el frontmatter y el cuerpo del artículo sin navegación. El archivo vive en tu carpeta, en un formato que no controla ningún proveedor.

  • Título, autor, fecha de publicación y dirección de origen en el frontmatter de cada archivo
  • El cuerpo del artículo sin navegación ni bloques promocionales, listo para citar
  • El autor se filtra: los títulos de sección, los nombres del medio y las etiquetas de botón se descartan
Más información
PeriodistasLa página tal como la viste, con su fecha de publicación, en un formato que sobrevive al sitio.

Las páginas se editan y se retiran sin avisar. Una captura con la dirección de origen, la fecha de publicación y el texto completo es constancia de lo que decía la página cuando la leíste, y vive en tu disco y no en un servicio que puede cerrar. La fecha se lee de los metadatos de la propia página, no del texto.

  • La fecha de publicación se lee de los metadatos de la página, no del texto ni del día de la captura
  • La dirección de origen queda en el frontmatter de cada archivo
  • El texto completo del artículo, sin la navegación ni los bloques promocionales que cambian entre visitas
Más información
Trabajo jurídicoEl texto tal como se publicó, con la dirección de origen y la fecha, en un archivo que controlas tú.

Las normas, las condiciones de servicio y las guías administrativas cambian sin aviso. Una copia en Markdown con la dirección de la que salió y la fecha que llevaba es constancia de lo que decía el texto cuando lo leíste. La extensión no resume, no reescribe y no reordena: dentro del cuerpo del documento no se añade ni se quita una palabra.

  • Texto literal: no se resume, no se reescribe y no se reordena nada dentro del cuerpo
  • Dirección de origen y fecha de publicación en el frontmatter de cada archivo
  • Las tablas de tasas, plazos y umbrales sobreviven enteras a la conversión
Más información
AnalistasClean Clipper serializa las tablas por su cuenta: una celda con código o con una lista ya no rompe la fila.

Los conversores genéricos de HTML a Markdown se rompen justo con las tablas que importan: las que llevan una lista, un enlace o un ejemplo de código dentro de una celda. Clean Clipper escribe la tabla él mismo y aplana el contenido de la celda en vez de perder la fila. En un corpus técnico de quince tablas conservó doce, frente a siete de cada motor comparado.

  • Serializador propio de tablas GFM en lugar de un plugin genérico
  • Doce tablas de quince conservadas en el corpus técnico, frente a siete de cada motor comparado
  • Las tablas irregulares de dos columnas pasan a líneas Clave: valor en vez de a una rejilla rota
Más información
DocentesCaptura el contenido, conserva la fuente e imprímelo, sin el mobiliario del sitio.

Una página impresa directamente desde el navegador arrastra sus menús, su aviso de cookies y su publicidad hasta el material de clase. Clean Clipper imprime la captura y no la página: queda el texto, con la dirección de origen para atribuirlo. La vista de lectura enseña el resultado sin símbolos de Markdown antes de imprimir o de guardar.

  • Un botón de imprimir que imprime la captura, no la página
  • La vista de lectura muestra el resultado sin símbolos de Markdown
  • La dirección de origen se queda en la nota, así que atribuir no cuesta esfuerzo
Más información
TraductoresLa navegación, los banners y los menús repetidos no llegan nunca a la lista de segmentos.

El texto origen pegado desde una página web arrastra la navegación consigo, y cada elemento de menú se convierte en un segmento que hay que saltar. Clean Clipper corta esos bloques antes de exportar, así que lo que importas es prosa. La negrita, la cursiva, los enlaces y las listas llegan como Markdown estándar, que las herramientas TAO tratan como etiquetas en línea.

  • Menús, paginadores, banners y listas de «lo más leído» cortados antes de exportar
  • Las líneas de navegación duplicadas se reducen unas cuatro veces frente a los motores comparados
  • Negrita, cursiva, enlaces, código y listas llegan como Markdown estándar
Más información
Product managersCaptura changelogs, documentación y notas de versión en notas fechadas y localizables.

La investigación de la competencia guardada como marcadores se degrada hasta ser una lista de enlaces que no se puede buscar. Capturada en Markdown, se convierte en un corpus con fechas que puedes recorrer, comparar y citar en un documento de decisión. Cada nota lleva la fecha de publicación real de la página, no la del día en que la guardaste.

  • La fecha de publicación se lee de la página, así que una entrada de changelog conserva su momento real
  • Las reglas por sitio llevan a cada competidor a su propia carpeta y con sus propios ajustes
  • Las tablas de planes, límites y comparativas sobreviven enteras
Más información
Redacción técnicaLa estructura, los bloques de código y las tablas llegan al otro lado; el envoltorio del sitio no.

Migrar documentación suele significar convertir el HTML y luego pasar más tiempo quitando lo que el conversor decidió conservar. Ese recorte es justo para lo que se hizo Clean Clipper, y es la parte que está medida: cero etiquetas HTML sobrantes en las 512 páginas del corpus. Los encabezados, las listas, las tablas, los bloques de código y las notas al pie se corresponden con Markdown estándar.

  • Encabezados, listas, tablas, bloques de código y notas al pie se corresponden con Markdown estándar
  • Las etiquetas de lenguaje se conservan en los bloques de código
  • Cero etiquetas HTML sobrantes en las 512 páginas medidas
Más información
Archivo personalArchivos Markdown en tu propio disco. Sin cuenta, sin servicio, sin nada que pueda cerrar.

Los marcadores apuntan a páginas que cambian o desaparecen; una captura es el texto en sí. Clean Clipper escribe texto plano con frontmatter YAML en la carpeta que tú decidas, sin cuenta, sin servidor y sin ninguna petición de red. Lo que guardas hoy se abre dentro de diez años con cualquier editor.

  • Formato abierto y duradero: texto plano con frontmatter YAML
  • Sin cuenta y sin servidor: la extensión no hace ninguna petición de red
  • La fecha de publicación y la dirección de origen se guardan junto con el texto
Más información
Leer sin ruidoUna vista de lectura que muestra el texto sin menús, sin banners y sin símbolos de Markdown.

El mobiliario de una página no es solo desorden visual: es texto que un lector de pantalla tiene que leer en voz alta y que la persona tiene que saltar. La ventana de captura muestra el artículo solo, en el tema claro u oscuro de tu navegador y sin ejecutar ningún script de la página. El archivo que guardas es texto plano, que cualquier herramienta de apoyo maneja sin tropiezos.

  • La vista de lectura muestra la captura como texto corriente, sin símbolos de Markdown
  • Sigue el ajuste de tema claro y oscuro de tu navegador
  • Se amplía a una ventana que ocupa tres cuartos de la pantalla para leer con comodidad
Más información

Preguntas

¿Clean Clipper envía mis páginas a algún sitio?
No. La extracción y la conversión ocurren por completo dentro de tu navegador. La copia va a tu portapapeles y el archivo a tu disco. No hay cuenta, ni analítica, ni ninguna petición a terceros. La extensión no pide permisos de host, así que no puede leer una página en la que no hayas hecho clic.
¿Hace falta tener Obsidian abierto para guardar en el vault?
No. Clean Clipper escribe el archivo directamente en una carpeta a la que le has dado acceso, con la File System Access API del navegador. Obsidian lo recoge la próxima vez que mira el vault.
¿Qué pasa en una página que no es un artículo?
Lo dice. En tiendas, tablones de titulares y resultados de búsqueda no hay artículo que extraer, y la extensión marca la captura como «sin artículo» en lugar de devolver una página llena de enlaces.
¿En qué navegadores funciona?
Chrome y el resto de navegadores Chromium: Edge, Brave, Vivaldi, Opera. Es una extensión Manifest V3 sin permisos de host.
¿Es gratis?
Sí, entera. Capturar páginas y selecciones sin límite, el frontmatter, las notas al pie, las tablas, las etiquetas de lenguaje en el código, las reglas por sitio, la carpeta en el disco, el vault de Obsidian y los catorce idiomas de la interfaz: todo está en la extensión gratuita. No hay cuenta, ni registro, ni versión de pago.