Extensión de Chrome
Guardar una página web en Markdown que no tendrás que limpiar
Guardar una página web en Markdown son dos segundos: haces clic en el icono y la captura ya está lista – el título, el autor, la fecha de publicación y la dirección de origen recogidos en el frontmatter, y el cuerpo sin navegación. Todo ocurre dentro de tu navegador: sin cuenta, sin servidor, sin telemetría.

El problema nunca es la conversión. Es todo lo que viene con ella.
Cualquier clipper convierte HTML en Markdown. Luego abres la nota y ahí están el aviso de cookies, el menú lateral, una lista de «lo más leído» y una tabla que se deshizo por el camino. Clean Clipper está construido justo alrededor de quitar eso, y ese recorte está medido, no prometido.
lo que conservan otros clippers
[Saltar al contenido](#main) [Iniciar sesión](/login) [Registrarse](/registro) [Portada](/) [Actualidad](/actualidad) [Deportes](/deportes) [Cultura](/cultura) [Más](/mas) Usamos cookies y tecnologías similares para mejorar tu experiencia. [Aceptar todo] [Configurar] # El artículo que venías a leer El primer párrafo de verdad del texto. <div class="promo-inline"> ## Lo más leído [Otro titular](/a) [Un titular más](/b) [Y un tercero](/c)
lo que acaba en la nota
# El artículo que venías a leer El primer párrafo de verdad del texto.
Qué hace que la salida esté limpia
- El código conserva su lenguaje. El bloque sale marcado como
js, no desnudo, y el resaltado funciona nada más pegarlo. - Las tablas quedan enteras. Una celda con código o con una lista ya no rompe la fila.
- Las notas al pie funcionan de verdad. Los enlaces de referencia se convierten en
[^1]con sus definiciones al final de la nota, no en anclas muertas. - La fecha se lee, no se adivina. JSON-LD,
article:published_time,citation_date(el estándar de arXiv, PubMed e IEEE),time[datetime], marcas Unix. Si la página no trae fecha, el campo queda vacío; nunca se rellena con la de hoy. - Menús, banners y «lo más leído» se cortan. Las tiras de logotipos, los paginadores y la navegación repetida en cada sección no llegan a la nota.
- Ni una etiqueta suelta. Nada de
divnitablevarados en mitad del texto.
---
title: "Cadena de Márkov - Wikipedia, la enciclopedia libre"
source: "https://es.wikipedia.org/wiki/Cadena_de_Márkov"
date: "2004-11-21T19:32:08.000Z"
extraction: "dom"
---
Una cadena de Márkov es un proceso estocástico que describe una secuencia de
posibles sucesos en la que la probabilidad de cada uno depende únicamente del
estado alcanzado en el suceso anterior.[^1]
[^1]: Márkov, A. A. (1906). Extensión de la ley de los grandes números a
magnitudes dependientes entre sí.Medido sobre 512 páginas de los sitios más visitados del mundo
Dos pasadas. La primera tomó 109 páginas de los cien sitios más visitados del mundo y de Rusia y comparó la salida con otros tres motores de extracción. La segunda tomó los cincuenta sitios más visitados de doce países europeos: 403 páginas más, cada una capturada en el idioma del país.
Dónde guarda
- Copiar el Markdown al portapapeles
- Descargar el archivo
.md - Escribir en una carpeta que elijas en el disco
- Escribir directamente en tu vault de Obsidian – sin plugin, sin API REST local, sin esquema URI; el archivo simplemente aparece
El clic en el icono es configurable. Puedes dejarlo como ventana de vista previa o hacer que un solo clic deje la nota en el vault y no abra nada.

Honesto sobre el origen
Cada nota lleva un campo extraction. dom significa que el texto salió de lo que el navegador renderizó de verdad. jsonld-articlebody significa que la página nunca terminó de renderizarse y el cuerpo hubo que leerlo de sus propios datos estructurados. Y cuando en la página no hay artículo ninguno –una tienda, un tablón de titulares, un resultado de búsqueda– la extensión lo dice en vez de soltarte trescientos enlaces.
Quince formas de usarlo
DesarrolladoresLos bloques conservan su etiqueta de lenguaje: la documentación pegada sale resaltada.
Clean Clipper lee el lenguaje del marcado de la propia página –la clase del bloque, el elemento padre o lo que dejó el resaltador– y lo escribe en el bloque de Markdown. Al pegar la nota en Obsidian, VS Code o GitHub el resaltado ya funciona, sin tocar nada. En un corpus técnico de nueve páginas la etiqueta sobrevivió en 73 de 156 bloques, frente a 20 y 0 de los dos motores comparados.
- El bloque sale como ```js, no desnudo: el resaltado funciona en Obsidian, VS Code y GitHub nada más pegar
- La etiqueta se lee del marcado del sitio; la extensión no adivina el lenguaje a partir del código
- Las tablas con código o con una lista dentro de una celda mantienen la fila en su sitio
Usuarios de ObsidianEliges una carpeta dentro del vault y un clic escribe la nota ahí. Obsidian no tiene que estar abierto.
Clean Clipper escribe el archivo .md por su cuenta, con la File System Access API del navegador, en una carpeta a la que le das acceso una sola vez. No hay plugin de la comunidad, ni servidor local, ni enlaces obsidian:// que mantener vivos. Obsidian recoge la nota la próxima vez que mira el vault.
- Sin plugin, sin servidor local, sin enlaces
obsidian:// - Obsidian no necesita estar abierto: el archivo está ahí la próxima vez que lo abras
- Frontmatter YAML con title, source, author, published y extraction, y eliges cuáles conservar
Flujos con IALa navegación repetida es contexto tirado. Se corta antes de que el texto llegue a tu modelo.
Cuando pegas una página web en un modelo, cada línea de menú duplicada, cada aviso de cookies y cada lista de «lo más leído» ocupa contexto y compite por la atención del modelo. En un corpus de 109 páginas Clean Clipper dejó 102 líneas de navegación duplicadas donde los otros tres motores dejaron 282, 478 y 491. Lo que llega al chat es el artículo, con su dirección de origen y su fecha en el frontmatter.
- Cuatro veces menos navegación duplicada que la media de los motores comparados
- Cero etiquetas HTML sobrantes en las 512 páginas medidas
- El frontmatter le da al modelo la dirección de origen y la fecha de publicación de forma explícita
InvestigaciónLee citation_date, el estándar de arXiv, PubMed e IEEE, y agrupa las notas al final del archivo.
Clean Clipper toma la fecha de los metadatos de la propia página en vez de deducirla del texto, y si la página no declara ninguna, deja el campo vacío. Los enlaces de referencia se convierten en notas al pie de Markdown con sus definiciones al final del archivo. La dirección de origen viaja en el frontmatter, así que la nota se puede citar sin volver a buscarla.
- Lee
citation_dateycitation_publication_date, las etiquetas meta que emiten arXiv, PubMed e IEEE - También JSON-LD
datePublished,article:published_time,time[datetime]y marcas de tiempo Unix - Si la página no declara fecha, el campo queda vacío; nunca se rellena con la de hoy
EstudiantesCaptura clases, capítulos y páginas de referencia en archivos que se quedan contigo.
Una página guardada en Markdown es un archivo de texto en tu disco: se abre sin conexión, se busca con cualquier buscador del sistema y sigue abriéndose dentro de diez años. Puedes capturar la página entera o solo el párrafo que has seleccionado. Cada archivo lleva la dirección de origen, así que citarlo después no cuesta ninguna búsqueda.
- Seleccionas un pasaje y solo se captura la selección: útil para quedarte con una definición
- Cada archivo lleva la dirección de origen, así que citarlo después no cuesta ninguna búsqueda
- Funciona con Obsidian, Logseq, Joplin o una carpeta de archivos sin más
AutoresCada captura conserva título, autor, fecha y dirección, así que una cita no pierde su procedencia.
El material reunido en capturas de pantalla o en marcadores deja de servir justo cuando hay que atribuirlo. Clean Clipper guarda una página web en Markdown con esos cuatro datos en el frontmatter y el cuerpo del artículo sin navegación. El archivo vive en tu carpeta, en un formato que no controla ningún proveedor.
- Título, autor, fecha de publicación y dirección de origen en el frontmatter de cada archivo
- El cuerpo del artículo sin navegación ni bloques promocionales, listo para citar
- El autor se filtra: los títulos de sección, los nombres del medio y las etiquetas de botón se descartan
PeriodistasLa página tal como la viste, con su fecha de publicación, en un formato que sobrevive al sitio.
Las páginas se editan y se retiran sin avisar. Una captura con la dirección de origen, la fecha de publicación y el texto completo es constancia de lo que decía la página cuando la leíste, y vive en tu disco y no en un servicio que puede cerrar. La fecha se lee de los metadatos de la propia página, no del texto.
- La fecha de publicación se lee de los metadatos de la página, no del texto ni del día de la captura
- La dirección de origen queda en el frontmatter de cada archivo
- El texto completo del artículo, sin la navegación ni los bloques promocionales que cambian entre visitas
Trabajo jurídicoEl texto tal como se publicó, con la dirección de origen y la fecha, en un archivo que controlas tú.
Las normas, las condiciones de servicio y las guías administrativas cambian sin aviso. Una copia en Markdown con la dirección de la que salió y la fecha que llevaba es constancia de lo que decía el texto cuando lo leíste. La extensión no resume, no reescribe y no reordena: dentro del cuerpo del documento no se añade ni se quita una palabra.
- Texto literal: no se resume, no se reescribe y no se reordena nada dentro del cuerpo
- Dirección de origen y fecha de publicación en el frontmatter de cada archivo
- Las tablas de tasas, plazos y umbrales sobreviven enteras a la conversión
AnalistasClean Clipper serializa las tablas por su cuenta: una celda con código o con una lista ya no rompe la fila.
Los conversores genéricos de HTML a Markdown se rompen justo con las tablas que importan: las que llevan una lista, un enlace o un ejemplo de código dentro de una celda. Clean Clipper escribe la tabla él mismo y aplana el contenido de la celda en vez de perder la fila. En un corpus técnico de quince tablas conservó doce, frente a siete de cada motor comparado.
- Serializador propio de tablas GFM en lugar de un plugin genérico
- Doce tablas de quince conservadas en el corpus técnico, frente a siete de cada motor comparado
- Las tablas irregulares de dos columnas pasan a líneas
Clave: valoren vez de a una rejilla rota
DocentesCaptura el contenido, conserva la fuente e imprímelo, sin el mobiliario del sitio.
Una página impresa directamente desde el navegador arrastra sus menús, su aviso de cookies y su publicidad hasta el material de clase. Clean Clipper imprime la captura y no la página: queda el texto, con la dirección de origen para atribuirlo. La vista de lectura enseña el resultado sin símbolos de Markdown antes de imprimir o de guardar.
- Un botón de imprimir que imprime la captura, no la página
- La vista de lectura muestra el resultado sin símbolos de Markdown
- La dirección de origen se queda en la nota, así que atribuir no cuesta esfuerzo
TraductoresLa navegación, los banners y los menús repetidos no llegan nunca a la lista de segmentos.
El texto origen pegado desde una página web arrastra la navegación consigo, y cada elemento de menú se convierte en un segmento que hay que saltar. Clean Clipper corta esos bloques antes de exportar, así que lo que importas es prosa. La negrita, la cursiva, los enlaces y las listas llegan como Markdown estándar, que las herramientas TAO tratan como etiquetas en línea.
- Menús, paginadores, banners y listas de «lo más leído» cortados antes de exportar
- Las líneas de navegación duplicadas se reducen unas cuatro veces frente a los motores comparados
- Negrita, cursiva, enlaces, código y listas llegan como Markdown estándar
Product managersCaptura changelogs, documentación y notas de versión en notas fechadas y localizables.
La investigación de la competencia guardada como marcadores se degrada hasta ser una lista de enlaces que no se puede buscar. Capturada en Markdown, se convierte en un corpus con fechas que puedes recorrer, comparar y citar en un documento de decisión. Cada nota lleva la fecha de publicación real de la página, no la del día en que la guardaste.
- La fecha de publicación se lee de la página, así que una entrada de changelog conserva su momento real
- Las reglas por sitio llevan a cada competidor a su propia carpeta y con sus propios ajustes
- Las tablas de planes, límites y comparativas sobreviven enteras
Redacción técnicaLa estructura, los bloques de código y las tablas llegan al otro lado; el envoltorio del sitio no.
Migrar documentación suele significar convertir el HTML y luego pasar más tiempo quitando lo que el conversor decidió conservar. Ese recorte es justo para lo que se hizo Clean Clipper, y es la parte que está medida: cero etiquetas HTML sobrantes en las 512 páginas del corpus. Los encabezados, las listas, las tablas, los bloques de código y las notas al pie se corresponden con Markdown estándar.
- Encabezados, listas, tablas, bloques de código y notas al pie se corresponden con Markdown estándar
- Las etiquetas de lenguaje se conservan en los bloques de código
- Cero etiquetas HTML sobrantes en las 512 páginas medidas
Archivo personalArchivos Markdown en tu propio disco. Sin cuenta, sin servicio, sin nada que pueda cerrar.
Los marcadores apuntan a páginas que cambian o desaparecen; una captura es el texto en sí. Clean Clipper escribe texto plano con frontmatter YAML en la carpeta que tú decidas, sin cuenta, sin servidor y sin ninguna petición de red. Lo que guardas hoy se abre dentro de diez años con cualquier editor.
- Formato abierto y duradero: texto plano con frontmatter YAML
- Sin cuenta y sin servidor: la extensión no hace ninguna petición de red
- La fecha de publicación y la dirección de origen se guardan junto con el texto
Leer sin ruidoUna vista de lectura que muestra el texto sin menús, sin banners y sin símbolos de Markdown.
El mobiliario de una página no es solo desorden visual: es texto que un lector de pantalla tiene que leer en voz alta y que la persona tiene que saltar. La ventana de captura muestra el artículo solo, en el tema claro u oscuro de tu navegador y sin ejecutar ningún script de la página. El archivo que guardas es texto plano, que cualquier herramienta de apoyo maneja sin tropiezos.
- La vista de lectura muestra la captura como texto corriente, sin símbolos de Markdown
- Sigue el ajuste de tema claro y oscuro de tu navegador
- Se amplía a una ventana que ocupa tres cuartos de la pantalla para leer con comodidad