Clean Clipper Añadir a Chrome – gratis

Para quién es

Reúne material que se pueda seguir citando

El material reunido en capturas de pantalla o en marcadores deja de servir justo cuando hay que atribuirlo. Clean Clipper guarda una página web en Markdown con esos cuatro datos en el frontmatter y el cuerpo del artículo sin navegación. El archivo vive en tu carpeta, en un formato que no controla ningún proveedor.

Material que se queda mudo

La documentación de un texto largo se junta a lo largo de meses: una entrevista, un informe, un par de artículos, una entrada de blog que ya no encuentras. Guardada como captura de pantalla, no se puede buscar; guardada como marcador, apunta a una página que puede haber cambiado. Cuando llega la revisión y hay que sostener una frase, empieza otra vez la búsqueda desde cero.

El campo del autor es el que más se pierde. Los clippers que lo rellenan suelen meter lo primero que se parece a un nombre: el título de la sección, el nombre del medio o la etiqueta de un botón. Una ficha con el autor equivocado da más trabajo que una ficha sin autor, porque hay que descubrir primero que está mal.

A eso se suma que el material no viene todo en el mismo idioma ni de la misma clase de sitio. Una entrevista en portugués, un informe institucional, un blog personal y la ficha de un archivo: cada uno maqueta el texto a su manera y cada uno rompe de forma distinta. La extracción se midió sobre 403 páginas de los cincuenta sitios más visitados de doce países europeos, cada una capturada en el idioma de su país, sin un solo fallo y sin una etiqueta HTML sobrante; esa es la razón de que la carpeta de documentación se pueda leer entera sin excepciones.

Qué cambia en tu carpeta

El campo author se filtra en lugar de rellenarse con lo primerofundeu.es
---
title: "Recomendación: cómo escribir sobre cifras económicas"
source: "https://www.fundeu.es/recomendacion/cifras-economicas/"
author: "Fundéu RAE"
published: "2023-02-09"
extraction: "dom"
---

Descartados en el campo author por ser falsos positivos: «Compartir»,
«Recomendaciones» y el nombre de la propia publicación.

Cómo montar tu carpeta de documentación

La documentación de un libro o de un reportaje largo se acumula durante meses, y lo que decide si sirve es cómo entra, no cuánto hay. Estos seis pasos dejan la carpeta lista antes de la primera fuente.

  1. Elige una sola carpeta para todo el proyecto y señálala en los ajustes de la extensión como carpeta de destino. Repartir la documentación entre varias carpetas es lo que después obliga a buscar tres veces la misma cita.
  2. Pon la plantilla de nombre en {date}-{domain}-{title}. El dominio en el nombre permite ver de un vistazo si una afirmación se apoya en tres fuentes distintas o en la misma tres veces, que es la comprobación que más se agradece en la revisión.
  3. Deja activos los cinco campos del frontmatter, y en especial author y published. Son los dos datos que hacen falta para atribuir, y los dos que se pierden al copiar y pegar.
  4. Deja el clic en el icono en «vista previa». En documentación conviene mirar la captura antes de archivarla: es el momento de comprobar que el autor que aparece es el autor y no el nombre de la sección.
  5. Practica la captura de selección con un párrafo cualquiera. Es lo que usarás para quedarte con una frase concreta de una entrevista larga, y el frontmatter se escribe completo igual, así que la cita no pierde su procedencia.
  6. Crea reglas por sitio para los dominios de los que vayas a sacar más material. Un patrón de dirección recibe su propia subcarpeta y su propio ajuste de imágenes, y eso mantiene separadas las fuentes primarias de las lecturas de contexto sin que decidas nada al capturar.

Ajustes para documentación citable

Los valores de abajo están elegidos para que dentro de un año la ficha siga diciendo quién lo escribió, cuándo y dónde. Es la diferencia entre documentación y una carpeta de textos sueltos.

AjusteValorPor qué así para documentar
Clic en el iconoVista previaRevisar la captura es el único momento barato para detectar un campo `author` que se ha llenado con la sección en lugar de la firma
Carpeta de destinoUna por proyectoLa documentación de un texto largo se consulta entera; repartida no se consulta
Plantilla de nombre`{date}-{domain}-{title}`El dominio en el nombre enseña de un vistazo si tres fichas son tres fuentes o la misma tres veces
FrontmatterLos cinco campos`author` y `published` son exactamente lo que pide una atribución; `extraction` dice de qué capturas fiarse
ImágenesEnlaceUna fotografía o un gráfico citado al menos queda localizable; no se descargan archivos binarios
Regla por sitioFuentes primarias → subcarpeta aparteSeparar la fuente directa de la lectura de contexto evita atribuir a una lo que dijo la otra
Captura de selecciónSeleccionar antes de pulsarPara quedarte con la frase que vas a citar sin arrastrar la entrevista entera
Caso difícil: la firma se lee de los datos estructurados y la fecha de edición se descartaletraslibres.com
---
title: "Conversación sobre el oficio de traducir"
source: "https://letraslibres.com/literatura/conversacion-oficio-traducir/"
author: "Marta Rebón"
published: "2024-10-11"
extraction: "dom"
---

  JSON-LD author            Marta Rebón          ← el que se usa
  JSON-LD dateModified      2025-01-30           (edición posterior, descartada)
  article:published_time    2024-10-11           ← el que se usa

Descartados en el campo author por ser falsos positivos: «Literatura»
(título de sección), «Letras Libres» (nombre de la publicación) y
«Suscríbete» (etiqueta de botón).

Tres casos reales

Documentar un texto largo durante meses

Estás con un ensayo que tardará medio año. Cada vez que encuentras algo que puede servir lo capturas sin decidir todavía si lo usarás: cuesta un gesto, y la decisión de descartar es mucho más barata cuando el material ya está a mano que cuando hay que volver a buscarlo.

Al llegar la escritura tienes doscientos archivos en una carpeta, cada uno con su autor, su fecha y su dirección. Buscas por palabra y la cita aparece con su procedencia puesta. Como los nombres llevan el dominio delante, se ve enseguida si una afirmación se apoya en fuentes distintas o en la misma repetida.

Una frase concreta de una entrevista larga

La entrevista tiene cuarenta preguntas y a ti te interesa una respuesta. La seleccionas en la página y capturas la selección: se guarda ese pasaje con el frontmatter completo, incluidos el autor y la fecha de publicación de la entrevista entera.

Eso es lo que convierte una cita en algo defendible: el texto exacto, con quién lo dijo, dónde se publicó y cuándo. Y si más tarde necesitas el contexto, la dirección del frontmatter te devuelve a la entrevista completa sin buscar nada.

Material en otro idioma

Una parte de la documentación está en portugués, en italiano o en alemán. La captura funciona igual: la selección del cuerpo del artículo se hace por densidad de texto y no por palabras clave del idioma, así que no hay lenguas mejor o peor atendidas.

Eso está medido: 403 páginas de los cincuenta sitios más visitados de doce países europeos, cada una capturada con el navegador puesto en el idioma del país, con cero fallos y cero etiquetas HTML sobrantes. Lo que sí conviene saber es que la fecha depende de lo que declare cada sitio, y hay corpus enteros donde no está.

Frente a las otras formas de documentarse

Cada método sirve para algo distinto, y todos cuestan algo. La última fila es esta extensión, con su parte dicha sin adornos.

Cómo se hace ahoraQué obtienesQué cuesta
Captura de pantallaPrueba visual de lo que viste, con su maquetaciónNo se busca por palabra ni se cita; una carpeta de trescientas imágenes solo la entiende quien la hizo
MarcadorUn índice de lo leído, sin esfuerzoGuarda la dirección, no el texto: cuando la página se edita o desaparece, la ficha deja de probar nada
Copiar y pegar en un documentoEl texto donde ya escribesSe pierden el autor y la fecha, y con el tiempo no se distingue la cita literal de la nota propia
Servicio de lectura para más tardeUna biblioteca ordenada y sincronizadaTu material vive en el servidor y el formato de otro; la exportación llega tarde o incompleta
Imprimir a PDFUn archivo fiel, fechado por el sistemaArrastra menús y publicidad, no se edita y no lleva dentro la fecha real de publicación
Clean ClipperMarkdown con título, autor, fecha y dirección, en tu carpetaNo comprueba si la fuente es fiable, no conserva la maquetación, no descarga imágenes y no resuelve derechos de uso

Cuando la ficha sale incompleta

¿Por qué el campo author está vacío?

Porque la página no declara una firma que pueda leerse con seguridad. Se miran los datos estructurados y las firmas del cuerpo, y se descartan los falsos positivos habituales: títulos de sección, nombre de la publicación, etiquetas de botón y bloques de control de autoridades. Cuando lo único disponible es uno de esos, el campo se deja vacío. En el primer corpus se encontraron 20 autores frente a los 28 del mejor motor comparado, y esa diferencia es deliberada: un autor equivocado cuesta más de descubrir que uno ausente.

¿Por qué el autor que aparece no es el que firma?

Ocurre en páginas que declaran como autor a la propia publicación, o en secciones colectivas donde la firma del cuerpo pertenece a otra pieza de la misma página. La extensión toma lo que la página declara; no lo inventa, pero tampoco lo verifica. Si vas a atribuir, la comprobación de un vistazo en la vista de lectura es el momento de hacerla, y corregir un campo del frontmatter es editar una línea de texto.

¿Por qué el artículo de pago sale cortado?

Porque tu navegador tampoco lo tenía entero. Si el sitio muestra dos párrafos y esconde el resto tras la suscripción, eso es lo que hay en la página y eso es lo que se captura. Con la sesión iniciada y el artículo abierto de verdad, la captura trae el texto completo: la extensión lee lo que el navegador ya renderizó para ti, y no inicia sesión ni guarda credenciales.

¿Por qué la captura trae titulares de la columna lateral?

Porque en ese sitio la columna está maquetada dentro del propio artículo y no alrededor. El recorte quita navegación, banners, barras para compartir, paginadores y listas de «lo más leído», y elimina las líneas repetidas, pero un bloque de titulares colocado dentro del cuerpo se parece a una lista corriente.

La medida es esa: en 109 páginas quedaron 102 líneas de menú duplicadas frente a 282, 478 y 491 de los otros tres motores. No es cero, y en la ficha de documentación esas líneas se borran en un segundo, que es distinto de reconstruir un texto.

Lo que no hace

No comprueba si la cita es correcta ni si la fuente es fiable: guarda lo que la página decía y de dónde salía. No conserva el diseño de la página, ni hace capturas de pantalla, ni descarga las imágenes: quedan como enlaces al sitio original. No rellena el autor cuando la página no lo declara, y prefiere dejarlo vacío antes que acertar por casualidad. Y no gestiona derechos: lo que puedas hacer con el texto que capturas depende de la licencia de cada sitio.

Añadir a Chrome – gratisGratis del todo: sin cuenta y sin límite de páginas.

Preguntas

¿Conserva el autor?
Cuando la página lo declara. Clean Clipper lee los datos estructurados y las firmas, y descarta los falsos positivos –títulos de sección, nombres del medio, etiquetas de botón– en vez de meter en el campo la primera cadena verosímil.
¿Puedo conservar las imágenes?
Sí, como enlaces al sitio original, que es lo que hace por defecto. Puedes desactivarlas de forma global o solo para algunos sitios.
¿Y los artículos de pago a los que estoy suscrito?
Se capturan con normalidad, porque la extensión lee la página que tu navegador ya ha renderizado para ti con tu sesión.
¿Puedo guardar solo la frase que quiero citar?
Sí. Selecciónala antes de capturar: se guarda la selección con el mismo frontmatter completo, así que la cita conserva su procedencia.
¿Sirve para material en varios idiomas?
Sí. La extracción se midió en 403 páginas de los cincuenta sitios más visitados de doce países europeos, cada una en el idioma de su país, sin un solo fallo.
¿Puedo corregir a mano el autor o la fecha de una ficha?
Sí, es un archivo de texto. El frontmatter son líneas YAML al principio del .md: se edita como cualquier otra línea, y ninguna herramienta tiene que dar permiso para ello.
¿Distingue la fecha de publicación de la de la última edición?
Sí. dateModified se descarta a propósito: refleja una edición posterior, y usarla como fecha de publicación mete en la documentación un dato que parece correcto sin serlo.
¿Se conservan las notas al pie del artículo?
Sí. Los enlaces de referencia se convierten en notas [^1] con sus definiciones agrupadas al final del archivo, en lugar de quedar como anclas que apuntan a una página cerrada.
¿Puedo tener una carpeta por proyecto y cambiar entre ellas?
Sí. La carpeta de destino se cambia en los ajustes cuando quieras, y dentro de una misma carpeta las reglas por sitio reparten en subcarpetas según el dominio de origen.
¿Qué pasa con las entrevistas en vídeo?
Se guarda el texto de la página, no el vídeo: la extensión no descarga archivos binarios. Si la página publica transcripción, esa sí se captura entera y es lo que después se puede citar y buscar.