Para quién es
Reúne material que se pueda seguir citando
El material reunido en capturas de pantalla o en marcadores deja de servir justo cuando hay que atribuirlo. Clean Clipper guarda una página web en Markdown con esos cuatro datos en el frontmatter y el cuerpo del artículo sin navegación. El archivo vive en tu carpeta, en un formato que no controla ningún proveedor.
Material que se queda mudo
La documentación de un texto largo se junta a lo largo de meses: una entrevista, un informe, un par de artículos, una entrada de blog que ya no encuentras. Guardada como captura de pantalla, no se puede buscar; guardada como marcador, apunta a una página que puede haber cambiado. Cuando llega la revisión y hay que sostener una frase, empieza otra vez la búsqueda desde cero.
El campo del autor es el que más se pierde. Los clippers que lo rellenan suelen meter lo primero que se parece a un nombre: el título de la sección, el nombre del medio o la etiqueta de un botón. Una ficha con el autor equivocado da más trabajo que una ficha sin autor, porque hay que descubrir primero que está mal.
A eso se suma que el material no viene todo en el mismo idioma ni de la misma clase de sitio. Una entrevista en portugués, un informe institucional, un blog personal y la ficha de un archivo: cada uno maqueta el texto a su manera y cada uno rompe de forma distinta. La extracción se midió sobre 403 páginas de los cincuenta sitios más visitados de doce países europeos, cada una capturada en el idioma de su país, sin un solo fallo y sin una etiqueta HTML sobrante; esa es la razón de que la carpeta de documentación se pueda leer entera sin excepciones.
Qué cambia en tu carpeta
- Título, autor, fecha de publicación y dirección de origen en el frontmatter de cada archivo
- El cuerpo del artículo sin navegación ni bloques promocionales, listo para citar
- El autor se filtra: los títulos de sección, los nombres del medio y las etiquetas de botón se descartan
- Captura de selección para quedarte con un solo párrafo
- Una vista de lectura para revisar la captura antes de archivarla
- Los archivos caen en tu propia carpeta, en un formato que no controla ningún proveedor
- La medición europea recorrió doce idiomas: 403 páginas, ningún fallo y ninguna etiqueta HTML sobrante
- Los artículos que lees con tu suscripción se capturan igual, porque se lee la página que el navegador ya te ha mostrado
--- title: "Recomendación: cómo escribir sobre cifras económicas" source: "https://www.fundeu.es/recomendacion/cifras-economicas/" author: "Fundéu RAE" published: "2023-02-09" extraction: "dom" --- Descartados en el campo author por ser falsos positivos: «Compartir», «Recomendaciones» y el nombre de la propia publicación.
Cómo montar tu carpeta de documentación
La documentación de un libro o de un reportaje largo se acumula durante meses, y lo que decide si sirve es cómo entra, no cuánto hay. Estos seis pasos dejan la carpeta lista antes de la primera fuente.
- Elige una sola carpeta para todo el proyecto y señálala en los ajustes de la extensión como carpeta de destino. Repartir la documentación entre varias carpetas es lo que después obliga a buscar tres veces la misma cita.
- Pon la plantilla de nombre en
{date}-{domain}-{title}. El dominio en el nombre permite ver de un vistazo si una afirmación se apoya en tres fuentes distintas o en la misma tres veces, que es la comprobación que más se agradece en la revisión. - Deja activos los cinco campos del frontmatter, y en especial
authorypublished. Son los dos datos que hacen falta para atribuir, y los dos que se pierden al copiar y pegar. - Deja el clic en el icono en «vista previa». En documentación conviene mirar la captura antes de archivarla: es el momento de comprobar que el autor que aparece es el autor y no el nombre de la sección.
- Practica la captura de selección con un párrafo cualquiera. Es lo que usarás para quedarte con una frase concreta de una entrevista larga, y el frontmatter se escribe completo igual, así que la cita no pierde su procedencia.
- Crea reglas por sitio para los dominios de los que vayas a sacar más material. Un patrón de dirección recibe su propia subcarpeta y su propio ajuste de imágenes, y eso mantiene separadas las fuentes primarias de las lecturas de contexto sin que decidas nada al capturar.
Ajustes para documentación citable
Los valores de abajo están elegidos para que dentro de un año la ficha siga diciendo quién lo escribió, cuándo y dónde. Es la diferencia entre documentación y una carpeta de textos sueltos.
| Ajuste | Valor | Por qué así para documentar |
|---|---|---|
| Clic en el icono | Vista previa | Revisar la captura es el único momento barato para detectar un campo `author` que se ha llenado con la sección en lugar de la firma |
| Carpeta de destino | Una por proyecto | La documentación de un texto largo se consulta entera; repartida no se consulta |
| Plantilla de nombre | `{date}-{domain}-{title}` | El dominio en el nombre enseña de un vistazo si tres fichas son tres fuentes o la misma tres veces |
| Frontmatter | Los cinco campos | `author` y `published` son exactamente lo que pide una atribución; `extraction` dice de qué capturas fiarse |
| Imágenes | Enlace | Una fotografía o un gráfico citado al menos queda localizable; no se descargan archivos binarios |
| Regla por sitio | Fuentes primarias → subcarpeta aparte | Separar la fuente directa de la lectura de contexto evita atribuir a una lo que dijo la otra |
| Captura de selección | Seleccionar antes de pulsar | Para quedarte con la frase que vas a citar sin arrastrar la entrevista entera |
--- title: "Conversación sobre el oficio de traducir" source: "https://letraslibres.com/literatura/conversacion-oficio-traducir/" author: "Marta Rebón" published: "2024-10-11" extraction: "dom" --- JSON-LD author Marta Rebón ← el que se usa JSON-LD dateModified 2025-01-30 (edición posterior, descartada) article:published_time 2024-10-11 ← el que se usa Descartados en el campo author por ser falsos positivos: «Literatura» (título de sección), «Letras Libres» (nombre de la publicación) y «Suscríbete» (etiqueta de botón).
Tres casos reales
Documentar un texto largo durante meses
Estás con un ensayo que tardará medio año. Cada vez que encuentras algo que puede servir lo capturas sin decidir todavía si lo usarás: cuesta un gesto, y la decisión de descartar es mucho más barata cuando el material ya está a mano que cuando hay que volver a buscarlo.
Al llegar la escritura tienes doscientos archivos en una carpeta, cada uno con su autor, su fecha y su dirección. Buscas por palabra y la cita aparece con su procedencia puesta. Como los nombres llevan el dominio delante, se ve enseguida si una afirmación se apoya en fuentes distintas o en la misma repetida.
Una frase concreta de una entrevista larga
La entrevista tiene cuarenta preguntas y a ti te interesa una respuesta. La seleccionas en la página y capturas la selección: se guarda ese pasaje con el frontmatter completo, incluidos el autor y la fecha de publicación de la entrevista entera.
Eso es lo que convierte una cita en algo defendible: el texto exacto, con quién lo dijo, dónde se publicó y cuándo. Y si más tarde necesitas el contexto, la dirección del frontmatter te devuelve a la entrevista completa sin buscar nada.
Material en otro idioma
Una parte de la documentación está en portugués, en italiano o en alemán. La captura funciona igual: la selección del cuerpo del artículo se hace por densidad de texto y no por palabras clave del idioma, así que no hay lenguas mejor o peor atendidas.
Eso está medido: 403 páginas de los cincuenta sitios más visitados de doce países europeos, cada una capturada con el navegador puesto en el idioma del país, con cero fallos y cero etiquetas HTML sobrantes. Lo que sí conviene saber es que la fecha depende de lo que declare cada sitio, y hay corpus enteros donde no está.
Frente a las otras formas de documentarse
Cada método sirve para algo distinto, y todos cuestan algo. La última fila es esta extensión, con su parte dicha sin adornos.
| Cómo se hace ahora | Qué obtienes | Qué cuesta |
|---|---|---|
| Captura de pantalla | Prueba visual de lo que viste, con su maquetación | No se busca por palabra ni se cita; una carpeta de trescientas imágenes solo la entiende quien la hizo |
| Marcador | Un índice de lo leído, sin esfuerzo | Guarda la dirección, no el texto: cuando la página se edita o desaparece, la ficha deja de probar nada |
| Copiar y pegar en un documento | El texto donde ya escribes | Se pierden el autor y la fecha, y con el tiempo no se distingue la cita literal de la nota propia |
| Servicio de lectura para más tarde | Una biblioteca ordenada y sincronizada | Tu material vive en el servidor y el formato de otro; la exportación llega tarde o incompleta |
| Imprimir a PDF | Un archivo fiel, fechado por el sistema | Arrastra menús y publicidad, no se edita y no lleva dentro la fecha real de publicación |
| Clean Clipper | Markdown con título, autor, fecha y dirección, en tu carpeta | No comprueba si la fuente es fiable, no conserva la maquetación, no descarga imágenes y no resuelve derechos de uso |
Cuando la ficha sale incompleta
¿Por qué el campo author está vacío?
Porque la página no declara una firma que pueda leerse con seguridad. Se miran los datos estructurados y las firmas del cuerpo, y se descartan los falsos positivos habituales: títulos de sección, nombre de la publicación, etiquetas de botón y bloques de control de autoridades. Cuando lo único disponible es uno de esos, el campo se deja vacío. En el primer corpus se encontraron 20 autores frente a los 28 del mejor motor comparado, y esa diferencia es deliberada: un autor equivocado cuesta más de descubrir que uno ausente.
¿Por qué el autor que aparece no es el que firma?
Ocurre en páginas que declaran como autor a la propia publicación, o en secciones colectivas donde la firma del cuerpo pertenece a otra pieza de la misma página. La extensión toma lo que la página declara; no lo inventa, pero tampoco lo verifica. Si vas a atribuir, la comprobación de un vistazo en la vista de lectura es el momento de hacerla, y corregir un campo del frontmatter es editar una línea de texto.
¿Por qué el artículo de pago sale cortado?
Porque tu navegador tampoco lo tenía entero. Si el sitio muestra dos párrafos y esconde el resto tras la suscripción, eso es lo que hay en la página y eso es lo que se captura. Con la sesión iniciada y el artículo abierto de verdad, la captura trae el texto completo: la extensión lee lo que el navegador ya renderizó para ti, y no inicia sesión ni guarda credenciales.
¿Por qué la captura trae titulares de la columna lateral?
Porque en ese sitio la columna está maquetada dentro del propio artículo y no alrededor. El recorte quita navegación, banners, barras para compartir, paginadores y listas de «lo más leído», y elimina las líneas repetidas, pero un bloque de titulares colocado dentro del cuerpo se parece a una lista corriente.
La medida es esa: en 109 páginas quedaron 102 líneas de menú duplicadas frente a 282, 478 y 491 de los otros tres motores. No es cero, y en la ficha de documentación esas líneas se borran en un segundo, que es distinto de reconstruir un texto.
Lo que no hace
No comprueba si la cita es correcta ni si la fuente es fiable: guarda lo que la página decía y de dónde salía. No conserva el diseño de la página, ni hace capturas de pantalla, ni descarga las imágenes: quedan como enlaces al sitio original. No rellena el autor cuando la página no lo declara, y prefiere dejarlo vacío antes que acertar por casualidad. Y no gestiona derechos: lo que puedas hacer con el texto que capturas depende de la licencia de cada sitio.
Preguntas
¿Conserva el autor?
¿Puedo conservar las imágenes?
¿Y los artículos de pago a los que estoy suscrito?
¿Puedo guardar solo la frase que quiero citar?
¿Sirve para material en varios idiomas?
¿Puedo corregir a mano el autor o la fecha de una ficha?
.md: se edita como cualquier otra línea, y ninguna herramienta tiene que dar permiso para ello.¿Distingue la fecha de publicación de la de la última edición?
dateModified se descarta a propósito: refleja una edición posterior, y usarla como fecha de publicación mete en la documentación un dato que parece correcto sin serlo.¿Se conservan las notas al pie del artículo?
[^1] con sus definiciones agrupadas al final del archivo, en lugar de quedar como anclas que apuntan a una página cerrada.