Para quién es
Artículos con su fecha real de publicación
Clean Clipper toma la fecha de los metadatos de la propia página en vez de deducirla del texto, y si la página no declara ninguna, deja el campo vacío. Los enlaces de referencia se convierten en notas al pie de Markdown con sus definiciones al final del archivo. La dirección de origen viaja en el frontmatter, así que la nota se puede citar sin volver a buscarla.
La cita que hay que reconstruir
Un artículo guardado sin fecha es una cita a medias, y el día que la necesitas ya no recuerdas de dónde salió. Muchos clippers rellenan ese hueco con el día en que capturaste la página, que es peor que dejarlo vacío: parece un dato y no lo es. Meses después la bibliografía sale con fechas que no corresponden a nada, y no hay forma de saber cuáles hay que revisar.
Con las notas al pie pasa algo parecido. En la página son enlaces que saltan al final; en la mayoría de las capturas se convierten en anclas muertas que apuntan a una dirección ya cerrada. Y las referencias, que son la mitad del valor de un artículo académico, se quedan fuera o se mezclan con el cuerpo del texto.
Queda un tercer problema, el más incómodo: meses después no sabes cómo obtuviste cada nota. Si un párrafo es cita literal o paráfrasis tuya, si salió del cuerpo del artículo o del resumen, si aquel día la página se veía entera o a medias. Por eso cada captura escribe el campo extraction, que distingue el texto que el navegador renderizó de verdad del que hubo que leer de los datos estructurados de la página: es la diferencia entre revisar tres archivos dudosos y volver a revisar cuarenta.
Qué cambia en la nota
- Lee
citation_dateycitation_publication_date, las etiquetas meta que emiten arXiv, PubMed e IEEE - También JSON-LD
datePublished,article:published_time,time[datetime]y marcas de tiempo Unix - Si la página no declara fecha, el campo queda vacío; nunca se rellena con la de hoy
- Los enlaces de referencia se convierten en notas
[^1]con sus definiciones al final del archivo - El campo author se filtra: los títulos de sección y las etiquetas de botón no acaban ahí
- El campo
extractiondeja constancia de por qué vía se obtuvo el texto - Las notas al pie se recogen antes de que el saneador elimine los identificadores de los que dependen: si ese orden se invierte, se pierden todas sin avisar
- La captura se hace sobre la página que tu navegador ya mostró con tu sesión institucional abierta
---
title: "Métodos numéricos para ecuaciones diferenciales"
source: "https://ocw.uc3m.es/matematicas/metodos-numericos"
author: ""
published: "2021-09-13"
extraction: "dom"
---
El método de Euler explícito aproxima la solución paso a paso.[^1]
[^1]: La definición de la nota se agrupa al final del archivo, no queda
como un ancla que apunta a una página ya cerrada.Cómo montar una carpeta de fuentes citables
La configuración de partida importa más aquí que en otros usos, porque una carpeta de fuentes se llena durante meses y corregirla después es inviable. Estos siete pasos la dejan lista para citar desde el primer artículo.
- Abre los ajustes y elige como carpeta de destino la del proyecto, no una carpeta general de recortes. Una revisión bibliográfica se busca entera con una sola consulta, y eso solo funciona si todo lo del proyecto está junto.
- Pon la plantilla de nombre en
{date}-{title}. La fecha del nombre es la de la captura; la de publicación vive aparte, en el campopublisheddel frontmatter, y no se confunden nunca. - Deja activos los cinco campos del frontmatter.
authorypublishedson los que después ahorran la vuelta al repositorio, yextractiones el que te dice de qué capturas puedes fiarte sin volver a mirarlas. - Antes de capturar, inicia sesión en tu acceso institucional como lo harías para leer. La extensión no inicia sesión por ti ni guarda credenciales: lee la página que tu navegador ya ha renderizado, así que lo que puedes ver, se puede capturar.
- Abre el artículo en su versión HTML completa, no en la ficha del registro. La ficha trae resumen y metadatos; el texto que quieres citar está en la vista de lectura completa, y capturar la ficha por error es el fallo más común de este flujo.
- Captura y revisa la nota una vez: comprueba que las referencias hayan llegado como notas
[^1]con sus definiciones agrupadas al final, y no como anclas sueltas. Si un repositorio se comporta bien, todos sus artículos se comportarán igual. - Para quedarte solo con un pasaje, selecciónalo en la página antes de capturar. El frontmatter se escribe completo igualmente, así que una cita suelta conserva su autor, su fecha y su dirección.
Ajustes para material citable
Estos valores están elegidos por una sola razón: que dentro de un año la nota siga sirviendo como fuente sin volver al repositorio. La diferencia con otros usos está sobre todo en el frontmatter.
| Ajuste | Valor | Por qué así para investigación |
|---|---|---|
| Clic en el icono | Vista previa | Los repositorios varían mucho; un vistazo antes de guardar detecta la ficha capturada por error en lugar del texto completo |
| Carpeta de destino | La carpeta del proyecto | Una revisión bibliográfica se consulta entera de golpe, y eso exige que no esté repartida |
| Plantilla de nombre | `{date}-{title}` | Ordena por el día en que consultaste la fuente, que es lo que necesitas para reconstruir tu propio recorrido |
| Frontmatter | Los cinco campos | `author` y `published` evitan la vuelta al repositorio; `extraction` señala qué capturas conviene revisar |
| Imágenes | Enlace | Las figuras y las fórmulas maquetadas como imagen al menos quedan localizables; omitirlas las hace desaparecer sin rastro |
| Regla por sitio | Un repositorio → su propia subcarpeta | Separar preprints de artículos revisados evita citar uno por otro seis meses después |
| Vista de lectura | Revisar el primer artículo de cada repositorio | Si las notas al pie llegan bien en uno, llegarán bien en todos los de ese sitio |
--- title: "Variabilidad interanual de la surgencia en el noroeste peninsular" source: "https://digital.csic.es/handle/10261/241893" author: "" published: "2021-06-30" extraction: "jsonld-articlebody" --- citation_date 2021-06-30 ← el que se usa JSON-LD datePublished ausente JSON-LD dateModified 2023-11-02 (revisión del registro, no vale) time[datetime] 2026-08-31 (fecha de visita, descartada) El campo author queda vacío: la página lista a los autores dentro de un bloque de enlaces del catálogo, y una firma tomada de ahí sería el nombre de un descriptor, no el de una persona. Vacío se corrige en un minuto; equivocado no se detecta nunca.
Tres casos reales
Una revisión bibliográfica de cuarenta artículos
Estás recorriendo resultados de búsqueda en un repositorio y abriendo en pestañas todo lo que parece pertinente. En vez de acumular treinta pestañas, capturas cada artículo que te sirve nada más leer el resumen y cierras. La extensión no rastrea: capturas uno a uno, que es lo que quieres cuando el criterio de inclusión lo pones tú.
Al final del día tienes cuarenta archivos en la carpeta del proyecto, cada uno con su autor, su fecha y su dirección. Los que traigan extraction: jsonld-articlebody son los que conviene mirar dos veces, porque su cuerpo se leyó de los datos estructurados en lugar del texto renderizado.
Un capítulo con setenta notas al pie
Encuentras en HTML un capítulo con aparato crítico completo. Al capturarlo, los enlaces de referencia se convierten en notas [^1] y sus definiciones se agrupan al final del archivo. El orden interno importa: las notas se recogen antes de que el saneador elimine los identificadores de los que dependen, y hacerlo al revés las pierde todas en silencio.
El resultado se abre en Obsidian o en cualquier editor y las notas funcionan dentro de la propia nota, no como anclas que apuntan a una página cerrada. Una página muy larga con cientos de notas tarda unos pocos cientos de milisegundos en lugar de decenas, y el tiempo aparece en la esquina de la ventana de captura.
Comprobar una cita seis meses después
Estás cerrando el texto y el revisor pregunta por una afirmación concreta. Abres el archivo de la carpeta del proyecto: el párrafo está ahí, con source y published en la cabecera. No hace falta volver al repositorio ni comprobar si el artículo sigue accesible.
Si además el enlace ya no responde –una versión retirada, un repositorio migrado–, tu copia sigue diciendo qué decía el texto y cuándo se publicó. No sustituye a un archivo web ni certifica nada, pero es la diferencia entre defender una cita y retirarla.
Frente a las otras formas de guardar fuentes
La comparación honesta aquí es con el gestor bibliográfico, que hace cosas que esto no hace. La última fila dice lo que cuesta esta extensión.
| Cómo se hace ahora | Qué obtienes | Qué cuesta |
|---|---|---|
| La extensión de tu gestor bibliográfico | Metadatos estructurados y la cita ya formateada | El texto queda dentro de la base del gestor, en su formato; migrar o buscar fuera de él es otro proyecto |
| Guardar el PDF | El artículo tal como se publicó, paginado y citable | No se busca bien por palabra, ocupa mucho, y en las revistas que solo publican en HTML sencillamente no existe |
| Imprimir a PDF desde el navegador | Un archivo inmediato | Arrastra menús y barras laterales, corta las tablas anchas y el texto en columnas se convierte mal |
| Copiar y pegar en un documento | Control total sobre qué entra | Se pierden la fecha y las notas al pie, y con el tiempo no se distingue la cita literal de la paráfrasis |
| Marcador o enlace en una hoja de cálculo | Un índice ligero de lo consultado | Cuando el artículo se retira o el proxy caduca, el enlace no prueba nada |
| Clean Clipper | Markdown con autor, fecha, dirección y notas al pie, en tu carpeta | No genera citas en APA ni BibTeX, no descarga el PDF ni los materiales suplementarios, y no resuelve un DOI |
Cuando la fuente no se captura bien
¿Por qué published está vacío en un artículo académico?
Porque esa página no declara la fecha en ningún formato conocido. Se buscan citation_date y citation_publication_date –las etiquetas que emiten arXiv, PubMed e IEEE–, JSON-LD datePublished, article:published_time, time[datetime] y marcas de tiempo Unix, en ese orden de preferencia.
dateModified se descarta a propósito: en un repositorio suele ser la última edición del registro, no la publicación del artículo, y usarla mete en la bibliografía una fecha que parece correcta y no lo es. Cuando falta, el campo se queda vacío y lo completas tú desde la portada del artículo.
¿Por qué el autor sale vacío si el artículo tiene cinco firmantes?
Porque en esa página los firmantes están dentro de un bloque de enlaces del catálogo, y una firma tomada de ahí sería el nombre de un descriptor o de una colección. La detección descarta los falsos positivos habituales –títulos de sección, nombre de la publicación, etiquetas de botón, bloques de control de autoridades– antes que rellenar el campo con la primera cadena verosímil. En el primer corpus se encontraron 20 autores frente a los 28 del mejor motor: esa distancia es el precio de no equivocarse.
¿Por qué han desaparecido las fórmulas?
Depende de cómo las publique la revista. Las que la página muestra como texto llegan como texto, no como LaTeX. Las que muestra como imagen quedan como enlaces de imagen, y desaparecen del todo si tienes las imágenes en «omitir». Para material con notación densa conviene dejar las imágenes en «enlace» aunque en el resto de tu trabajo las omitas.
¿Por qué solo se ha capturado el resumen?
Porque capturaste la ficha del registro y no el texto completo. Muchos repositorios sirven primero una página de catálogo con resumen, metadatos y enlaces de descarga; ahí el artículo no está. Abre la vista de lectura completa del propio repositorio o de la revista y captura esa. Si la ficha misma es casi toda enlaces, la extensión la marcará como «sin artículo» en lugar de darte el catálogo.
Lo que no hace
No genera citas en APA, MLA ni BibTeX: guarda los campos, y el formato lo pone tu gestor bibliográfico. No descarga el PDF ni los materiales suplementarios; captura la página HTML que estás viendo. No inventa la fecha cuando la página no la declara, y hay repositorios y sitios de noticias donde esa fecha sencillamente no está en los metadatos. Tampoco resuelve un DOI ni consulta ninguna base externa: todo ocurre dentro del navegador.
Preguntas
¿Y si la página no tiene fecha de publicación?
¿Los enlaces de las notas siguen funcionando?
¿Puede capturar un artículo detrás de un acceso institucional?
¿Se puede llevar a Zotero o a Mendeley?
¿Sobreviven las fórmulas?
¿Distingue la fecha de publicación de la de revisión?
dateModified no se usa para rellenar published, porque en un repositorio suele reflejar un cambio en el registro y no la publicación del trabajo.