Clean Clipper Añadir a Chrome – gratis

Para quién es

Artículos con su fecha real de publicación

Clean Clipper toma la fecha de los metadatos de la propia página en vez de deducirla del texto, y si la página no declara ninguna, deja el campo vacío. Los enlaces de referencia se convierten en notas al pie de Markdown con sus definiciones al final del archivo. La dirección de origen viaja en el frontmatter, así que la nota se puede citar sin volver a buscarla.

La cita que hay que reconstruir

Un artículo guardado sin fecha es una cita a medias, y el día que la necesitas ya no recuerdas de dónde salió. Muchos clippers rellenan ese hueco con el día en que capturaste la página, que es peor que dejarlo vacío: parece un dato y no lo es. Meses después la bibliografía sale con fechas que no corresponden a nada, y no hay forma de saber cuáles hay que revisar.

Con las notas al pie pasa algo parecido. En la página son enlaces que saltan al final; en la mayoría de las capturas se convierten en anclas muertas que apuntan a una dirección ya cerrada. Y las referencias, que son la mitad del valor de un artículo académico, se quedan fuera o se mezclan con el cuerpo del texto.

Queda un tercer problema, el más incómodo: meses después no sabes cómo obtuviste cada nota. Si un párrafo es cita literal o paráfrasis tuya, si salió del cuerpo del artículo o del resumen, si aquel día la página se veía entera o a medias. Por eso cada captura escribe el campo extraction, que distingue el texto que el navegador renderizó de verdad del que hubo que leer de los datos estructurados de la página: es la diferencia entre revisar tres archivos dudosos y volver a revisar cuarenta.

Qué cambia en la nota

La fecha viene de la página; el autor queda vacío porque la página no lo declaraocw.uc3m.es
---
title: "Métodos numéricos para ecuaciones diferenciales"
source: "https://ocw.uc3m.es/matematicas/metodos-numericos"
author: ""
published: "2021-09-13"
extraction: "dom"
---

El método de Euler explícito aproxima la solución paso a paso.[^1]

[^1]: La definición de la nota se agrupa al final del archivo, no queda
      como un ancla que apunta a una página ya cerrada.

Cómo montar una carpeta de fuentes citables

La configuración de partida importa más aquí que en otros usos, porque una carpeta de fuentes se llena durante meses y corregirla después es inviable. Estos siete pasos la dejan lista para citar desde el primer artículo.

  1. Abre los ajustes y elige como carpeta de destino la del proyecto, no una carpeta general de recortes. Una revisión bibliográfica se busca entera con una sola consulta, y eso solo funciona si todo lo del proyecto está junto.
  2. Pon la plantilla de nombre en {date}-{title}. La fecha del nombre es la de la captura; la de publicación vive aparte, en el campo published del frontmatter, y no se confunden nunca.
  3. Deja activos los cinco campos del frontmatter. author y published son los que después ahorran la vuelta al repositorio, y extraction es el que te dice de qué capturas puedes fiarte sin volver a mirarlas.
  4. Antes de capturar, inicia sesión en tu acceso institucional como lo harías para leer. La extensión no inicia sesión por ti ni guarda credenciales: lee la página que tu navegador ya ha renderizado, así que lo que puedes ver, se puede capturar.
  5. Abre el artículo en su versión HTML completa, no en la ficha del registro. La ficha trae resumen y metadatos; el texto que quieres citar está en la vista de lectura completa, y capturar la ficha por error es el fallo más común de este flujo.
  6. Captura y revisa la nota una vez: comprueba que las referencias hayan llegado como notas [^1] con sus definiciones agrupadas al final, y no como anclas sueltas. Si un repositorio se comporta bien, todos sus artículos se comportarán igual.
  7. Para quedarte solo con un pasaje, selecciónalo en la página antes de capturar. El frontmatter se escribe completo igualmente, así que una cita suelta conserva su autor, su fecha y su dirección.

Ajustes para material citable

Estos valores están elegidos por una sola razón: que dentro de un año la nota siga sirviendo como fuente sin volver al repositorio. La diferencia con otros usos está sobre todo en el frontmatter.

AjusteValorPor qué así para investigación
Clic en el iconoVista previaLos repositorios varían mucho; un vistazo antes de guardar detecta la ficha capturada por error en lugar del texto completo
Carpeta de destinoLa carpeta del proyectoUna revisión bibliográfica se consulta entera de golpe, y eso exige que no esté repartida
Plantilla de nombre`{date}-{title}`Ordena por el día en que consultaste la fuente, que es lo que necesitas para reconstruir tu propio recorrido
FrontmatterLos cinco campos`author` y `published` evitan la vuelta al repositorio; `extraction` señala qué capturas conviene revisar
ImágenesEnlaceLas figuras y las fórmulas maquetadas como imagen al menos quedan localizables; omitirlas las hace desaparecer sin rastro
Regla por sitioUn repositorio → su propia subcarpetaSeparar preprints de artículos revisados evita citar uno por otro seis meses después
Vista de lecturaRevisar el primer artículo de cada repositorioSi las notas al pie llegan bien en uno, llegarán bien en todos los de ese sitio
Caso difícil: la fecha viene de `citation_date`, el autor no se rellena y el cuerpo hubo que leerlo de los datos estructuradosdigital.csic.es
---
title: "Variabilidad interanual de la surgencia en el noroeste peninsular"
source: "https://digital.csic.es/handle/10261/241893"
author: ""
published: "2021-06-30"
extraction: "jsonld-articlebody"
---

  citation_date            2021-06-30   ← el que se usa
  JSON-LD datePublished    ausente
  JSON-LD dateModified     2023-11-02   (revisión del registro, no vale)
  time[datetime]           2026-08-31   (fecha de visita, descartada)

El campo author queda vacío: la página lista a los autores dentro de un
bloque de enlaces del catálogo, y una firma tomada de ahí sería el nombre
de un descriptor, no el de una persona. Vacío se corrige en un minuto;
equivocado no se detecta nunca.

Tres casos reales

Una revisión bibliográfica de cuarenta artículos

Estás recorriendo resultados de búsqueda en un repositorio y abriendo en pestañas todo lo que parece pertinente. En vez de acumular treinta pestañas, capturas cada artículo que te sirve nada más leer el resumen y cierras. La extensión no rastrea: capturas uno a uno, que es lo que quieres cuando el criterio de inclusión lo pones tú.

Al final del día tienes cuarenta archivos en la carpeta del proyecto, cada uno con su autor, su fecha y su dirección. Los que traigan extraction: jsonld-articlebody son los que conviene mirar dos veces, porque su cuerpo se leyó de los datos estructurados en lugar del texto renderizado.

Un capítulo con setenta notas al pie

Encuentras en HTML un capítulo con aparato crítico completo. Al capturarlo, los enlaces de referencia se convierten en notas [^1] y sus definiciones se agrupan al final del archivo. El orden interno importa: las notas se recogen antes de que el saneador elimine los identificadores de los que dependen, y hacerlo al revés las pierde todas en silencio.

El resultado se abre en Obsidian o en cualquier editor y las notas funcionan dentro de la propia nota, no como anclas que apuntan a una página cerrada. Una página muy larga con cientos de notas tarda unos pocos cientos de milisegundos en lugar de decenas, y el tiempo aparece en la esquina de la ventana de captura.

Comprobar una cita seis meses después

Estás cerrando el texto y el revisor pregunta por una afirmación concreta. Abres el archivo de la carpeta del proyecto: el párrafo está ahí, con source y published en la cabecera. No hace falta volver al repositorio ni comprobar si el artículo sigue accesible.

Si además el enlace ya no responde –una versión retirada, un repositorio migrado–, tu copia sigue diciendo qué decía el texto y cuándo se publicó. No sustituye a un archivo web ni certifica nada, pero es la diferencia entre defender una cita y retirarla.

Frente a las otras formas de guardar fuentes

La comparación honesta aquí es con el gestor bibliográfico, que hace cosas que esto no hace. La última fila dice lo que cuesta esta extensión.

Cómo se hace ahoraQué obtienesQué cuesta
La extensión de tu gestor bibliográficoMetadatos estructurados y la cita ya formateadaEl texto queda dentro de la base del gestor, en su formato; migrar o buscar fuera de él es otro proyecto
Guardar el PDFEl artículo tal como se publicó, paginado y citableNo se busca bien por palabra, ocupa mucho, y en las revistas que solo publican en HTML sencillamente no existe
Imprimir a PDF desde el navegadorUn archivo inmediatoArrastra menús y barras laterales, corta las tablas anchas y el texto en columnas se convierte mal
Copiar y pegar en un documentoControl total sobre qué entraSe pierden la fecha y las notas al pie, y con el tiempo no se distingue la cita literal de la paráfrasis
Marcador o enlace en una hoja de cálculoUn índice ligero de lo consultadoCuando el artículo se retira o el proxy caduca, el enlace no prueba nada
Clean ClipperMarkdown con autor, fecha, dirección y notas al pie, en tu carpetaNo genera citas en APA ni BibTeX, no descarga el PDF ni los materiales suplementarios, y no resuelve un DOI

Cuando la fuente no se captura bien

¿Por qué published está vacío en un artículo académico?

Porque esa página no declara la fecha en ningún formato conocido. Se buscan citation_date y citation_publication_date –las etiquetas que emiten arXiv, PubMed e IEEE–, JSON-LD datePublished, article:published_time, time[datetime] y marcas de tiempo Unix, en ese orden de preferencia.

dateModified se descarta a propósito: en un repositorio suele ser la última edición del registro, no la publicación del artículo, y usarla mete en la bibliografía una fecha que parece correcta y no lo es. Cuando falta, el campo se queda vacío y lo completas tú desde la portada del artículo.

¿Por qué el autor sale vacío si el artículo tiene cinco firmantes?

Porque en esa página los firmantes están dentro de un bloque de enlaces del catálogo, y una firma tomada de ahí sería el nombre de un descriptor o de una colección. La detección descarta los falsos positivos habituales –títulos de sección, nombre de la publicación, etiquetas de botón, bloques de control de autoridades– antes que rellenar el campo con la primera cadena verosímil. En el primer corpus se encontraron 20 autores frente a los 28 del mejor motor: esa distancia es el precio de no equivocarse.

¿Por qué han desaparecido las fórmulas?

Depende de cómo las publique la revista. Las que la página muestra como texto llegan como texto, no como LaTeX. Las que muestra como imagen quedan como enlaces de imagen, y desaparecen del todo si tienes las imágenes en «omitir». Para material con notación densa conviene dejar las imágenes en «enlace» aunque en el resto de tu trabajo las omitas.

¿Por qué solo se ha capturado el resumen?

Porque capturaste la ficha del registro y no el texto completo. Muchos repositorios sirven primero una página de catálogo con resumen, metadatos y enlaces de descarga; ahí el artículo no está. Abre la vista de lectura completa del propio repositorio o de la revista y captura esa. Si la ficha misma es casi toda enlaces, la extensión la marcará como «sin artículo» en lugar de darte el catálogo.

Lo que no hace

No genera citas en APA, MLA ni BibTeX: guarda los campos, y el formato lo pone tu gestor bibliográfico. No descarga el PDF ni los materiales suplementarios; captura la página HTML que estás viendo. No inventa la fecha cuando la página no la declara, y hay repositorios y sitios de noticias donde esa fecha sencillamente no está en los metadatos. Tampoco resuelve un DOI ni consulta ninguna base externa: todo ocurre dentro del navegador.

Añadir a Chrome – gratisGratis del todo: sin cuenta y sin límite de páginas.

Preguntas

¿Y si la página no tiene fecha de publicación?
El campo se queda vacío. Rellenarlo con el día en que capturaste la página es peor que dejarlo en blanco, porque se convierte en un dato equivocado dentro de tus notas sin que lo notes.
¿Los enlaces de las notas siguen funcionando?
Sí. Pasan a ser notas al pie estándar de Markdown, que Obsidian y la mayoría de los renderizadores convierten en enlaces que funcionan dentro de la propia nota.
¿Puede capturar un artículo detrás de un acceso institucional?
Sí, porque lee la página que tu navegador ya ha renderizado. Si puedes verla en pantalla, se puede capturar.
¿Se puede llevar a Zotero o a Mendeley?
No hay integración directa. La nota es un archivo Markdown con frontmatter: si tu gestor lee carpetas de Markdown, encaja, y si no, los campos están ahí a la vista para copiarlos.
¿Sobreviven las fórmulas?
Las que la página muestra como texto, sí. Las que muestra como imagen quedan como enlaces de imagen, o desaparecen si pones las imágenes en «omitir». Una fórmula renderizada en HTML se convierte en texto, no en LaTeX.
¿Distingue la fecha de publicación de la de revisión?
Sí, y descarta la segunda. dateModified no se usa para rellenar published, porque en un repositorio suele reflejar un cambio en el registro y no la publicación del trabajo.
¿Qué significa `extraction: jsonld-articlebody` en un artículo?
Que la página no llegó a mostrar el cuerpo en el DOM y el texto se leyó de sus datos estructurados. El contenido es el mismo, pero conviene comprobarlo: por esa vía es frecuente que se pierdan el formato de las tablas y la posición exacta de las llamadas de nota.
¿Puedo capturar un preprint y luego la versión publicada?
Sí, y las dos conviven. Como el nombre del archivo coincidiría, la segunda captura recibe un sufijo numérico y la primera queda intacta, que es exactamente lo que necesitas para comparar qué cambió entre versiones.
¿Se conservan las tablas de resultados?
Normalmente sí. Las tablas las serializa la propia extensión en lugar de un conversor genérico, y en el corpus técnico sobrevivieron doce de quince frente a siete de cada motor comparado. Las celdas combinadas se aplanan, porque Markdown no sabe expresarlas.
¿Sirve para material en otros idiomas?
Sí. La extracción se midió en 403 páginas de los cincuenta sitios más visitados de doce países europeos, cada una capturada en el idioma de su país: cero fallos y cero etiquetas HTML sobrantes en las doce lenguas.