Clean Clipper Añadir a Chrome – gratis

Para quién es

Archiva una fuente antes de que cambie

Las páginas se editan y se retiran sin avisar. Una captura con la dirección de origen, la fecha de publicación y el texto completo es constancia de lo que decía la página cuando la leíste, y vive en tu disco y no en un servicio que puede cerrar. La fecha se lee de los metadatos de la propia página, no del texto.

La página que ya no dice lo mismo

Un titular se corrige, un párrafo desaparece y una nota de prensa se sustituye por otra versión con la misma dirección. Cuando alguien discute lo que publicaste, el enlace ya no prueba nada: lleva al texto de hoy, no al de aquel día. Y si el medio cierra o rehace su web, la dirección directamente deja de existir.

Guardarlo en el momento tampoco es gratis. Un PDF de la página pesa, no se busca bien y arrastra el menú, la publicidad y el aviso de cookies. Copiar el texto a mano pierde la fecha de publicación, que es justo el dato que después hay que sostener.

Y una parte de las fuentes ni siquiera es un artículo. Un hilo de foro, un anuncio en una comunidad, una respuesta enterrada entre doscientos comentarios: material que desaparece cuando alguien borra su cuenta. En Reddit los comentarios se capturan como hilo compacto con la puntuación de cada uno, que es la forma de conservar quién dijo qué y cuánto apoyo tenía; en el resto de sitios los comentarios se tratan como mobiliario de la página y se cortan.

Qué cambia en tu archivo

De dónde sale la fecha de publicación y cuál ganartve.es/noticias
published: "2024-03-21T18:42:00+01:00"

  article:published_time    2024-03-21T18:42:00+01:00   ← el que se usa
  JSON-LD datePublished     2024-03-21
  JSON-LD dateModified      2024-06-02   (edición posterior, no es la fecha)
  time[datetime]            2025-08-31   (fecha de visita, descartada)

Cómo archivar una fuente en dos segundos

Lo que decide si una fuente queda archivada no es la calidad de la herramienta, sino que capturar cueste menos que dudar. Estos seis pasos dejan el gesto en una tecla.

  1. En los ajustes, pon el clic en el icono en «carpeta». Sin ventana intermedia, capturar deja de ser una decisión: se hace mientras lees, que es el único momento en que la página todavía dice lo que decía.
  2. Elige como destino una carpeta de trabajo y escribe la subcarpeta del tema que estés cubriendo. Cambiar de tema es cambiar una línea de texto en los ajustes, no volver a dar permiso sobre la carpeta.
  3. Pon la plantilla de nombre en {date}-{domain}-{title}. El {date} del nombre es el día de la captura; la fecha de publicación vive aparte en el campo published, así que en un archivo siempre se ve a la vez cuándo se publicó y cuándo lo guardaste.
  4. Deja activos los cinco campos del frontmatter. extraction es el que convierte la copia en algo auditable: dice si el texto salió del DOM que el navegador mostró o de los datos estructurados de la página.
  5. Comprueba Alt+Shift+M en chrome://extensions/shortcuts. Con el clic puesto en «carpeta», el atajo archiva sin apartar la vista de la página: es la diferencia entre archivar veinte fuentes en una jornada y archivar tres.
  6. Cuando la fuente sea un hilo de Reddit, despliega antes los comentarios que te interesen. Se captura lo que hay en la página en ese momento, y los hilos plegados no están en la página.

Ajustes para un archivo de fuentes

La configuración de abajo prioriza dos cosas por encima de todo: que capturar sea instantáneo y que el archivo diga por sí solo de dónde salió cada cosa y cuándo.

AjusteValorPor qué así para archivar fuentes
Clic en el iconoCarpetaArchivar tiene que costar menos que decidir si archivar; una ventana de por medio ya es demasiado
SubcarpetaEl tema que cubresUn tema se revisa entero cuando salta; repartido entre carpetas, no se revisa
Plantilla de nombre`{date}-{domain}-{title}`La fecha de captura y el medio en el nombre reconstruyen la cronología sin abrir un solo archivo
FrontmatterLos cinco campos`published` sostiene la cronología y `extraction` hace la copia auditable
ImágenesEnlaceUn gráfico o una fotografía citada queda localizable; los archivos binarios no se descargan
Atajo de tecladoAlt+Shift+MPermite archivar sin apartar la vista, que es lo que hace posible veinte capturas en una jornada
Regla por sitioFuentes oficiales → subcarpeta aparteSeparar la fuente primaria de la reacción evita atribuir a una lo que dijo la otra
Caso difícil: un hilo de comentarios como fuente, con la puntuación de cada intervenciónreddit.com/r/es
---
title: "Corte de suministro en el polígono: qué se sabe"
source: "https://www.reddit.com/r/es/comments/1f2k8xq/"
published: "2025-04-22"
extraction: "dom"
---

- **[+412] vecino_del_9** – Llevamos desde las 6:40 sin luz en toda la
  calle. La compañía dice que es una avería en el centro de transformación.
  - **[+88] a_pie_de_obra** – Confirmado, hay dos camiones trabajando
    en la esquina desde las 8:15.
  - **[+12] pasaba_por_aqui** – En el polígono de al lado no hay corte.
- **[+37] turno_de_noche** – Aviso oficial publicado a las 9:02.

Los comentarios llegan como hilo compacto con su puntuación. Fuera de
Reddit los comentarios se tratan como mobiliario de la página y se cortan.

Tres casos reales

Una nota de prensa que va a cambiar

Un organismo publica una nota y sabes por experiencia que la versión de mañana no será la de hoy: se corrigen cifras, se retira un párrafo, se sustituye el archivo en la misma dirección. Pulsas Alt+Shift+M nada más leerla. Dos segundos, sin salir de la página.

Lo que queda en la carpeta del tema es el texto completo con la fecha de publicación leída de los metadatos de la propia página, no del día de la captura. Cuando la versión cambie, capturas otra vez: como el nombre coincide, la segunda recibe un sufijo numérico y la primera queda intacta para comparar.

Un hilo como fuente

La primera señal de una historia aparece en un hilo, entre doscientos comentarios y con la mitad plegados. Despliegas lo que te interesa y capturas: se guarda un hilo compacto con la puntuación de cada intervención, que es lo que después permite decir cuánta gente lo respaldaba.

Ese material desaparece con facilidad: una cuenta borrada se lleva sus mensajes por delante. Tu copia es un archivo de texto en tu disco y no depende de que la plataforma siga sirviendo el hilo, aunque no sustituye a un archivo web ni certifica nada ante un tercero.

Demostrar qué decía la página aquel día

Publicas apoyándote en una página y semanas después alguien discute la cita. El enlace ya no ayuda: lleva al texto de hoy. Abres tus dos capturas de la misma dirección y las comparas con cualquier herramienta de comparación de texto, línea por línea.

Lo que aporta la extensión aquí es solo que las dos copias sean comparables: no vigila páginas, no avisa de cambios y no compara nada por su cuenta. Y conviene decirlo entero: es tu copia fechada, no una prueba certificada; para eso hace falta un tercero autorizado.

Frente a las otras formas de archivar

En este oficio conviven varias vías y cada una cubre algo distinto. La última fila es esta extensión, con lo que no hace dicho igual de claro.

Cómo se hace ahoraQué obtienesQué cuesta
Servicio de archivo webUn registro visual con sello de un terceroDepende de que ese servicio siga en pie y llegue a la página; muchas páginas con sesión o con muro no se archivan
Imprimir a PDFLa página tal como se veía, en un archivoArrastra menú, publicidad y aviso de cookies; no se busca bien y no lleva dentro la fecha real de publicación
Captura de pantallaInmediata y visualNo se busca por palabra, no se compara con la versión siguiente y un artículo largo son quince imágenes
Copiar y pegarEl texto, yaSe pierden la fecha de publicación y la dirección, que es justo lo que hay que sostener después
MarcadorUn índice de lo leídoCuando la página se edita o el medio rehace su web, no prueba nada
Clean ClipperEl texto completo con fecha de publicación y dirección, en tu disco, en dos segundosNo guarda la maquetación ni hace capturas de pantalla, no sella ni certifica, y fuera de Reddit no captura comentarios

Cuando la fuente no se deja archivar

¿Por qué un directo sale incompleto?

Porque un directo no termina de existir. Las entradas se añaden mientras lees y muchas se cargan al desplazarse, así que la captura contiene lo que había en la página en el instante en que pulsaste. Baja hasta donde te interese antes de capturar, y si el directo dura horas, captura varias veces: cada archivo recibe un sufijo numérico y entre todos queda la cronología.

¿Por qué una portada dice «sin artículo»?

Porque no lo hay. La extensión revisa el Markdown terminado y, si más de una cuarta parte del texto está dentro de etiquetas de enlace, se niega en lugar de entregar trescientos titulares con aspecto de contenido. Las portadas, las páginas de sección y los resultados de búsqueda caen ahí siempre. Entra en la pieza concreta y captura ahí.

¿Por qué está vacía la fecha de una nota oficial?

Porque esa página no la declara en sus metadatos. Se buscan JSON-LD datePublished, article:published_time, citation_date, time[datetime] y marcas de tiempo Unix, y en muchos sitios institucionales la fecha solo aparece impresa dentro del texto, donde no se puede leer con seguridad.

Rellenarla con el día de la captura sería inventar un dato. Lo que sí queda registrado es cuándo lo archivaste tú, en el {date} del nombre del archivo, y ese es un dato distinto que no se confunde con el otro.

¿Por qué no aparecen los comentarios?

Porque solo se capturan en Reddit. En el resto de los sitios los comentarios se tratan como mobiliario de la página y se cortan junto con la navegación y los bloques promocionales. Cuando el hilo de comentarios es la fuente y no el adorno, la vía es capturar la selección: marca en la página los mensajes que importan y captura solo eso, con el frontmatter completo.

Lo que no hace

No sustituye a un archivo web: guarda el texto, no la página tal como se veía, así que no hay maquetación, ni capturas de pantalla, ni recursos descargados. No sella ni firma nada: es tu copia, no una prueba certificada ante un tercero. No captura los comentarios fuera de Reddit, porque en el resto de sitios se tratan como mobiliario de la página. Y en una portada o en un tablón de titulares dirá que no hay artículo, porque ahí no lo hay.

Añadir a Chrome – gratisGratis del todo: sin cuenta y sin límite de páginas.

Preguntas

¿Sustituye a un archivo web?
No. Guarda el texto y sus metadatos, no la página tal como se veía. Para un registro visual usa un servicio de archivo; para el texto, la fecha y la dirección, esto es más rápido y se queda en tu disco.
¿Captura los comentarios?
En Reddit sí, como un hilo compacto con la puntuación de cada comentario. En el resto de sitios los comentarios se tratan como mobiliario de la página y se cortan.
¿Puede registrar cuándo lo capturé?
Sí. La plantilla de nombre admite {date}, que es la fecha de la captura. La fecha de publicación es un campo aparte del frontmatter, así que las dos nunca se confunden.
¿Y si la página no declara fecha?
El campo queda vacío. Hay corpus enteros donde la fecha no está en los metadatos, y ponerte la de hoy sería inventarla.
¿Sirve para páginas en otros idiomas?
Sí. La medición europea recorrió los cincuenta sitios más visitados de doce países, cada uno en su idioma: 403 páginas, cero fallos y cero etiquetas HTML sobrantes.
¿Cuánto tarda una captura?
Decenas de milisegundos en una pieza normal, y unos pocos cientos en una página muy larga con muchas notas al pie. El tiempo aparece en la esquina de la ventana de captura, así que se ve enseguida si lo que tardó fue la página o la extracción.
¿Se puede archivar una página que solo veo con mi suscripción?
Sí. Se lee la página que tu navegador ya ha renderizado con tu sesión abierta; la extensión no inicia sesión por ti ni guarda credenciales, y no tiene permiso para mirar pestañas que no le hayas señalado.
¿Queda constancia de cómo se obtuvo el texto?
Sí, en el campo extraction. dom significa que el texto salió de lo que el navegador mostró de verdad; jsonld-articlebody, que la página nunca terminó de renderizarse y el cuerpo se leyó de sus datos estructurados.
¿Puedo capturar solo un párrafo de la fuente?
Sí. Selecciónalo antes de capturar y se guarda esa parte con el frontmatter completo: dirección, fecha de publicación y título de la pieza entera siguen ahí.
¿Sirve para medios en otros idiomas?
Sí. La medición europea recorrió los cincuenta sitios más visitados de doce países, cada página en el idioma de su país: 403 páginas sin un solo fallo. Con una salvedad publicada: en los corpus turco y checo la fecha aparece pocas veces, porque esos sitios no la declaran.