Clean Clipper Ajouter à Chrome – gratuit

Pour qui

Archiver une source avant qu’elle change

Les pages sont réécrites, corrigées et retirées, souvent sans mention du changement. Une capture qui porte l’adresse source, la date de publication et le texte intégral est une trace que vous pouvez montrer plus tard. Elle vit sur votre disque, en Markdown, plutôt que dans un service qui peut fermer.

Quand la page a changé

Un texte en ligne n’est pas un document figé. Un titre est adouci quelques heures après la publication, un paragraphe disparaît, une déclaration est reformulée, et rien n’en garde la trace visible. Vous citez ce que vous avez lu, on vous répond que la page ne dit pas cela, et vous avez raison sans pouvoir le prouver.

Le lien vers un service d’archivage extérieur ne règle qu’une partie du problème. Il faut que le service ait attrapé la bonne version, qu’il soit encore là au moment de la vérification, et qu’il ait pu passer la connexion ou le mur payant derrière lequel vous lisiez. Pendant ce temps, la seule copie qui compte vraiment est celle que vous n’avez pas prise.

À cela s’ajoute une difficulté plus récente : deux personnes ne voient plus forcément la même page. Le contenu est adapté au profil, au pays et au moment, les blocs sont réordonnés par des tests en cours, et un site sert parfois aux robots une version qui n’est pas celle affichée à l’écran. Une capture prise depuis votre propre onglet fixe ce que vous, vous avez lu – et le champ extraction précise si le texte vient du rendu de la page ou de ses données structurées, ce qui n’est pas le même degré de témoignage.

Ce que la trace contient

Sortie réelle, non retouchéefrancetvinfo.fr
---
title: "Ce que contient le projet de loi de finances"
source: "https://www.francetvinfo.fr/economie/projet-de-loi-de-finances.html"
author: "franceinfo"
published: "2024-09-17T06:12:00.000Z"
extraction: "dom"
---

Le texte présenté mercredi fixe le cadre budgétaire de l’année suivante et
détaille les recettes attendues.

Prendre une trace en trois secondes

Sur un sujet chaud, une méthode qui demande six gestes n’est pas appliquée. Les réglages ci-dessous ramènent la capture à un raccourci clavier, sans rien perdre de ce qui sert à dater la source.

  1. Dans les paramètres, section « Où enregistrer », désignez avec « Choisir… » un dossier d’archives sur votre disque, puis indiquez le sujet en cours dans « Sous-dossier des téléchargements ». Le sous-dossier se change en une seconde quand vous passez à un autre sujet.
  2. Réglez « Nom du fichier » sur {domain} - {date} - {title}. Le domaine en tête regroupe les captures par source, la date les ordonne, et deux versions d’un même article prises à des dates de publication différentes ne se réécrivent pas.
  3. Dans les propriétés, gardez les cinq champs. published et source sont ce qui date la trace ; extraction dit si le texte vient de l’écran ou des données structurées de la page, une nuance qui compte le jour où la capture est discutée.
  4. Passez « Clic sur l’icône » sur « Placer dans un dossier ». La capture se fait alors sans fenêtre : un clic, ou Alt+Shift+M sans quitter le clavier, et le fichier est écrit pendant que vous continuez à lire.
  5. Vérifiez le comportement une fois sur un article ordinaire : rouvrez le fichier et contrôlez que published correspond bien à la date annoncée par la page, et non à celle du jour. Sur les sites qui ne publient aucune date, le champ est absent – c’est une information sur la source, à noter dans le dossier.
  6. Quand une page compte vraiment, capturez-la deux fois : une fois entière, une fois sur la sélection du passage litigieux. La seconde capture n’est coupée d’aucune manière, puisque la coupe ne s’applique jamais à une sélection.

Réglages conseillés pour l’archivage

Ces valeurs privilégient la vitesse et la complétude sur la légèreté du fichier : une trace amputée ne se répare pas, et une trace qui prend une minute à prendre n’est pas prise.

RéglageValeurPourquoi celle-là ici
Clic sur l’icônePlacer dans un dossiersur un sujet en cours, la capture doit coûter un geste ; la vérification vient après, dans le fichier
Nom du fichier`{domain} - {date} - {title}`un dossier d’enquête se lit alors par source puis par date, et deux versions datées différemment coexistent
Propriétés gardéesles cinq champs`published`, `source` et `extraction` sont exactement ce qui fait la valeur d’une trace ; les retirer la vide de sens
Imagesgarder en liensle lien indique au moins quelles illustrations accompagnaient l’article, et à quel emplacement du texte
Couper la navigationactivéles blocs de promotion et « à lire aussi » changent à chaque visite : gardés, ils rendent deux captures de la même page incomparables
Sélectionactivépour doubler la capture entière d’une capture du seul passage litigieux, que rien ne vient couper
Boutons de la fenêtreCopier + Dossierla copie sert au montage du papier, le dossier à l’archive – les autres boutons ralentissent la fenêtre
Cas difficile : la page n’a jamais fini d’afficher son corps de texte, lu dans ses données structurées20minutes.fr
---
title: "Conseil municipal : le budget voté après quatre heures de séance"
source: "https://www.20minutes.fr/lille/4098211-20250318-conseil-municipal.html"
author: "20 Minutes avec AFP"
published: "2025-03-18T21:47:00.000Z"
extraction: "jsonld-articlebody"
---

La délibération a été adoptée par vingt-huit voix contre onze, après le retrait
de l’amendement sur la tarification des cantines.

Trois usages réels

Fixer une page avant la correction

Une déclaration est publiée à 18 h et vous savez, d’expérience, que la formulation sera adoucie avant la nuit. Vous capturez la page telle qu’elle est, avec sa date de publication au format ISO, heure comprise. Le fichier arrive dans le dossier du sujet sans ouvrir de fenêtre, ce qui compte quand la capture doit tenir entre deux appels.

Le lendemain, la page a changé. Vous recapturez : comme la date de publication annoncée est la même, changez le sous-dossier ou renommez la première capture avant de recommencer, sinon le second fichier prend la place du premier. L’extension ne compare pas les deux versions et ne signale pas ce qui a bougé ; la comparaison se fait dans votre éditeur.

Un fil de discussion comme source

Sur Reddit, la capture rend le fil en citations imbriquées selon la profondeur des réponses, chaque message précédé de son auteur et de son score. Le champ extraction porte alors dom-only : rien n’a été rechargé depuis le réseau, ce que vous obtenez est exactement ce que la page avait déjà affiché.

Conséquence pratique : les commentaires non chargés ne sont pas dans la capture. Déroulez les fils qui vous intéressent et cliquez sur « plus de commentaires » avant de capturer. Hors de Reddit, les commentaires sont traités comme de l’habillage de page et coupés – c’est un choix, pas un oubli.

Une source derrière un mur payant

Un article auquel votre rédaction est abonnée se capture comme n’importe quelle page : l’extension lit ce que votre navigateur a affiché après authentification, et aucune requête ne part vers un serveur. C’est précisément le cas où les services d’archivage extérieurs échouent, puisqu’ils arrivent sur la page sans votre session.

Ce que vous obtenez reste une copie de travail : un fichier daté sur votre disque, ni horodaté par un tiers, ni signé. Pour une trace opposable, il faut un constat ; pour savoir ce que la page disait le jour où vous l’avez lue, le fichier suffit et se prend en trois secondes.

Comparé aux façons de faire actuelles

Chaque méthode d’archivage résout un problème différent. Le tableau dit lequel, et où chacune s’arrête – y compris celle-ci.

MéthodeCe que vous obtenezCe que ça coûte
Un service d’archivage webune trace publique, horodatée par un tierséchoue derrière une connexion ou un mur payant, dépend de la survie du service, et n’attrape pas toujours la version que vous avez lue
Capture d’écranl’apparence exacte, immédiatementni cherchable, ni citable au mot près ; un article long demande dix images qu’il faudra rouvrir une à une
Imprimer la page en PDFla mise en page complète dans un seul fichierles menus et les encarts occupent des pages entières, et le texte se cite mal depuis un PDF de page web
« Enregistrer la page » du navigateurle HTML et ses ressources, hors ligneun dossier lourd par page, illisible sans navigateur, et la mise en page casse dès que les scripts manquent
Copier-coller dans un documentle texte, tout de suitel’adresse, l’auteur et la date sont à recopier à la main, et l’habillage de la page arrive avec le texte
Clean Clipperle texte, la date ISO et l’adresse dans un fichier à vousaucune valeur probante opposable, aucune surveillance de la page, pas d’images ni de mise en page conservées

Quand la trace n’est pas celle attendue

Pourquoi le nom du fichier porte-t-il la date d’aujourd’hui ?

Parce que la page n’annonce aucune date de publication. Dans le modèle de nom, {date} utilise la date que la page déclare ; à défaut, il retombe sur la date du jour, faute de quoi le nom serait tronqué. Le frontmatter, lui, ne triche pas : le champ published n’est pas écrit du tout quand la page n’en donne pas.

C’est donc le fichier qu’il faut croire, pas son nom. Quand une source ne date jamais ses pages, mettez {domain} - {title} dans le modèle et notez la date de lecture dans le dossier du sujet.

Pourquoi le texte ne ressemble-t-il pas à ce que j’avais à l’écran ?

Regardez le champ extraction. jsonld-articlebody signifie que le corps de l’article a été lu dans les données structurées de la page, ce qui n’arrive que si celles-ci contiennent au moins une fois et demie plus de texte que le rendu réel. C’est le cas des pages qui n’ont jamais fini de s’afficher, et de certaines qui n’affichent qu’un extrait.

Cette version est celle que l’éditeur publie pour les moteurs : elle peut être plus complète que ce que vous voyiez, et ne pas contenir les encarts insérés dans la page. Le mode d’extraction est écrit dans la note précisément pour que cette différence soit consignée plutôt que découverte plus tard.

Pourquoi l’extension répond-elle « aucun article » sur un direct ?

Parce qu’un fil en direct est, structurellement, une liste de liens et d’horodatages. Au-delà de 800 caractères, si plus d’un quart des caractères se trouvent dans des libellés de liens, la page est classée comme fil et seule l’en-tête est enregistrée. Une page d’accueil ou une page de rubrique donne le même résultat, pour la même raison.

Deux contournements : ouvrez le billet précis plutôt que le fil, ou sélectionnez à la main le bloc qui vous intéresse – sur une sélection, ni la coupe ni le refus ne s’appliquent, et le texte est enregistré tel quel.

Pourquoi les commentaires ont-ils disparu ?

Parce que hors de Reddit ils sont traités comme de l’habillage de page. Un espace de commentaires est un bloc chargé après coup, souvent par un service tiers, avec sa pagination et ses boutons de tri : le convertir donnerait quelques dizaines de lignes de navigation pour trois phrases utiles.

Si un commentaire précis fait partie de la source, sélectionnez-le sur la page et capturez la sélection. Elle est enregistrée sans coupe, avec le même frontmatter que la page entière, ce qui garde le lien avec l’adresse et la date.

Ce qu’il ne fait pas

Ce n’est pas un archivage web : il enregistre le texte, pas la page telle qu’elle s’affiche – ni mise en page, ni capture d’écran, ni ressources associées. Il ne produit pas de preuve horodatée opposable, seulement un fichier daté sur votre disque. Il ne surveille pas une page et ne signale pas ses modifications ; il faut recapturer soi-même. Et hors de Reddit, les commentaires sont traités comme de l’habillage de page, donc coupés.

Ajouter à Chrome – gratuitGratuit, sans compte et sans version payante.

Questions

Est-ce que ça remplace un archivage web ?
Non. Cela enregistre le texte et ses métadonnées, pas l’apparence de la page. Pour une trace visuelle, passez par un service d’archivage ; pour le texte, ceci va plus vite et reste sur votre disque.
Les commentaires sont-ils capturés ?
Sur Reddit, oui, sous forme de fil compact avec le score de chaque commentaire. Ailleurs, les commentaires sont traités comme de l’habillage de page et coupés.
Peut-il noter la date à laquelle j’ai capturé la page ?
Indirectement. Le jeton {date} du nom de fichier prend la date annoncée par la page, et retombe sur celle du jour quand la page n’en donne aucune ; la date de création du fichier, elle, reste celle de la capture.
Et une page derrière un mur payant auquel je suis abonné ?
Elle se capture, parce que l’extension lit la page que votre navigateur a affichée après votre connexion.
Comment savoir d’où vient le texte capturé ?
Le champ extraction le dit : dom signifie que le texte vient de ce que le navigateur a réellement affiché, jsonld-articlebody qu’il a fallu le lire dans les données structurées de la page.
L’heure de publication est-elle conservée ?
Quand la page la donne, oui. La date est normalisée au format ISO complet, par exemple 2024-09-17T06:12:00.000Z ; les horodatages Unix à dix ou treize chiffres sont convertis, et les valeurs hors de la fenêtre 1990–2100 sont rejetées.
Puis-je capturer une page qui se recharge toute seule ?
Oui, mais la capture porte sur ce qui est à l’écran au moment du clic. Sur un fil qui s’actualise, prenez la capture juste après avoir lu le passage qui compte, et vérifiez ensuite le fichier plutôt que la page.
Puis-je archiver dix pages en une seule fois avant un bouclage ?
Non, il faut dix captures. Il n’y a ni traitement par lots ni robot d’exploration : chacune part de votre clic ou du raccourci, sur l’onglet actif.
Les photos et leurs crédits sont-ils gardés ?
Les images restent des liens vers le site d’origine et ne sont pas téléchargées ; elles mourront avec lui. Le crédit photo n’est conservé que s’il figure dans le texte de la page, pas s’il n’existe que dans une légende gérée par un script.
Le site voit-il que je capture une page ?
Non. Rien n’est demandé au serveur : l’extraction porte sur la page déjà chargée dans votre onglet, l’extension ne fait aucune requête réseau et ne demande aucune permission d’hôte.