Pour qui
Archiver une source avant qu’elle change
Les pages sont réécrites, corrigées et retirées, souvent sans mention du changement. Une capture qui porte l’adresse source, la date de publication et le texte intégral est une trace que vous pouvez montrer plus tard. Elle vit sur votre disque, en Markdown, plutôt que dans un service qui peut fermer.
Quand la page a changé
Un texte en ligne n’est pas un document figé. Un titre est adouci quelques heures après la publication, un paragraphe disparaît, une déclaration est reformulée, et rien n’en garde la trace visible. Vous citez ce que vous avez lu, on vous répond que la page ne dit pas cela, et vous avez raison sans pouvoir le prouver.
Le lien vers un service d’archivage extérieur ne règle qu’une partie du problème. Il faut que le service ait attrapé la bonne version, qu’il soit encore là au moment de la vérification, et qu’il ait pu passer la connexion ou le mur payant derrière lequel vous lisiez. Pendant ce temps, la seule copie qui compte vraiment est celle que vous n’avez pas prise.
À cela s’ajoute une difficulté plus récente : deux personnes ne voient plus forcément la même page. Le contenu est adapté au profil, au pays et au moment, les blocs sont réordonnés par des tests en cours, et un site sert parfois aux robots une version qui n’est pas celle affichée à l’écran. Une capture prise depuis votre propre onglet fixe ce que vous, vous avez lu – et le champ extraction précise si le texte vient du rendu de la page ou de ses données structurées, ce qui n’est pas le même degré de témoignage.
Ce que la trace contient
- Date de publication lue dans les métadonnées de la page, pas cherchée dans le texte
- La date est écrite au format ISO complet, heure comprise quand la page la donne –
2024-09-17T06:12:00.000Z - Adresse source dans le frontmatter de chaque note, avec le titre tel qu’il était
- Texte intégral de l’article, sans les blocs de navigation et de promotion qui changent à chaque visite
- Le champ
extractionconsigne comment le texte a été obtenu,domoujsonld-articlebody - De simples fichiers – pas de format propriétaire, pas de compte, pas de service qui puisse révoquer l’accès
- Sur Reddit, le fil est rendu en citations imbriquées selon la profondeur des réponses, avec le score de chaque message
- Le modèle de nom accepte
{date}et{domain}, ce qui range un dossier d’enquête par source et par jour
--- title: "Ce que contient le projet de loi de finances" source: "https://www.francetvinfo.fr/economie/projet-de-loi-de-finances.html" author: "franceinfo" published: "2024-09-17T06:12:00.000Z" extraction: "dom" --- Le texte présenté mercredi fixe le cadre budgétaire de l’année suivante et détaille les recettes attendues.
Prendre une trace en trois secondes
Sur un sujet chaud, une méthode qui demande six gestes n’est pas appliquée. Les réglages ci-dessous ramènent la capture à un raccourci clavier, sans rien perdre de ce qui sert à dater la source.
- Dans les paramètres, section « Où enregistrer », désignez avec « Choisir… » un dossier d’archives sur votre disque, puis indiquez le sujet en cours dans « Sous-dossier des téléchargements ». Le sous-dossier se change en une seconde quand vous passez à un autre sujet.
- Réglez « Nom du fichier » sur
{domain} - {date} - {title}. Le domaine en tête regroupe les captures par source, la date les ordonne, et deux versions d’un même article prises à des dates de publication différentes ne se réécrivent pas. - Dans les propriétés, gardez les cinq champs.
publishedetsourcesont ce qui date la trace ;extractiondit si le texte vient de l’écran ou des données structurées de la page, une nuance qui compte le jour où la capture est discutée. - Passez « Clic sur l’icône » sur « Placer dans un dossier ». La capture se fait alors sans fenêtre : un clic, ou Alt+Shift+M sans quitter le clavier, et le fichier est écrit pendant que vous continuez à lire.
- Vérifiez le comportement une fois sur un article ordinaire : rouvrez le fichier et contrôlez que
publishedcorrespond bien à la date annoncée par la page, et non à celle du jour. Sur les sites qui ne publient aucune date, le champ est absent – c’est une information sur la source, à noter dans le dossier. - Quand une page compte vraiment, capturez-la deux fois : une fois entière, une fois sur la sélection du passage litigieux. La seconde capture n’est coupée d’aucune manière, puisque la coupe ne s’applique jamais à une sélection.
Réglages conseillés pour l’archivage
Ces valeurs privilégient la vitesse et la complétude sur la légèreté du fichier : une trace amputée ne se répare pas, et une trace qui prend une minute à prendre n’est pas prise.
| Réglage | Valeur | Pourquoi celle-là ici |
|---|---|---|
| Clic sur l’icône | Placer dans un dossier | sur un sujet en cours, la capture doit coûter un geste ; la vérification vient après, dans le fichier |
| Nom du fichier | `{domain} - {date} - {title}` | un dossier d’enquête se lit alors par source puis par date, et deux versions datées différemment coexistent |
| Propriétés gardées | les cinq champs | `published`, `source` et `extraction` sont exactement ce qui fait la valeur d’une trace ; les retirer la vide de sens |
| Images | garder en liens | le lien indique au moins quelles illustrations accompagnaient l’article, et à quel emplacement du texte |
| Couper la navigation | activé | les blocs de promotion et « à lire aussi » changent à chaque visite : gardés, ils rendent deux captures de la même page incomparables |
| Sélection | activé | pour doubler la capture entière d’une capture du seul passage litigieux, que rien ne vient couper |
| Boutons de la fenêtre | Copier + Dossier | la copie sert au montage du papier, le dossier à l’archive – les autres boutons ralentissent la fenêtre |
--- title: "Conseil municipal : le budget voté après quatre heures de séance" source: "https://www.20minutes.fr/lille/4098211-20250318-conseil-municipal.html" author: "20 Minutes avec AFP" published: "2025-03-18T21:47:00.000Z" extraction: "jsonld-articlebody" --- La délibération a été adoptée par vingt-huit voix contre onze, après le retrait de l’amendement sur la tarification des cantines.
Trois usages réels
Fixer une page avant la correction
Une déclaration est publiée à 18 h et vous savez, d’expérience, que la formulation sera adoucie avant la nuit. Vous capturez la page telle qu’elle est, avec sa date de publication au format ISO, heure comprise. Le fichier arrive dans le dossier du sujet sans ouvrir de fenêtre, ce qui compte quand la capture doit tenir entre deux appels.
Le lendemain, la page a changé. Vous recapturez : comme la date de publication annoncée est la même, changez le sous-dossier ou renommez la première capture avant de recommencer, sinon le second fichier prend la place du premier. L’extension ne compare pas les deux versions et ne signale pas ce qui a bougé ; la comparaison se fait dans votre éditeur.
Un fil de discussion comme source
Sur Reddit, la capture rend le fil en citations imbriquées selon la profondeur des réponses, chaque message précédé de son auteur et de son score. Le champ extraction porte alors dom-only : rien n’a été rechargé depuis le réseau, ce que vous obtenez est exactement ce que la page avait déjà affiché.
Conséquence pratique : les commentaires non chargés ne sont pas dans la capture. Déroulez les fils qui vous intéressent et cliquez sur « plus de commentaires » avant de capturer. Hors de Reddit, les commentaires sont traités comme de l’habillage de page et coupés – c’est un choix, pas un oubli.
Une source derrière un mur payant
Un article auquel votre rédaction est abonnée se capture comme n’importe quelle page : l’extension lit ce que votre navigateur a affiché après authentification, et aucune requête ne part vers un serveur. C’est précisément le cas où les services d’archivage extérieurs échouent, puisqu’ils arrivent sur la page sans votre session.
Ce que vous obtenez reste une copie de travail : un fichier daté sur votre disque, ni horodaté par un tiers, ni signé. Pour une trace opposable, il faut un constat ; pour savoir ce que la page disait le jour où vous l’avez lue, le fichier suffit et se prend en trois secondes.
Comparé aux façons de faire actuelles
Chaque méthode d’archivage résout un problème différent. Le tableau dit lequel, et où chacune s’arrête – y compris celle-ci.
| Méthode | Ce que vous obtenez | Ce que ça coûte |
|---|---|---|
| Un service d’archivage web | une trace publique, horodatée par un tiers | échoue derrière une connexion ou un mur payant, dépend de la survie du service, et n’attrape pas toujours la version que vous avez lue |
| Capture d’écran | l’apparence exacte, immédiatement | ni cherchable, ni citable au mot près ; un article long demande dix images qu’il faudra rouvrir une à une |
| Imprimer la page en PDF | la mise en page complète dans un seul fichier | les menus et les encarts occupent des pages entières, et le texte se cite mal depuis un PDF de page web |
| « Enregistrer la page » du navigateur | le HTML et ses ressources, hors ligne | un dossier lourd par page, illisible sans navigateur, et la mise en page casse dès que les scripts manquent |
| Copier-coller dans un document | le texte, tout de suite | l’adresse, l’auteur et la date sont à recopier à la main, et l’habillage de la page arrive avec le texte |
| Clean Clipper | le texte, la date ISO et l’adresse dans un fichier à vous | aucune valeur probante opposable, aucune surveillance de la page, pas d’images ni de mise en page conservées |
Quand la trace n’est pas celle attendue
Pourquoi le nom du fichier porte-t-il la date d’aujourd’hui ?
Parce que la page n’annonce aucune date de publication. Dans le modèle de nom, {date} utilise la date que la page déclare ; à défaut, il retombe sur la date du jour, faute de quoi le nom serait tronqué. Le frontmatter, lui, ne triche pas : le champ published n’est pas écrit du tout quand la page n’en donne pas.
C’est donc le fichier qu’il faut croire, pas son nom. Quand une source ne date jamais ses pages, mettez {domain} - {title} dans le modèle et notez la date de lecture dans le dossier du sujet.
Pourquoi le texte ne ressemble-t-il pas à ce que j’avais à l’écran ?
Regardez le champ extraction. jsonld-articlebody signifie que le corps de l’article a été lu dans les données structurées de la page, ce qui n’arrive que si celles-ci contiennent au moins une fois et demie plus de texte que le rendu réel. C’est le cas des pages qui n’ont jamais fini de s’afficher, et de certaines qui n’affichent qu’un extrait.
Cette version est celle que l’éditeur publie pour les moteurs : elle peut être plus complète que ce que vous voyiez, et ne pas contenir les encarts insérés dans la page. Le mode d’extraction est écrit dans la note précisément pour que cette différence soit consignée plutôt que découverte plus tard.
Pourquoi l’extension répond-elle « aucun article » sur un direct ?
Parce qu’un fil en direct est, structurellement, une liste de liens et d’horodatages. Au-delà de 800 caractères, si plus d’un quart des caractères se trouvent dans des libellés de liens, la page est classée comme fil et seule l’en-tête est enregistrée. Une page d’accueil ou une page de rubrique donne le même résultat, pour la même raison.
Deux contournements : ouvrez le billet précis plutôt que le fil, ou sélectionnez à la main le bloc qui vous intéresse – sur une sélection, ni la coupe ni le refus ne s’appliquent, et le texte est enregistré tel quel.
Pourquoi les commentaires ont-ils disparu ?
Parce que hors de Reddit ils sont traités comme de l’habillage de page. Un espace de commentaires est un bloc chargé après coup, souvent par un service tiers, avec sa pagination et ses boutons de tri : le convertir donnerait quelques dizaines de lignes de navigation pour trois phrases utiles.
Si un commentaire précis fait partie de la source, sélectionnez-le sur la page et capturez la sélection. Elle est enregistrée sans coupe, avec le même frontmatter que la page entière, ce qui garde le lien avec l’adresse et la date.
Ce qu’il ne fait pas
Ce n’est pas un archivage web : il enregistre le texte, pas la page telle qu’elle s’affiche – ni mise en page, ni capture d’écran, ni ressources associées. Il ne produit pas de preuve horodatée opposable, seulement un fichier daté sur votre disque. Il ne surveille pas une page et ne signale pas ses modifications ; il faut recapturer soi-même. Et hors de Reddit, les commentaires sont traités comme de l’habillage de page, donc coupés.
Questions
Est-ce que ça remplace un archivage web ?
Les commentaires sont-ils capturés ?
Peut-il noter la date à laquelle j’ai capturé la page ?
{date} du nom de fichier prend la date annoncée par la page, et retombe sur celle du jour quand la page n’en donne aucune ; la date de création du fichier, elle, reste celle de la capture.Et une page derrière un mur payant auquel je suis abonné ?
Comment savoir d’où vient le texte capturé ?
extraction le dit : dom signifie que le texte vient de ce que le navigateur a réellement affiché, jsonld-articlebody qu’il a fallu le lire dans les données structurées de la page.L’heure de publication est-elle conservée ?
2024-09-17T06:12:00.000Z ; les horodatages Unix à dix ou treize chiffres sont convertis, et les valeurs hors de la fenêtre 1990–2100 sont rejetées.