Extension Chrome
Enregistrer une page web en Markdown que vous n’aurez pas à nettoyer
Un clic sur l’icône suffit pour enregistrer une page web en Markdown : titre, auteur, date de publication et adresse source rassemblés dans le frontmatter, le corps du texte débarrassé de la navigation. Tout se passe dans votre navigateur : pas de compte, pas de serveur, pas de télémétrie.

Le problème n’est jamais la conversion. C’est tout ce qui vient avec.
N’importe quel clipper transforme du HTML en Markdown. Puis vous ouvrez la note et vous y trouvez le bandeau cookies, le menu latéral, une liste « à lire aussi » et un tableau qui s’est défait en chemin. Clean Clipper est construit autour du retrait de tout cela – et ce retrait est mesuré, pas affirmé.
ce que les autres clippers gardent
[Aller au contenu](#main) [Se connecter](/login) [S’inscrire](/inscription) [Accueil](/) [Actualités](/actualites) [Sport](/sport) [Culture](/culture) [Plus](/plus) Nous utilisons des cookies et technologies similaires pour améliorer votre expérience. [Tout accepter] [Gérer mes choix] # L’article pour lequel vous êtes venu Le véritable premier paragraphe du texte. <div class="promo-inline"> ## À lire aussi [Un autre titre](/a) [Encore un titre](/b) [Et un troisième](/c)
ce qui arrive dans la note
# L’article pour lequel vous êtes venu Le véritable premier paragraphe du texte.
Ce qui rend la sortie propre
- Le code garde son langage. Le bloc ressort étiqueté
jset non nu : la coloration fonctionne dès le collage. - Les tableaux restent entiers. Une cellule contenant du code ou une liste ne casse plus la ligne.
- Les notes fonctionnent vraiment. Les liens de renvoi deviennent
[^1]avec leurs définitions en fin de note, au lieu d’ancres mortes. - La date est lue, pas devinée. JSON-LD,
article:published_time,citation_date(le standard d’arXiv, PubMed et IEEE),time[datetime], horodatages Unix. Pas de date sur la page signifie champ vide, jamais la date du jour. - Menus, bandeaux et « à lire aussi » sont coupés. Bandes de logos, paginations et navigation répétée dans chaque section n’atteignent jamais la note.
- Pas une balise oubliée. Aucun
divnitableéchoué au milieu de votre texte.
---
title: "Chaîne de Markov – Wikipédia"
source: "https://fr.wikipedia.org/wiki/Chaîne_de_Markov"
date: "2003-04-11T09:26:33.000Z"
extraction: "dom"
---
Une chaîne de Markov est un processus stochastique dans lequel la probabilité
de chaque événement ne dépend que de l’état atteint lors de l’événement
précédent.[^1]
[^1]: Markov, A. A. (1906). Extension de la loi des grands nombres aux
grandeurs dépendant les unes des autres.Mesuré sur 512 pages des sites les plus visités
Deux passages. Le premier a pris 109 pages parmi les cent sites les plus visités au monde et en Russie et a comparé la sortie à trois autres moteurs d’extraction. Le second a pris les cinquante premiers sites de douze pays européens – 403 pages de plus, chacune capturée dans la langue du pays.
Où ça enregistre
- Copier le Markdown dans le presse-papiers
- Télécharger le fichier
.md - Écrire dans un dossier que vous avez choisi sur le disque
- Écrire directement dans votre vault Obsidian – sans plugin, sans API REST locale, sans schéma d’URI ; le fichier apparaît, c’est tout
Le clic sur l’icône se règle. Gardez la fenêtre d’aperçu, ou faites qu’un seul clic dépose la note dans le vault et n’ouvre rien du tout.

Honnête sur la source
Chaque note porte un champ extraction. dom signifie que le texte vient de ce que le navigateur a réellement affiché. jsonld-articlebody signifie que la page n’a jamais fini de s’afficher et que le corps a dû être lu dans ses propres données structurées. Et quand il n’y a aucun article sur la page – une boutique, un fil, une page de résultats – l’extension le dit au lieu de vous déverser trois cents liens.
Quinze façons de s’en servir
DéveloppeursLes blocs de code gardent leur étiquette de langage : la coloration fonctionne dès le collage.
Clean Clipper lit le langage sur la page elle-même – la classe du bloc, l’élément parent, le balisage laissé par la coloration du site – et l’inscrit sur la clôture. Sur un corpus technique de neuf pages, l’étiquette a survécu dans 73 blocs sur 156, contre 20 et 0 pour les deux autres moteurs mesurés. Le reste de la page arrive en Markdown standard, sans la barre latérale.
- Le bloc ressort en ```js et non nu – la coloration fonctionne dans Obsidian, VS Code et GitHub dès le collage
- Le langage est lu sur la page – attributs
data-langetdata-language, classeslanguage-*,lang-*ethljs-*– jamais deviné à partir du code - Les alias sont ramenés à une forme unique :
javascriptdevientjs,typescriptdevientts,ymldevientyaml
Utilisateurs d’ObsidianChoisissez un dossier du vault : un clic y écrit la note, et Obsidian n’a pas besoin d’être lancé.
L’extension écrit le fichier .md elle-même, dans un dossier auquel vous donnez accès une seule fois. Il n’y a ni plugin communautaire, ni serveur local, ni lien obsidian:// à entretenir. La note est simplement là la prochaine fois que vous ouvrez votre coffre.
- Pas de plugin, pas de serveur local, pas de lien
obsidian:// - Obsidian n’a pas besoin d’être ouvert – le fichier apparaît dans le dossier et l’index le récupère ensuite
- Frontmatter YAML avec title, source, author, published et extraction, et vous décidez des champs gardés
IA et modèlesLa navigation répétée est du contexte gaspillé. Elle est retirée avant que le texte n’atteigne le modèle.
Quand une page web est collée dans un modèle, chaque ligne de menu dupliquée et chaque bandeau est compté comme contexte et dispute l’attention au texte qui vous intéresse. Sur un corpus de 109 pages, Clean Clipper a laissé 102 lignes de navigation répétées, là où les trois autres moteurs en laissaient 282, 478 et 491. Le frontmatter donne au passage l’adresse et la date de publication.
- Quatre fois moins de lignes de navigation répétées que la moyenne des moteurs comparés
- Zéro reste de balise HTML sur les 512 pages mesurées – le modèle n’a pas à contourner du balisage égaré
- Le frontmatter donne explicitement l’adresse source et la date de publication, au lieu de les laisser deviner
ChercheursLa date est lue dans les métadonnées, y compris `citation_date`, le standard d’arXiv, PubMed et IEEE.
Un article enregistré sans sa date de publication devient une référence à reconstituer plus tard. L’extension lit la date dans les métadonnées de la page plutôt que de la chercher dans le texte, et laisse le champ vide quand la page n’en porte aucune. Les liens de renvoi, eux, deviennent de vraies notes Markdown rassemblées en fin de fichier.
- Lit
citation_dateetcitation_publication_date– les balises meta qu’émettent arXiv, PubMed, HAL et IEEE - Lit aussi JSON-LD
datePublished,article:published_time,time[datetime]et les horodatages Unix - L’ordre des sources est fixe : données structurées, puis balises meta, puis
time[datetime]– aucune date n’est cherchée dans le corps du texte
ÉtudiantsCours, chapitres et pages de référence deviennent des fichiers Markdown que vous gardez.
Les supports disparaissent à la fin du semestre et les liens pourrissent ; un fichier Markdown sur votre disque, non. Une capture prend le texte, son adresse source et sa date, et s’ouvre dans n’importe quel éditeur, avec ou sans réseau. Tout ce qui est décrit ici est gratuit et ne demande aucun compte.
- Sélectionnez un passage et seule la sélection est capturée – pratique pour une définition ou un énoncé
- Chaque note porte son adresse source, la citer plus tard ne demande aucune recherche
- Les fichiers s’ouvrent hors ligne, dans Obsidian, Logseq, Joplin ou un simple éditeur de texte
AuteursChaque capture garde son adresse source, son auteur et sa date : l’attribution ne se perd pas.
Une documentation rassemblée en captures d’écran et en favoris cesse d’être utilisable au moment précis où il faut l’attribuer. Un fichier Markdown avec frontmatter garde le titre, l’auteur, la date de publication et l’adresse d’origine dans le fichier lui-même. Il reste lisible et cherchable des années plus tard, sans dépendre d’un service.
- Titre, auteur, date de publication et adresse source dans le frontmatter de chaque fichier
- L’auteur est cherché dans les données structurées et les signatures, et les faux positifs sont écartés
- Le corps de l’article sans la navigation ni les blocs promotionnels, prêt à citer
JournalistesFixez la page telle que vous l’avez lue, avec sa date de publication et son adresse.
Les pages sont réécrites, corrigées et retirées, souvent sans mention du changement. Une capture qui porte l’adresse source, la date de publication et le texte intégral est une trace que vous pouvez montrer plus tard. Elle vit sur votre disque, en Markdown, plutôt que dans un service qui peut fermer.
- Date de publication lue dans les métadonnées de la page, pas cherchée dans le texte
- La date est écrite au format ISO complet, heure comprise quand la page la donne –
2024-09-17T06:12:00.000Z - Adresse source dans le frontmatter de chaque note, avec le titre tel qu’il était
Métiers du droitLe texte tel qu’il est publié, avec son adresse et sa date, dans un fichier qui vous appartient.
Règlements, conditions générales et notices changent sans préavis et sans historique visible. Une copie Markdown qui porte l’adresse d’où elle vient et la date qu’elle affichait est la trace de ce que le texte disait le jour où vous l’avez lu. Rien n’est résumé ni reformulé au passage.
- Texte mot pour mot – l’extension ne résume pas, ne réécrit pas, ne réordonne pas
- Adresse source et date de publication dans le frontmatter, au-dessus du texte
- L’adresse conserve l’identifiant de version quand la base en publie un, comme le
LEGIARTI…d’un article consolidé
AnalystesLe sérialiseur de tableaux est propre à l’extension : une cellule avec du code ne casse plus la ligne.
Les convertisseurs HTML vers Markdown génériques cassent justement sur les tableaux qui comptent, ceux dont une cellule contient une liste, un lien ou un extrait de code. L’extension écrit le tableau elle-même et aplatit le contenu de la cellule plutôt que de perdre la ligne. Sur un corpus de quinze tableaux, douze sont passés entiers, contre sept pour chacun des moteurs comparés.
- Sérialiseur de tableaux GFM propre à l’extension, et non un greffon générique
- Douze tableaux sur quinze conservés sur le corpus technique, contre sept pour chacun des moteurs comparés
- Une cellule contenant une liste, un lien ou du code est aplatie proprement au lieu de casser la ligne
EnseignantsCapturez le support, gardez la source, imprimez-le ou classez-le, sans l’habillage du site.
Une page imprimée directement depuis le navigateur emporte ses menus, son bandeau cookies et ses encarts sur le polycopié. Une capture n’emporte que le texte, avec l’adresse d’origine conservée pour l’attribution. Le bouton d’impression de la fenêtre imprime la capture, pas la page.
- Un bouton d’impression qui imprime la capture nettoyée, pas la page du site
- La vue Lecture montre le résultat sans les symboles Markdown, tel qu’il sortira
- La fenêtre s’agrandit aux trois quarts de l’écran pour relire un texte long avant de l’imprimer
TraducteursNavigation, bandeaux et menus répétés n’arrivent jamais dans la liste de segments.
Un texte source collé depuis une page web emporte la navigation avec lui, et chaque entrée de menu devient un segment à sauter. Le retirer avant l’import va plus vite que de le filtrer après. Sur le corpus mesuré, les lignes de navigation répétées tombent à 102, contre 282, 478 et 491 pour les trois autres moteurs.
- Menus, paginations, bandeaux et fils « à lire aussi » coupés avant l’export
- Lignes de navigation répétées réduites d’environ quatre fois par rapport aux moteurs comparés
- Du Markdown simple, que tous les grands outils de TAO savent importer
Product managersChangelogs, documentation et notes de version deviennent des notes datées et cherchables.
Une veille gardée en favoris se dégrade en une liste de liens qu’on ne peut pas fouiller. Capturée en Markdown, elle devient un corpus que vous pouvez chercher, comparer et citer dans une note de décision. Chaque entrée garde la date que la page annonçait, pas celle du jour où vous l’avez lue.
- La date de publication est lue sur la page, donc une entrée de changelog garde son vrai calendrier
- Les règles par site rangent chaque concurrent dans son propre sous-dossier
- Le motif d’une règle ignore le protocole et le
www., et*remplace n’importe quelle suite :exemple.com/blog/*couvre tout un blog
Rédacteurs techniquesStructure, blocs de code et tableaux passent ; l’habillage du site, non.
Migrer une documentation consiste d’ordinaire à convertir du HTML, puis à passer plus longtemps encore à retirer ce que le convertisseur a gardé. C’est ce retrait qui a été construit et mesuré ici : zéro reste de balise HTML sur les 512 pages du corpus, et 102 lignes de navigation répétées contre 282, 478 et 491 pour les moteurs comparés.
- Titres, listes, tableaux, blocs de code et notes deviennent du Markdown standard
- Les étiquettes de langage sont conservées sur les blocs de code – 73 blocs sur 156 contre 20 et 0
- Un bloc contenant lui-même trois accents graves est clôturé par quatre : la clôture ne se referme pas au mauvais endroit
Archives personnellesDe simples fichiers Markdown sur votre disque. Pas de compte, pas de service, rien qui puisse fermer.
Un favori pointe vers une page qui change ou disparaît ; une capture, c’est le texte lui-même. Le format est du texte brut avec un frontmatter YAML, sans propriétaire et sans date de péremption, rangé là où vous décidez. Rien ne dépend de l’extension une fois le fichier écrit.
- Format ouvert et durable – du texte brut avec un frontmatter YAML, écrit en UTF-8
- Pas de compte et pas de serveur : l’extension ne fait aucune requête réseau
- Date de publication et adresse source capturées avec le texte
Lecture sans bruitUne vue Lecture qui montre le texte sans menus, sans bandeaux et sans symboles Markdown.
L’habillage d’une page n’est pas seulement du désordre visuel : c’est du texte qu’un lecteur d’écran doit prononcer et qu’un lecteur doit sauter. La fenêtre de capture montre l’article seul, dans le thème clair ou sombre de votre navigateur, et aucun script de la page ne s’y exécute. Le fichier enregistré est du texte brut, que tout outil d’assistance sait lire.
- La vue Lecture affiche la capture en texte ordinaire, sans les symboles Markdown
- Elle suit le réglage clair ou sombre de votre navigateur, sans réglage supplémentaire
- Un bouton agrandit la fenêtre aux trois quarts de l’écran, la page restant visible derrière