Chrome-extensie
Een webpagina opslaan als Markdown die je niet hoeft na te bewerken
Klik op het icoon en de clip staat er al: titel, auteur, publicatiedatum en bron verzameld in de frontmatter, de tekst ontdaan van navigatie. Alles gebeurt in je browser – geen account, geen server, geen telemetrie.

Het probleem is nooit de omzetting. Het is alles wat meekomt.
Elke clipper maakt van HTML Markdown. Daarna open je de notitie en vind je de cookiebalk, het zijmenu, een “lees ook”-lijst en een tabel die onderweg uit elkaar is gevallen. Clean Clipper is precies om dat weghalen heen gebouwd, en dat weghalen is gemeten in plaats van beweerd.
wat andere clippers laten staan
[Naar de inhoud](#main) [Inloggen](/login) [Registreren](/register) [Home](/) [Nieuws](/nieuws) [Sport](/sport) [Cultuur](/cultuur) [Meer](/meer) We gebruiken cookies en vergelijkbare technieken om je ervaring te verbeteren. [Alles accepteren] [Voorkeuren beheren] # Het artikel waarvoor je kwam De eerste echte alinea van de tekst. <div class="promo-inline"> ## Lees ook [Nog een kop](/a) [En nog een kop](/b) [En een derde](/c)
wat er in de notitie belandt
# Het artikel waarvoor je kwam De eerste echte alinea van de tekst.
Wat de uitvoer schoon maakt
- Code houdt zijn taal. Je krijgt een fence met
jserop en geen kale, dus highlighting werkt zodra je plakt. - Tabellen blijven heel. Een cel met code of een lijst breekt de rij niet meer.
- Voetnoten werken echt. Verwijzingen worden
[^1]met de definities achter in de notitie, geen dode ankers. - De datum wordt gelezen, niet geraden. JSON-LD,
article:published_time,citation_date(de standaard van arXiv, PubMed en IEEE),time[datetime], Unix-stempels. Staat er geen datum op de pagina, dan blijft het veld leeg – nooit de datum van vandaag. - Menu’s, banners en “lees ook” gaan eruit. Logobalken, paginering en navigatie die in elke sectie terugkomt halen de notitie nooit.
- Geen enkel restje markup. Geen
divoftablemidden in je tekst.
---
title: "Markovketen - Wikipedia"
source: "https://nl.wikipedia.org/wiki/Markovketen"
date: "2004-03-11T09:26:52.000Z"
extraction: "dom"
---
Een markovketen is een stochastisch proces waarin de kans op de volgende
toestand alleen afhangt van de toestand waarin het proces zich nu bevindt,
en niet van de weg daarnaartoe.[^1]
[^1]: Markov, A. A. (1906). Uitbreiding van de wet van de grote aantallen
tot onderling afhankelijke grootheden.Gemeten op 512 pagina’s van de drukstbezochte websites ter wereld
Twee runs. De eerste nam 109 pagina’s uit de honderd drukstbezochte websites wereldwijd en in Rusland en legde de uitvoer naast drie andere extractie-engines. De tweede nam de top vijftig van elk van twaalf Europese landen – 403 pagina’s erbij, elk opgehaald in de taal van het land.
Waar het naartoe gaat
- De Markdown naar het klembord kopiëren
- Het
.md-bestand downloaden - Schrijven naar een map die je zelf op de schijf hebt gekozen
- Rechtstreeks in je Obsidian-vault schrijven – geen plug-in, geen lokale REST API, geen URI-schema; het bestand staat er gewoon
Wat de klik op het icoon doet, stel je zelf in. Laat het voorbeeldvenster staan, of maak er één klik van die de notitie in je vault legt en verder niets opent.

Eerlijk over de herkomst
Elke notitie krijgt een veld extraction. dom betekent dat de tekst komt uit wat de browser werkelijk heeft gerenderd. jsonld-articlebody betekent dat de pagina nooit klaar was met renderen en de tekst uit haar eigen gestructureerde data moest komen. En staat er helemaal geen artikel op de pagina – een webwinkel, een tijdlijn, een zoekresultaat – dan zegt de extensie dat, in plaats van je driehonderd links voor te schotelen.
Vijftien manieren waarop mensen het gebruiken
OntwikkelaarsCode-fences houden hun taallabel, dus geplakte documentatie is meteen gekleurd.
Clean Clipper leest de taal van een codeblok van de pagina zelf af – uit de class op de fence, uit het bovenliggende element of uit de markup van de highlighter – en schrijft die in de Markdown. Op een technisch corpus bleef het label staan in 73 van de 156 fences, tegen 20 en 0 bij de twee vergeleken engines.
- Een fence komt eruit als ```js en niet kaal – highlighting werkt in Obsidian, VS Code en op GitHub zodra je plakt
- Het label komt van de pagina zelf: de class die de highlighter achterliet, geen gok op basis van de code
- Tabellen met een codevoorbeeld in een cel klappen niet dicht tot één regel
Obsidian-gebruikersWijs één keer een map in je vault aan en de clip komt daar als .md-bestand terecht.
De extensie schrijft de notitie zelf in de map die je aanwijst, via de File System Access API van de browser. Er komt geen community-plug-in aan te pas, geen lokale REST API en geen obsidian://-link, en Obsidian hoeft niet te draaien: het bestand staat er zodra je de vault weer opent.
- Geen plug-in, geen lokale server, geen
obsidian://-links – de extensie schrijft het bestand zelf - Obsidian hoeft niet open te staan; het bestand ligt er wanneer je de vault weer opent
- YAML-frontmatter met title, source, author, date en extraction, en jij kiest welke velden blijven
AI en LLM’sHerhaalde navigatie is weggegooide context. Die gaat eruit voordat de tekst je model bereikt.
Een webpagina die je in een model plakt bestaat voor een flink deel uit navigatie, en elke dubbele menuregel telt mee als context. Op een corpus van 109 pagina’s bleven er bij Clean Clipper 102 dubbele navigatieregels over, waar drie andere engines er 282, 478 en 491 lieten staan. Wat overblijft is de tekst, met de bron-URL en de datum in de frontmatter.
- Ongeveer vier keer minder dubbele navigatieregels dan het gemiddelde van de vergeleken engines
- Nul achtergebleven HTML-tags over 512 gemeten pagina’s – geen markup om omheen te lezen
- De frontmatter geeft het model de bron-URL en de publicatiedatum expliciet mee
OnderzoekersLeest citation_date, de standaard van arXiv, PubMed en IEEE, en zet voetnoten achterin.
De datum komt uit de metadata van de pagina en niet uit een gok op de tekst: citation_date, JSON-LD datePublished, article:published_time, time[datetime] en Unix-stempels worden in die volgorde gelezen. Draagt de pagina geen datum, dan blijft het veld leeg. Verwijzingen worden [^1]-voetnoten met hun definities achter in de notitie.
- Leest
citation_dateencitation_publication_date– de metatags die arXiv, PubMed en IEEE meegeven - Daarnaast JSON-LD
datePublished,article:published_time,time[datetime]en Unix-stempels - Geen datum op de pagina betekent een leeg veld, nooit de datum van vandaag
StudentenColleges, hoofdstukken en naslagpagina’s worden gewone Markdown-bestanden op je eigen schijf.
Studiemateriaal verdwijnt als het blok voorbij is: de leeromgeving sluit, de link rot weg en de pdf staat achter een login die je niet meer hebt. Een clip is platte tekst met de bron erbij, en die opent over tien jaar nog in elke editor. Selecteer je iets op de pagina, dan wordt alleen die selectie opgehaald.
- Selecteer een passage en alleen de selectie wordt opgehaald – handig om een definitie te citeren
- Elke notitie draagt de bron-URL, dus verwijzen kost later geen zoekwerk
- De publicatiedatum wordt gelezen waar de pagina er een draagt, en blijft anders leeg
SchrijversElke clip houdt bron-URL, auteur en publicatiedatum vast, dus een citaat raakt zijn herkomst niet kwijt.
Wat je als schermafbeelding of bladwijzer bewaart, is precies op het moment van toeschrijven onbruikbaar: je weet niet meer wie het schreef en wanneer. Markdown met frontmatter houdt title, author, date en source bij elkaar in hetzelfde bestand als de tekst, en de auteursherkenning filtert sectiekoppen en knopteksten eruit in plaats van er maar iets neer te zetten.
- Title, author, date en source in de frontmatter van elke notitie
- De artikeltekst zonder navigatie, klaar om uit te citeren
- De auteursherkenning filtert sectiekoppen, uitgeversnamen en knopteksten weg
JournalistenDe pagina zoals je hem zag, met publicatiedatum, in een formaat dat de site overleeft.
Pagina’s worden herschreven en offline gehaald, meestal zonder dat er iets bij staat. Een clip met de bron-URL, de publicatiedatum en de volledige tekst is een vastlegging waar je later naar kunt wijzen, en die staat op je eigen schijf. Het veld extraction noteert bovendien hoe de tekst is verkregen, zodat de notitie controleerbaar is.
- Publicatiedatum gelezen uit de metadata van de pagina, niet uit de lopende tekst
- Bron-URL in de frontmatter van elke notitie, dus de herkomst reist mee
- De volledige artikeltekst zonder de navigatie- en promoblokken die per bezoek verschillen
Juridisch werkDe tekst zoals gepubliceerd, met bron-URL en datum, in een bestand dat jij beheert.
Regelingen, algemene voorwaarden en beleidsregels veranderen zonder aankondiging. Een Markdown-kopie met het adres waar hij vandaan komt en de datum die erop stond, legt vast wat de tekst zei toen jij hem las. Binnen de artikeltekst worden geen woorden toegevoegd, weggehaald of verplaatst; alleen HTML wordt Markdown.
- Woordelijke tekst: de extensie vat niets samen, herschrijft niets en verandert geen volgorde
- Bron-URL en publicatiedatum in de frontmatter, dus de vindplaats reist mee
- Tabellen met tarieven, termijnen en drempels komen heel door de omzetting
AnalistenEen eigen tabelserialisatie: een cel met een lijst, een link of code breekt de rij niet meer.
Generieke omzetters van HTML naar Markdown lopen stuk op precies de tabellen waar het om gaat. Clean Clipper schrijft de tabel zelf en slaat de celinhoud plat in plaats van de rij te laten vallen: op een corpus van vijftien tabellen bleven er twaalf heel, tegen zeven bij elk van de vergeleken engines.
- Eigen GFM-tabelserialisatie in plaats van een generieke plug-in
- Twaalf van de vijftien tabellen behouden op het technische corpus, tegen zeven bij elke vergeleken engine
- Een cel met een lijst, een link of een codevoorbeeld wordt platgeslagen, niet weggelaten
DocentenHaal het materiaal op, houd de bron, druk het af – zonder het meubilair van de site.
Een pagina die je rechtstreeks uit de browser afdrukt, neemt de menu’s, de cookiebalk en de advertenties mee op de hand-out. Clean Clipper drukt de clip af en niet de pagina: alleen de tekst, met de bron-URL erbij zodat de bronvermelding klopt. Wil je één oefening of één definitie, dan selecteer je die en haal je alleen de selectie op.
- Een printknop die de clip afdrukt en niet de pagina, zonder menu’s en banners
- De leesweergave toont het resultaat zonder Markdown-tekens voordat je print
- De bron-URL blijft in de notitie staan, dus bronvermelding kost geen moeite
VertalersNavigatie, banners en herhaalde menu’s halen de segmentlijst nooit.
Brontekst die je uit een webpagina plakt, neemt de navigatie mee, en elk menu-item wordt een segment dat je moet overslaan. Clean Clipper knipt dat weg vóór de export: op een corpus van 109 pagina’s bleven er 102 dubbele navigatieregels over, tegen 282, 478 en 491 bij de drie andere engines. Wat je importeert is lopende tekst.
- Menu’s, paginering, cookiebalken en “lees ook”-blokken gaan eruit vóór de export
- Dubbele navigatieregels ruwweg vier keer minder dan bij de vergeleken engines
- Gewone Markdown importeert in elke gangbare CAT-tool
ProductmanagersChangelogs, documentatie en release notes als gedateerde, doorzoekbare notities.
Concurrentieonderzoek dat je als bladwijzers bewaart, verwordt tot een lijst links waar je niet in kunt zoeken. Opgehaald als Markdown wordt het een corpus dat je kunt doorzoeken, vergelijken en citeren in een beslisdocument – met de publicatiedatum van de pagina zelf, zodat een changelog-regel zijn echte timing houdt.
- Publicatiedatum gelezen van de pagina, dus een changelog-regel houdt zijn echte timing
- Met regels per website gaat elke concurrent vanzelf naar een eigen map
- Tabellen met pakketten, limieten en functievergelijkingen komen heel door
Technisch schrijversStructuur, code-fences en tabellen komen mee; het meubilair van de site niet.
Documentatie migreren betekent meestal: HTML omzetten en daarna langer bezig zijn met weghalen wat de omzetter heeft bewaard. Dat weghalen is waar Clean Clipper om heen is gebouwd, en het is ook het deel dat gemeten is: nul achtergebleven HTML-tags over 512 pagina’s, en taallabels die op de code-fences blijven staan.
- Kopjes, lijsten, tabellen, code-fences en voetnoten worden allemaal standaard Markdown
- Taallabels blijven op de code-fences staan – 73 van de 156 op het technische corpus, tegen 20 en 0
- Nul achtergebleven HTML-tags over 512 gemeten pagina’s
Persoonlijk archiefGewone Markdown-bestanden op je eigen schijf. Geen account, geen dienst, niets dat kan sluiten.
Bladwijzers wijzen naar pagina’s die veranderen of verdwijnen. Een clip is de tekst zelf, in platte tekst met YAML-frontmatter, opgeslagen waar jij dat bepaalt. De extensie doet geen enkel netwerkverzoek, dus er is geen account dat kan verlopen en geen dienst die je toegang kan intrekken.
- Duurzaam open formaat: platte tekst met YAML-frontmatter, leesbaar in elke editor
- Geen account en geen server – de extensie doet helemaal geen netwerkverzoeken
- Publicatiedatum en bron-URL worden samen met de tekst vastgelegd
Lezen zonder ruisEen leesweergave die de tekst toont zonder menu’s, zonder banners en zonder Markdown-tekens.
Pagina-meubilair is niet alleen visuele rommel: het is tekst die een schermlezer voorleest en een lezer moet overslaan. Het clipvenster toont het artikel op zichzelf, in het lichte of donkere thema van je browser, en er draaien geen scripts van de pagina in mee. Wat je opslaat is platte tekst die elk hulpmiddel aankan.
- Toont de clip als gewone tekst, zonder Markdown-tekens, met kopjes, tabellen en werkende links
- Volgt de licht- en donkerinstelling van je browser
- Vergroot tot een venster van driekwart scherm, zodat de pagina erachter zichtbaar blijft