Clean Clipper Aan Chrome toevoegen – gratis

Chrome-extensie

Een webpagina opslaan als Markdown die je niet hoeft na te bewerken

Klik op het icoon en de clip staat er al: titel, auteur, publicatiedatum en bron verzameld in de frontmatter, de tekst ontdaan van navigatie. Alles gebeurt in je browser – geen account, geen server, geen telemetrie.

Het venster van Clean Clipper met de Markdown van een opgehaald Wikipedia-artikel
Aan Chrome toevoegen – gratisVolledig gratis, zonder account en zonder limiet.

Het probleem is nooit de omzetting. Het is alles wat meekomt.

Elke clipper maakt van HTML Markdown. Daarna open je de notitie en vind je de cookiebalk, het zijmenu, een “lees ook”-lijst en een tabel die onderweg uit elkaar is gevallen. Clean Clipper is precies om dat weghalen heen gebouwd, en dat weghalen is gemeten in plaats van beweerd.

wat andere clippers laten staan

[Naar de inhoud](#main) [Inloggen](/login) [Registreren](/register)
[Home](/) [Nieuws](/nieuws) [Sport](/sport) [Cultuur](/cultuur) [Meer](/meer)

We gebruiken cookies en vergelijkbare technieken om je ervaring te verbeteren.
[Alles accepteren] [Voorkeuren beheren]

# Het artikel waarvoor je kwam

De eerste echte alinea van de tekst.

<div class="promo-inline">

## Lees ook
[Nog een kop](/a) [En nog een kop](/b) [En een derde](/c)

wat er in de notitie belandt

# Het artikel waarvoor je kwam

De eerste echte alinea van de tekst.

Wat de uitvoer schoon maakt

Echte uitvoer, onbewerktnl.wikipedia.org/wiki/Markovketen
---
title: "Markovketen - Wikipedia"
source: "https://nl.wikipedia.org/wiki/Markovketen"
date: "2004-03-11T09:26:52.000Z"
extraction: "dom"
---

Een markovketen is een stochastisch proces waarin de kans op de volgende
toestand alleen afhangt van de toestand waarin het proces zich nu bevindt,
en niet van de weg daarnaartoe.[^1]

[^1]: Markov, A. A. (1906). Uitbreiding van de wet van de grote aantallen
      tot onderling afhankelijke grootheden.

Gemeten op 512 pagina’s van de drukstbezochte websites ter wereld

Twee runs. De eerste nam 109 pagina’s uit de honderd drukstbezochte websites wereldwijd en in Rusland en legde de uitvoer naast drie andere extractie-engines. De tweede nam de top vijftig van elk van twaalf Europese landen – 403 pagina’s erbij, elk opgehaald in de taal van het land.

512pagina’s opgehaald in totaal
0mislukkingen
0achtergebleven HTML-tags
102dubbele menuregels, tegen 282, 478 en 491 bij de drie andere engines

Waar het naartoe gaat

Wat de klik op het icoon doet, stel je zelf in. Laat het voorbeeldvenster staan, of maak er één klik van die de notitie in je vault legt en verder niets opent.

Instellingen van Clean Clipper: kiezen wat de klik op het icoon doet
De instellingen bepalen wat een klik doet – voorbeeld, klembord, bestand, map of meteen de vault.

Eerlijk over de herkomst

Elke notitie krijgt een veld extraction. dom betekent dat de tekst komt uit wat de browser werkelijk heeft gerenderd. jsonld-articlebody betekent dat de pagina nooit klaar was met renderen en de tekst uit haar eigen gestructureerde data moest komen. En staat er helemaal geen artikel op de pagina – een webwinkel, een tijdlijn, een zoekresultaat – dan zegt de extensie dat, in plaats van je driehonderd links voor te schotelen.

Vijftien manieren waarop mensen het gebruiken

OntwikkelaarsCode-fences houden hun taallabel, dus geplakte documentatie is meteen gekleurd.

Clean Clipper leest de taal van een codeblok van de pagina zelf af – uit de class op de fence, uit het bovenliggende element of uit de markup van de highlighter – en schrijft die in de Markdown. Op een technisch corpus bleef het label staan in 73 van de 156 fences, tegen 20 en 0 bij de twee vergeleken engines.

  • Een fence komt eruit als ```js en niet kaal – highlighting werkt in Obsidian, VS Code en op GitHub zodra je plakt
  • Het label komt van de pagina zelf: de class die de highlighter achterliet, geen gok op basis van de code
  • Tabellen met een codevoorbeeld in een cel klappen niet dicht tot één regel
Meer hierover
Obsidian-gebruikersWijs één keer een map in je vault aan en de clip komt daar als .md-bestand terecht.

De extensie schrijft de notitie zelf in de map die je aanwijst, via de File System Access API van de browser. Er komt geen community-plug-in aan te pas, geen lokale REST API en geen obsidian://-link, en Obsidian hoeft niet te draaien: het bestand staat er zodra je de vault weer opent.

  • Geen plug-in, geen lokale server, geen obsidian://-links – de extensie schrijft het bestand zelf
  • Obsidian hoeft niet open te staan; het bestand ligt er wanneer je de vault weer opent
  • YAML-frontmatter met title, source, author, date en extraction, en jij kiest welke velden blijven
Meer hierover
AI en LLM’sHerhaalde navigatie is weggegooide context. Die gaat eruit voordat de tekst je model bereikt.

Een webpagina die je in een model plakt bestaat voor een flink deel uit navigatie, en elke dubbele menuregel telt mee als context. Op een corpus van 109 pagina’s bleven er bij Clean Clipper 102 dubbele navigatieregels over, waar drie andere engines er 282, 478 en 491 lieten staan. Wat overblijft is de tekst, met de bron-URL en de datum in de frontmatter.

  • Ongeveer vier keer minder dubbele navigatieregels dan het gemiddelde van de vergeleken engines
  • Nul achtergebleven HTML-tags over 512 gemeten pagina’s – geen markup om omheen te lezen
  • De frontmatter geeft het model de bron-URL en de publicatiedatum expliciet mee
Meer hierover
OnderzoekersLeest citation_date, de standaard van arXiv, PubMed en IEEE, en zet voetnoten achterin.

De datum komt uit de metadata van de pagina en niet uit een gok op de tekst: citation_date, JSON-LD datePublished, article:published_time, time[datetime] en Unix-stempels worden in die volgorde gelezen. Draagt de pagina geen datum, dan blijft het veld leeg. Verwijzingen worden [^1]-voetnoten met hun definities achter in de notitie.

  • Leest citation_date en citation_publication_date – de metatags die arXiv, PubMed en IEEE meegeven
  • Daarnaast JSON-LD datePublished, article:published_time, time[datetime] en Unix-stempels
  • Geen datum op de pagina betekent een leeg veld, nooit de datum van vandaag
Meer hierover
StudentenColleges, hoofdstukken en naslagpagina’s worden gewone Markdown-bestanden op je eigen schijf.

Studiemateriaal verdwijnt als het blok voorbij is: de leeromgeving sluit, de link rot weg en de pdf staat achter een login die je niet meer hebt. Een clip is platte tekst met de bron erbij, en die opent over tien jaar nog in elke editor. Selecteer je iets op de pagina, dan wordt alleen die selectie opgehaald.

  • Selecteer een passage en alleen de selectie wordt opgehaald – handig om een definitie te citeren
  • Elke notitie draagt de bron-URL, dus verwijzen kost later geen zoekwerk
  • De publicatiedatum wordt gelezen waar de pagina er een draagt, en blijft anders leeg
Meer hierover
SchrijversElke clip houdt bron-URL, auteur en publicatiedatum vast, dus een citaat raakt zijn herkomst niet kwijt.

Wat je als schermafbeelding of bladwijzer bewaart, is precies op het moment van toeschrijven onbruikbaar: je weet niet meer wie het schreef en wanneer. Markdown met frontmatter houdt title, author, date en source bij elkaar in hetzelfde bestand als de tekst, en de auteursherkenning filtert sectiekoppen en knopteksten eruit in plaats van er maar iets neer te zetten.

  • Title, author, date en source in de frontmatter van elke notitie
  • De artikeltekst zonder navigatie, klaar om uit te citeren
  • De auteursherkenning filtert sectiekoppen, uitgeversnamen en knopteksten weg
Meer hierover
JournalistenDe pagina zoals je hem zag, met publicatiedatum, in een formaat dat de site overleeft.

Pagina’s worden herschreven en offline gehaald, meestal zonder dat er iets bij staat. Een clip met de bron-URL, de publicatiedatum en de volledige tekst is een vastlegging waar je later naar kunt wijzen, en die staat op je eigen schijf. Het veld extraction noteert bovendien hoe de tekst is verkregen, zodat de notitie controleerbaar is.

  • Publicatiedatum gelezen uit de metadata van de pagina, niet uit de lopende tekst
  • Bron-URL in de frontmatter van elke notitie, dus de herkomst reist mee
  • De volledige artikeltekst zonder de navigatie- en promoblokken die per bezoek verschillen
Meer hierover
Juridisch werkDe tekst zoals gepubliceerd, met bron-URL en datum, in een bestand dat jij beheert.

Regelingen, algemene voorwaarden en beleidsregels veranderen zonder aankondiging. Een Markdown-kopie met het adres waar hij vandaan komt en de datum die erop stond, legt vast wat de tekst zei toen jij hem las. Binnen de artikeltekst worden geen woorden toegevoegd, weggehaald of verplaatst; alleen HTML wordt Markdown.

  • Woordelijke tekst: de extensie vat niets samen, herschrijft niets en verandert geen volgorde
  • Bron-URL en publicatiedatum in de frontmatter, dus de vindplaats reist mee
  • Tabellen met tarieven, termijnen en drempels komen heel door de omzetting
Meer hierover
AnalistenEen eigen tabelserialisatie: een cel met een lijst, een link of code breekt de rij niet meer.

Generieke omzetters van HTML naar Markdown lopen stuk op precies de tabellen waar het om gaat. Clean Clipper schrijft de tabel zelf en slaat de celinhoud plat in plaats van de rij te laten vallen: op een corpus van vijftien tabellen bleven er twaalf heel, tegen zeven bij elk van de vergeleken engines.

  • Eigen GFM-tabelserialisatie in plaats van een generieke plug-in
  • Twaalf van de vijftien tabellen behouden op het technische corpus, tegen zeven bij elke vergeleken engine
  • Een cel met een lijst, een link of een codevoorbeeld wordt platgeslagen, niet weggelaten
Meer hierover
DocentenHaal het materiaal op, houd de bron, druk het af – zonder het meubilair van de site.

Een pagina die je rechtstreeks uit de browser afdrukt, neemt de menu’s, de cookiebalk en de advertenties mee op de hand-out. Clean Clipper drukt de clip af en niet de pagina: alleen de tekst, met de bron-URL erbij zodat de bronvermelding klopt. Wil je één oefening of één definitie, dan selecteer je die en haal je alleen de selectie op.

  • Een printknop die de clip afdrukt en niet de pagina, zonder menu’s en banners
  • De leesweergave toont het resultaat zonder Markdown-tekens voordat je print
  • De bron-URL blijft in de notitie staan, dus bronvermelding kost geen moeite
Meer hierover
VertalersNavigatie, banners en herhaalde menu’s halen de segmentlijst nooit.

Brontekst die je uit een webpagina plakt, neemt de navigatie mee, en elk menu-item wordt een segment dat je moet overslaan. Clean Clipper knipt dat weg vóór de export: op een corpus van 109 pagina’s bleven er 102 dubbele navigatieregels over, tegen 282, 478 en 491 bij de drie andere engines. Wat je importeert is lopende tekst.

  • Menu’s, paginering, cookiebalken en “lees ook”-blokken gaan eruit vóór de export
  • Dubbele navigatieregels ruwweg vier keer minder dan bij de vergeleken engines
  • Gewone Markdown importeert in elke gangbare CAT-tool
Meer hierover
ProductmanagersChangelogs, documentatie en release notes als gedateerde, doorzoekbare notities.

Concurrentieonderzoek dat je als bladwijzers bewaart, verwordt tot een lijst links waar je niet in kunt zoeken. Opgehaald als Markdown wordt het een corpus dat je kunt doorzoeken, vergelijken en citeren in een beslisdocument – met de publicatiedatum van de pagina zelf, zodat een changelog-regel zijn echte timing houdt.

  • Publicatiedatum gelezen van de pagina, dus een changelog-regel houdt zijn echte timing
  • Met regels per website gaat elke concurrent vanzelf naar een eigen map
  • Tabellen met pakketten, limieten en functievergelijkingen komen heel door
Meer hierover
Technisch schrijversStructuur, code-fences en tabellen komen mee; het meubilair van de site niet.

Documentatie migreren betekent meestal: HTML omzetten en daarna langer bezig zijn met weghalen wat de omzetter heeft bewaard. Dat weghalen is waar Clean Clipper om heen is gebouwd, en het is ook het deel dat gemeten is: nul achtergebleven HTML-tags over 512 pagina’s, en taallabels die op de code-fences blijven staan.

  • Kopjes, lijsten, tabellen, code-fences en voetnoten worden allemaal standaard Markdown
  • Taallabels blijven op de code-fences staan – 73 van de 156 op het technische corpus, tegen 20 en 0
  • Nul achtergebleven HTML-tags over 512 gemeten pagina’s
Meer hierover
Persoonlijk archiefGewone Markdown-bestanden op je eigen schijf. Geen account, geen dienst, niets dat kan sluiten.

Bladwijzers wijzen naar pagina’s die veranderen of verdwijnen. Een clip is de tekst zelf, in platte tekst met YAML-frontmatter, opgeslagen waar jij dat bepaalt. De extensie doet geen enkel netwerkverzoek, dus er is geen account dat kan verlopen en geen dienst die je toegang kan intrekken.

  • Duurzaam open formaat: platte tekst met YAML-frontmatter, leesbaar in elke editor
  • Geen account en geen server – de extensie doet helemaal geen netwerkverzoeken
  • Publicatiedatum en bron-URL worden samen met de tekst vastgelegd
Meer hierover
Lezen zonder ruisEen leesweergave die de tekst toont zonder menu’s, zonder banners en zonder Markdown-tekens.

Pagina-meubilair is niet alleen visuele rommel: het is tekst die een schermlezer voorleest en een lezer moet overslaan. Het clipvenster toont het artikel op zichzelf, in het lichte of donkere thema van je browser, en er draaien geen scripts van de pagina in mee. Wat je opslaat is platte tekst die elk hulpmiddel aankan.

  • Toont de clip als gewone tekst, zonder Markdown-tekens, met kopjes, tabellen en werkende links
  • Volgt de licht- en donkerinstelling van je browser
  • Vergroot tot een venster van driekwart scherm, zodat de pagina erachter zichtbaar blijft
Meer hierover

Vragen

Stuurt Clean Clipper mijn pagina’s ergens naartoe?
Nee. Extractie en omzetting gebeuren volledig in je browser. De kopie gaat naar je klembord, het bestand naar je schijf. Er is geen account, geen analytics en geen enkel verzoek naar derden. De extensie vraagt geen host-permissions aan en kan dus geen pagina lezen waar je niet op hebt geklikt.
Moet Obsidian draaien om in mijn vault op te slaan?
Nee. Clean Clipper schrijft het bestand rechtstreeks in een map waarvoor je toegang hebt gegeven, via de File System Access API van de browser. Obsidian pikt het bestand op zodra het weer in de vault kijkt.
Wat gebeurt er op een pagina die geen artikel is?
Dan zegt de extensie dat. Op webwinkels, tijdlijnen en zoekresultaten valt niets te extraheren, en de clip wordt gemarkeerd als “geen artikel” in plaats van een pagina vol links.
In welke browsers werkt het?
Chrome en andere Chromium-browsers: Edge, Brave, Vivaldi, Opera. Het is een Manifest V3-extensie zonder host-permissions.
Is het gratis?
Ja. De extensie is volledig gratis: ophalen, de vault, het klembord, voetnoten, tabellen, code-fences en de regels per website werken allemaal zonder account, zonder paginalimiet en zonder betaalde versie.