Clean Clipper Aan Chrome toevoegen – gratis

Voor wie

Betaal niet veertig keer voor hetzelfde menu

Een webpagina die je in een model plakt bestaat voor een flink deel uit navigatie, en elke dubbele menuregel telt mee als context. Op een corpus van 109 pagina’s bleven er bij Clean Clipper 102 dubbele navigatieregels over, waar drie andere engines er 282, 478 en 491 lieten staan. Wat overblijft is de tekst, met de bron-URL en de datum in de frontmatter.

Waarom een geplakte pagina slecht werkt

Kopieer een artikel uit je browser en je plakt een cookiebanner, een logobalk, een zijmenu dat in elke sectie terugkomt en een blok “lees ook” mee. Dat is geen ruis die het model even negeert: het is context die je meebetaalt en die meevecht om de aandacht. Bij lange pagina’s duw je zo je eigen vraag naar de rand van het venster.

De alternatieven zijn niet beter. Het model de URL geven werkt vaak niet, omdat het de pagina niet kan bereiken of de versie krijgt die een bot voorgeschoteld krijgt. En ruwe HTML plakken maakt het erger: dan komen er ook nog attributen en losse tags bij, waar het model omheen moet lezen voordat het aan je vraag toekomt.

Wat daarna gebeurt is nog vervelender: een gesprek met een model is geen vastlegging van de bron. Wil je een week later controleren waar een antwoord op stoelde, dan moet je de pagina opnieuw openen – en die is misschien herschreven. Blijft de input als bestand op je schijf staan, dan kun je precies dezelfde tekst nog eens aan een ander model geven en de twee antwoorden naast elkaar leggen. Het veld extraction zegt er bovendien bij langs welke weg de tekst is gelezen.

Wat er verandert aan je input

Wat het model krijgt: geen menu, geen banner, geen “lees ook”rijksoverheid.nl/onderwerpen/privacy-en-persoonsgegevens
---
title: "Privacy en persoonsgegevens"
source: "https://www.rijksoverheid.nl/onderwerpen/privacy-en-persoonsgegevens"
date: "2023-05-24T00:00:00.000Z"
extraction: "dom"
---

Organisaties mogen persoonsgegevens alleen verwerken als daar een grondslag
voor is. Welke grondslagen er zijn, staat in de Algemene verordening
gegevensbescherming (AVG).

## Wanneer u een verwerkingsregister moet bijhouden

Instellen om een model te voeren

Je wilt hier iets anders dan bij het opbouwen van een archief: zo min mogelijk tekst die geen inhoud is, en de bron en de datum expliciet bovenaan. Dat zijn vier instellingen.

  1. Installeer de extensie, zet het icoon vast en open Opties via een rechtermuisklik op het icoon.
  2. Zet wat een klik op het icoon doet op “naar het klembord”. Voor deze manier van werken hoeft er geen bestand te ontstaan: je plakt de tekst meteen in je chat.
  3. Zet afbeeldingen op overslaan. Elke afbeeldingslink is een regel met een adres erin die het model moet lezen en die niets bijdraagt, want de pixels krijgt het toch niet te zien.
  4. Laat in de frontmatter source en date aan staan en zet author uit. De bron en de datum zijn precies wat een model niet zelf kan weten; de auteursregel weegt er zelden tegenop.
  5. Kies in de instellingen de chatdienst waar de knop naartoe gaat. Die knop kopieert de clip en opent het tabblad van die dienst – plakken doe je zelf, want de extensie stuurt niets over het net.
  6. Controleer Alt+Shift+M in chrome://extensions/shortcuts. Wie een model voedt doet dat tientallen keren per dag, en dan telt elke handeling die je niet hoeft te doen.
  7. Zet een regel voor de sites waarvan je juist wél het bestand wilt bewaren – documentatie bijvoorbeeld – met “opslaan in map” als bestemming, zodat die clips herbruikbaar op je schijf staan.

Instellingen voor werk met modellen

Deze waarden gaan uit van veel korte clips die rechtstreeks een chatvenster in gaan, en niet van een verzameling die je jaren bewaart.

InstellingWaardeWaarom juist deze
Klik op het icoonNaar het klembordEr hoeft geen bestand te ontstaan voor iets wat je meteen plakt
AfbeeldingenOverslaanEen afbeeldingslink is context waarvoor het model niets terugkrijgt
Frontmatter`source` en `date` aan, `author` uitBron en datum kan een model niet zelf weten; de auteur zelden nodig
ChatdienstDe dienst die je toch al gebruiktDe knop kopieert en opent een tabblad; er gaat niets over het net vanuit de extensie
Sneltoets`Alt+Shift+M`Tientallen keren per dag ophalen loont alleen zonder muisbeweging
Regel per siteDocumentatiedomeinen → opslaan in mapWat je vaker dan één keer nodig hebt, wil je als bestand en niet alleen op het klembord
SelectieSelecteren vóór het ophalenDe helft van een lange pagina meegeven is vaak genoeg voor de vraag die je stelt
Wat een overzichtspagina teruggeeft in plaats van tweehonderd linkshet clipvenster op een rubriekspagina
Geen artikel op deze pagina.

  Blokken onderzocht   38
  Gekozen blok         <div class="overzicht">
  Aandeel links        0,68
  Echte tekst          610 tekens

Boven de drempel van ongeveer een kwart links stopt de extractie en zegt de
extensie dit, in plaats van je de rubriekenlijst als artikel te geven.

Drie manieren waarop het loopt

Een lange handleiding met één vraag eronder

Je hebt een handleiding van veertig schermen open en wilt weten of er een uitzondering in staat voor jouw geval. Je drukt op Alt+Shift+M, plakt de Markdown in je chat en zet je vraag eronder. Wat het model krijgt begint met de titel, het adres en de datum, en daarna alleen lopende tekst.

Dezelfde pagina uit de browser gekopieerd begint met een cookiemelding, een rubriekenbalk en een aanmeldblok, en herhaalt de rubriekenbalk tussen de secties. Op het corpus van 109 pagina’s bleven er hier 102 dubbele navigatieregels over tegen 282, 478 en 491 bij de drie andere engines – dat verschil staat vóór je vraag in het venster.

Twee leveranciers naast elkaar leggen

Je haalt van twee leveranciers de pagina met technische voorwaarden op, allebei als bestand, en plakt ze achter elkaar in één prompt met een kop erboven. Beide clips dragen hun eigen adres en publicatiedatum, dus het model kan de twee niet door elkaar halen en jij kunt het antwoord terugvoeren op de juiste bron.

Omdat het bestanden zijn, kun je dezelfde twee teksten een maand later opnieuw voorleggen, aan hetzelfde of aan een ander model. Een chatgeschiedenis kan dat niet: die bewaart het antwoord, niet de invoer waar het op stoelde.

Een eigen index vullen zonder crawler

Voor een zoekindex over je eigen leesmateriaal wil je schone tekst met herkomst. Je haalt de pagina’s op die je toch al leest, elk naar een map, en laat je indexeringsscript de frontmatter uitlezen: source wordt het adres van het document, date de sorteersleutel en extraction de aantekening hoe de tekst is verkregen.

Er zit geen crawler en geen batchverwerking in, dus dit werkt alleen voor materiaal dat je zelf bezoekt. Dat is een echte beperking: een hele site binnenhalen kan hiermee niet, en dat is ook niet waar het voor gemaakt is.

Tegenover de gebruikelijke manieren

Alle vijf worden ze dagelijks gebruikt en ze leveren allemaal iets op. De derde kolom zegt wat je ervoor inlevert, ook bij ons.

Hoe het nu gaatWat je krijgtWat het kost
Alleen de URL gevenEen verwijzing, in één regelVeel modellen komen er niet bij, en wie er wel bij komt krijgt de versie voor bots
De pagina kopiëren en plakkenDe tekst, meteenMenu, cookiebalk en “lees ook” komen mee en tellen als context
Ruwe HTML plakkenAlles wat op de pagina stondAttributen en tags erbij, waar het model doorheen moet lezen
Een schermafbeelding meegevenDe pagina zoals hij eruitzagTekst wordt herkend in plaats van gelezen, en tabellen lopen daarbij scheef
De leesmodus van de browserAlleen het artikelMist juist tabellen en codeblokken, en levert geen bron en datum als velden
Clean ClipperMarkdown met bron en datum bovenaanVat niets samen en knipt niets in: bij een enorme pagina moet je zelf selecteren

Als het model er niets mee kan

De extensie zegt “geen artikel” op de pagina die ik wilde meegeven

Dan bestond die pagina vooral uit linkteksten: een overzicht, een tijdlijn, een zoekresultaat of een webwinkel. Boven ongeveer een kwart links stopt de extractie met opzet. Op de gemeten Europese corpora zat het aandeel links bij echte artikelen tussen 0,036 en 0,064; een overzichtspagina zit daar ver boven. Wil je zo’n pagina toch meegeven, selecteer dan het stuk dat wel tekst is en haal de selectie op.

De clip past niet in het contextvenster

Die kan de extensie niet voor je oplossen: ze vat niets samen en knipt niets in op tokens, met opzet, want dan zou je niet meer weten wat het model wel en niet heeft gezien. Wat je zelf kunt doen: op de pagina selecteren wat je nodig hebt en alleen de selectie ophalen, of afbeeldingen op “overslaan” zetten zodat de linkregels vervallen.

Het model haalt twee bronnen door elkaar

Dat gebeurt als je twee clips achter elkaar plakt zonder scheiding. De frontmatter van elke clip begint met drie streepjes en bevat de titel en het adres – laat die staan en zet er zelf een kopregel boven, dan heeft het model per blok een expliciete bron. Haal je de frontmatter weg om ruimte te winnen, dan haal je precies het deel weg dat de twee uit elkaar houdt.

Er staat extraction: "jsonld-articlebody" boven mijn tekst

De pagina heeft haar tekst niet uitgerenderd maar wel in gestructureerde data meegestuurd, en die is toen gelezen. Dat is genoteerd omdat de twee versies kunnen verschillen: de gestructureerde variant is soms een eerdere opzet en soms juist de volledige tekst waar op het scherm maar een deel van stond. Voor een model maakt dat niets uit; voor jouw controle achteraf wel.

Wat het niet doet

De extensie praat zelf met geen enkele AI-dienst: ze doet helemaal geen netwerkverzoeken. De knop naar een chat kopieert de tekst en opent een tabblad, meer niet. Ze vat ook niets samen en knipt niets in op tokens – je krijgt de hele tekst, alleen zonder het meubilair. En op een webwinkel, een tijdlijn of een zoekresultaat valt geen artikel te vinden; dan meldt de extensie dat, in plaats van je driehonderd links mee te geven.

Aan Chrome toevoegen – gratisVolledig gratis, zonder account en zonder limiet.

Vragen

Waarom niet gewoon de URL plakken en het model laten ophalen?
Veel modellen komen helemaal niet bij de pagina, en modellen die dat wel kunnen krijgen vaak de versie die een bot voorgeschoteld krijgt. Een clip legt vast wat er op jouw scherm stond, ook achter een login waar je toch al was ingelogd.
Stuurt de extensie zelf iets naar een AI-dienst?
Nee. De extensie doet geen enkel netwerkverzoek. Druk je op de knop naar de chat, dan gaat de clip naar je klembord en opent er een tabblad; het plakken doe je zelf.
Kan ik afbeeldingen weglaten om context te sparen?
Ja. Zet afbeeldingen op “overslaan” en de Markdown bevat geen afbeeldingslinks meer.
Scheelt het echt tokens?
Dat hangt van de pagina af. Wat gemeten is, is ruis: 102 dubbele menuregels over 109 pagina’s tegen 282, 478 en 491 bij de andere engines, en nul achtergebleven HTML-tags.
Werkt het voor RAG of een eigen index?
Ja, want de uitvoer is gewone Markdown met de bron-URL en de datum in de frontmatter. Er zit geen batchverwerking of crawler in: je haalt pagina voor pagina op.
Vat het de pagina samen?
Nee. Je krijgt de volledige tekst, alleen zonder het meubilair van de site. Samenvatten is een keuze over inhoud, en die hoort bij jou of bij het model dat je de tekst geeft – niet bij een extractiestap die je niet ziet.
Kan ik meerdere pagina’s in één prompt zetten?
Ja, door de clips zelf achter elkaar te plakken. De extensie voegt niets samen en haalt één pagina tegelijk op; welke bestanden je daarna combineert, bepaal jij.
Telt het tokens voor mij?
Nee. Er zit geen tokenteller en geen limietbewaking in. Wat gemeten is, is de ruis die verdwijnt: 102 dubbele menuregels over 109 pagina’s tegen 282, 478 en 491, en nul achtergebleven HTML-tags over 512 pagina’s.
Blijven tabellen bruikbaar voor een model?
Ja. Ze komen als GFM-tabellen binnen, dus rijen en kolommen blijven als tekststructuur herkenbaar. Op het testcorpus van vijftien tabellen bleven er twaalf heel, tegen zeven bij elk van de vergeleken engines.
Wordt mijn clip gebruikt om een model te trainen?
Niet door de extensie: die verstuurt niets en bewaart niets buiten je eigen schijf. Wat er gebeurt nadat jij de tekst in een chatvenster plakt, valt onder de voorwaarden van die dienst, en dat staat volledig los van dit gereedschap.