Voor wie
Betaal niet veertig keer voor hetzelfde menu
Een webpagina die je in een model plakt bestaat voor een flink deel uit navigatie, en elke dubbele menuregel telt mee als context. Op een corpus van 109 pagina’s bleven er bij Clean Clipper 102 dubbele navigatieregels over, waar drie andere engines er 282, 478 en 491 lieten staan. Wat overblijft is de tekst, met de bron-URL en de datum in de frontmatter.
Waarom een geplakte pagina slecht werkt
Kopieer een artikel uit je browser en je plakt een cookiebanner, een logobalk, een zijmenu dat in elke sectie terugkomt en een blok “lees ook” mee. Dat is geen ruis die het model even negeert: het is context die je meebetaalt en die meevecht om de aandacht. Bij lange pagina’s duw je zo je eigen vraag naar de rand van het venster.
De alternatieven zijn niet beter. Het model de URL geven werkt vaak niet, omdat het de pagina niet kan bereiken of de versie krijgt die een bot voorgeschoteld krijgt. En ruwe HTML plakken maakt het erger: dan komen er ook nog attributen en losse tags bij, waar het model omheen moet lezen voordat het aan je vraag toekomt.
Wat daarna gebeurt is nog vervelender: een gesprek met een model is geen vastlegging van de bron. Wil je een week later controleren waar een antwoord op stoelde, dan moet je de pagina opnieuw openen – en die is misschien herschreven. Blijft de input als bestand op je schijf staan, dan kun je precies dezelfde tekst nog eens aan een ander model geven en de twee antwoorden naast elkaar leggen. Het veld extraction zegt er bovendien bij langs welke weg de tekst is gelezen.
Wat er verandert aan je input
- Ongeveer vier keer minder dubbele navigatieregels dan het gemiddelde van de vergeleken engines
- Nul achtergebleven HTML-tags over 512 gemeten pagina’s – geen markup om omheen te lezen
- De frontmatter geeft het model de bron-URL en de publicatiedatum expliciet mee
- Eén sneltoets kopieert de hele pagina als Markdown, klaar om in elke chat te plakken
- De knop naar de AI-chat kopieert en opent het tabblad in één beweging
- Afbeeldingen kun je uitzetten, zodat er ook geen linkregels meer meegaan
- Op een overzichtspagina zonder artikel meldt de extensie dat, in plaats van je een lijst linkteksten als “tekst” mee te geven
- De input blijft als bestand bestaan, dus je kunt dezelfde tekst later nog eens aan een ander model geven en de antwoorden vergelijken
--- title: "Privacy en persoonsgegevens" source: "https://www.rijksoverheid.nl/onderwerpen/privacy-en-persoonsgegevens" date: "2023-05-24T00:00:00.000Z" extraction: "dom" --- Organisaties mogen persoonsgegevens alleen verwerken als daar een grondslag voor is. Welke grondslagen er zijn, staat in de Algemene verordening gegevensbescherming (AVG). ## Wanneer u een verwerkingsregister moet bijhouden
Instellen om een model te voeren
Je wilt hier iets anders dan bij het opbouwen van een archief: zo min mogelijk tekst die geen inhoud is, en de bron en de datum expliciet bovenaan. Dat zijn vier instellingen.
- Installeer de extensie, zet het icoon vast en open Opties via een rechtermuisklik op het icoon.
- Zet wat een klik op het icoon doet op “naar het klembord”. Voor deze manier van werken hoeft er geen bestand te ontstaan: je plakt de tekst meteen in je chat.
- Zet afbeeldingen op overslaan. Elke afbeeldingslink is een regel met een adres erin die het model moet lezen en die niets bijdraagt, want de pixels krijgt het toch niet te zien.
- Laat in de frontmatter
sourceendateaan staan en zetauthoruit. De bron en de datum zijn precies wat een model niet zelf kan weten; de auteursregel weegt er zelden tegenop. - Kies in de instellingen de chatdienst waar de knop naartoe gaat. Die knop kopieert de clip en opent het tabblad van die dienst – plakken doe je zelf, want de extensie stuurt niets over het net.
- Controleer
Alt+Shift+Minchrome://extensions/shortcuts. Wie een model voedt doet dat tientallen keren per dag, en dan telt elke handeling die je niet hoeft te doen. - Zet een regel voor de sites waarvan je juist wél het bestand wilt bewaren – documentatie bijvoorbeeld – met “opslaan in map” als bestemming, zodat die clips herbruikbaar op je schijf staan.
Instellingen voor werk met modellen
Deze waarden gaan uit van veel korte clips die rechtstreeks een chatvenster in gaan, en niet van een verzameling die je jaren bewaart.
| Instelling | Waarde | Waarom juist deze |
|---|---|---|
| Klik op het icoon | Naar het klembord | Er hoeft geen bestand te ontstaan voor iets wat je meteen plakt |
| Afbeeldingen | Overslaan | Een afbeeldingslink is context waarvoor het model niets terugkrijgt |
| Frontmatter | `source` en `date` aan, `author` uit | Bron en datum kan een model niet zelf weten; de auteur zelden nodig |
| Chatdienst | De dienst die je toch al gebruikt | De knop kopieert en opent een tabblad; er gaat niets over het net vanuit de extensie |
| Sneltoets | `Alt+Shift+M` | Tientallen keren per dag ophalen loont alleen zonder muisbeweging |
| Regel per site | Documentatiedomeinen → opslaan in map | Wat je vaker dan één keer nodig hebt, wil je als bestand en niet alleen op het klembord |
| Selectie | Selecteren vóór het ophalen | De helft van een lange pagina meegeven is vaak genoeg voor de vraag die je stelt |
Geen artikel op deze pagina. Blokken onderzocht 38 Gekozen blok <div class="overzicht"> Aandeel links 0,68 Echte tekst 610 tekens Boven de drempel van ongeveer een kwart links stopt de extractie en zegt de extensie dit, in plaats van je de rubriekenlijst als artikel te geven.
Drie manieren waarop het loopt
Een lange handleiding met één vraag eronder
Je hebt een handleiding van veertig schermen open en wilt weten of er een uitzondering in staat voor jouw geval. Je drukt op Alt+Shift+M, plakt de Markdown in je chat en zet je vraag eronder. Wat het model krijgt begint met de titel, het adres en de datum, en daarna alleen lopende tekst.
Dezelfde pagina uit de browser gekopieerd begint met een cookiemelding, een rubriekenbalk en een aanmeldblok, en herhaalt de rubriekenbalk tussen de secties. Op het corpus van 109 pagina’s bleven er hier 102 dubbele navigatieregels over tegen 282, 478 en 491 bij de drie andere engines – dat verschil staat vóór je vraag in het venster.
Twee leveranciers naast elkaar leggen
Je haalt van twee leveranciers de pagina met technische voorwaarden op, allebei als bestand, en plakt ze achter elkaar in één prompt met een kop erboven. Beide clips dragen hun eigen adres en publicatiedatum, dus het model kan de twee niet door elkaar halen en jij kunt het antwoord terugvoeren op de juiste bron.
Omdat het bestanden zijn, kun je dezelfde twee teksten een maand later opnieuw voorleggen, aan hetzelfde of aan een ander model. Een chatgeschiedenis kan dat niet: die bewaart het antwoord, niet de invoer waar het op stoelde.
Een eigen index vullen zonder crawler
Voor een zoekindex over je eigen leesmateriaal wil je schone tekst met herkomst. Je haalt de pagina’s op die je toch al leest, elk naar een map, en laat je indexeringsscript de frontmatter uitlezen: source wordt het adres van het document, date de sorteersleutel en extraction de aantekening hoe de tekst is verkregen.
Er zit geen crawler en geen batchverwerking in, dus dit werkt alleen voor materiaal dat je zelf bezoekt. Dat is een echte beperking: een hele site binnenhalen kan hiermee niet, en dat is ook niet waar het voor gemaakt is.
Tegenover de gebruikelijke manieren
Alle vijf worden ze dagelijks gebruikt en ze leveren allemaal iets op. De derde kolom zegt wat je ervoor inlevert, ook bij ons.
| Hoe het nu gaat | Wat je krijgt | Wat het kost |
|---|---|---|
| Alleen de URL geven | Een verwijzing, in één regel | Veel modellen komen er niet bij, en wie er wel bij komt krijgt de versie voor bots |
| De pagina kopiëren en plakken | De tekst, meteen | Menu, cookiebalk en “lees ook” komen mee en tellen als context |
| Ruwe HTML plakken | Alles wat op de pagina stond | Attributen en tags erbij, waar het model doorheen moet lezen |
| Een schermafbeelding meegeven | De pagina zoals hij eruitzag | Tekst wordt herkend in plaats van gelezen, en tabellen lopen daarbij scheef |
| De leesmodus van de browser | Alleen het artikel | Mist juist tabellen en codeblokken, en levert geen bron en datum als velden |
| Clean Clipper | Markdown met bron en datum bovenaan | Vat niets samen en knipt niets in: bij een enorme pagina moet je zelf selecteren |
Als het model er niets mee kan
De extensie zegt “geen artikel” op de pagina die ik wilde meegeven
Dan bestond die pagina vooral uit linkteksten: een overzicht, een tijdlijn, een zoekresultaat of een webwinkel. Boven ongeveer een kwart links stopt de extractie met opzet. Op de gemeten Europese corpora zat het aandeel links bij echte artikelen tussen 0,036 en 0,064; een overzichtspagina zit daar ver boven. Wil je zo’n pagina toch meegeven, selecteer dan het stuk dat wel tekst is en haal de selectie op.
De clip past niet in het contextvenster
Die kan de extensie niet voor je oplossen: ze vat niets samen en knipt niets in op tokens, met opzet, want dan zou je niet meer weten wat het model wel en niet heeft gezien. Wat je zelf kunt doen: op de pagina selecteren wat je nodig hebt en alleen de selectie ophalen, of afbeeldingen op “overslaan” zetten zodat de linkregels vervallen.
Het model haalt twee bronnen door elkaar
Dat gebeurt als je twee clips achter elkaar plakt zonder scheiding. De frontmatter van elke clip begint met drie streepjes en bevat de titel en het adres – laat die staan en zet er zelf een kopregel boven, dan heeft het model per blok een expliciete bron. Haal je de frontmatter weg om ruimte te winnen, dan haal je precies het deel weg dat de twee uit elkaar houdt.
Er staat extraction: "jsonld-articlebody" boven mijn tekst
De pagina heeft haar tekst niet uitgerenderd maar wel in gestructureerde data meegestuurd, en die is toen gelezen. Dat is genoteerd omdat de twee versies kunnen verschillen: de gestructureerde variant is soms een eerdere opzet en soms juist de volledige tekst waar op het scherm maar een deel van stond. Voor een model maakt dat niets uit; voor jouw controle achteraf wel.
Wat het niet doet
De extensie praat zelf met geen enkele AI-dienst: ze doet helemaal geen netwerkverzoeken. De knop naar een chat kopieert de tekst en opent een tabblad, meer niet. Ze vat ook niets samen en knipt niets in op tokens – je krijgt de hele tekst, alleen zonder het meubilair. En op een webwinkel, een tijdlijn of een zoekresultaat valt geen artikel te vinden; dan meldt de extensie dat, in plaats van je driehonderd links mee te geven.