Clean Clipper Aan Chrome toevoegen – gratis

Onder de motorkap

Hoe het werkt, en waar het stopt

Er zit hier niets magisch in en er wordt geen server gebeld. De hele pijplijn draait in de pagina die je voor je hebt, in een paar tientallen milliseconden.

Het artikel vinden

Eerst zoekt de extensie de voor de hand liggende containers waar een artikel meestal in zit. Is die er niet – en op veel echte sites is die er niet – dan meet ze de tekstdichtheid: welk blok bevat de meeste alineatekst die niet in een link zit. Het smalste blok dat vrijwel al die tekst nog bevat, wint.

Een blok waarvan de tekst vooral uit linkteksten bestaat is een menu of een tijdlijn, geen artikel, en valt af – tenzij er meer dan ongeveer 1200 tekens echte tekst in staan, want lange artikelen bevatten nu eenmaal veel links.

Het meubilair weghalen

Daarna gaan de bekende niet-inhoudelijke elementen eruit: navigatie, banners, deelbalken, cookiemeldingen, paginering, “lees ook”-blokken en logobalken. Herhaalde regels verdwijnen, want navigatie die in elke sectie terugkomt is veruit de grootste bron van ruis in een opgehaalde pagina.

wat andere clippers laten staan

[Naar de inhoud](#main) [Inloggen](/login) [Registreren](/register)
[Home](/) [Nieuws](/nieuws) [Sport](/sport) [Cultuur](/cultuur) [Meer](/meer)

We gebruiken cookies en vergelijkbare technieken om je ervaring te verbeteren.
[Alles accepteren] [Voorkeuren beheren]

# Het artikel waarvoor je kwam

De eerste echte alinea van de tekst.

<div class="promo-inline">

## Lees ook
[Nog een kop](/a) [En nog een kop](/b) [En een derde](/c)

wat er in de notitie belandt

# Het artikel waarvoor je kwam

De eerste echte alinea van de tekst.

Omzetten

Tabellen worden door de extensie zelf geserialiseerd en niet door een generieke plug-in, omdat generieke omzetters stuklopen op een cel met een lijst of een codeblok. Code-fences halen de taal uit de markup van de pagina zelf. Verwijzingen worden tot Markdown-voetnoten verzameld vóór de sanitizer de id’s weghaalt waar ze op steunen – die volgorde is bepalend, en wie hem omdraait verliest stilletjes elke voetnoot.

Waar het stopt

Op een webwinkel, een tijdlijn of een zoekresultaat is er geen artikel. De extensie controleert de afgeronde Markdown: zit meer dan een kwart ervan in linkteksten, dan meldt ze “geen artikel” in plaats van je driehonderd links te geven. Die weigering is bewust, en daarom liggen de tekenaantallen hier lager dan bij gereedschap dat altijd iets teruggeeft.

Wat het niet doet

Vragen

Hoe lang duurt het ophalen?
Tientallen milliseconden voor een gewoon artikel; een heel lange pagina met honderden voetnoten kost er een paar honderd. De tijd staat in de hoek van het clipvenster.
Werkt het op single-page applications?
Ja. De DOM wordt gelezen nadat de pagina is gerenderd, dus een documentatiesite die in JavaScript is gebouwd komt binnen zoals je hem ziet.
Wat is de extractiemodus jsonld-articlebody?
Sommige pagina’s leveren de artikeltekst mee in hun gestructureerde data, maar renderen die nooit af. Bevat die data duidelijk meer tekst dan de DOM, dan gebruikt de extensie haar en noteert ze dat ook.