Voor wie
Artikelen met hun echte publicatiedatum
De datum komt uit de metadata van de pagina en niet uit een gok op de tekst: citation_date, JSON-LD datePublished, article:published_time, time[datetime] en Unix-stempels worden in die volgorde gelezen. Draagt de pagina geen datum, dan blijft het veld leeg. Verwijzingen worden [^1]-voetnoten met hun definities achter in de notitie.
Waarom een bewaard artikel onbruikbaar wordt
Een opgeslagen artikel zonder publicatiedatum is een verwijzing die je later opnieuw moet uitzoeken. Erger is een clipper die het veld toch vult, met de dag waarop jij toevallig ophaalde: dan staat er stilletjes verkeerde data in je notities en merk je dat pas als je de literatuurlijst nakijkt. Vijftig zulke notities later is de schade niet meer met de hand te repareren.
Daarnaast sneuvelt de verwijsstructuur. Voetnootnummers worden dode ankers naar een pagina die je allang verlaten hebt, en de definities eronder verdwijnen bij het opschonen. De auteursregel is net zo grillig: veel gereedschap zet het eerste plausibele stukje tekst in het author-veld, en dan krijg je een sectiekop of de naam van de uitgever als auteur.
Daar komt bij dat één artikel zelden één pagina is. Dezelfde titel bestaat als preprint, als geaccepteerd manuscript in een repository en als versie bij de uitgever, elk met een eigen adres en een eigen datum, en soms met een alinea verschil. Een bladwijzer legt niet vast welke van de drie je las. Een bestand met het adres, de datum en de tekst erin doet dat wel, en dat is precies de vraag die een medebeoordelaar een half jaar later stelt.
Wat er in je notitie staat
- Leest
citation_dateencitation_publication_date– de metatags die arXiv, PubMed en IEEE meegeven - Daarnaast JSON-LD
datePublished,article:published_time,time[datetime]en Unix-stempels - Geen datum op de pagina betekent een leeg veld, nooit de datum van vandaag
- Verwijzingen worden
[^1]-voetnoten met hun definities achter in de notitie - De auteur wordt gefilterd: sectiekoppen, uitgeversnamen en knopteksten belanden niet in author
- De bron-URL staat in de frontmatter, dus de notitie is op zichzelf citeerbaar
- Het veld
extractionnoteert langs welke weg de tekst is gelezen, zodat een notitie na te lopen is in plaats van op vertrouwen te rusten - Preprint en gepubliceerde versie worden twee bestanden naast elkaar, elk met het eigen adres en de eigen datum
--- title: "Zoutindringing in het Noordzeekanaal: een modelstudie" source: "https://repository.tudelft.nl/islandora/object/uuid:8f1c" author: "De Vries, M." date: "2019-11-04T00:00:00.000Z" extraction: "dom" --- De gemeten chlorideconcentratie bij Amsterdam-Rijnkanaal wijkt structureel af van de modeluitkomst voor droge zomers.[^3] [^3]: Rijkswaterstaat (2018). Waterkwaliteitsrapportage Noordzeekanaalgebied.
Inrichten voor literatuurwerk
De standaardinstellingen zijn gemaakt om artikelen te lezen. Voor literatuurwerk verschuift er drie dingen: de bestandsnaam moet sorteren, alle metadatavelden moeten aan, en de afbeeldingen mogen weg.
- Open Opties met een rechtermuisklik op het icoon en zet de bestemming op een map op je schijf – bij voorkeur één map per project of per hoofdstuk, niet één grote hoop.
- Zet het sjabloon voor de bestandsnaam op
{date}-{title}. De datum die daarin belandt is de dag van je clip; daardoor sorteert de map op het moment waarop je een bron erbij haalde, en dat is de volgorde waarin je je eigen werk terugleest. - Zet alle vijf frontmatter-velden aan:
title,author,date,sourceenextraction. Voor citeren heb je de eerste vier nodig, en de vijfde is wat je later laat zien als iemand vraagt hoe de tekst is verkregen. - Zet afbeeldingen op overslaan. Figuren en grafieken zitten toch niet in de clip – het zouden links naar de uitgever zijn – en zonder die links leest de notitie schoner.
- Voeg regels per website toe voor de repositories en uitgevers die je het vaakst gebruikt, elk met een eigen submap. Daarmee staat het onderscheid tussen preprint en gepubliceerde versie al in het pad.
- Haal één artikel op waarvan je de publicatiedatum kent, en controleer het veld
datein het bestand. Klopt het, dan draagt de site bruikbare metadata en kun je de rest vertrouwen; blijft het leeg, dan weet je dat je bij die uitgever zelf moet aanvullen.
Instellingen voor onderzoek
Wat hier anders is dan bij gewoon lezen: elk veld dat je later in een verwijzing nodig hebt moet in het bestand staan, en niets mag stilzwijgend worden ingevuld.
| Instelling | Waarde | Waarom juist deze |
|---|---|---|
| Bestemming | Eén map per project | Een literatuurmap die over drie projecten gaat, doorzoek je nooit meer gericht |
| Bestandsnaam | `{date}-{title}` | Sorteert op het moment waarop je de bron erbij haalde, en houdt twee versies van één artikel uit elkaar |
| Frontmatter | Alle vijf velden aan | Titel, auteur, datum en adres zijn de verwijzing; `extraction` is de verantwoording |
| Afbeeldingen | Overslaan | Figuren blijven toch bij de uitgever; de linkregels maken de notitie alleen rommeliger |
| Regel per site | Repository → submap `preprints` | Het onderscheid tussen preprint en eindversie staat dan al in het pad |
| Selectie | Selecteren bij lange artikelen | Voor een citaat heb je de discussieparagraaf nodig, niet de hele methodesectie |
| Klik op het icoon | Voorbeeldvenster tonen | Bij bronwerk wil je vóór het opslaan zien of de datum en de auteur kloppen |
--- title: "Bodemdaling in het westelijk veenweidegebied" source: "https://voorbeeld-tijdschrift.nl/artikelen/bodemdaling-veenweide" author: "Van Dijk, R.; Bakker, S." date: "" extraction: "dom" --- Er stond geen `citation_date`, geen JSON-LD `datePublished`, geen `article:published_time` en geen `time[datetime]` op de pagina. De regel "2019" in de kopregel is opmaak en geen metadata, dus die wordt niet gelezen.
Drie keer in de praktijk
De preprint en de eindversie naast elkaar
Je leest eerst de preprint in een repository en maanden later de versie bij de uitgever. Je haalt ze allebei op. Het worden twee bestanden met dezelfde titel maar een verschillend adres, een verschillende datum en een verschillende submap, want de regel voor het repositorydomein stuurt de eerste naar preprints.
Als je later citeert, laat een diff van de twee bestanden in een paar seconden zien welke alinea’s tussen de twee versies zijn veranderd. Dat is werk dat je anders met twee vensters naast elkaar doet, en dat je daarom meestal niet doet.
Een bron achter een instellingslogin
Het artikel staat achter de toegang van je instelling. Je bent al ingelogd, dus de pagina staat gewoon op je scherm; de extensie leest wat je browser heeft gerenderd en logt zelf nergens in. De clip bevat de tekst, de auteurs uit de metadata en de publicatiedatum uit citation_date.
Wat er niet gebeurt, is minstens zo belangrijk: er gaat geen verzoek naar de uitgever, er wordt geen sessie doorgegeven en er verlaat niets je machine. De extensie doet helemaal geen netwerkverzoeken.
Een leeslijst die doorzoekbaar wordt
Aan het begin van een hoofdstuk haal je in twee weken veertig artikelpagina’s op, één map, één sjabloon. Dan zoek je met een gewoon zoekprogramma door de map naar een term die in de literatuur wisselend wordt gebruikt, en krijgt terug in welke bestanden hij voorkomt – met de auteur en het jaar in de kop van elk bestand.
Dat is iets anders dan zoeken in een database: je doorzoekt precies de teksten die je zelf hebt gelezen en geselecteerd, offline, zonder dat een dienst bepaalt wat er in de index staat.
Tegenover de gebruikelijke manieren
Onderzoekers bewaren bronnen op vijf manieren, en die sluiten elkaar niet uit. Wat hier staat is wat elke manier oplevert en wat je ervoor inlevert.
| Hoe het nu gaat | Wat je krijgt | Wat het kost |
|---|---|---|
| De pdf downloaden | Het artikel zoals het is gezet | De metadata zit in de pagina eromheen, niet in het bestand; doorzoeken is beperkt |
| De knop van je referentiemanager | Een record met velden, netjes | De tekst zelf gaat meestal niet mee, dus citeren betekent terug naar de bron |
| Een bladwijzer of DOI-link | Een verwijzing, in één klik | Zegt niet welke versie je las en niet wat er stond |
| Kopiëren en plakken in een document | De alinea die je nodig had | Auteur en datum raak je onderweg kwijt, en dat merk je bij het afronden |
| Clean Clipper | De tekst met titel, auteur, datum en adres in de kop | Geen BibTeX, geen pdf, geen bibliotheek – en een lege datum blijft leeg |
Als de metadata niet klopt
Het veld date is leeg gebleven
Dan droeg de pagina geen datum in haar markup: geen citation_date, geen JSON-LD datePublished, geen article:published_time, geen time[datetime] en geen tijdstempel. Een jaartal dat in de kopregel op het scherm staat is opmaak en geen metadata, en dat wordt niet gelezen. Vul het veld zelf aan in het bestand – het is gewone YAML – of haal de pagina van de uitgever op, die vaker wel volledige metadata meestuurt dan een landingspagina.
In author staat iets wat geen auteur is
Dat kan gebeuren als de pagina een naam in gestructureerde data zet die er geen is – de naam van de uitgevende instelling bijvoorbeeld. De herkenning filtert sectiekoppen, uitgeversnamen en knopteksten weg, maar ze kan een veld dat de site zelf verkeerd invult niet beter maken dan de bron. Corrigeer het in het bestand; het is één regel YAML.
Ik wilde de pdf ophalen en er gebeurt niets
Een pdf is geen HTML-pagina en de extensie werkt op wat de browser als pagina heeft gerenderd. Haal in plaats daarvan de artikelpagina van het repository of de uitgever op: daar staat de tekst in HTML én de metadata waaruit de datum en de auteurs worden gelezen. De pdf bewaar je er desgewenst los naast.
De voetnoten verwijzen nergens meer naartoe
Verwijzingen worden [^1]-voetnoten met hun definities achter in de notitie, en dat werkt zolang de pagina de verwijzingen als gewone ankers heeft staan. Toont een site zijn referenties pas in een pop-up die met een script wordt opgebouwd, dan staat de definitie op het moment van ophalen niet in de DOM en blijft alleen de markering over. Klap de referentielijst open voordat je ophaalt, dan komt hij wel mee.
Wat het niet oplevert
Het is geen referentiemanager: er komt geen BibTeX of RIS uit en er wordt niets aan een bibliotheek toegevoegd. PDF’s worden niet gelezen – je haalt de HTML-pagina van het artikel op, niet het bestand erachter. Afbeeldingen, grafieken en supplementair materiaal blijven links naar de oorspronkelijke site. En de datum is precies zo betrouwbaar als de metadata van de uitgever: staat daar de verkeerde in, dan neemt de extensie die over.
Vragen
Wat als er geen publicatiedatum op de pagina staat?
Blijven voetnootlinks werken na het ophalen?
Kan het een artikel achter een instellingslogin vastleggen?
Haalt het een PDF op?
Krijg ik er een citatie in APA of BibTeX uit?
Welke datum wordt gekozen als de pagina er meerdere noemt?
citation_date en citation_publication_date, dan JSON-LD datePublished, dan article:published_time, dan time[datetime], en als laatste een Unix-tijdstempel. De eerste die er staat wint, zodat dezelfde pagina altijd hetzelfde resultaat geeft.Legt het de DOI vast?
Werkt het op arXiv, PubMed en universitaire repositories?
citation_*-metatags mee, en dat is de eerste bron waar de datum uit wordt gelezen. Bij commerciële uitgevers hangt het van de pagina af, en dan zie je aan een leeg veld dat er niets stond.Komt de referentielijst mee?
[^1]-voetnoten en hun definities achterin. Wordt de lijst pas met een script opgebouwd nadat je ergens op klikt, dan moet hij open staan op het moment dat je ophaalt.