Voor wie
Schone brontekst voor je CAT-tool
Brontekst die je uit een webpagina plakt, neemt de navigatie mee, en elk menu-item wordt een segment dat je moet overslaan. Clean Clipper knipt dat weg vóór de export: op een corpus van 109 pagina’s bleven er 102 dubbele navigatieregels over, tegen 282, 478 en 491 bij de drie andere engines. Wat je importeert is lopende tekst.
Waarom de segmentlijst vervuilt
Een geplakte webpagina levert tientallen segmenten op die geen vertaalwerk zijn: “Home”, “Inloggen”, “Alles accepteren”, een paginering van 1 tot 12, en dezelfde rubriekenbalk die in elke sectie terugkomt. Je moet ze stuk voor stuk aanraken of uitsluiten, en ze vervuilen je vertaalgeheugen als je dat niet doet. Bij een reeks pagina’s van dezelfde site herhaalt dat werk zich elke keer.
Achteraf filteren is bewerkelijker dan het lijkt, want de ruis staat door de tekst heen en niet netjes vooraan. Bovendien breekt een geplakte pagina de opmaak binnen de regel: vet en cursief gaan verloren of veranderen in losse tags, en een tabel wordt een reeks losse regels waarvan de samenhang weg is.
Het begint eigenlijk al bij de offerte. Een opdrachtgever stuurt een adres en geen bestand, en het woordaantal dat je daaruit haalt, telt het menu, de voettekst en de rubriekenbalk mee – bij korte pagina’s is dat een aanzienlijk deel van het totaal. Reken je op dat aantal af, dan werk je onder je tarief; corrigeer je het met de natte vinger, dan sta je bij navraag met lege handen. Een clip zonder navigatie geeft een aantal dat je kunt laten zien.
Wat je importeert
- Menu’s, paginering, cookiebalken en “lees ook”-blokken gaan eruit vóór de export
- Dubbele navigatieregels ruwweg vier keer minder dan bij de vergeleken engines
- Gewone Markdown importeert in elke gangbare CAT-tool
- Vet, cursief, links, code en lijsten worden hun Markdown-equivalent, dat de meeste tools als inline tag behandelen
- De bron-URL reist met de tekst mee, dus context is één klik weg
- Selectie ophalen als je maar één passage nodig hebt
- Een woordaantal uit de clip telt alleen lopende tekst, want het meubilair van de site zit er niet meer in
- Verwijzingen worden
[^1]-voetnoten met hun definities achterin in plaats van losse ankers zonder doel
Het Parlement heeft de herziening van de richtlijn met 486 stemmen voor, 132 tegen en 21 onthoudingen aangenomen. De lidstaten krijgen achttien maanden om de bepalingen in nationale wetgeving om te zetten. De Commissie brengt daarna elke twee jaar verslag uit.
Inrichten voor een vertaalproject
Je wilt hier één ding bereiken: dat wat je importeert alleen tekst is die vertaald moet worden. Dat is vooral een kwestie van weglaten.
- Open Opties met een rechtermuisklik op het icoon en zet de bestemming op de projectmap waar je brondocumenten voor deze opdracht staan.
- Zet het sjabloon voor de bestandsnaam op
{domain}-{title}. Bij een reeks pagina’s van dezelfde site staan de bestanden dan bij elkaar en in de volgorde waarin je ze zult verwerken. - Zet afbeeldingen op overslaan. Een afbeeldingslink wordt in de meeste CAT-tools een segment dat je moet aanraken, en er valt niets aan te vertalen.
- Zet de frontmatter-velden uit die je niet nodig hebt en laat
sourcestaan. Sommige tools importeren de YAML-kop als segmenten; hoe minder velden, hoe minder regels die je moet uitsluiten. - Haal één pagina op en bekijk hem in de leesweergave voordat je importeert. Zie je daar nog een rubriekenbalk of een “lees ook”-blok staan, dan is dat wat je in je segmentlijst krijgt – en dan is een selectie ophalen de betere weg.
- Tel de woorden in de clip in plaats van op de pagina. Dat is het aantal waarover je offreert, en het bestand waaruit dat aantal komt, kun je meesturen.
Instellingen voor vertalers
Deze waarden gaan uit van bestanden die een CAT-tool in gaan, en niet van notities die je zelf terugleest – dat verandert wat er weg mag.
| Instelling | Waarde | Waarom juist deze |
|---|---|---|
| Bestemming | De projectmap van de opdracht | Brondocumenten horen bij het project, niet in een algemene leesmap |
| Bestandsnaam | `{domain}-{title}` | Een reeks pagina’s van dezelfde site blijft bij elkaar en op volgorde staan |
| Afbeeldingen | Overslaan | Een afbeeldingslink wordt een segment waaraan niets te vertalen valt |
| Frontmatter | Alleen `source` aan | Sommige tools importeren de YAML-kop als segmenten; hoe minder velden, hoe minder uitsluitwerk |
| Klik op het icoon | Voorbeeldvenster tonen | Vóór het importeren wil je zien of er nog navigatie in de tekst zit |
| Selectie | Selecteren bij lange pagina’s | De helft van een pagina vertalen begint met de helft van een pagina ophalen |
| Regel per site | Vaste opdrachtgever → eigen submap | Bij terugkerend werk voor dezelfde site scheelt dat elke keer twee handelingen |
Het **basispakket** bevat *maximaal vijf* gebruikers. Extra gebruikers worden per maand afgerekend; zie de [voorwaarden](https://voorbeeld.nl/voorwaarden) of zet `SEATS` in je configuratiebestand. - Een plaats kan één keer per periode worden overgezet. - Ongebruikte plaatsen schuiven niet door. Vier inline-elementen in één zin: vet, cursief, een link en code. Elk krijgt zijn Markdown-equivalent, en dat importeert een CAT-tool als inline tag.
Drie keer in een opdracht
Een offerte op een adres in plaats van een bestand
De opdrachtgever stuurt vier adressen en vraagt om een prijs. Je haalt de vier pagina’s op, telt de woorden in de bestanden en offreert daarop. Wat je telt is lopende tekst: de menu’s, de voettekst en de rubriekenbalk zitten er niet meer in.
Bij navraag kun je laten zien waarop je hebt gerekend, want de bestanden zijn er. Tel je op de pagina zelf, dan telt bij een korte pagina het meubilair flink mee, en dan begint elke discussie over de factuur bij de vraag wat er nu eigenlijk geteld is.
Een reeks pagina’s van dezelfde site
Twintig productpagina’s van dezelfde opdrachtgever, allemaal met dezelfde rubriekenbalk en dezelfde voettekst. Je haalt ze één voor één op naar de projectmap. In elk bestand ontbreekt dat terugkerende deel, dus je vertaalgeheugen vult zich niet met twintig keer dezelfde menu-items.
Wat dat waard is, laat de meting zien: over 109 pagina’s bleven er 102 dubbele navigatieregels over, tegen 282, 478 en 491 bij de drie andere engines. Elke van die regels zou in een geplakte pagina een segment zijn geweest.
Opmaak binnen de regel die moet overleven
De brontekst staat vol vet, cursief, links en stukjes code binnen dezelfde zin. Je haalt de pagina op en importeert het Markdown-bestand. De opmaak komt binnen als Markdown-equivalenten, en de meeste CAT-tools behandelen die als inline tags die je in de doeltekst weer op hun plek zet.
Uit een geplakte pagina komen die elementen meestal als kale tekst, of juist als losse HTML-tags in het segment. Beide leveren werk op dat niets met vertalen te maken heeft: in het eerste geval opmaak herstellen, in het tweede tags omzeilen.
Tegenover de gebruikelijke manieren
Een webpagina in een CAT-tool krijgen kan op vijf manieren. De derde kolom is wat elke manier je kost, ook deze.
| Hoe het nu gaat | Wat je krijgt | Wat het kost |
|---|---|---|
| Kopiëren en plakken | De tekst, meteen | Menu’s en paginering worden segmenten, en die vervuilen je geheugen |
| De HTML-pagina opslaan | Alles wat de site meestuurt | Scripts, stijlen en tags erbij, waar je filter zich doorheen moet werken |
| De leesmodus van de browser | Alleen het artikel | Mist tabellen en codeblokken, en levert geen bestand met bron erbij |
| De opdrachtgever om een export vragen | Het bronformaat, zoals bedoeld | Kost dagen wachten, en vaak bestaat de export niet |
| Clean Clipper | Markdown met alleen lopende tekst | Geen XLIFF of TMX, geen segmentatie, één pagina tegelijk |
Als de import tegenvalt
Er zitten toch nog menu-items in de segmentlijst
Dan stond dat blok in dezelfde container als het artikel, en dat komt voor bij sites die hun opbouw niet semantisch markeren. Bekijk de clip in de leesweergave voordat je importeert; zie je het blok daar, haal de pagina dan opnieuw op met een selectie van alleen de tekst, of verwijder het blok in de editor – het is Markdown, dus dat is één handeling.
De YAML-kop komt als segmenten binnen
Sommige tools importeren de frontmatter als gewone tekst. Zet in dat geval de velden uit die je niet nodig hebt, of haal de kop weg voordat je importeert. Het zijn de eerste regels tussen twee streepjeslijnen, dus dat gaat met één selectie.
De helft van de pagina ontbreekt
Bijna altijd tabbladen, een accordeon of een “lees verder”-knop: wat pas na een klik wordt ingeladen, staat op het moment van ophalen niet in de pagina. Klap alles open en haal daarna opnieuw op. Wat met CSS verborgen is maar wel gerenderd, komt gewoon mee.
De tekst in de afbeeldingen komt niet mee
Nee, en dat gebeurt ook niet: er wordt geen tekst uit beeld herkend. Staat er in een infographic of een schermafbeelding tekst die vertaald moet worden, dan valt die buiten de clip en moet die apart worden aangeleverd. Dat is precies het soort werk dat je bij de offerte wilt weten, en daarom is het de moeite waard om de clip vóór het offreren even te bekijken.
Wat het niet doet
Het vertaalt niets en herkent de brontaal niet: het levert alleen schone tekst op. Er komt geen XLIFF, TMX of segmentbestand uit – de uitvoer is Markdown, en de segmentatie doet je CAT-tool. Je haalt één pagina tegelijk op; er zit geen crawler in die een hele site binnenhaalt. En tekst die in een afbeelding staat, blijft een afbeelding.