Clean Clipper Aan Chrome toevoegen – gratis

Voor wie

Schone brontekst voor je CAT-tool

Brontekst die je uit een webpagina plakt, neemt de navigatie mee, en elk menu-item wordt een segment dat je moet overslaan. Clean Clipper knipt dat weg vóór de export: op een corpus van 109 pagina’s bleven er 102 dubbele navigatieregels over, tegen 282, 478 en 491 bij de drie andere engines. Wat je importeert is lopende tekst.

Waarom de segmentlijst vervuilt

Een geplakte webpagina levert tientallen segmenten op die geen vertaalwerk zijn: “Home”, “Inloggen”, “Alles accepteren”, een paginering van 1 tot 12, en dezelfde rubriekenbalk die in elke sectie terugkomt. Je moet ze stuk voor stuk aanraken of uitsluiten, en ze vervuilen je vertaalgeheugen als je dat niet doet. Bij een reeks pagina’s van dezelfde site herhaalt dat werk zich elke keer.

Achteraf filteren is bewerkelijker dan het lijkt, want de ruis staat door de tekst heen en niet netjes vooraan. Bovendien breekt een geplakte pagina de opmaak binnen de regel: vet en cursief gaan verloren of veranderen in losse tags, en een tabel wordt een reeks losse regels waarvan de samenhang weg is.

Het begint eigenlijk al bij de offerte. Een opdrachtgever stuurt een adres en geen bestand, en het woordaantal dat je daaruit haalt, telt het menu, de voettekst en de rubriekenbalk mee – bij korte pagina’s is dat een aanzienlijk deel van het totaal. Reken je op dat aantal af, dan werk je onder je tarief; corrigeer je het met de natte vinger, dan sta je bij navraag met lege handen. Een clip zonder navigatie geeft een aantal dat je kunt laten zien.

Wat je importeert

Alleen lopende tekst: elke regel wordt een bruikbaar segmenteuroparl.europa.eu/news/nl
Het Parlement heeft de herziening van de richtlijn met 486 stemmen voor,
132 tegen en 21 onthoudingen aangenomen.

De lidstaten krijgen achttien maanden om de bepalingen in nationale
wetgeving om te zetten. De Commissie brengt daarna elke twee jaar verslag uit.

Inrichten voor een vertaalproject

Je wilt hier één ding bereiken: dat wat je importeert alleen tekst is die vertaald moet worden. Dat is vooral een kwestie van weglaten.

  1. Open Opties met een rechtermuisklik op het icoon en zet de bestemming op de projectmap waar je brondocumenten voor deze opdracht staan.
  2. Zet het sjabloon voor de bestandsnaam op {domain}-{title}. Bij een reeks pagina’s van dezelfde site staan de bestanden dan bij elkaar en in de volgorde waarin je ze zult verwerken.
  3. Zet afbeeldingen op overslaan. Een afbeeldingslink wordt in de meeste CAT-tools een segment dat je moet aanraken, en er valt niets aan te vertalen.
  4. Zet de frontmatter-velden uit die je niet nodig hebt en laat source staan. Sommige tools importeren de YAML-kop als segmenten; hoe minder velden, hoe minder regels die je moet uitsluiten.
  5. Haal één pagina op en bekijk hem in de leesweergave voordat je importeert. Zie je daar nog een rubriekenbalk of een “lees ook”-blok staan, dan is dat wat je in je segmentlijst krijgt – en dan is een selectie ophalen de betere weg.
  6. Tel de woorden in de clip in plaats van op de pagina. Dat is het aantal waarover je offreert, en het bestand waaruit dat aantal komt, kun je meesturen.

Instellingen voor vertalers

Deze waarden gaan uit van bestanden die een CAT-tool in gaan, en niet van notities die je zelf terugleest – dat verandert wat er weg mag.

InstellingWaardeWaarom juist deze
BestemmingDe projectmap van de opdrachtBrondocumenten horen bij het project, niet in een algemene leesmap
Bestandsnaam`{domain}-{title}`Een reeks pagina’s van dezelfde site blijft bij elkaar en op volgorde staan
AfbeeldingenOverslaanEen afbeeldingslink wordt een segment waaraan niets te vertalen valt
FrontmatterAlleen `source` aanSommige tools importeren de YAML-kop als segmenten; hoe minder velden, hoe minder uitsluitwerk
Klik op het icoonVoorbeeldvenster tonenVóór het importeren wil je zien of er nog navigatie in de tekst zit
SelectieSelecteren bij lange pagina’sDe helft van een pagina vertalen begint met de helft van een pagina ophalen
Regel per siteVaste opdrachtgever → eigen submapBij terugkerend werk voor dezelfde site scheelt dat elke keer twee handelingen
Opmaak binnen de regel wordt omgezet, niet weggegooideen alinea van een productpagina
Het **basispakket** bevat *maximaal vijf* gebruikers. Extra gebruikers
worden per maand afgerekend; zie de [voorwaarden](https://voorbeeld.nl/voorwaarden)
of zet `SEATS` in je configuratiebestand.

- Een plaats kan één keer per periode worden overgezet.
- Ongebruikte plaatsen schuiven niet door.

Vier inline-elementen in één zin: vet, cursief, een link en code. Elk krijgt
zijn Markdown-equivalent, en dat importeert een CAT-tool als inline tag.

Drie keer in een opdracht

Een offerte op een adres in plaats van een bestand

De opdrachtgever stuurt vier adressen en vraagt om een prijs. Je haalt de vier pagina’s op, telt de woorden in de bestanden en offreert daarop. Wat je telt is lopende tekst: de menu’s, de voettekst en de rubriekenbalk zitten er niet meer in.

Bij navraag kun je laten zien waarop je hebt gerekend, want de bestanden zijn er. Tel je op de pagina zelf, dan telt bij een korte pagina het meubilair flink mee, en dan begint elke discussie over de factuur bij de vraag wat er nu eigenlijk geteld is.

Een reeks pagina’s van dezelfde site

Twintig productpagina’s van dezelfde opdrachtgever, allemaal met dezelfde rubriekenbalk en dezelfde voettekst. Je haalt ze één voor één op naar de projectmap. In elk bestand ontbreekt dat terugkerende deel, dus je vertaalgeheugen vult zich niet met twintig keer dezelfde menu-items.

Wat dat waard is, laat de meting zien: over 109 pagina’s bleven er 102 dubbele navigatieregels over, tegen 282, 478 en 491 bij de drie andere engines. Elke van die regels zou in een geplakte pagina een segment zijn geweest.

Opmaak binnen de regel die moet overleven

De brontekst staat vol vet, cursief, links en stukjes code binnen dezelfde zin. Je haalt de pagina op en importeert het Markdown-bestand. De opmaak komt binnen als Markdown-equivalenten, en de meeste CAT-tools behandelen die als inline tags die je in de doeltekst weer op hun plek zet.

Uit een geplakte pagina komen die elementen meestal als kale tekst, of juist als losse HTML-tags in het segment. Beide leveren werk op dat niets met vertalen te maken heeft: in het eerste geval opmaak herstellen, in het tweede tags omzeilen.

Tegenover de gebruikelijke manieren

Een webpagina in een CAT-tool krijgen kan op vijf manieren. De derde kolom is wat elke manier je kost, ook deze.

Hoe het nu gaatWat je krijgtWat het kost
Kopiëren en plakkenDe tekst, meteenMenu’s en paginering worden segmenten, en die vervuilen je geheugen
De HTML-pagina opslaanAlles wat de site meestuurtScripts, stijlen en tags erbij, waar je filter zich doorheen moet werken
De leesmodus van de browserAlleen het artikelMist tabellen en codeblokken, en levert geen bestand met bron erbij
De opdrachtgever om een export vragenHet bronformaat, zoals bedoeldKost dagen wachten, en vaak bestaat de export niet
Clean ClipperMarkdown met alleen lopende tekstGeen XLIFF of TMX, geen segmentatie, één pagina tegelijk

Als de import tegenvalt

Er zitten toch nog menu-items in de segmentlijst

Dan stond dat blok in dezelfde container als het artikel, en dat komt voor bij sites die hun opbouw niet semantisch markeren. Bekijk de clip in de leesweergave voordat je importeert; zie je het blok daar, haal de pagina dan opnieuw op met een selectie van alleen de tekst, of verwijder het blok in de editor – het is Markdown, dus dat is één handeling.

De YAML-kop komt als segmenten binnen

Sommige tools importeren de frontmatter als gewone tekst. Zet in dat geval de velden uit die je niet nodig hebt, of haal de kop weg voordat je importeert. Het zijn de eerste regels tussen twee streepjeslijnen, dus dat gaat met één selectie.

De helft van de pagina ontbreekt

Bijna altijd tabbladen, een accordeon of een “lees verder”-knop: wat pas na een klik wordt ingeladen, staat op het moment van ophalen niet in de pagina. Klap alles open en haal daarna opnieuw op. Wat met CSS verborgen is maar wel gerenderd, komt gewoon mee.

De tekst in de afbeeldingen komt niet mee

Nee, en dat gebeurt ook niet: er wordt geen tekst uit beeld herkend. Staat er in een infographic of een schermafbeelding tekst die vertaald moet worden, dan valt die buiten de clip en moet die apart worden aangeleverd. Dat is precies het soort werk dat je bij de offerte wilt weten, en daarom is het de moeite waard om de clip vóór het offreren even te bekijken.

Wat het niet doet

Het vertaalt niets en herkent de brontaal niet: het levert alleen schone tekst op. Er komt geen XLIFF, TMX of segmentbestand uit – de uitvoer is Markdown, en de segmentatie doet je CAT-tool. Je haalt één pagina tegelijk op; er zit geen crawler in die een hele site binnenhaalt. En tekst die in een afbeelding staat, blijft een afbeelding.

Aan Chrome toevoegen – gratisVolledig gratis, zonder account en zonder limiet.

Vragen

Blijft opmaak binnen de regel behouden?
Ja. Vet, cursief, links, code en lijsten worden hun Markdown-equivalent, en de meeste CAT-tools behandelen die als inline tags.
Kan het pagina’s in elke taal ophalen?
Ja. De extractie is gemeten op 403 pagina’s uit de top vijftig van twaalf Europese landen, plus de wereld- en Russische top honderd – nul mislukkingen over het geheel. Voor de Nederlandse lijst ging het om 37 pagina’s met nul mislukkingen en nul achtergebleven HTML.
Spreekt de interface mijn taal?
De extensie is vertaald naar veertien talen en volgt de instelling van je browser.
Krijg ik er XLIFF of TMX uit?
Nee. Je krijgt Markdown; de omzetting naar een tweetalig formaat doet je CAT-tool bij het importeren.
Kan ik een hele site in één keer binnenhalen?
Nee. Er zit geen crawler in: je haalt de pagina op waar je op staat, één tegelijk.
Hoe kom ik aan een betrouwbaar woordaantal?
Door te tellen in de clip in plaats van op de pagina. Wat in het bestand staat is lopende tekst; menu’s, paginering en voetteksten zijn er al uit. Bij korte pagina’s scheelt dat aanzienlijk, en het bestand waaruit je telt kun je meesturen.
Segmenteert het de tekst voor mij?
Nee. Segmenteren doet je CAT-tool, volgens jouw eigen regels. De extensie levert een schoon brondocument aan; wat er daarna met de zinsgrenzen gebeurt, blijft binnen je eigen werkwijze.
Kan ik de YAML-kop weglaten?
Ja. Zet de frontmatter-velden uit die je niet nodig hebt; zet je ze allemaal uit, dan begint het bestand meteen met de tekst. Handig als je tool de kop anders als segmenten importeert.
Wordt tekst in afbeeldingen herkend?
Nee. Er zit geen tekstherkenning in: staat er tekst in een infographic of een schermafbeelding, dan valt die buiten de clip en moet die apart worden aangeleverd.
Werkt het ook voor talen buiten het Latijnse schrift?
Ja. De uitvoer is UTF-8 en de extractie is niet op één schrift gebouwd; ze is gemeten op de top vijftig van twaalf Europese landen, 403 pagina’s, met nul mislukkingen en nul achtergebleven HTML. De extensie zelf is in veertien talen vertaald en volgt de instelling van je browser.