Clean Clipper Zu Chrome hinzufügen – kostenlos

Für wen

Sauberer Ausgangstext für Ihr CAT-Tool

Ausgangstext, der aus einer Webseite kopiert wird, bringt die Navigation mit, und jeder Menüpunkt wird zu einem Segment, das übersprungen werden will. Ihn vor dem Import zu entfernen geht schneller, als ihn hinterher aus der Segmentliste zu putzen. Fett, kursiv, Links und Listen bleiben dabei als Markdown erhalten.

Segmente, die niemand übersetzt

Eine Webseite, die roh in ein CAT-Tool wandert, bringt ihr ganzes Gerüst mit. Das Hauptmenü wird zu zwanzig Ein-Wort-Segmenten, der Cookie-Hinweis zu dreien, die Fußzeile zu weiteren dreißig. Die Segmentzahl im Angebot stimmt dann nicht mit der Arbeit überein, und die Analyse gegen das Translation Memory wird von Fragmenten verwässert, die nie ein Satz waren.

Beim Aufräumen entsteht die zweite Schicht Arbeit. Sie löschen Segmente, prüfen, ob dabei ein echter Satz verschwunden ist, und stellen beim Gegenlesen fest, dass eine Tabelle mit Produktdaten unterwegs zusammengefallen ist. Die Quelladresse fehlt außerdem, und für eine Nachfrage zum Kontext beginnt die Suche von vorn.

Die dritte Schicht sind die Tags. Bleibt beim Umwandeln rohe Auszeichnung im Text stehen, wird daraus im CAT-Tool ein Inline-Tag, das durch jedes Segment mitgeschleppt und beim Export wieder richtig gesetzt werden will. Deshalb ist die Zahl, auf die es hier ankommt, null: über 512 gemessene Seiten blieb kein einziges übriges HTML-Tag im Markdown stehen. Was an Auszeichnung ankommt, ist Fett, Kursiv, Link, Code und Liste – also genau das, was die meisten Werkzeuge ohnehin als Inline-Tag behandeln.

Was in die Segmentliste kommt

Ein Wörterbucheintrag, ohne das Gerüst der Seitedwds.de/wb/Quelle
---
title: "Quelle, die"
source: "https://www.dwds.de/wb/Quelle"
extraction: "dom"
---

## Quelle, die

1. Stelle, an der Wasser aus dem Boden austritt und einen Wasserlauf speist
2. übertragen: Ursprung, Ausgangspunkt einer Sache
3. Text oder Zeugnis, auf das sich eine Darstellung stützt

Ausgangstext vor dem Import

Der Zweck ist eine Datei, in der jedes Segment ein Satz ist. Fünf Schritte, von denen die ersten drei einmal pro Projekt anfallen.

  1. Legen Sie in den Einstellungen einen Zielordner pro Projekt an und setzen Sie die Namensvorlage auf {domain}-{title}. Bei mehreren Quellen desselben Kunden sagt die Domain sofort, welche Datei zu welcher Website gehört.
  2. Stellen Sie Bilder auf „weglassen“. Bildlinks erzeugen im Import Segmente, die niemand übersetzt, und tragen zur Analyse gegen das Translation Memory nichts bei.
  3. Behalten Sie title und source im Frontmatter. Die Adresse ist der Weg zurück zum Kontext, wenn beim Übersetzen eine Rückfrage entsteht – und der ist ein Klick statt einer Suche.
  4. Stellen Sie den Browser auf die Sprache der Fassung, die Sie brauchen, und öffnen Sie die Seite dort. Erfasst wird immer die Sprachfassung, die in Ihrem Browser steht; die Erweiterung holt keine zweite dazu.
  5. Erfassen Sie die Seite und prüfen Sie im Lesemodus, ob noch Navigation übrig ist. Was Sie hier sehen, wird zu Segmenten – es ist die letzte Stelle, an der eine Menüzeile billig zu entfernen ist.
  6. Speichern Sie die .md-Datei in den Projektordner und importieren Sie sie in Ihr Werkzeug. Die Segmentierung übernimmt das CAT-Tool; die Erweiterung erzeugt weder XLIFF noch TMX und legt keine zweisprachige Datei an.

Einstellungen vor dem Import

Alles hier zielt darauf, Segmente zu vermeiden, die niemand übersetzt. Was an Auszeichnung bleibt, ist das, was die meisten Werkzeuge als Inline-Tag behandeln.

EinstellungWertWarum gerade so
Klick auf das SymbolVorschaufensterDer Lesemodus ist die letzte Stelle, an der eine übrige Menüzeile billig zu entfernen ist
Bilder`weglassen`Bildlinks werden beim Import zu Segmenten, die niemand übersetzt, und verwässern die Analyse
Namensvorlage`{domain}-{title}`Bei mehreren Quellen desselben Kunden sagt die Domain sofort, wozu eine Datei gehört
Frontmatter`title`, `source`Die Adresse ist bei einer Rückfrage zum Kontext ein Klick statt einer Suche
Zielordner`Projekte/<Kunde>/quellen`Der Ausgangstext gehört neben das Projekt, nicht in einen allgemeinen Ablageordner
Browsersprachedie Sprache der gewünschten FassungErfasst wird die Fassung, die im Browser steht – bei mehrsprachigen Websites entscheidet das über den Inhalt
Der schwierige Fall: ein Rechtstext mit nummerierten Begriffsbestimmungen – die Ebenen bleiben erhalten, damit die Segmentgrenzen im CAT-Tool dort verlaufen, wo sie hingehören; erfasst wird die Sprachfassung, die im Browser geöffnet isteur-lex.europa.eu
---
title: "Verordnung (EU) 2016/679 – Artikel 4 Begriffsbestimmungen"
source: "https://eur-lex.europa.eu/legal-content/DE/TXT/?uri=CELEX:32016R0679"
extraction: "dom"
---

## Artikel 4 – Begriffsbestimmungen

Im Sinne dieser Verordnung bezeichnet der Ausdruck:

1. **„personenbezogene Daten“** alle Informationen, die sich auf eine
   identifizierte oder identifizierbare natürliche Person beziehen;
2. **„Verarbeitung“** jeden mit oder ohne Hilfe automatisierter Verfahren
   ausgeführten Vorgang im Zusammenhang mit personenbezogenen Daten;

Drei Wege im Projekt

Ein Angebot mit belastbarer Segmentzahl

Der Kunde schickt eine Adresse statt einer Datei, und die Analyse soll sagen, wie groß der Auftrag ist. Roh importiert bringt die Seite zwanzig Ein-Wort-Segmente aus dem Hauptmenü, drei aus dem Cookie-Hinweis und dreißig aus der Fußzeile.

Sauber erfasst zählt die Analyse, was wirklich zu übersetzen ist. Die Bereinigung ist dabei gemessen: 102 doppelte Navigationszeilen auf dem Korpus von 109 Seiten, gegen 282, 478 und 491 bei den drei verglichenen Engines.

Die Zielsprachfassung als Referenz danebenlegen

Für die Terminologie brauchen Sie die vorhandene Fassung derselben Seite in der anderen Sprache. Die Erweiterung erfasst immer die Fassung, die in Ihrem Browser steht – also stellen Sie die Sprache auf der Website um und erfassen ein zweites Mal.

Weil {domain}-{title} im Dateinamen steht und die Titel sich unterscheiden, liegen beide Dateien nebeneinander im Projektordner. Eine zweisprachige Datei entsteht dabei nicht; die Ausrichtung machen Sie in Ihrem Werkzeug, wenn Sie eine brauchen.

Einen Glossareintrag im Vorbeigehen sichern

Beim Übersetzen taucht ein Terminus auf, dessen Bedeutung in einem Wörterbuch oder einer Termdatenbank steht. Markieren, Alt+Shift+M, weiter – es wird nur die Auswahl gespeichert, mit Quelladresse im Frontmatter.

Nach einem Projekt ist der Ordner eine durchsuchbare Sammlung von Belegstellen, weil es Textdateien sind. Was daraus wird, entscheiden Sie: Die Erweiterung schlägt keine Terminologie vor und pflegt keine Termdatenbank.

Gegen die üblichen Wege

Ausgangstext von einer Website in ein Werkzeug zu bekommen geht auf mehrere Arten. Die letzte Zeile nennt auch, was hier nicht dabei ist.

WegWas in der Segmentliste ankommtWas es kostet
Seite markieren und einfügenDer Text mitsamt Menü, Banner und FußzeileSegmente, die niemand übersetzt, eine verwässerte Analyse und ein Angebot, das nicht zur Arbeit passt
HTML der Seite direkt importierenAlles, was im Quelltext steht, mit voller AuszeichnungInline-Tags aus Layout-Auszeichnung, die durch jedes Segment mitgeschleppt werden müssen
Als PDF drucken und importierenEin Dokument, das sich importieren lässtSegmentgrenzen an Zeilenumbrüchen, zerfallene Tabellen und Kopfzeilen mitten im Text
Hinterher in der Segmentliste aufräumenAm Ende eine saubere ListeLöschen und Prüfen pro Segment, und dabei verschwindet gelegentlich ein echter Satz
Clean ClipperFließtext mit Fett, Kursiv, Links, Code und Listen als MarkdownKein XLIFF, kein TMX, keine zweisprachige Datei, keine Wortzählung – und immer nur die Sprachfassung, die im Browser steht

Wenn der Ausgangstext klemmt

Ich bekomme die englische Fassung statt der deutschen

Weil die Website die Fassung nach Ihrer Browsersprache oder Ihrem Standort ausliefert und die Erweiterung erfasst, was im Browser steht. Stellen Sie die Sprache auf der Website selbst um oder ändern Sie die Spracheinstellung des Browsers und laden Sie die Seite neu, bevor Sie erfassen.

Warum steht in der Datei kein Fließtext, sondern „kein Artikel“?

Weil die Seite überwiegend aus Linkbeschriftungen besteht – eine Produktübersicht, eine Startseite, eine Trefferliste. Die Erweiterung verweigert, wenn mehr als ein Viertel des fertigen Markdowns in Links sitzt. Für solche Seiten brauchen Sie ohnehin die Einzelseiten, denn eine Kachelübersicht ergibt keine übersetzbaren Sätze.

Die Produkttabelle ist beim Import zusammengefallen

Prüfen Sie zuerst, ob sie schon im Clip zusammengefallen war. Die Erweiterung schreibt Tabellen selbst und hält sie in den meisten Fällen zusammen; kam sie sauber an und zerfällt erst im Werkzeug, liegt es an der Importeinstellung für Markdown-Tabellen. Ungleichmäßige zweispaltige Tabellen werden absichtlich zu Schlüssel: Wert-Zeilen umgeformt.

Kommt der Text hinter der Anmeldung des Kunden mit?

Ja, sofern Sie angemeldet sind und die Seite echten Text enthält – gelesen wird, was Ihr Browser gerendert hat. Die Erweiterung meldet sich nirgends selbst an. Ist der Text erst nach einem Klick auf eine Registerkarte da, öffnen Sie diese vorher.

Was es nicht tut

Es übersetzt nichts und schlägt keine Terminologie vor: Es liefert den Ausgangstext, mehr nicht. Es exportiert weder XLIFF noch TMX und legt keine zweisprachige Datei an, die Segmentierung bleibt bei Ihrem Werkzeug. Es zählt keine Wörter und erstellt keine Analyse gegen ein Translation Memory. Und es holt nicht die anderen Sprachfassungen einer Seite dazu: Erfasst wird die Fassung, die in Ihrem Browser steht.

Zu Chrome hinzufügen – kostenlosVollständig kostenlos, ohne Konto und ohne Bezahlversion.

Fragen

Bleibt die Formatierung im Text erhalten?
Ja. Fett, kursiv, Links, Code und Listen werden zu ihren Markdown-Entsprechungen, die die meisten CAT-Tools als Inline-Tags behandeln.
Lassen sich Seiten in jeder Sprache erfassen?
Ja. Gemessen wurde an 403 Seiten der Top-50 in zwölf europäischen Ländern, dazu an den Top-100 weltweit und in Russland – null Fehlschläge in allen. Auf den deutschen Top-50: null Fehlschläge und null übrige HTML-Tags.
Spricht die Oberfläche Deutsch?
Ja. Die Erweiterung ist in vierzehn Sprachen übersetzt und folgt der Spracheinstellung Ihres Browsers.
Bekomme ich eine zweisprachige Datei?
Nein. Die Ausgabe ist der Ausgangstext als Markdown; die zweisprachige Struktur legt Ihr CAT-Tool beim Import an.
Kann ich nur einen Glossareintrag erfassen?
Ja. Markieren Sie ihn auf der Seite und erfassen Sie die Auswahl – die Quelladresse steht trotzdem im Frontmatter.
Bleiben rohe HTML-Tags im Text stehen?
Nein. Über 512 gemessene Seiten blieb kein einziges übriges HTML-Tag im Markdown – das ist die Zahl, auf die es beim Import ankommt, weil jede übrige Auszeichnung im Werkzeug zu einem Inline-Tag würde.
Zählt es Wörter oder Segmente?
Nein, keines von beidem. Die Erweiterung liefert den Ausgangstext; die Analyse gegen Ihr Translation Memory und die Zählung macht Ihr CAT-Tool, das die Datei importiert.
Holt es die anderen Sprachfassungen einer Seite dazu?
Nein. Erfasst wird die Fassung, die in Ihrem Browser steht. Für die Referenz stellen Sie die Sprache auf der Website um und erfassen ein zweites Mal – die beiden Dateien liegen danach nebeneinander im Projektordner.
Wie kommen Nummerierungen in Rechtstexten an?
Als Markdown-Listen mit ihren Ebenen. Das ist bei Verordnungen und Bedingungen wichtig, weil die Segmentgrenzen im Werkzeug an diesen Ebenen verlaufen und ein eingeebneter Text sie an falscher Stelle setzt.
Gibt es die Oberfläche in meiner Arbeitssprache?
Wahrscheinlich: Die Erweiterung ist in vierzehn Sprachen übersetzt und folgt der Spracheinstellung Ihres Browsers. Auf die Ausgabe hat das keinen Einfluss – erfasst wird immer die Sprache der Seite.