Clean Web Clipper Lägg till i Chrome – gratis

För vem ·

Ren källtext till ditt CAT-verktyg

Källtext som klistras in från en webbsida bär med sig navigeringen, och varje menypost blir ett segment du måste hoppa över. Clean Web Clipper klipper bort det före exporten: på ett korpus om 109 sidor återstod 102 dubblerade navigeringsrader, mot 282, 478 och 491 hos de tre andra motorerna. Det du importerar är brödtext.

Varför segmentlistan smutsas ned

En inklistrad webbsida ger tiotals segment som inte är översättningsarbete: ”Start”, ”Logga in”, ”Godkänn alla”, en sidnumrering från 1 till 12 och samma rubrikrad som återkommer i varje avsnitt. Du måste röra vid dem en och en eller utesluta dem, och gör du inte det smutsar de ned ditt översättningsminne. Vid en serie sidor från samma webbplats upprepas arbetet varje gång.

Att filtrera i efterhand är mer omständligt än det låter, för bruset ligger utspritt i texten och inte prydligt först. Dessutom bryter en inklistrad sida formateringen inne i raden: fetstil och kursiv går förlorade eller blir lösa taggar, och en tabell blir en följd av rader vars samband är borta.

Lägg till i Chrome – gratisHelt gratis. Inget konto, ingen registrering, inga gränser.For Chrome on a computer

Vad du importerar

Bara brödtext: varje rad blir ett användbart segmentregeringen.se/pressmeddelanden
Riksdagen har beslutat om ändringarna med 178 röster för, 121 emot och 12
nedlagda röster.

Bestämmelserna träder i kraft den 1 juli och ska följas upp efter två år.
Uppföljningen redovisas i en rapport till riksdagen.

Vad det inte gör

Det översätter ingenting och känner inte igen källspråket: det ger bara ren text. Det kommer ingen XLIFF, TMX eller segmentfil ur det – utdatan är Markdown, och segmenteringen sköter ditt CAT-verktyg. Du sparar en sida i taget; det finns ingen crawler som drar hem en hel webbplats. Och text som ligger i en bild förblir en bild.

Lägg till i Chrome – gratisHelt gratis. Inget konto, ingen registrering, inga gränser.For Chrome on a computer

Frågor

Bevaras formateringen inne i raden?
Ja. Fetstil, kursiv, länkar, kod och listor blir sina Markdown-motsvarigheter, och de flesta CAT-verktyg hanterar dem som inline-taggar.
Går det att spara sidor på vilket språk som helst?
Ja. Extraheringen testades på 403 sidor från de femtio största webbplatserna i tolv europeiska länder, plus världens och Rysslands hundra största – noll krascher i samtliga. Den svenska delen var 28 sidor med noll krascher och noll kvarlämnad HTML.
Talar gränssnittet mitt språk?
Med största sannolikhet: det finns på 19 språk och följer inställningen i din webbläsare – engelska, ryska, tyska, franska, spanska, italienska, nederländska, polska, brasiliansk portugisiska, rumänska, svenska, turkiska, ukrainska, tjeckiska, kinesiska (förenklad och traditionell), japanska, koreanska och vietnamesiska. Själva extraheringen fungerar på sidor på vilket språk som helst.
Får jag ut XLIFF eller TMX?
Nej. Du får Markdown; omvandlingen till ett tvåspråkigt format gör ditt CAT-verktyg vid importen.
Kan jag dra hem en hel webbplats på en gång?
Nej. Det finns ingen crawler: du sparar sidan du står på, en i taget.