Clean Web Clipper 加到 Chrome(免費)

適用對象

給 CAT 工具的乾淨原文

從網頁貼上的原文會把導覽一起帶進來,每個選單項目都變成一個你得跳過、計算,最後還得在帳單上解釋的句段。Clean Web Clipper 在檔案接近你的工具之前,就把它們移除。

不是文字的句段

你匯入一個頁面,專案一打開,在正文第一句之前就有六十個句段:「Skip to content」、「Log in」、九個產品分類、一則 Cookie 通知,還有一個列出三十種語言的語言切換器。這些都不是需要翻譯的內容,卻全都在檔案裡、在字數統計裡,還得一個句段一個句段地鎖定或刪除。

接著是重複。同樣的選單區塊在每個段落和頁尾再出現一次,用這個檔案餵進去的翻譯記憶庫,就開始把「Read next」當成真正句子的比對結果推薦給你。匯入前清理原文只要幾秒。事後清理翻譯記憶庫可不是。

麻煩在工作開始之前就來了。客戶請你為「這個頁面」報價,而你給的數字完全取決於你計算了什麼:從原始頁面算出的字數包含選單,清理後算出的則不包含,這種對話沒人想經歷第二次。然後,客戶在你翻譯期間修改了頁面。報價當天擷取的檔案,檔頭帶有網址和頁面自己的日期,兩個問題都能解決,不需要任何人去回想頁面當時的樣子。

進入句段清單的是什麼

六十段導覽,一段都沒留下gov.uk:指引頁面
---
title: "Register a trade mark: step by step"
source: "https://www.gov.uk/how-to-register-a-trade-mark"
extraction: "dom"
---

## Check whether your trade mark can be registered

Your trade mark must be unique. It can include words, sounds, logos, colours
or a combination of these.

You cannot register a trade mark that is offensive, describes the goods it
relates to, or is misleading.

準備原文檔案

目標是讓檔案在你的工具中打開時,第一個句段就是正文的第一句。兩項設定能完成大部分工作,而其中一項很容易設錯。

  1. 從擴充功能圖示開啟選項,把存放位置指向工作所在的資料夾,例如 jobs/client/source。原文檔案屬於這件工作,而不是放在一般的擷取資料夾裡。
  2. 按下圖示時的動作設為「下載 .md 檔案」或「存到資料夾」,看哪一種適合你的檔案處理方式。無論哪種,你得到的都是可以匯入的檔案,而不是得先貼到某處的剪貼簿。
  3. 把檔名範本設為 {date}-{domain}-{title}。客戶的頁面在你報價後被修改時,擷取日期就是你可以指出的依據。
  4. 如果要直接匯入檔案,就關閉 frontmatter 欄位。YAML 檔頭是文字,不認得它的工具會很樂意把 extraction: "dom" 當成要翻譯的句段。
  5. 把圖片設為略過。Markdown 中的圖片連結會變成句段,或變成你得在整個檔案中一路帶著的行內標籤,而那張圖根本不是正文的一部分。
  6. 只有一節在範圍內時,在頁面上選取它並擷取選取範圍。報價的是一節、交付的卻是整頁,這種誤會就是從擷取那一刻開始的。
  7. 在報價當天擷取頁面,並保留檔案。它是價格談定時原文狀態的唯一紀錄。

原文檔案的設定

frontmatter 那一列最容易讓人出錯。其餘的設定,都是為了讓句段清單只剩真正的正文。

設定為什麼在這裡用這個值
按下圖示下載 `.md`你要的是可匯入的檔案,而不是要貼上的剪貼簿
Frontmatter直接匯入時全部關閉YAML 檔頭是文字;不跳過它的工具會把它當成句段
圖片略過圖片連結會變成句段或行內標籤,而它根本不是正文
檔名範本`{date}-{domain}-{title}`固定報價所依據的客戶頁面版本
存放位置工作資料夾原文屬於這件工作,頁面改變後也仍留在那裡
選取範圍擷取範圍內的那一節範圍蔓延往往始於一次整頁擷取
個別網站規則客戶網域 → 工作子資料夾,略過圖片固定客戶就不必每次都做決定
行內格式會被對應,而不是被丟掉產品頁面中的一段文字
The **starter plan** includes *up to five* seats. Additional seats are
billed monthly; see the [pricing page](https://example.com/pricing) or set
`SEATS` in your configuration file.

- Seats can be reassigned once per billing period.
- Unused seats are not carried over.

一句話裡有四種行內標記:粗體、斜體、連結和程式碼。每一種都
對應到 Markdown 的等價寫法,CAT 工具會把它匯入為行內標籤。

三件工作

依正文而不是網站外框報價

客戶寄來一個網址,請你報價。你擷取這個頁面:選單、列出三十種語言的語言切換器、同意通知和頁尾,在檔案產生之前就都不見了,所以你報的字數,就是需要翻譯的文字的字數。

這件事的測量版本是重複的導覽:在 109 頁的語料上有 102 行重複,比較的引擎分別是 282、478 和 491 行。在選單於每個段落重複的頁面上,這就是同一件工作兩份報價之間的大部分差距。

工作進行到一半時改變的頁面

第三天,客戶提到行銷部門「調整了幾個地方」。你再擷取一次頁面;第二個檔案加上數字後綴,和你報價時的檔案比對後,顯示多了兩段文字,還改了一個標題。

這就成了一場手上有文件的範圍討論,而不是一場憑記憶的爭論。每個檔名中的擷取日期說明哪個是哪個,date 欄位則說明頁面在每一次如何描述自己。

從線上網站建立雙語參考資料

客戶的網站已經有德文版。你把英文頁面和德文頁面先後擷取到同一個工作資料夾。擷取不依賴文字的語言,所以兩者都會產生同樣乾淨的結構,同樣的標題、同樣的順序。

這是刻意測量過的:十二個歐洲國家前五十大網站的 403 個頁面,每一頁都以設定為該國語言的瀏覽器擷取,沒有當機,也沒有任何殘留的 HTML。對齊兩個乾淨的檔案是一件工作;對齊兩個塞滿選單的檔案,則是另一件更糟的工作。

和一般的前置作業相比

前置作業一定會發生,問題在於在哪裡做。以下是譯者目前做前置作業的地方,以及各自的代價。

目前的做法你得到什麼代價是什麼
複製貼上到工具立刻得到文字第一句之前有六十個導覽句段,得手動鎖定或刪除
工具自己的網頁匯入篩選器直接從網址建立專案篩選器得逐站設定,而固定版面文字通常還是會漏過
向客戶索取原始檔案真正的正文,附帶脈絡來得晚、是沒人打得開的 CMS 匯出檔,或根本沒來
把頁面存成 HTML 再清理完全掌控保留哪些內容每個頁面都要在文字編輯器裡花上一小時
Clean Web Clipper正文的 `.md` 檔案,記錄來源和日期沒有 XLIFF、沒有 TMX、沒有斷句、沒有字數統計。這些仍交給你的工具

匯入結果不乾淨時

我的工具把 YAML 檔頭當成句段

frontmatter 是檔案頂端的文字,不認得 YAML 區塊的工具會把它當成內容。在擷取打算直接匯入的檔案前,先在設定中關閉 frontmatter 欄位,或擷取後刪除檔頭。另外保留一份帶檔頭的副本很值得:來源網址和日期就在那份副本裡。

還是有六十個導覽句段混了進來

這發生在頁面根本沒有文章內文的時候:分類列表、商店首頁、搜尋結果。這種情況擴充功能會回報「沒有文章」,而不是傳回連結,所以匯入前先看看擷取視窗說了什麼。如果它確實傳回了文章、選單也一起進來,那是網站把導覽標記成文章內容,而這是密度判斷唯一看不穿的情況。

匯入後行內格式看起來不對

Markdown 用字元而不是標籤標記強調,所以把檔案當成純文字匯入的工具,會直接顯示 bold,而不是行內標籤。請把它當成 Markdown 匯入,而不是當成文字;大多數工具兩種篩選器都有,而同一個檔案在兩者之下的表現完全不同。

行銷頁面的正文少了一半

行銷頁面常由捲動時才呈現的設計區塊組成,或由打開時才插入文字的分頁標籤和摺疊區塊組成。瀏覽器沒有呈現的東西不在 DOM 裡,也就擷取不到。把頁面捲到底、打開各個區段,再擷取一次;或者向客戶索取文案稿,對這種頁面來說,那本來就是更好的原文。

它不是什麼

它不是 CAT 工具:沒有 XLIFF、沒有 TMX、沒有斷句,也沒有字數統計。它不保留頁面的 HTML 以便回寫。輸出是 Markdown,用來閱讀和翻譯,而不是合併回網站。圖片中的文字不會被擷取。介面語言(19 種之一,依你的瀏覽器設定)和頁面的語言是兩回事:擷取本身不依賴文字的語言。

加到 Chrome(免費)完全免費。不需要帳號、不需要註冊,也沒有任何限制。

常見問題

它會保留行內格式嗎?
會:粗體、斜體、連結、程式碼和清單都會變成對應的 Markdown 寫法,大多數 CAT 工具會把它們當成行內標籤處理。
可以擷取任何語言的頁面嗎?
可以。擷取在十二個歐洲國家前五十大網站的 403 個頁面上測量過,每一頁都以該國語言擷取,沒有當機,擷取出的文章中也沒有任何殘留的 HTML。
可以從中取得 XLIFF 嗎?
不行。輸出是 Markdown,所有主要的 CAT 工具都能匯入。轉換成你交付的格式,仍由你的工具負責。
介面有我的語言嗎?
很可能有:介面提供 19 種語言,並跟隨你瀏覽器的設定,包括英文、俄文、德文、法文、西班牙文、義大利文、荷蘭文、波蘭文、巴西葡萄牙文、羅馬尼亞文、瑞典文、土耳其文、烏克蘭文、捷克文、中文(簡體和繁體)、日文、韓文和越南文。擷取本身適用於任何語言的頁面。
會有任何東西被送到翻譯服務嗎?
不會。擷取內容絕不會上傳:它進入你的剪貼簿或磁碟,不會去其他地方。
它能處理非拉丁文字和由右至左的文字嗎?
文字會照頁面呈現的樣子,一個字元一個字元地擷取,無論是哪種文字系統。不會轉寫、重新排序或正規化。擷取依據的是頁面結構,而結構和字母是什麼無關。
它會給我字數統計嗎?
不會。沒有計數、沒有斷句,也沒有任何形式的分析:輸出是一個 Markdown 檔案。它改變的是有哪些東西要計算,在你的工具看到之前先移除導覽。
可以完全關閉 YAML 檔頭嗎?
可以。每個 frontmatter 欄位(title、source、author、date、extraction)都能個別關閉,可以全域設定,也可以只針對某個網站。全部關閉時,檔案會從正文的第一個標題開始。
可以擷取客戶的測試站嗎?
只要能在你的瀏覽器中呈現就可以,包括需要基本驗證或 IP 允許清單的網站,因為擴充功能讀取的是你的工作階段已經載入的頁面。它不會自己發出任何請求,所以測試站不會被觸碰,也不會被抓取第二次。
兩欄版面擷取出來的順序對嗎?
文章內文依它在文件中出現的順序寫出,而不是依畫面上的位置。擺在正文旁邊的側欄會被當成雜物移除,而不是和正文交錯排列,所以正文會依序讀下來,這正是句段清單需要的,而依畫面順序擷取做不到。