適用對象
給 CAT 工具的乾淨原文
從網頁貼上的原文會把導覽一起帶進來,每個選單項目都變成一個你得跳過、計算,最後還得在帳單上解釋的句段。Clean Web Clipper 在檔案接近你的工具之前,就把它們移除。
不是文字的句段
你匯入一個頁面,專案一打開,在正文第一句之前就有六十個句段:「Skip to content」、「Log in」、九個產品分類、一則 Cookie 通知,還有一個列出三十種語言的語言切換器。這些都不是需要翻譯的內容,卻全都在檔案裡、在字數統計裡,還得一個句段一個句段地鎖定或刪除。
接著是重複。同樣的選單區塊在每個段落和頁尾再出現一次,用這個檔案餵進去的翻譯記憶庫,就開始把「Read next」當成真正句子的比對結果推薦給你。匯入前清理原文只要幾秒。事後清理翻譯記憶庫可不是。
麻煩在工作開始之前就來了。客戶請你為「這個頁面」報價,而你給的數字完全取決於你計算了什麼:從原始頁面算出的字數包含選單,清理後算出的則不包含,這種對話沒人想經歷第二次。然後,客戶在你翻譯期間修改了頁面。報價當天擷取的檔案,檔頭帶有網址和頁面自己的日期,兩個問題都能解決,不需要任何人去回想頁面當時的樣子。
進入句段清單的是什麼
- 選單、分頁列、同意橫幅和「延伸閱讀」資訊流在檔案產生之前就被刪除。
- 重複的導覽大約減少四倍,相較於比較的引擎:102 行重複,對比 282、478 和 491 行。
- 一個殘留的 HTML 標籤都沒有(512 個測量頁面),所以不會有零散的標記變成行內標籤。
- 行內格式對應到 Markdown:粗體、斜體、連結、程式碼和清單,所有主要的 CAT 工具都能匯入。
- 來源網址隨 frontmatter 一起保存,句段的背景資訊只要點一下就能看到。
- 在十二個歐洲國家前五十大網站的 403 個頁面上測量,每一頁都以該國語言擷取:沒有當機。
- 標題、清單和引用區塊保留層級,所以譯文必須對應的結構,在原文檔案中就看得到,而不必從句段推測。
title和date來自頁面自己的中繼資料,所以工作資料夾會記錄你報價時依據的是哪個版本的原文。
--- title: "Register a trade mark: step by step" source: "https://www.gov.uk/how-to-register-a-trade-mark" extraction: "dom" --- ## Check whether your trade mark can be registered Your trade mark must be unique. It can include words, sounds, logos, colours or a combination of these. You cannot register a trade mark that is offensive, describes the goods it relates to, or is misleading.
準備原文檔案
目標是讓檔案在你的工具中打開時,第一個句段就是正文的第一句。兩項設定能完成大部分工作,而其中一項很容易設錯。
- 從擴充功能圖示開啟選項,把存放位置指向工作所在的資料夾,例如
jobs/client/source。原文檔案屬於這件工作,而不是放在一般的擷取資料夾裡。 - 把按下圖示時的動作設為「下載
.md檔案」或「存到資料夾」,看哪一種適合你的檔案處理方式。無論哪種,你得到的都是可以匯入的檔案,而不是得先貼到某處的剪貼簿。 - 把檔名範本設為
{date}-{domain}-{title}。客戶的頁面在你報價後被修改時,擷取日期就是你可以指出的依據。 - 如果要直接匯入檔案,就關閉 frontmatter 欄位。YAML 檔頭是文字,不認得它的工具會很樂意把
extraction: "dom"當成要翻譯的句段。 - 把圖片設為略過。Markdown 中的圖片連結會變成句段,或變成你得在整個檔案中一路帶著的行內標籤,而那張圖根本不是正文的一部分。
- 只有一節在範圍內時,在頁面上選取它並擷取選取範圍。報價的是一節、交付的卻是整頁,這種誤會就是從擷取那一刻開始的。
- 在報價當天擷取頁面,並保留檔案。它是價格談定時原文狀態的唯一紀錄。
原文檔案的設定
frontmatter 那一列最容易讓人出錯。其餘的設定,都是為了讓句段清單只剩真正的正文。
| 設定 | 值 | 為什麼在這裡用這個值 |
|---|---|---|
| 按下圖示 | 下載 `.md` | 你要的是可匯入的檔案,而不是要貼上的剪貼簿 |
| Frontmatter | 直接匯入時全部關閉 | YAML 檔頭是文字;不跳過它的工具會把它當成句段 |
| 圖片 | 略過 | 圖片連結會變成句段或行內標籤,而它根本不是正文 |
| 檔名範本 | `{date}-{domain}-{title}` | 固定報價所依據的客戶頁面版本 |
| 存放位置 | 工作資料夾 | 原文屬於這件工作,頁面改變後也仍留在那裡 |
| 選取範圍 | 擷取範圍內的那一節 | 範圍蔓延往往始於一次整頁擷取 |
| 個別網站規則 | 客戶網域 → 工作子資料夾,略過圖片 | 固定客戶就不必每次都做決定 |
The **starter plan** includes *up to five* seats. Additional seats are billed monthly; see the [pricing page](https://example.com/pricing) or set `SEATS` in your configuration file. - Seats can be reassigned once per billing period. - Unused seats are not carried over. 一句話裡有四種行內標記:粗體、斜體、連結和程式碼。每一種都 對應到 Markdown 的等價寫法,CAT 工具會把它匯入為行內標籤。
三件工作
依正文而不是網站外框報價
客戶寄來一個網址,請你報價。你擷取這個頁面:選單、列出三十種語言的語言切換器、同意通知和頁尾,在檔案產生之前就都不見了,所以你報的字數,就是需要翻譯的文字的字數。
這件事的測量版本是重複的導覽:在 109 頁的語料上有 102 行重複,比較的引擎分別是 282、478 和 491 行。在選單於每個段落重複的頁面上,這就是同一件工作兩份報價之間的大部分差距。
工作進行到一半時改變的頁面
第三天,客戶提到行銷部門「調整了幾個地方」。你再擷取一次頁面;第二個檔案加上數字後綴,和你報價時的檔案比對後,顯示多了兩段文字,還改了一個標題。
這就成了一場手上有文件的範圍討論,而不是一場憑記憶的爭論。每個檔名中的擷取日期說明哪個是哪個,date 欄位則說明頁面在每一次如何描述自己。
從線上網站建立雙語參考資料
客戶的網站已經有德文版。你把英文頁面和德文頁面先後擷取到同一個工作資料夾。擷取不依賴文字的語言,所以兩者都會產生同樣乾淨的結構,同樣的標題、同樣的順序。
這是刻意測量過的:十二個歐洲國家前五十大網站的 403 個頁面,每一頁都以設定為該國語言的瀏覽器擷取,沒有當機,也沒有任何殘留的 HTML。對齊兩個乾淨的檔案是一件工作;對齊兩個塞滿選單的檔案,則是另一件更糟的工作。
和一般的前置作業相比
前置作業一定會發生,問題在於在哪裡做。以下是譯者目前做前置作業的地方,以及各自的代價。
| 目前的做法 | 你得到什麼 | 代價是什麼 |
|---|---|---|
| 複製貼上到工具 | 立刻得到文字 | 第一句之前有六十個導覽句段,得手動鎖定或刪除 |
| 工具自己的網頁匯入篩選器 | 直接從網址建立專案 | 篩選器得逐站設定,而固定版面文字通常還是會漏過 |
| 向客戶索取原始檔案 | 真正的正文,附帶脈絡 | 來得晚、是沒人打得開的 CMS 匯出檔,或根本沒來 |
| 把頁面存成 HTML 再清理 | 完全掌控保留哪些內容 | 每個頁面都要在文字編輯器裡花上一小時 |
| Clean Web Clipper | 正文的 `.md` 檔案,記錄來源和日期 | 沒有 XLIFF、沒有 TMX、沒有斷句、沒有字數統計。這些仍交給你的工具 |
匯入結果不乾淨時
我的工具把 YAML 檔頭當成句段
frontmatter 是檔案頂端的文字,不認得 YAML 區塊的工具會把它當成內容。在擷取打算直接匯入的檔案前,先在設定中關閉 frontmatter 欄位,或擷取後刪除檔頭。另外保留一份帶檔頭的副本很值得:來源網址和日期就在那份副本裡。
還是有六十個導覽句段混了進來
這發生在頁面根本沒有文章內文的時候:分類列表、商店首頁、搜尋結果。這種情況擴充功能會回報「沒有文章」,而不是傳回連結,所以匯入前先看看擷取視窗說了什麼。如果它確實傳回了文章、選單也一起進來,那是網站把導覽標記成文章內容,而這是密度判斷唯一看不穿的情況。
匯入後行內格式看起來不對
Markdown 用字元而不是標籤標記強調,所以把檔案當成純文字匯入的工具,會直接顯示 bold,而不是行內標籤。請把它當成 Markdown 匯入,而不是當成文字;大多數工具兩種篩選器都有,而同一個檔案在兩者之下的表現完全不同。
行銷頁面的正文少了一半
行銷頁面常由捲動時才呈現的設計區塊組成,或由打開時才插入文字的分頁標籤和摺疊區塊組成。瀏覽器沒有呈現的東西不在 DOM 裡,也就擷取不到。把頁面捲到底、打開各個區段,再擷取一次;或者向客戶索取文案稿,對這種頁面來說,那本來就是更好的原文。
它不是什麼
它不是 CAT 工具:沒有 XLIFF、沒有 TMX、沒有斷句,也沒有字數統計。它不保留頁面的 HTML 以便回寫。輸出是 Markdown,用來閱讀和翻譯,而不是合併回網站。圖片中的文字不會被擷取。介面語言(19 種之一,依你的瀏覽器設定)和頁面的語言是兩回事:擷取本身不依賴文字的語言。