Clean Web Clipper Chrome에 추가 (무료)

누구를 위한 도구인가

CAT 도구에 넣을 깨끗한 원문

웹페이지에서 붙여 넣은 원문에는 내비게이션이 딸려 오고, 메뉴 항목 하나하나가 건너뛰고, 세고, 결국 견적서에서 설명해야 하는 세그먼트가 됩니다. Clean Web Clipper는 파일이 도구 근처에 가기 전에 그것을 제거합니다.

텍스트가 아닌 세그먼트

페이지를 가져오면 실제 원문의 첫 문장 전에 세그먼트 60개로 프로젝트가 열립니다. “본문 바로가기”, “로그인”, 제품 카테고리 아홉 개, 쿠키 안내, 서른 개 언어를 나열한 언어 선택기. 어느 것도 번역할 콘텐츠가 아니지만 모두 파일과 단어 수에 들어 있고, 세그먼트 하나씩 잠그거나 지워야 합니다.

그다음은 반복입니다. 같은 메뉴 블록이 섹션마다, 푸터에 또 나오므로, 그 파일로 채운 번역 메모리는 실제 문장에 “함께 읽을 기사”를 일치 항목으로 제안하기 시작합니다. 가져오기 전에 원문을 정리하는 데는 몇 초면 됩니다. 나중에 번역 메모리를 정리하는 데는 그렇지 않습니다.

문제는 작업 전에 이미 시작됩니다. “이 페이지” 견적을 요청받으면, 제시하는 숫자는 전적으로 무엇을 셌느냐에 달려 있습니다. 원본 페이지로 센 숫자에는 메뉴가 들어가고 정리한 뒤 센 숫자에는 들어가지 않으며, 이는 누구도 두 번 하고 싶지 않은 대화입니다. 그러다 작업 도중 고객이 페이지를 수정합니다. 견적을 낸 날 클리핑하고 머리글에 주소와 페이지 자체의 날짜를 담은 파일은, 페이지가 어땠는지 아무도 기억할 필요 없이 두 질문을 모두 정리합니다.

세그먼트 목록에 들어가는 것

내비게이션 60개 구간이 사라진 원문gov.uk: guidance page
---
title: "Register a trade mark: step by step"
source: "https://www.gov.uk/how-to-register-a-trade-mark"
extraction: "dom"
---

## Check whether your trade mark can be registered

Your trade mark must be unique. It can include words, sounds, logos, colours
or a combination of these.

You cannot register a trade mark that is offensive, describes the goods it
relates to, or is misleading.

원문 파일 준비하기

목표는 도구에서 열었을 때 첫 세그먼트가 원문의 첫 문장인 파일입니다. 대부분은 설정 두 가지로 되고, 그중 하나는 틀리기 쉽습니다.

  1. 확장 프로그램 아이콘에서 옵션을 열고 저장 위치를 작업 폴더 jobs/client/source로 지정합니다. 원문 파일은 일반 클립 폴더가 아니라 작업과 함께 있어야 합니다.
  2. 아이콘 클릭 동작을 “.md 파일 다운로드”나 “폴더에 저장” 중 파일 관리 방식에 맞는 쪽으로 설정합니다. 어느 쪽이든 어딘가에 먼저 붙여 넣어야 하는 클립보드가 아니라 가져올 파일이 생깁니다.
  3. 이름 규칙은 {date}-{domain}-{title}이 좋습니다. 견적을 낸 뒤 고객 페이지가 바뀌었을 때 가리킬 것이 캡처 날짜입니다.
  4. 파일을 직접 가져온다면 frontmatter 필드를 끕니다. YAML 머리글도 텍스트이므로, 이를 인식하지 못하는 도구는 extraction: "dom"을 번역할 세그먼트로 내놓습니다.
  5. 이미지를 제외로 설정합니다. Markdown 속 이미지 링크는 세그먼트가 되거나, 원문도 아닌 그림 때문에 파일 끝까지 끌고 가야 하는 인라인 태그가 됩니다.
  6. 한 섹션만 범위라면 페이지에서 선택한 뒤 선택 영역을 클리핑합니다. 섹션으로 견적을 내고 페이지 전체를 납품하는 오해는 캡처하는 순간 시작됩니다.
  7. 견적을 내는 날 페이지를 클리핑하고 파일을 보관합니다. 가격에 합의했을 때의 원문을 보여 주는 유일한 기록입니다.

원문 파일용 설정

사람들이 걸려 넘어지는 것은 frontmatter 행입니다. 나머지는 모두 세그먼트 목록을 실제 원문으로만 채우기 위한 것입니다.

설정여기서 이 값인 이유
아이콘 클릭`.md` 다운로드필요한 것은 붙여 넣을 클립보드가 아니라 가져올 파일입니다
frontmatter직접 가져오기용이면 모든 필드 끔YAML 머리글도 텍스트이고, 건너뛰지 않는 도구는 세그먼트로 내놓습니다
이미지제외이미지 링크는 원문도 아닌 것 때문에 세그먼트나 인라인 태그가 됩니다
파일 이름 템플릿`{date}-{domain}-{title}`견적의 기준이 된 고객 페이지 버전을 고정합니다
저장 위치작업 폴더원문은 작업에 속하고, 페이지가 바뀌어도 거기 남습니다
선택 영역범위에 든 섹션만 클리핑범위가 불어나는 일은 흔히 페이지 전체 캡처에서 시작됩니다
사이트별 규칙고객 도메인 → 작업 하위 폴더, 이미지 제외단골 고객은 매번 결정할 필요가 없어집니다
인라인 서식은 버려지지 않고 대응됩니다제품 페이지의 한 문단
The **starter plan** includes *up to five* seats. Additional seats are
billed monthly; see the [pricing page](https://example.com/pricing) or set
`SEATS` in your configuration file.

- Seats can be reassigned once per billing period.
- Unused seats are not carried over.

한 문장에 인라인 태그가 네 개 있습니다: 굵게, 기울임, 링크, 코드. 각각
CAT 도구가 인라인 태그로 가져오는 Markdown 표기로 대응됩니다.

세 가지 작업

껍데기가 아니라 원문으로 낸 견적

고객이 URL을 보내 가격을 묻습니다. 페이지를 클리핑하면 메뉴, 서른 개 언어를 나열한 언어 선택기, 동의 안내, 푸터가 파일이 생기기 전에 사라지므로, 견적에 쓰는 숫자는 번역해야 할 텍스트의 숫자입니다.

이것을 측정한 것이 중복 내비게이션입니다. 109페이지 코퍼스에서 반복 줄 102개, 비교한 엔진은 282, 478, 491개였습니다. 섹션마다 메뉴가 반복되는 페이지라면, 같은 작업에 대한 두 견적 차이의 대부분이 그것입니다.

작업 도중 바뀐 페이지

작업 사흘째, 고객이 마케팅팀이 “몇 군데 손봤다”고 말합니다. 페이지를 다시 클리핑하면 두 번째 파일에 숫자 접미사가 붙고, 견적을 낸 파일과의 diff에 새 문단 두 개와 바뀐 제목 하나가 보입니다.

기억을 두고 벌이는 논쟁이 아니라 문서가 있는 범위 협의가 됩니다. 각 파일 이름의 캡처 날짜가 어느 쪽이 어느 것인지 말해 주고, date 필드가 매번 페이지가 스스로에 대해 밝힌 내용을 말해 줍니다.

운영 중인 사이트로 만드는 이중 언어 참고 자료

고객 사이트에 이미 독일어 버전이 있습니다. 영어 페이지와 독일어 페이지를 차례로 같은 작업 폴더에 클리핑합니다. 추출은 텍스트의 언어에 좌우되지 않으므로, 둘 다 같은 제목이 같은 순서로 놓인 같은 깔끔한 구조로 나옵니다.

이 점은 일부러 측정했습니다. 유럽 12개국 상위 50개 사이트의 페이지 403개를 각각 브라우저를 그 나라 언어로 설정해 캡처했고, 크래시도 남은 HTML도 없었습니다. 깔끔한 파일 두 개를 정렬하는 것은 작업이지만, 메뉴로 가득한 파일 두 개를 정렬하는 것은 다른, 더 나쁜 작업입니다.

흔한 준비 방식과 비교

준비는 언제나 일어납니다. 문제는 어디서 하느냐입니다. 번역가들이 지금 준비하는 곳과 각각의 비용입니다.

지금 쓰는 방법얻는 것치르는 비용
도구에 복사해 붙여 넣기바로 얻는 텍스트첫 문장 전에 내비게이션 세그먼트 60개, 손으로 잠그거나 삭제
도구 자체의 웹 가져오기 필터URL에서 바로 만드는 프로젝트필터는 사이트마다 작업이 필요하고, 상용구는 대개 필터를 통과함
고객에게 원문 파일 요청맥락이 담긴 진짜 원고늦게 오거나, 아무도 못 여는 CMS 내보내기로 오거나, 아예 오지 않음
HTML로 저장해 정리남길 것을 완전히 통제페이지마다 반복되는 텍스트 편집기 속 한 시간
Clean Web Clipper출처와 날짜가 기록된 원문 `.md` 파일XLIFF, TMX, 세그먼트 분할, 단어 수 없음. 그것은 도구의 몫

가져오기가 깔끔하지 않을 때

도구가 YAML 머리글을 세그먼트로 내놓았습니다

frontmatter는 파일 맨 위의 텍스트이고, YAML 블록을 인식하지 못하는 도구는 그것을 콘텐츠로 취급합니다. 직접 가져올 파일을 클리핑하기 전에 설정에서 frontmatter 필드를 끄거나, 클리핑한 뒤 머리글을 지우세요. 머리글이 있는 사본을 하나 더 보관할 가치가 있습니다. 출처 URL과 날짜가 있는 곳이 그 사본입니다.

내비게이션 세그먼트 60개가 여전히 들어왔습니다

페이지에 기사 본문이 전혀 없을 때 생깁니다. 카테고리 목록, 쇼핑몰 첫 화면, 검색 결과입니다. 그 경우 확장 프로그램은 링크를 돌려주는 대신 “기사 없음”을 알리므로, 가져오기 전에 클립 창에 뭐라고 나왔는지 확인하세요. 기사가 나왔는데 메뉴까지 따라왔다면, 사이트가 내비게이션을 기사 콘텐츠로 마크업한 것이고, 밀도 기반 판단이 꿰뚫어 보지 못하는 유일한 경우입니다.

가져온 뒤 인라인 서식이 이상해 보입니다

Markdown은 강조를 태그가 아니라 문자로 표시하므로, 파일을 일반 텍스트로 가져오는 도구는 bold를 인라인 태그가 아니라 글자 그대로 보여 줍니다. 텍스트가 아니라 Markdown으로 가져오세요. 대부분의 도구에 두 필터가 모두 있고, 같은 파일에서도 전혀 다르게 동작합니다.

마케팅 페이지에서 원고의 절반이 빠졌습니다

마케팅 페이지는 스크롤할 때 렌더링되는 디자인 블록이나, 열었을 때만 텍스트를 넣는 탭과 아코디언으로 만들어진 경우가 많습니다. 브라우저가 렌더링하지 않은 것은 DOM에 없고 캡처할 수 없습니다. 페이지 끝까지 스크롤하고 섹션을 연 뒤 다시 클리핑하거나, 고객에게 원고 문서를 요청하세요. 그런 페이지라면 원고 문서가 어차피 더 나은 원문입니다.

이것이 아닌 것

CAT 도구가 아닙니다. XLIFF도, TMX도, 세그먼트 분할도, 단어 수 계산도 없습니다. 사이트로 되돌리기 위해 페이지의 HTML을 보존하지 않습니다. 출력은 사이트에 다시 병합하는 용도가 아니라 읽고 번역하기 위한 Markdown입니다. 이미지 속 텍스트는 추출하지 않습니다. 그리고 브라우저 설정에 따라 19개 언어 중 하나로 표시되는 인터페이스 언어는 페이지의 언어와 별개입니다. 추출 자체는 텍스트의 언어에 좌우되지 않습니다.

Chrome에 추가 (무료)전부 무료입니다. 계정도, 가입도, 제한도 없습니다.

자주 묻는 질문

인라인 서식이 보존되나요?
네. 굵게, 기울임, 링크, 코드, 목록이 Markdown 표기가 되고, 대부분의 CAT 도구가 이를 인라인 태그로 처리합니다.
어떤 언어의 페이지든 클리핑할 수 있나요?
네. 유럽 12개국 상위 50개 사이트의 페이지 403개를 각각 그 나라 언어로 캡처해 추출을 측정했고, 크래시는 없었으며 추출된 어떤 기사에도 HTML이 남지 않았습니다.
XLIFF로 받을 수 있나요?
아니요. 출력은 Markdown이며, 주요 CAT 도구가 모두 가져올 수 있습니다. 납품 형식으로의 변환은 도구의 몫입니다.
인터페이스가 제 언어를 지원하나요?
아마 그럴 것입니다. 19개 언어로 제공되며 브라우저 설정을 따릅니다. 영어, 러시아어, 독일어, 프랑스어, 스페인어, 이탈리아어, 네덜란드어, 폴란드어, 브라질 포르투갈어, 루마니아어, 스웨덴어, 튀르키예어, 우크라이나어, 체코어, 중국어(간체와 번체), 일본어, 한국어, 베트남어입니다. 추출 자체는 어떤 언어의 페이지에서든 작동합니다.
번역 서비스로 무언가 전송되나요?
아니요. 클립은 업로드되지 않습니다. 클립보드나 디스크로 가고, 그 밖의 어디로도 가지 않습니다.
라틴 문자가 아닌 문자와 오른쪽에서 왼쪽으로 쓰는 텍스트도 처리하나요?
텍스트는 어떤 문자든 페이지가 렌더링한 그대로 한 글자씩 캡처됩니다. 음역, 재배열, 정규화는 없습니다. 추출은 페이지 구조를 기준으로 하고, 구조는 글자가 무엇이든 같습니다.
단어 수를 알려 주나요?
아니요. 세기, 세그먼트 분할, 어떤 분석도 없습니다. 출력은 Markdown 파일입니다. 바뀌는 것은 셀 대상입니다. 도구가 보기 전에 내비게이션을 걷어 내니까요.
YAML 머리글을 완전히 끌 수 있나요?
네. 각 frontmatter 필드(title, source, author, date, extraction)를 전체 또는 사이트별로 하나씩 끌 수 있습니다. 모두 끄면 파일은 원고의 첫 제목으로 시작합니다.
고객의 스테이징 사이트를 클리핑할 수 있나요?
브라우저에 렌더링된다면 됩니다. 기본 인증이나 IP 허용 목록 뒤에 있어도 됩니다. 확장 프로그램은 내 세션이 이미 불러온 페이지를 읽기 때문입니다. 스스로 요청을 보내지 않으므로, 스테이징 사이트에 대해 무엇도 건드리거나 두 번 불러오지 않습니다.
2단 레이아웃이 올바른 순서로 나오나요?
기사 본문은 화면에 보이는 순서가 아니라 문서에 나오는 순서대로 쓰입니다. 본문 옆 사이드바는 본문에 끼어들지 않고 부가 요소로 제거되므로, 원고가 차례대로 읽힙니다. 세그먼트 목록에 필요한 것이 바로 그것이고, 화면 순서대로 캡처하면 얻을 수 없는 것입니다.