Clean Clipper Установить – бесплатно

Кому это

Чистый исходник для CAT-инструмента

Исходник, вставленный из веб-страницы, тащит за собой всю обвязку, и каждый пункт меню становится сегментом, который надо пропустить. Убрать это до импорта быстрее, чем отфильтровать после. На замеренном корпусе повторы строк меню падают до 102 против 282, 478 и 491 у трёх других движков.

Сегменты, которые не текст

Текст, импортированный с веб-страницы, приходит вместе со всей обвязкой, а CAT-инструмент разницы не видит. «Главная», «Контакты», «Принять все» и название каждой рубрики становятся полноценными сегментами вперемешку с настоящим текстом. На сколько-нибудь структурированном сайте эта доля легко доходит до четверти сегментов, и перед началом работы их приходится блокировать или удалять по одному.

Последствия живут дольше самого импорта. Память перевода наполняется сегментами, которые ничего не стоят, объём в смете завышен с самого начала, а предлагаемые совпадения потом ведут на подписи интерфейса. Чистить постфактум дороже, чем один раз импортировать чистый текст.

Есть и третья статья расходов – теги. Импорт HTML тащит за собой внутреннюю разметку форматирования, и предложение в списке сегментов выглядит как частокол из парных и одиночных тегов, между которыми где-то лежат слова. Половина внимания уходит на то, чтобы теги не рассыпались при перестановке слов, – а перестановка слов при переводе на русский происходит почти в каждом предложении.

Что приезжает в инструмент

Чистые сегменты, ни одного пункта менюgramota.ru
---
title: "ИСТОЧНИК, -а, м."
source: "https://gramota.ru/poisk?query=источник"
extraction: "dom"
---

## ИСТОЧНИК, -а, м.

1. Струя воды, выходящая на поверхность из-под земли; родник, ключ.

2. перен. То, что даёт начало чему-либо, откуда исходит что-либо.

Как готовить исходник к переводу

Весь смысл в том, чтобы решение «что не переводим» принималось до импорта, а не в списке сегментов. Настройка занимает минуту и действует на весь проект.

  1. В настройках, в разделе «Клик по иконке», выберите «Скачать .md». Исходник почти всегда идёт в файл, а не в буфер, и лишний шаг с окном на объёме в тридцать страниц ощутим.
  2. Впишите шаблон имени {domain}-{title} и подпапку с названием проекта. В одном заказе бывает по десять страниц с одного сайта, и заголовки у них похожи до неразличимости.
  3. Переключите картинки в режим «пропускать». Ссылки на изображения превращаются в сегменты с адресами, которые не переводятся, но которые всё равно приходится пропускать по одному.
  4. Убедитесь, что «Срезать навигацию, пагинаторы и служебные секции» включено. Это тот самый выигрыш: на замеренном корпусе повторов строк меню осталось 102 против 282, 478 и 491 у трёх сравниваемых движков.
  5. На странице-исходнике нажмите иконку. Если в работу идёт один раздел, выделите его до нажатия – к выделению не применяется ни срезка, ни отказ «статьи нет», поэтому взять кусок с середины можно всегда.
  6. Перед сохранением пролистайте вид «Просмотр» и убедитесь, что ни один навигационный блок не уцелел. Потом импортируйте .md в свой инструмент как обычный текстовый файл – сегментацию он сделает сам, расширение в неё не вмешивается.

Готовые настройки для подготовки исходников

Значения ниже уменьшают одно число – количество сегментов, которые придётся пропустить вручную. Всё остальное в них следствие.

НастройкаЗначениеПочему именно так
Клик по иконкеСкачать .mdисходник идёт в файл для импорта, а не в буфер; на тридцати страницах лишний шаг заметен
Имя файла`{domain}-{title}`в одном заказе бывает десять страниц одного сайта с почти одинаковыми заголовками
Картинкипропускатьссылка на изображение становится сегментом с адресом, который не переводят, но пропускают руками
Срезать навигациювключеноэто и есть основной выигрыш: повторы строк меню падают до 102 против 282, 478 и 491
Сноскивыносить в конец заметкимаркер посреди фразы разрывает сегмент; в конце файла определения идут отдельными сегментами
Если есть выделение – клипать выделениевключенов работу нередко идёт один раздел большой страницы, а не вся она
Свойства`title`, `source`адрес источника – это контекст, к которому возвращаются при спорном термине, и он всегда в первых строках
Сложный случай: курсив внутри пунктов списка остался курсивом – в инструменте это внутристрочный тег, а не мусорgramota.ru/spravka
---
title: "Правописание н и нн в суффиксах"
source: "https://gramota.ru/spravka/pravila/n-nn"
extraction: "dom"
---

## Одна буква н

- в отглагольных прилагательных без приставки: *варёный*, *копчёный*;
- в кратких формах страдательных причастий: *задача решена*.

## Две буквы н

- в причастиях с приставкой: *сваренный*, *прочитанный*;
- в прилагательных с суффиксами `-енн-` и `-онн-`.

Три сценария целиком

Сайт клиента на перевод

Заказ – тридцать страниц корпоративного сайта, доступа к системе управления содержимым нет, выгрузку никто не даст. Вы обходите страницы по списку и на каждой жмёте Alt+Shift+M: одна страница за раз, краулера и пакетной обработки здесь нет.

В папке проекта тридцать файлов, названных по домену и заголовку. Меню, подвал и плашка про куки в них не попали, повторяющиеся строки схлопнулись, и после импорта список сегментов начинается с текста, а не с «Главная – О компании – Контакты».

Один раздел большой справки

Из справочного центра клиента нужен только раздел про возвраты – остальное уже переведено. Вы выделяете раздел на странице и клипаете выделение: расширение ничего от него не отрезает, потому что фрагмент выбрал человек.

Внутристрочное оформление доезжает своими эквивалентами Markdown: жирный, курсив, ссылки и код становятся тем, что большинство инструментов разбирает как внутристрочные теги. Их немного, они парные и предсказуемые – в отличие от разметки, которая приезжает при прямом импорте HTML.

Двуязычная страница

На странице две колонки: слева оригинал, справа существующий перевод. Содержимое берётся в порядке документа, а колоночная вёрстка – это сетка позиционирования, и она разворачивается.

Поэтому версии в файле идут одна за другой, а не друг напротив друга. Выравнивать пары расширение не умеет и не пытается: это работа вашего инструмента выравнивания, а на вход ему нужен чистый текст – как раз то, что получилось.

Чем это заменяет привычные способы

Веб-страницу заводят в работу пятью способами. Разница между ними измеряется не удобством, а числом сегментов, которые придётся пропустить руками.

СпособЧто получаетсяЧего стоит
Импорт HTML прямо в инструментничего не надо делать заранееменю и подвал становятся сегментами, а предложения тонут в частоколе внутренних тегов
Скопировать в текстовый документразметка исчезает вместе с мусоромисчезает и нужная: жирный, курсив и ссылки приходится восстанавливать по оригиналу
Сохранить страницу целикомсохраняется всё, включая скриптык импорту это не приближает: тот же HTML со всей обвязкой, только теперь на диске
Онлайн-конвертер HTML в текстбыстро и без установкистраницу за логином он не увидит, а обвязку убирает по общим правилам, без разбора структуры
Перепечатать исходник вручнуюполный контроль над сегментамичасы на объём, который читается за двадцать минут
Clean Clipperчистые сегменты и внутристрочные теги, которые не рассыпаютсяни XLIFF, ни TMX на выходе; сегментацию, выравнивание и подсчёт объёма он на себя не берёт

Если сегменты вышли не такими

Почему в списке сегментов всё ещё есть пункты меню?

Проверьте, включена ли срезка навигации, и не клипали ли вы выделение: к выделенному фрагменту срезка не применяется вовсе, потому что человек выбрал его сам.

Отдельный случай – одиночная ссылка в предложении: она остаётся намеренно. Убираются только идущие подряд строки-ссылки, начиная с трёх, – это и есть форма, в которой на странице живёт навигация.

Почему языковые версии идут подряд, а не параллельно?

Потому что содержимое берётся в порядке документа, а две колонки – это сетка позиционирования. Такая сетка разворачивается, иначе в Markdown она уехала бы сырым HTML. Выравнивать пары расширение не умеет: это работа инструмента выравнивания, которому как раз и нужен чистый текст на входе.

Почему часть текста не попала в файл?

Скорее всего, она догружалась при прокрутке или лежала под кнопкой «показать ещё». Берётся то, что отрисовано в момент нажатия. Долистайте страницу до конца, раскройте свёрнутое и нажмите «Склипать заново» – окно закрывать не нужно.

Почему инструмент не принимает файл?

Потому что на выходе Markdown, а не обменный формат. Инструменты, которые принимают текст или Markdown, импортируют файл напрямую; остальным нужна конвертация в их формат. Ни XLIFF, ни TMX расширение не отдаёт – оно готовит исходник, и на этом его роль кончается.

Чего он не делает

Он ничего не переводит и не выравнивает пары языков: он готовит исходник, и на этом всё. Он не отдаёт ни XLIFF, ни TMX, ни другой обменный формат – на выходе Markdown. Он не сегментирует текст, это остаётся работой вашего инструмента. И он снимает по одной странице за раз, ту, что перед вами: ни краулера, ни пакетной обработки здесь нет.

Установить – бесплатноБесплатно целиком, без аккаунта и без ограничений.

Вопросы

Сохраняется ли внутристрочное оформление?
Да. Жирный, курсив, ссылки, код и списки становятся своими эквивалентами Markdown, которые большинство CAT-инструментов обрабатывает как внутристрочные теги.
Работает ли он со страницами на любом языке?
Да. Извлечение замерено на 403 страницах из топ-50 сайтов двенадцати европейских стран плюс сотня самых посещаемых сайтов мира и Рунета – без единого сбоя.
Есть ли интерфейс на моём языке?
Расширение переведено на четырнадцать языков и следует настройке браузера.
Можно ли импортировать прямо в мой CAT-инструмент?
Зависит от инструмента. Файл – обычный Markdown: те, что принимают текст или Markdown, импортируют его без промежуточного шага, остальным нужна конвертация.
А двуязычные страницы и страницы в две колонки?
Содержимое берётся в порядке документа. Колоночная вёрстка – это сетка позиционирования, она разворачивается, поэтому версии идут одна за другой, а не друг напротив друга.
Сколько навигации остаётся в исходнике?
Немного, и это измерено: на корпусе из 109 страниц повторов строк меню осталось 102 против 282, 478 и 491 у трёх сравниваемых движков. Ноль обещать нечестно – на нестандартной вёрстке отдельные строки проходят.
Что происходит с альтернативным текстом картинок?
В режиме «оставлять ссылками» он сохраняется вместе с ссылкой и становится сегментом, который можно перевести. В режиме «пропускать» изображение исчезает целиком, вместе с подписью.
Считает ли он объём в словах или знаках?
Нет, это работа вашего инструмента. Расширение показывает в окне только длину клипа в символах – как ориентир, а не как основание для сметы.
Надо ли переводить шапку файла?
Нет. Фронтматтер между строками из трёх дефисов – служебные метаданные, а не текст. Их либо исключают из перевода в настройках инструмента, либо просто удаляют из файла перед импортом: это обычный текст.
Что делать, если проект требует XLIFF?
Конвертировать. Расширение отдаёт Markdown и обменных форматов не строит – но Markdown принимает почти любой конвертер, а часть инструментов импортирует его напрямую и сама создаёт двуязычный файл.