Кому это
Чистый исходник для CAT-инструмента
Исходник, вставленный из веб-страницы, тащит за собой всю обвязку, и каждый пункт меню становится сегментом, который надо пропустить. Убрать это до импорта быстрее, чем отфильтровать после. На замеренном корпусе повторы строк меню падают до 102 против 282, 478 и 491 у трёх других движков.
Сегменты, которые не текст
Текст, импортированный с веб-страницы, приходит вместе со всей обвязкой, а CAT-инструмент разницы не видит. «Главная», «Контакты», «Принять все» и название каждой рубрики становятся полноценными сегментами вперемешку с настоящим текстом. На сколько-нибудь структурированном сайте эта доля легко доходит до четверти сегментов, и перед началом работы их приходится блокировать или удалять по одному.
Последствия живут дольше самого импорта. Память перевода наполняется сегментами, которые ничего не стоят, объём в смете завышен с самого начала, а предлагаемые совпадения потом ведут на подписи интерфейса. Чистить постфактум дороже, чем один раз импортировать чистый текст.
Есть и третья статья расходов – теги. Импорт HTML тащит за собой внутреннюю разметку форматирования, и предложение в списке сегментов выглядит как частокол из парных и одиночных тегов, между которыми где-то лежат слова. Половина внимания уходит на то, чтобы теги не рассыпались при перестановке слов, – а перестановка слов при переводе на русский происходит почти в каждом предложении.
Что приезжает в инструмент
- Меню, пагинаторы, плашки и ленты «Читайте также» срезаются до экспорта
- Повторов навигации примерно вчетверо меньше, чем у сравниваемых движков
- Простой Markdown, который умеют импортировать все крупные CAT-инструменты
- Внутристрочное оформление – жирный, курсив, ссылки, код – становится своими эквивалентами Markdown
- Адрес источника едет вместе с текстом, поэтому контекст всегда в одном клике
- Клип выделения позволяет взять в работу один конкретный раздел
- Строки, повторённые по всей странице, схлопываются – одно меню не становится десятью одинаковыми сегментами
- Идущие подряд строки-ссылки убираются пачками от трёх и длиннее, а одиночная ссылка внутри предложения остаётся на месте
--- title: "ИСТОЧНИК, -а, м." source: "https://gramota.ru/poisk?query=источник" extraction: "dom" --- ## ИСТОЧНИК, -а, м. 1. Струя воды, выходящая на поверхность из-под земли; родник, ключ. 2. перен. То, что даёт начало чему-либо, откуда исходит что-либо.
Как готовить исходник к переводу
Весь смысл в том, чтобы решение «что не переводим» принималось до импорта, а не в списке сегментов. Настройка занимает минуту и действует на весь проект.
- В настройках, в разделе «Клик по иконке», выберите «Скачать .md». Исходник почти всегда идёт в файл, а не в буфер, и лишний шаг с окном на объёме в тридцать страниц ощутим.
- Впишите шаблон имени
{domain}-{title}и подпапку с названием проекта. В одном заказе бывает по десять страниц с одного сайта, и заголовки у них похожи до неразличимости. - Переключите картинки в режим «пропускать». Ссылки на изображения превращаются в сегменты с адресами, которые не переводятся, но которые всё равно приходится пропускать по одному.
- Убедитесь, что «Срезать навигацию, пагинаторы и служебные секции» включено. Это тот самый выигрыш: на замеренном корпусе повторов строк меню осталось 102 против 282, 478 и 491 у трёх сравниваемых движков.
- На странице-исходнике нажмите иконку. Если в работу идёт один раздел, выделите его до нажатия – к выделению не применяется ни срезка, ни отказ «статьи нет», поэтому взять кусок с середины можно всегда.
- Перед сохранением пролистайте вид «Просмотр» и убедитесь, что ни один навигационный блок не уцелел. Потом импортируйте
.mdв свой инструмент как обычный текстовый файл – сегментацию он сделает сам, расширение в неё не вмешивается.
Готовые настройки для подготовки исходников
Значения ниже уменьшают одно число – количество сегментов, которые придётся пропустить вручную. Всё остальное в них следствие.
| Настройка | Значение | Почему именно так |
|---|---|---|
| Клик по иконке | Скачать .md | исходник идёт в файл для импорта, а не в буфер; на тридцати страницах лишний шаг заметен |
| Имя файла | `{domain}-{title}` | в одном заказе бывает десять страниц одного сайта с почти одинаковыми заголовками |
| Картинки | пропускать | ссылка на изображение становится сегментом с адресом, который не переводят, но пропускают руками |
| Срезать навигацию | включено | это и есть основной выигрыш: повторы строк меню падают до 102 против 282, 478 и 491 |
| Сноски | выносить в конец заметки | маркер посреди фразы разрывает сегмент; в конце файла определения идут отдельными сегментами |
| Если есть выделение – клипать выделение | включено | в работу нередко идёт один раздел большой страницы, а не вся она |
| Свойства | `title`, `source` | адрес источника – это контекст, к которому возвращаются при спорном термине, и он всегда в первых строках |
--- title: "Правописание н и нн в суффиксах" source: "https://gramota.ru/spravka/pravila/n-nn" extraction: "dom" --- ## Одна буква н - в отглагольных прилагательных без приставки: *варёный*, *копчёный*; - в кратких формах страдательных причастий: *задача решена*. ## Две буквы н - в причастиях с приставкой: *сваренный*, *прочитанный*; - в прилагательных с суффиксами `-енн-` и `-онн-`.
Три сценария целиком
Сайт клиента на перевод
Заказ – тридцать страниц корпоративного сайта, доступа к системе управления содержимым нет, выгрузку никто не даст. Вы обходите страницы по списку и на каждой жмёте Alt+Shift+M: одна страница за раз, краулера и пакетной обработки здесь нет.
В папке проекта тридцать файлов, названных по домену и заголовку. Меню, подвал и плашка про куки в них не попали, повторяющиеся строки схлопнулись, и после импорта список сегментов начинается с текста, а не с «Главная – О компании – Контакты».
Один раздел большой справки
Из справочного центра клиента нужен только раздел про возвраты – остальное уже переведено. Вы выделяете раздел на странице и клипаете выделение: расширение ничего от него не отрезает, потому что фрагмент выбрал человек.
Внутристрочное оформление доезжает своими эквивалентами Markdown: жирный, курсив, ссылки и код становятся тем, что большинство инструментов разбирает как внутристрочные теги. Их немного, они парные и предсказуемые – в отличие от разметки, которая приезжает при прямом импорте HTML.
Двуязычная страница
На странице две колонки: слева оригинал, справа существующий перевод. Содержимое берётся в порядке документа, а колоночная вёрстка – это сетка позиционирования, и она разворачивается.
Поэтому версии в файле идут одна за другой, а не друг напротив друга. Выравнивать пары расширение не умеет и не пытается: это работа вашего инструмента выравнивания, а на вход ему нужен чистый текст – как раз то, что получилось.
Чем это заменяет привычные способы
Веб-страницу заводят в работу пятью способами. Разница между ними измеряется не удобством, а числом сегментов, которые придётся пропустить руками.
| Способ | Что получается | Чего стоит |
|---|---|---|
| Импорт HTML прямо в инструмент | ничего не надо делать заранее | меню и подвал становятся сегментами, а предложения тонут в частоколе внутренних тегов |
| Скопировать в текстовый документ | разметка исчезает вместе с мусором | исчезает и нужная: жирный, курсив и ссылки приходится восстанавливать по оригиналу |
| Сохранить страницу целиком | сохраняется всё, включая скрипты | к импорту это не приближает: тот же HTML со всей обвязкой, только теперь на диске |
| Онлайн-конвертер HTML в текст | быстро и без установки | страницу за логином он не увидит, а обвязку убирает по общим правилам, без разбора структуры |
| Перепечатать исходник вручную | полный контроль над сегментами | часы на объём, который читается за двадцать минут |
| Clean Clipper | чистые сегменты и внутристрочные теги, которые не рассыпаются | ни XLIFF, ни TMX на выходе; сегментацию, выравнивание и подсчёт объёма он на себя не берёт |
Если сегменты вышли не такими
Почему в списке сегментов всё ещё есть пункты меню?
Проверьте, включена ли срезка навигации, и не клипали ли вы выделение: к выделенному фрагменту срезка не применяется вовсе, потому что человек выбрал его сам.
Отдельный случай – одиночная ссылка в предложении: она остаётся намеренно. Убираются только идущие подряд строки-ссылки, начиная с трёх, – это и есть форма, в которой на странице живёт навигация.
Почему языковые версии идут подряд, а не параллельно?
Потому что содержимое берётся в порядке документа, а две колонки – это сетка позиционирования. Такая сетка разворачивается, иначе в Markdown она уехала бы сырым HTML. Выравнивать пары расширение не умеет: это работа инструмента выравнивания, которому как раз и нужен чистый текст на входе.
Почему часть текста не попала в файл?
Скорее всего, она догружалась при прокрутке или лежала под кнопкой «показать ещё». Берётся то, что отрисовано в момент нажатия. Долистайте страницу до конца, раскройте свёрнутое и нажмите «Склипать заново» – окно закрывать не нужно.
Почему инструмент не принимает файл?
Потому что на выходе Markdown, а не обменный формат. Инструменты, которые принимают текст или Markdown, импортируют файл напрямую; остальным нужна конвертация в их формат. Ни XLIFF, ни TMX расширение не отдаёт – оно готовит исходник, и на этом его роль кончается.
Чего он не делает
Он ничего не переводит и не выравнивает пары языков: он готовит исходник, и на этом всё. Он не отдаёт ни XLIFF, ни TMX, ни другой обменный формат – на выходе Markdown. Он не сегментирует текст, это остаётся работой вашего инструмента. И он снимает по одной странице за раз, ту, что перед вами: ни краулера, ни пакетной обработки здесь нет.