Кому це ·
Чистий вихідний текст для CAT-програми
Вихідний текст, вставлений із вебсторінки, тягне за собою навігацію, і кожен пункт меню стає сегментом, який доводиться пропускати, рахувати в обсязі й зрештою пояснювати в рахунку. Clean Web Clipper прибирає це ще до того, як файл потрапить у вашу програму.
Звідки ці числа: сторінка заміру з версіями рушіїв і датами
Сегменти, які не є текстом
Імпортуєте сторінку – а проєкт відкривається шістдесятьма сегментами ще до першого речення самого тексту: «Перейти до вмісту», «Увійти», дев’ять категорій товарів, повідомлення про cookie й перемикач мов на тридцять пунктів. Перекладати тут нічого, але все це є у файлі, у підрахунку слів, і його доводиться блокувати чи видаляти по одному сегменту.
Далі – повтори. Той самий блок меню з’являється в кожному розділі й ще раз у підвалі, тож пам’ять перекладів, наповнена з такого файлу, починає пропонувати «Читайте також» як збіг для справжніх речень. Очистити вихідний текст до імпорту – справа секунд. Очистити пам’ять перекладів потім – ні.
Клопіт починається ще до замовлення. Вас просять оцінити «цю сторінку», і названа сума повністю залежить від того, що ви рахували: підрахунок із сирої сторінки включає меню, а підрахунок після очищення – ні, і цю розмову нікому не хочеться вести двічі. А потім клієнт редагує сторінку, поки ви над нею працюєте. Файл, збережений у день оцінки, з адресою та власною датою сторінки в шапці, закриває обидва питання – і нікому не треба пригадувати, якою сторінка була.
Що доходить до списку сегментів
- Меню, пагінатори, банери згоди й стрічки «читайте також» зрізаються ще до появи файлу.
- Дубльованої навігації приблизно вчетверо менше, ніж у порівнюваних рушіїв: 102 повторені рядки проти 282, 478 і 491.
- Жодного вцілілого тега HTML у видобутих статтях на 512 протестованих сторінках, тож жоден уламок розмітки не стане внутрішнім тегом.
- Форматування в рядку стає Markdown – жирний, курсив, посилання, код і списки, які імпортує кожна велика CAT-програма.
- Адреса джерела їде у frontmatter, тож контекст сегмента завжди за один клік.
- Протестовано на 403 сторінках популярних сайтів дванадцяти європейських країн, кожну збережено мовою її країни: жодного падіння.
- Заголовки, списки й цитати зберігають свій рівень, тож структуру, яку має повторити переклад, видно у вихідному файлі, а не доводиться відтворювати із сегментів.
titleіdateберуться з метаданих самої сторінки, тож тека замовлення фіксує, за якою версією оригіналу ви давали оцінку.
## Як працює система сповіщення Сигнал надходить від оператора до серверів провайдерів, а вже вони розсилають його на застосунки. Затримка між командою і сповіщенням на телефоні – від двох до п’яти секунд. Оператор може надіслати сигнал на окрему область або на кілька районів окремо.
Як підготувати вихідний файл
Мета – файл, який відкривається у вашій програмі так, що перший сегмент – це перше речення тексту. Більшість роботи роблять два налаштування, і одне з них легко виставити неправильно.
- Відкрийте Налаштування розширення з іконки й вкажіть теку, де живе замовлення, –
jobs/клієнт/source. Вихідний файл належить до замовлення, а не до загальної теки збережених сторінок. - У пункті Клік по іконці оберіть «Завантажити .md» або «Покласти в теку» – як вам зручніше працювати з файлами. В обох випадках на руках файл для імпорту, а не буфер обміну, який ще треба кудись вставити.
- У полі Ім’я файлу поставте
{date}-{domain}-{title}. Саме на дату збереження ви вкажете, коли сторінка клієнта зміниться після вашої оцінки. - Вимкніть властивості frontmatter, якщо імпортуєте файл напряму. Заголовок YAML – теж текст, і програма, яка його не розпізнає, охоче запропонує перекласти
extraction: "dom"як сегмент. - Зображенням поставте «пропускати». Посилання на картинку в Markdown стає або сегментом, або внутрішнім тегом, який доведеться нести через увесь файл, – заради зображення, що не є частиною тексту.
- Коли в роботі лише один розділ, виділіть його на сторінці й збережіть виділене. Оцінити розділ, а здати всю сторінку – непорозуміння, яке починається саме в мить збереження.
- Збережіть сторінку в день оцінки й не видаляйте файл. Це єдиний запис того, яким був оригінал, коли погоджували ціну.
Налаштування для вихідного файлу
Найчастіше спотикаються на рядку про frontmatter. Решта потрібна для того, щоб у списку сегментів лишався тільки справжній текст.
| Налаштування | Значення | Чому саме так |
|---|---|---|
| Клік по іконці | Завантажити .md | Потрібен файл для імпорту, а не буфер обміну для вставлення |
| Властивості | Усі вимкнено для прямого імпорту | Заголовок YAML – це текст; програма, що його не пропускає, запропонує його сегментами |
| Зображення | Пропускати | Посилання на картинку стає сегментом чи внутрішнім тегом для того, що не є текстом |
| Ім’я файлу | {date}-{domain}-{title} | Фіксує, за якою версією сторінки клієнта давали оцінку |
| Тека | Тека замовлення | Оригінал належить до замовлення і лишається там, коли сторінка зміниться |
| Виділене | Зберігати розділ, який у роботі | Розповзання обсягу часто починається зі збереження цілої сторінки |
| Правило за сайтом | Домен клієнта → підтека замовлення, зображення пропускати | Для постійних клієнтів не треба щоразу ухвалювати рішення |
**Базовий тариф** містить *до п’яти* робочих місць. Додаткові місця оплачуються щомісяця; див. [сторінку тарифів](https://example.com/uk/taryfy) або задайте `SEATS` у файлі конфігурації. - Місце можна передати іншому користувачеві раз на розрахунковий період. - Невикористані місця на наступний період не переносяться. Чотири внутрішні теги в одному реченні: жирний, курсив, посилання й код. Кожен має відповідник у Markdown, який CAT-програма імпортує як внутрішній тег.
Три замовлення
Оцінка за текстом, а не за обв’язкою
Клієнт надсилає адресу й питає ціну. Ви зберігаєте сторінку – меню, перемикач мов на тридцять пунктів, повідомлення про згоду й підвал зникають ще до появи файлу, тож обсяг, який ви називаєте, – це обсяг тексту, що справді потребує перекладу.
Виміряний бік цього – дубльована навігація: 102 повторені рядки на корпусі зі 109 сторінок проти 282, 478 і 491 у порівнюваних рушіїв. На сторінці, де меню повторюється в кожному розділі, це майже вся різниця між двома оцінками того самого замовлення.
Сторінка, яка змінилася посеред роботи
На третій день клієнт згадує, що маркетинг «трохи дещо підправив». Ви зберігаєте сторінку ще раз; другий файл отримує числовий суфікс, і порівняння з файлом, за яким давали оцінку, показує два нові абзаци й змінений заголовок.
Тепер це розмова про обсяг із документом на столі, а не суперечка про те, хто що пам’ятає. Дата збереження в імені кожного файлу каже, котрий із них котрий, а поле date – що сторінка заявляла про себе кожного разу.
Двомовний довідник із живого сайту
Сайт клієнта вже існує німецькою. Ви зберігаєте англійську сторінку й німецьку, одну за одною, в ту саму теку замовлення. Видобування не залежить від мови тексту, тож обидві виходять однаково чистою структурою – ті самі заголовки в тому самому порядку.
Це перевіряли навмисно: 403 сторінки популярних сайтів дванадцяти європейських країн, кожну збережено з браузером, налаштованим на мову цієї країни, – жодного падіння й жодного вцілілого HTML. Вирівняти два чисті файли – робота; вирівняти два файли, повні меню, – інша й значно гірша робота.
Проти звичної підготовки
Підготовка буває завжди; питання лише в тому, де саме. Ось де перекладачі роблять її зараз і чого кожен спосіб коштує.
| Як роблять зараз | Що виходить | Чого це коштує |
|---|---|---|
| Скопіювати й вставити в програму | Текст, одразу | Шістдесят сегментів навігації до першого речення, заблокованих чи видалених вручну |
| Власний фільтр вебімпорту вашої програми | Проєкт просто з адреси | Фільтри налаштовують під кожен сайт окремо, а обв’язка зазвичай їх переживає |
| Попросити в клієнта вихідний файл | Справжній текст, у контексті | Приходить із запізненням, або вивантаженням із CMS, яке ніхто не відкриє, або не приходить зовсім |
| Зберегти сторінку як HTML і почистити | Повний контроль над тим, що лишається | Година в текстовому редакторі – і так для кожної сторінки |
| Clean Web Clipper | Файл .md із текстом, джерелом і датою | Без XLIFF, без TMX, без сегментації й підрахунку слів. Це лишається за вашою програмою |
Коли імпорт вийшов не чистим
Чому програма запропонувала заголовок YAML як сегменти?
Frontmatter – це текст на початку файлу, і програма, яка не розпізнає блок YAML, вважає його вмістом. Перед збереженням файлу для прямого імпорту вимкніть властивості в налаштуваннях або видаліть шапку після збереження. Другу копію з шапкою варто лишити – саме в ній живуть адреса джерела й дата.
Чому шістдесят сегментів навігації однаково пройшли?
Так буває, коли тіла статті на сторінці немає взагалі – список категорій, вітрина магазину, результати пошуку. У такому разі розширення повідомляє «статті немає», а не віддає посилання, тож перед імпортом гляньте, що сказало вікно. Якщо ж воно віддало статтю, а меню приїхало разом із нею, значить, сайт розмітив свою навігацію як вміст статті – це єдиний випадок, крізь який евристика щільності не бачить.
Чому після імпорту форматування в рядку виглядає неправильно?
Markdown позначає виділення символами, а не тегами, тож програма, яка імпортує файл як звичайний текст, покаже жирний буквально, а не внутрішнім тегом. Імпортуйте його як Markdown, а не як текст: у більшості програм є обидва фільтри, і на тому самому файлі вони поводяться зовсім по-різному.
Чому з маркетингової сторінки зникла половина тексту?
Маркетингові сторінки часто збирають із дизайнерських блоків, які відмальовуються під час прокручування, або з вкладок і акордеонів, що вставляють текст лише після відкриття. Те, чого браузер не відмалював, у DOM немає, і зберегти його неможливо. Прокрутіть сторінку до кінця, розкрийте розділи й збережіть знову – або попросіть у клієнта файл із текстами, який для такої сторінки однаково кращий оригінал.
Чим воно не є
Це не CAT-програма: жодного XLIFF, TMX, сегментації чи підрахунку слів. HTML сторінки для зворотного перенесення воно не зберігає. На виході Markdown, призначений для читання й перекладу, а не для злиття назад у сайт. Текст усередині зображень не видобувається. А мова інтерфейсу – одна з 19, за налаштуванням браузера, – не пов’язана з мовою сторінки: саме видобування від мови тексту не залежить.