Clean Web Clipper Додати в Chrome – безкоштовно

Кому це ·

Чистий вихідний текст для CAT-програми

Вихідний текст, вставлений із вебсторінки, тягне за собою навігацію, і кожен пункт меню стає сегментом, який доводиться пропускати, рахувати в обсязі й зрештою пояснювати в рахунку. Clean Web Clipper прибирає це ще до того, як файл потрапить у вашу програму.

Звідки ці числа: сторінка заміру з версіями рушіїв і датами

Сегменти, які не є текстом

Імпортуєте сторінку – а проєкт відкривається шістдесятьма сегментами ще до першого речення самого тексту: «Перейти до вмісту», «Увійти», дев’ять категорій товарів, повідомлення про cookie й перемикач мов на тридцять пунктів. Перекладати тут нічого, але все це є у файлі, у підрахунку слів, і його доводиться блокувати чи видаляти по одному сегменту.

Далі – повтори. Той самий блок меню з’являється в кожному розділі й ще раз у підвалі, тож пам’ять перекладів, наповнена з такого файлу, починає пропонувати «Читайте також» як збіг для справжніх речень. Очистити вихідний текст до імпорту – справа секунд. Очистити пам’ять перекладів потім – ні.

Клопіт починається ще до замовлення. Вас просять оцінити «цю сторінку», і названа сума повністю залежить від того, що ви рахували: підрахунок із сирої сторінки включає меню, а підрахунок після очищення – ні, і цю розмову нікому не хочеться вести двічі. А потім клієнт редагує сторінку, поки ви над нею працюєте. Файл, збережений у день оцінки, з адресою та власною датою сторінки в шапці, закриває обидва питання – і нікому не треба пригадувати, якою сторінка була.

Додати в Chrome – безкоштовноБезкоштовно повністю, без акаунта.For Chrome on a computer

Що доходить до списку сегментів

Перший сегмент – це вже текст статтіsuspilne.media/news/systema-spovishchennia
## Як працює система сповіщення

Сигнал надходить від оператора до серверів провайдерів, а вже вони розсилають
його на застосунки. Затримка між командою і сповіщенням на телефоні –
від двох до п’яти секунд.

Оператор може надіслати сигнал на окрему область або на кілька районів окремо.

Як підготувати вихідний файл

Мета – файл, який відкривається у вашій програмі так, що перший сегмент – це перше речення тексту. Більшість роботи роблять два налаштування, і одне з них легко виставити неправильно.

  1. Відкрийте Налаштування розширення з іконки й вкажіть теку, де живе замовлення, – jobs/клієнт/source. Вихідний файл належить до замовлення, а не до загальної теки збережених сторінок.
  2. У пункті Клік по іконці оберіть «Завантажити .md» або «Покласти в теку» – як вам зручніше працювати з файлами. В обох випадках на руках файл для імпорту, а не буфер обміну, який ще треба кудись вставити.
  3. У полі Ім’я файлу поставте {date}-{domain}-{title}. Саме на дату збереження ви вкажете, коли сторінка клієнта зміниться після вашої оцінки.
  4. Вимкніть властивості frontmatter, якщо імпортуєте файл напряму. Заголовок YAML – теж текст, і програма, яка його не розпізнає, охоче запропонує перекласти extraction: "dom" як сегмент.
  5. Зображенням поставте «пропускати». Посилання на картинку в Markdown стає або сегментом, або внутрішнім тегом, який доведеться нести через увесь файл, – заради зображення, що не є частиною тексту.
  6. Коли в роботі лише один розділ, виділіть його на сторінці й збережіть виділене. Оцінити розділ, а здати всю сторінку – непорозуміння, яке починається саме в мить збереження.
  7. Збережіть сторінку в день оцінки й не видаляйте файл. Це єдиний запис того, яким був оригінал, коли погоджували ціну.

Налаштування для вихідного файлу

Найчастіше спотикаються на рядку про frontmatter. Решта потрібна для того, щоб у списку сегментів лишався тільки справжній текст.

НалаштуванняЗначенняЧому саме так
Клік по іконціЗавантажити .mdПотрібен файл для імпорту, а не буфер обміну для вставлення
ВластивостіУсі вимкнено для прямого імпортуЗаголовок YAML – це текст; програма, що його не пропускає, запропонує його сегментами
ЗображенняПропускатиПосилання на картинку стає сегментом чи внутрішнім тегом для того, що не є текстом
Ім’я файлу{date}-{domain}-{title}Фіксує, за якою версією сторінки клієнта давали оцінку
ТекаТека замовленняОригінал належить до замовлення і лишається там, коли сторінка зміниться
ВиділенеЗберігати розділ, який у роботіРозповзання обсягу часто починається зі збереження цілої сторінки
Правило за сайтомДомен клієнта → підтека замовлення, зображення пропускатиДля постійних клієнтів не треба щоразу ухвалювати рішення
Форматування в рядку перетворено, а не викинутоабзац зі сторінки тарифів
**Базовий тариф** містить *до п’яти* робочих місць. Додаткові місця
оплачуються щомісяця; див. [сторінку тарифів](https://example.com/uk/taryfy) або
задайте `SEATS` у файлі конфігурації.

- Місце можна передати іншому користувачеві раз на розрахунковий період.
- Невикористані місця на наступний період не переносяться.

Чотири внутрішні теги в одному реченні: жирний, курсив, посилання й код.
Кожен має відповідник у Markdown, який CAT-програма імпортує як внутрішній тег.

Три замовлення

Оцінка за текстом, а не за обв’язкою

Клієнт надсилає адресу й питає ціну. Ви зберігаєте сторінку – меню, перемикач мов на тридцять пунктів, повідомлення про згоду й підвал зникають ще до появи файлу, тож обсяг, який ви називаєте, – це обсяг тексту, що справді потребує перекладу.

Виміряний бік цього – дубльована навігація: 102 повторені рядки на корпусі зі 109 сторінок проти 282, 478 і 491 у порівнюваних рушіїв. На сторінці, де меню повторюється в кожному розділі, це майже вся різниця між двома оцінками того самого замовлення.

Сторінка, яка змінилася посеред роботи

На третій день клієнт згадує, що маркетинг «трохи дещо підправив». Ви зберігаєте сторінку ще раз; другий файл отримує числовий суфікс, і порівняння з файлом, за яким давали оцінку, показує два нові абзаци й змінений заголовок.

Тепер це розмова про обсяг із документом на столі, а не суперечка про те, хто що пам’ятає. Дата збереження в імені кожного файлу каже, котрий із них котрий, а поле date – що сторінка заявляла про себе кожного разу.

Двомовний довідник із живого сайту

Сайт клієнта вже існує німецькою. Ви зберігаєте англійську сторінку й німецьку, одну за одною, в ту саму теку замовлення. Видобування не залежить від мови тексту, тож обидві виходять однаково чистою структурою – ті самі заголовки в тому самому порядку.

Це перевіряли навмисно: 403 сторінки популярних сайтів дванадцяти європейських країн, кожну збережено з браузером, налаштованим на мову цієї країни, – жодного падіння й жодного вцілілого HTML. Вирівняти два чисті файли – робота; вирівняти два файли, повні меню, – інша й значно гірша робота.

Проти звичної підготовки

Підготовка буває завжди; питання лише в тому, де саме. Ось де перекладачі роблять її зараз і чого кожен спосіб коштує.

Як роблять заразЩо виходитьЧого це коштує
Скопіювати й вставити в програмуТекст, одразуШістдесят сегментів навігації до першого речення, заблокованих чи видалених вручну
Власний фільтр вебімпорту вашої програмиПроєкт просто з адресиФільтри налаштовують під кожен сайт окремо, а обв’язка зазвичай їх переживає
Попросити в клієнта вихідний файлСправжній текст, у контекстіПриходить із запізненням, або вивантаженням із CMS, яке ніхто не відкриє, або не приходить зовсім
Зберегти сторінку як HTML і почиститиПовний контроль над тим, що лишаєтьсяГодина в текстовому редакторі – і так для кожної сторінки
Clean Web ClipperФайл .md із текстом, джерелом і датоюБез XLIFF, без TMX, без сегментації й підрахунку слів. Це лишається за вашою програмою

Коли імпорт вийшов не чистим

Чому програма запропонувала заголовок YAML як сегменти?

Frontmatter – це текст на початку файлу, і програма, яка не розпізнає блок YAML, вважає його вмістом. Перед збереженням файлу для прямого імпорту вимкніть властивості в налаштуваннях або видаліть шапку після збереження. Другу копію з шапкою варто лишити – саме в ній живуть адреса джерела й дата.

Чому шістдесят сегментів навігації однаково пройшли?

Так буває, коли тіла статті на сторінці немає взагалі – список категорій, вітрина магазину, результати пошуку. У такому разі розширення повідомляє «статті немає», а не віддає посилання, тож перед імпортом гляньте, що сказало вікно. Якщо ж воно віддало статтю, а меню приїхало разом із нею, значить, сайт розмітив свою навігацію як вміст статті – це єдиний випадок, крізь який евристика щільності не бачить.

Чому після імпорту форматування в рядку виглядає неправильно?

Markdown позначає виділення символами, а не тегами, тож програма, яка імпортує файл як звичайний текст, покаже жирний буквально, а не внутрішнім тегом. Імпортуйте його як Markdown, а не як текст: у більшості програм є обидва фільтри, і на тому самому файлі вони поводяться зовсім по-різному.

Чому з маркетингової сторінки зникла половина тексту?

Маркетингові сторінки часто збирають із дизайнерських блоків, які відмальовуються під час прокручування, або з вкладок і акордеонів, що вставляють текст лише після відкриття. Те, чого браузер не відмалював, у DOM немає, і зберегти його неможливо. Прокрутіть сторінку до кінця, розкрийте розділи й збережіть знову – або попросіть у клієнта файл із текстами, який для такої сторінки однаково кращий оригінал.

Чим воно не є

Це не CAT-програма: жодного XLIFF, TMX, сегментації чи підрахунку слів. HTML сторінки для зворотного перенесення воно не зберігає. На виході Markdown, призначений для читання й перекладу, а не для злиття назад у сайт. Текст усередині зображень не видобувається. А мова інтерфейсу – одна з 19, за налаштуванням браузера, – не пов’язана з мовою сторінки: саме видобування від мови тексту не залежить.

Додати в Chrome – безкоштовноБезкоштовно повністю, без акаунта.For Chrome on a computer

Питання

Чи зберігається форматування всередині рядка?
Так: жирний, курсив, посилання, код і списки стають своїми відповідниками в Markdown, які більшість CAT-програм обробляє як внутрішні теги.
Чи можна зберігати сторінки будь-якою мовою?
Так. Видобування протестували на 403 сторінках популярних сайтів дванадцяти європейських країн, кожну – мовою її країни: жодного падіння й жодного вцілілого HTML у видобутих статтях. Українська вибірка в цьому прогоні вийшла лише 13 сторінок, тож для української це орієнтир, а не повноцінний замір.
Чи можна отримати XLIFF?
Ні. На виході Markdown, який імпортує кожна велика CAT-програма. Перетворення у формат здачі лишається за вашою програмою.
Чи говорить інтерфейс українською?
Так. Інтерфейс перекладено 19 мовами, і він підлаштовується під налаштування браузера: англійська, російська, німецька, французька, іспанська, італійська, нідерландська, польська, бразильська португальська, румунська, шведська, турецька, українська, чеська, китайська (спрощена й традиційна), японська, корейська та в’єтнамська. Саме видобування працює зі сторінками будь-якою мовою.
Чи йде щось до сервісу перекладу?
Ні. Збережений текст ніколи не вивантажується – він потрапляє в буфер обміну або на диск і більше нікуди.
Чи впорається воно з нелатинськими абетками й текстом справа наліво?
Текст береться так, як його відмалювала сторінка, символ у символ, будь-якою писемністю. Нічого не транслітерується, не переставляється й не нормалізується. Видобування працює зі структурою сторінки, а структура однакова, хай які там літери.
Чи рахує воно слова?
Ні. Жодного підрахунку, сегментації чи аналізу – на виході файл Markdown. Змінюється те, що взагалі буде що рахувати: навігацію прибрано ще до того, як її побачить ваша програма.
Чи можна повністю вимкнути заголовок YAML?
Так. Кожне поле frontmatter (title, source, author, date, extraction) вимикається окремо – глобально або для одного сайту. Коли вимкнено всі, файл починається з першого заголовка тексту.
Чи можна зберегти тестову версію сайту клієнта?
Так, якщо вона відмальовується у вашому браузері, – зокрема за базовою автентифікацією чи списком дозволених IP, бо розширення читає сторінку, яку ваша сесія вже завантажила. Власних запитів до сайту воно не робить, тож тестовий сервер ніхто не чіпає й не завантажує вдруге. Домен успішного збереження, як і скрізь, іде в анонімну статистику, доки ви не вимкнете її в налаштуваннях; адреси з локальної мережі – localhost, імена .local, 10.x, 192.168.x – не надсилаються ніколи.
Чи вийде двоколонкова верстка в правильному порядку?
Тіло статті записується в тому порядку, у якому воно стоїть у документі, а не в якому видно на екрані. Бічна колонка поруч із текстом зрізається як обв’язка, а не вклинюється в нього, тож текст читається послідовно – саме те, що потрібно списку сегментів і чого не дасть знімок у порядку екрана.