Para quién es
Texto origen limpio para tu herramienta TAO
El texto origen pegado desde una página web arrastra la navegación consigo, y cada elemento de menú se convierte en un segmento que hay que saltar. Clean Clipper corta esos bloques antes de exportar, así que lo que importas es prosa. La negrita, la cursiva, los enlaces y las listas llegan como Markdown estándar, que las herramientas TAO tratan como etiquetas en línea.
Segmentos que no son texto
Importas una página de cuatro mil palabras y la herramienta te da cuatrocientos segmentos, de los cuales la mitad son «Inicio», «Contacto», «Aceptar cookies» y el nombre de cada sección repetido tres veces. Saltarlos uno a uno cuesta tiempo y ensucia el recuento de palabras del encargo. Peor todavía: si alguno se traduce por inercia, la memoria de traducción se queda con basura que reaparecerá en el próximo proyecto.
Limpiar antes tampoco es cómodo cuando se hace a mano. Copiar el texto a un documento pierde la negrita y los enlaces, que después hay que reconstruir en el destino. Y si el original cambia, hay que repetir toda la limpieza desde el principio.
Antes de todo eso está el presupuesto, que es donde el ruido cuesta dinero de verdad. El cliente manda una dirección y hay que decir un precio; si cuentas las palabras de la página tal cual, estás cobrando por menús que nadie va a traducir, y si restas a ojo, te quedas corto. La proporción de caracteres que viven dentro de enlaces quedó entre 0,036 y 0,064 en las doce lenguas medidas: sobre un encargo de veinte mil palabras, esa franja es la diferencia entre un presupuesto defendible y una discusión.
Qué cambia antes de importar
- Menús, paginadores, banners y listas de «lo más leído» cortados antes de exportar
- Las líneas de navegación duplicadas se reducen unas cuatro veces frente a los motores comparados
- Negrita, cursiva, enlaces, código y listas llegan como Markdown estándar
- El Markdown plano se importa en todas las herramientas TAO importantes
- La dirección de origen viaja en el archivo, así que el contexto está a un clic
- Captura de selección cuando solo hay que traducir un pasaje
- Las notas al pie llegan como notas
[^1]con sus definiciones al final, no como anclas que rompen el segmento - La interfaz está traducida a catorce idiomas y sigue la configuración del navegador
## traducir Del lat. *traducĕre* «hacer pasar de un lugar a otro». 1. tr. Expresar en una lengua lo que está escrito o se ha expresado antes en otra. 2. tr. Convertir, mudar, trocar. 3. tr. Explicar, interpretar. Ni una línea de menú, ni un botón de compartir, ni un aviso de cookies.
Cómo preparar un original para traducir
El objetivo aquí es que la lista de segmentos sean frases y no botones. Estos seis pasos dejan el original listo para importar sin limpieza manual.
- Abre la página en el idioma origen que vas a traducir. Muchos sitios sirven una versión distinta según el idioma del navegador o la ubicación: comprueba en la barra de direcciones que estás en la versión correcta antes de capturar, porque se captura lo que hay en pantalla.
- En los ajustes, deja el clic en el icono en «vista previa». En traducción, ver el texto antes de importarlo es lo que evita descubrir el mobiliario dentro de la herramienta TAO, cuando ya cuesta corregirlo.
- Pon las imágenes en «omitir». Un enlace de imagen se convierte en un segmento que no se traduce, y el texto que va dentro de una imagen no se recupera de ninguna manera: sigue siendo texto en una imagen.
- Deja activos
titleysource. El título suele ser un segmento que también hay que traducir, y la dirección es lo que te devuelve al original cuando una frase solo se entiende viendo la página. - Captura y revisa el resultado en la vista de lectura. Ahí se ve si ese sitio deja alguna línea de navegación dentro del cuerpo, que es el único ruido que sobrevive al recorte y el que conviene borrar antes de importar.
- Guarda el
.mden la carpeta del proyecto e impórtalo en tu herramienta TAO. Las que admiten Markdown lo toman directamente; las demás lo aceptan como texto plano o con un filtro, porque no hay etiquetas HTML sueltas que las confundan.
Ajustes para trabajo de traducción
Los valores de abajo persiguen una sola cosa: que cada segmento sea una unidad de traducción real. Se apartan de la configuración general en el trato de las imágenes y del frontmatter.
| Ajuste | Valor | Por qué así al traducir |
|---|---|---|
| Clic en el icono | Vista previa | Revisar antes de importar cuesta segundos; corregir dentro de la herramienta TAO cuesta el encargo |
| Imágenes | Omitir | Cada enlace de imagen es un segmento que no se traduce y ensucia el recuento |
| Frontmatter | `title`, `source` | El título es un segmento más y la dirección devuelve al contexto cuando una frase es ambigua |
| Campo `author` | Desactivado | Un nombre propio en la lista de segmentos solo sirve para que alguien lo traduzca por error |
| Subcarpeta | La referencia del encargo | Cuando llega la revisión, el original tiene que estar donde está la traducción |
| Captura de selección | Marcar el pasaje antes de pulsar | Para los encargos parciales, que son la mayoría de los urgentes |
| Antes de capturar | Comprobar la versión de idioma en la barra de direcciones | Los sitios multilingües redirigen según el navegador, y el original equivocado no se detecta hasta la entrega |
## El calco y el préstamo
Se llama **préstamo** a la incorporación de una palabra de otra lengua
sin apenas alteración, y *calco* a la traducción literal de sus
elementos.[^1] La distinción importa en textos técnicos, donde conviven
las dos soluciones para el mismo concepto.
| Término origen | Préstamo | Calco |
| --- | --- | --- |
| `software` | software | soporte lógico |
| `firewall` | firewall | cortafuegos |
[^1]: La definición de la nota se agrupa al final del archivo, así que
no parte el segmento donde aparece la llamada.
Líneas repetidas que no llegaron a la lista de segmentos:
Inicio · El Instituto · Enseñanza · Literatura × 9
Compartir · Imprimir · Enviar por correo × 6Tres casos reales
Presupuestar un encargo a partir de una dirección
El cliente manda el enlace de una sección de su web y pide precio. Capturas las páginas que la componen y cuentas las palabras del Markdown, no las de la página: fuera quedan el menú, el pie, el aviso de cookies y los titulares laterales.
El recuento resultante se parece al texto que de verdad hay que traducir. La medida publicada da la escala del problema: entre el 3,6 % y el 6,4 % de los caracteres de una página quedan dentro de etiquetas de enlace, y en la lista de segmentos esa parte pesa mucho más de lo que sugiere la cifra, porque son líneas cortas y numerosas.
Un artículo largo con formato en línea
Traduces un texto con negritas, cursivas, enlaces y una tabla de términos. Al capturar, todo eso llega como Markdown estándar, que las herramientas TAO tratan como etiquetas en línea y protegen durante la traducción.
Lo que se evita así es la reconstrucción del formato en el destino, que es donde se cuelan la mitad de los errores de entrega. Las notas al pie se agrupan al final del archivo en lugar de partir el segmento donde aparece la llamada, y eso mantiene limpia también la memoria de traducción.
Material de referencia terminológica
Antes de decidir un término, reúnes tres o cuatro páginas de referencia: un diccionario, una guía de estilo, la documentación del propio cliente. Capturas cada una a la carpeta del encargo, con su dirección y su fecha en la cabecera.
Cuando el revisor pregunte por qué elegiste una solución, la justificación está en la carpeta y no en el historial del navegador. Y como son archivos de texto, la misma carpeta se busca por palabra en el encargo siguiente, que es cuando la terminología empieza a rendir de verdad.
Frente a las otras formas de conseguir el original
Cuando el cliente puede dar el archivo fuente, esa es la vía preferible y conviene pedirla. Lo que sigue es lo que se hace cuando no la hay, y esta extensión está en la lista con su parte.
| Cómo se hace ahora | Qué obtienes | Qué cuesta |
|---|---|---|
| Pedir al cliente el archivo fuente | El original con su estructura y sus etiquetas | A menudo no existe, tarda días o llega en un formato peor que la propia web |
| Copiar y pegar en un procesador | El texto, ya | Se pierden negritas y enlaces, que hay que reconstruir en el destino, y entran los menús |
| Guardar el HTML e importarlo en la herramienta TAO | La estructura completa y etiquetas protegidas | Entra también toda la plantilla del sitio: cientos de segmentos de navegación por página |
| Extraer con la función de importar desde una dirección | Automático, sin pasos manuales | Recibe la versión que el sitio sirve a un programa, que no siempre es la que estás viendo |
| Imprimir a PDF | Un archivo estable que el cliente reconoce | La conversión posterior rompe los saltos de línea y convierte cada línea en un segmento |
| Clean Clipper | Prosa sin mobiliario, con el formato en línea intacto y la dirección de origen | No traduce ni pretraduce, no exporta a XLIFF ni a TMX, no recorre un sitio entero y no recupera el texto dentro de imágenes |
Cuando el original no queda limpio
¿Por qué quedan algunos segmentos de navegación?
Porque en ese sitio están maquetados dentro del cuerpo del artículo y no alrededor. El recorte quita navegación, banners, paginadores y listas de «lo más leído», y elimina las líneas repetidas; un bloque de enlaces colocado en mitad del texto se parece a una lista corriente. La medida es 102 líneas duplicadas en 109 páginas, frente a 282, 478 y 491 de los otros tres motores: son dos o tres líneas por página, no doscientas.
¿Por qué no aparece el texto que está dentro de las imágenes?
Porque sigue siendo una imagen. Los rótulos, las infografías y las capturas de pantalla con texto dentro no se convierten en texto: no hay reconocimiento óptico en ningún punto de la cadena. Lo que sí llega es el texto alternativo, cuando la página lo declara, y eso a veces basta para saber que ahí hay algo que traducir y hay que pedírselo al cliente.
¿Por qué capturé la versión en otro idioma?
Porque el sitio decidió cuál servir antes de que capturases. Muchos sitios multilingües redirigen según el idioma del navegador o la ubicación, y sirven la versión inglesa aunque la dirección apunte a otra.
Se captura lo que hay en pantalla, así que la comprobación es visual: mira la barra de direcciones y el propio texto antes de pulsar. Es exactamente el motivo por el que la medición europea se hizo con el navegador puesto en el idioma de cada país; sin eso, la mitad de los sitios habría servido páginas en inglés y se habría medido otra cosa.
¿Por qué no puedo capturar las cadenas de una aplicación web?
Porque las cadenas de una interfaz no son un artículo. Los botones, los menús y los mensajes de una aplicación viven en su código, y la extensión trabaja sobre el contenido de una página: en una pantalla que es casi toda controles, informará de «sin artículo» en lugar de devolver una lista de etiquetas. Para localizar software, lo que hay que pedir es el archivo de recursos.
Lo que no hace
No traduce ni pretraduce nada: entrega el texto origen limpio y ahí acaba su trabajo. No exporta a XLIFF, a TMX ni a ningún formato bilingüe; produce Markdown, y la conversión la hace tu herramienta. No conserva la maquetación ni las imágenes con texto dentro, que siguen siendo texto en una imagen. Y no recorre un sitio entero: capturas página a página, la que tienes delante.