Clean Clipper Añadir a Chrome – gratis

Para quién es

Texto origen limpio para tu herramienta TAO

El texto origen pegado desde una página web arrastra la navegación consigo, y cada elemento de menú se convierte en un segmento que hay que saltar. Clean Clipper corta esos bloques antes de exportar, así que lo que importas es prosa. La negrita, la cursiva, los enlaces y las listas llegan como Markdown estándar, que las herramientas TAO tratan como etiquetas en línea.

Segmentos que no son texto

Importas una página de cuatro mil palabras y la herramienta te da cuatrocientos segmentos, de los cuales la mitad son «Inicio», «Contacto», «Aceptar cookies» y el nombre de cada sección repetido tres veces. Saltarlos uno a uno cuesta tiempo y ensucia el recuento de palabras del encargo. Peor todavía: si alguno se traduce por inercia, la memoria de traducción se queda con basura que reaparecerá en el próximo proyecto.

Limpiar antes tampoco es cómodo cuando se hace a mano. Copiar el texto a un documento pierde la negrita y los enlaces, que después hay que reconstruir en el destino. Y si el original cambia, hay que repetir toda la limpieza desde el principio.

Antes de todo eso está el presupuesto, que es donde el ruido cuesta dinero de verdad. El cliente manda una dirección y hay que decir un precio; si cuentas las palabras de la página tal cual, estás cobrando por menús que nadie va a traducir, y si restas a ojo, te quedas corto. La proporción de caracteres que viven dentro de enlaces quedó entre 0,036 y 0,064 en las doce lenguas medidas: sobre un encargo de veinte mil palabras, esa franja es la diferencia entre un presupuesto defendible y una discusión.

Qué cambia antes de importar

Negrita, cursiva y lista numerada llegan al otro ladodle.rae.es/traducir
## traducir

Del lat. *traducĕre* «hacer pasar de un lugar a otro».

1. tr. Expresar en una lengua lo que está escrito o se ha expresado antes
   en otra.
2. tr. Convertir, mudar, trocar.
3. tr. Explicar, interpretar.

Ni una línea de menú, ni un botón de compartir, ni un aviso de cookies.

Cómo preparar un original para traducir

El objetivo aquí es que la lista de segmentos sean frases y no botones. Estos seis pasos dejan el original listo para importar sin limpieza manual.

  1. Abre la página en el idioma origen que vas a traducir. Muchos sitios sirven una versión distinta según el idioma del navegador o la ubicación: comprueba en la barra de direcciones que estás en la versión correcta antes de capturar, porque se captura lo que hay en pantalla.
  2. En los ajustes, deja el clic en el icono en «vista previa». En traducción, ver el texto antes de importarlo es lo que evita descubrir el mobiliario dentro de la herramienta TAO, cuando ya cuesta corregirlo.
  3. Pon las imágenes en «omitir». Un enlace de imagen se convierte en un segmento que no se traduce, y el texto que va dentro de una imagen no se recupera de ninguna manera: sigue siendo texto en una imagen.
  4. Deja activos title y source. El título suele ser un segmento que también hay que traducir, y la dirección es lo que te devuelve al original cuando una frase solo se entiende viendo la página.
  5. Captura y revisa el resultado en la vista de lectura. Ahí se ve si ese sitio deja alguna línea de navegación dentro del cuerpo, que es el único ruido que sobrevive al recorte y el que conviene borrar antes de importar.
  6. Guarda el .md en la carpeta del proyecto e impórtalo en tu herramienta TAO. Las que admiten Markdown lo toman directamente; las demás lo aceptan como texto plano o con un filtro, porque no hay etiquetas HTML sueltas que las confundan.

Ajustes para trabajo de traducción

Los valores de abajo persiguen una sola cosa: que cada segmento sea una unidad de traducción real. Se apartan de la configuración general en el trato de las imágenes y del frontmatter.

AjusteValorPor qué así al traducir
Clic en el iconoVista previaRevisar antes de importar cuesta segundos; corregir dentro de la herramienta TAO cuesta el encargo
ImágenesOmitirCada enlace de imagen es un segmento que no se traduce y ensucia el recuento
Frontmatter`title`, `source`El título es un segmento más y la dirección devuelve al contexto cuando una frase es ambigua
Campo `author`DesactivadoUn nombre propio en la lista de segmentos solo sirve para que alguien lo traduzca por error
SubcarpetaLa referencia del encargoCuando llega la revisión, el original tiene que estar donde está la traducción
Captura de selecciónMarcar el pasaje antes de pulsarPara los encargos parciales, que son la mayoría de los urgentes
Antes de capturarComprobar la versión de idioma en la barra de direccionesLos sitios multilingües redirigen según el navegador, y el original equivocado no se detecta hasta la entrega
Caso difícil: formato en línea, nota al pie y una tabla de términos dentro del mismo textocvc.cervantes.es
## El calco y el préstamo

Se llama **préstamo** a la incorporación de una palabra de otra lengua
sin apenas alteración, y *calco* a la traducción literal de sus
elementos.[^1] La distinción importa en textos técnicos, donde conviven
las dos soluciones para el mismo concepto.

| Término origen | Préstamo | Calco |
| --- | --- | --- |
| `software` | software | soporte lógico |
| `firewall` | firewall | cortafuegos |

[^1]: La definición de la nota se agrupa al final del archivo, así que
      no parte el segmento donde aparece la llamada.

Líneas repetidas que no llegaron a la lista de segmentos:

  Inicio · El Instituto · Enseñanza · Literatura     × 9
  Compartir · Imprimir · Enviar por correo           × 6

Tres casos reales

Presupuestar un encargo a partir de una dirección

El cliente manda el enlace de una sección de su web y pide precio. Capturas las páginas que la componen y cuentas las palabras del Markdown, no las de la página: fuera quedan el menú, el pie, el aviso de cookies y los titulares laterales.

El recuento resultante se parece al texto que de verdad hay que traducir. La medida publicada da la escala del problema: entre el 3,6 % y el 6,4 % de los caracteres de una página quedan dentro de etiquetas de enlace, y en la lista de segmentos esa parte pesa mucho más de lo que sugiere la cifra, porque son líneas cortas y numerosas.

Un artículo largo con formato en línea

Traduces un texto con negritas, cursivas, enlaces y una tabla de términos. Al capturar, todo eso llega como Markdown estándar, que las herramientas TAO tratan como etiquetas en línea y protegen durante la traducción.

Lo que se evita así es la reconstrucción del formato en el destino, que es donde se cuelan la mitad de los errores de entrega. Las notas al pie se agrupan al final del archivo en lugar de partir el segmento donde aparece la llamada, y eso mantiene limpia también la memoria de traducción.

Material de referencia terminológica

Antes de decidir un término, reúnes tres o cuatro páginas de referencia: un diccionario, una guía de estilo, la documentación del propio cliente. Capturas cada una a la carpeta del encargo, con su dirección y su fecha en la cabecera.

Cuando el revisor pregunte por qué elegiste una solución, la justificación está en la carpeta y no en el historial del navegador. Y como son archivos de texto, la misma carpeta se busca por palabra en el encargo siguiente, que es cuando la terminología empieza a rendir de verdad.

Frente a las otras formas de conseguir el original

Cuando el cliente puede dar el archivo fuente, esa es la vía preferible y conviene pedirla. Lo que sigue es lo que se hace cuando no la hay, y esta extensión está en la lista con su parte.

Cómo se hace ahoraQué obtienesQué cuesta
Pedir al cliente el archivo fuenteEl original con su estructura y sus etiquetasA menudo no existe, tarda días o llega en un formato peor que la propia web
Copiar y pegar en un procesadorEl texto, yaSe pierden negritas y enlaces, que hay que reconstruir en el destino, y entran los menús
Guardar el HTML e importarlo en la herramienta TAOLa estructura completa y etiquetas protegidasEntra también toda la plantilla del sitio: cientos de segmentos de navegación por página
Extraer con la función de importar desde una direcciónAutomático, sin pasos manualesRecibe la versión que el sitio sirve a un programa, que no siempre es la que estás viendo
Imprimir a PDFUn archivo estable que el cliente reconoceLa conversión posterior rompe los saltos de línea y convierte cada línea en un segmento
Clean ClipperProsa sin mobiliario, con el formato en línea intacto y la dirección de origenNo traduce ni pretraduce, no exporta a XLIFF ni a TMX, no recorre un sitio entero y no recupera el texto dentro de imágenes

Cuando el original no queda limpio

¿Por qué quedan algunos segmentos de navegación?

Porque en ese sitio están maquetados dentro del cuerpo del artículo y no alrededor. El recorte quita navegación, banners, paginadores y listas de «lo más leído», y elimina las líneas repetidas; un bloque de enlaces colocado en mitad del texto se parece a una lista corriente. La medida es 102 líneas duplicadas en 109 páginas, frente a 282, 478 y 491 de los otros tres motores: son dos o tres líneas por página, no doscientas.

¿Por qué no aparece el texto que está dentro de las imágenes?

Porque sigue siendo una imagen. Los rótulos, las infografías y las capturas de pantalla con texto dentro no se convierten en texto: no hay reconocimiento óptico en ningún punto de la cadena. Lo que sí llega es el texto alternativo, cuando la página lo declara, y eso a veces basta para saber que ahí hay algo que traducir y hay que pedírselo al cliente.

¿Por qué capturé la versión en otro idioma?

Porque el sitio decidió cuál servir antes de que capturases. Muchos sitios multilingües redirigen según el idioma del navegador o la ubicación, y sirven la versión inglesa aunque la dirección apunte a otra.

Se captura lo que hay en pantalla, así que la comprobación es visual: mira la barra de direcciones y el propio texto antes de pulsar. Es exactamente el motivo por el que la medición europea se hizo con el navegador puesto en el idioma de cada país; sin eso, la mitad de los sitios habría servido páginas en inglés y se habría medido otra cosa.

¿Por qué no puedo capturar las cadenas de una aplicación web?

Porque las cadenas de una interfaz no son un artículo. Los botones, los menús y los mensajes de una aplicación viven en su código, y la extensión trabaja sobre el contenido de una página: en una pantalla que es casi toda controles, informará de «sin artículo» en lugar de devolver una lista de etiquetas. Para localizar software, lo que hay que pedir es el archivo de recursos.

Lo que no hace

No traduce ni pretraduce nada: entrega el texto origen limpio y ahí acaba su trabajo. No exporta a XLIFF, a TMX ni a ningún formato bilingüe; produce Markdown, y la conversión la hace tu herramienta. No conserva la maquetación ni las imágenes con texto dentro, que siguen siendo texto en una imagen. Y no recorre un sitio entero: capturas página a página, la que tienes delante.

Añadir a Chrome – gratisGratis del todo: sin cuenta y sin límite de páginas.

Preguntas

¿Conserva el formato en línea?
Sí. Negrita, cursiva, enlaces, código y listas pasan a su equivalente en Markdown, que la mayoría de las herramientas TAO tratan como etiquetas en línea.
¿Puede capturar páginas en cualquier idioma?
Sí. La extracción se midió en 403 páginas de los cincuenta sitios más visitados de doce países europeos, más los cien primeros del mundo y de Rusia: cero fallos en todas ellas.
¿La interfaz habla mi idioma?
La extensión está traducida a catorce idiomas y sigue la configuración de tu navegador.
¿Se puede importar el Markdown directamente?
Sí, en las herramientas que admiten Markdown como formato de entrada. Las que no, lo aceptan como texto plano o mediante un filtro, porque no hay etiquetas HTML sueltas que las confundan.
¿Sirve para calcular el volumen de un encargo?
Sirve para contar mejor. Al quitar los menús y la navegación repetida, el recuento de palabras se acerca al texto que de verdad hay que traducir.
¿Se conservan los enlaces del texto?
Sí, como enlaces de Markdown con su dirección absoluta. Las herramientas TAO los tratan como etiquetas en línea, así que el destino conserva el enlace sin que tengas que reconstruirlo.
¿Puedo capturar el original y la traducción publicada de la misma página?
Sí, y es una forma barata de montar un corpus paralelo. Captura las dos versiones de idioma: como los títulos difieren, cada una recibe su propio nombre de archivo y quedan una al lado de la otra en la carpeta.
¿Cuenta las palabras la extensión?
No. Produce el Markdown limpio y el recuento lo hace tu herramienta habitual, que es la que después va a facturar. Lo que aporta es que lo que se cuenta sea el texto y no el mobiliario.
¿Qué pasa con los textos que se cargan al desplazarse?
Se captura lo que hay en la página en ese instante. En páginas largas conviene bajar hasta el final antes de capturar; si el original se pagina, cada página se captura por separado.
¿Sirve igual con idiomas de escritura no latina?
Sí. La extracción se midió en doce lenguas europeas, entre ellas el turco, el checo y el ucraniano, con cero fallos. La salvedad publicada del ucraniano es del corpus, no de la extracción: solo respondieron 13 páginas de 40.