Clean Clipper Añadir a Chrome – gratis

Para quién es

Tablas que sobreviven al viaje

Los conversores genéricos de HTML a Markdown se rompen justo con las tablas que importan: las que llevan una lista, un enlace o un ejemplo de código dentro de una celda. Clean Clipper escribe la tabla él mismo y aplana el contenido de la celda en vez de perder la fila. En un corpus técnico de quince tablas conservó doce, frente a siete de cada motor comparado.

La fila que se deshace

Una página de datos vale por su tabla: la serie, la unidad, la periodicidad, la nota al pie que explica el cambio de base. Al capturarla con una herramienta genérica, la fila con una lista dentro de una celda se parte en varias, o la tabla entera sale como un párrafo largo con barras verticales sueltas. Recomponerla a mano cuesta más que volver a la página original.

Después está el problema contrario: las rejillas que no son tablas. Muchos sitios usan tablas para colocar elementos, y un conversor fiel las reproduce como tablas de Markdown vacías de contenido. La nota acaba con tres rejillas de navegación y sin la tabla que buscabas.

Y hay una parte de los datos que no está en el texto de la página en ningún momento. Los gráficos interactivos se dibujan sobre un lienzo, y las cifras viven en una petición que el navegador hizo aparte; las tablas que aparecen al aplicar un filtro no existen hasta que lo aplicas. La extensión lee el DOM tal como está cuando pulsas, así que lo que no se haya dibujado todavía no se captura, y lo que se dibuja sobre un lienzo no se captura nunca.

Qué cambia en la nota

La tabla sale como tabla, con su cabecera y sus filasine.es
| Operación estadística | Periodicidad | Unidad |
| --- | --- | --- |
| Índice de Precios de Consumo | Mensual | Índice, base 2021 = 100 |
| Encuesta de Población Activa | Trimestral | Miles de personas |
| Contabilidad Nacional Trimestral | Trimestral | Variación en % |
| Cifras de Población | Semestral | Personas |

Cómo capturar una tabla paso a paso

Con datos, el orden de los gestos importa: casi todos los fallos vienen de capturar antes de que la tabla exista en la página. Estos seis pasos evitan justo eso.

  1. Antes de tocar nada, deja la página en el estado que quieres guardar: aplica el filtro, elige el periodo, despliega las notas metodológicas y baja hasta el final. Se captura lo que hay en el DOM en ese instante, ni más ni menos.
  2. Si solo te interesa la tabla, selecciónala con el ratón de la primera celda a la última. El interruptor de la parte superior de la ventana indica si vas a guardar la selección o la página entera.
  3. En los ajustes, deja el clic en el icono en «vista previa». Con tablas conviene comprobar el resultado antes de archivarlo: una fila desplazada se detecta de un vistazo y no cuando ya está en el análisis.
  4. Pon las imágenes en «omitir». En una página de datos las imágenes son gráficos, y un gráfico no aporta cifras a la nota: se queda como enlace y con el tiempo se rompe.
  5. Deja activos title, source y published. La dirección de origen es lo que permite rastrear una cifra hasta la publicación exacta de la que salió, y la fecha distingue una serie revisada de la anterior.
  6. Captura y abre el archivo en tu editor. Desde ahí la tabla en Markdown se copia a una hoja de cálculo o a un cuaderno de análisis: es un paso más, porque no hay exportación directa a CSV ni a Excel.

Ajustes para páginas de datos

La configuración de abajo está pensada para tablas y no para prosa, y por eso se aparta en dos puntos de la que sirve para artículos: las imágenes se omiten y la revisión previa deja de ser opcional.

AjusteValorPor qué así con datos
Clic en el iconoVista previaUna fila desplazada por celdas combinadas solo se detecta mirando, y mirar cuesta dos segundos
ImágenesOmitirEn una página de datos las imágenes son gráficos que no aportan cifras, solo enlaces que caducan
Frontmatter`title`, `source`, `published``source` permite rastrear una cifra hasta su publicación y `published` distingue una serie revisada de la anterior
Plantilla de nombre`{date}-{domain}-{title}`Con el organismo en el nombre se ve enseguida si dos archivos son dos fuentes o la misma en dos momentos
Captura de selecciónMarcar la tabla antes de pulsarEvita arrastrar quince pantallas de contexto cuando lo que quieres son cuarenta filas
Regla por sitioOrganismo estadístico → subcarpeta propiaSeparar la fuente oficial de los análisis de terceros evita citar el comentario como si fuera el dato
Antes de capturarAplicar el filtro y desplegar las notasLo que no está en la página en ese instante no entra en la captura
Caso difícil: una ficha irregular de dos columnas y una rejilla de maquetación que no era una tablaine.es
## Índice de Precios de Consumo. Metodología

**Organismo responsable**: Instituto Nacional de Estadística
**Periodicidad**: Mensual
**Base**: 2021 = 100
**Ámbito poblacional**: Hogares residentes en viviendas familiares
**Primer dato disponible**: Enero de 2002

| Grupo | Ponderación (‰) | Variación anual |
| --- | --- | --- |
| Alimentos y bebidas no alcohólicas | 224,6 | 1,9 % |
| Vivienda, agua y electricidad | 141,3 | 3,4 % |
| Transporte | 122,8 | −0,7 % |

La ficha de arriba estaba maquetada como tabla de dos columnas sin
cabecera: se convierte en líneas **Clave**: valor, que se leen mejor que
una rejilla rota. La barra de navegación del portal también estaba
dentro de una tabla, y esa se desenvuelve: se conserva su contenido y
no la rejilla.

Tres casos reales

Llevar una serie oficial a la hoja de cálculo

Estás en la página de una operación estadística y necesitas la tabla que hay en pantalla. Eliges el periodo, esperas a que la tabla se dibuje, la seleccionas y capturas la selección. En la nota aparece con su cabecera y sus filas, en Markdown estándar.

De ahí a la hoja de cálculo va un paso más, porque no hay exportación directa a CSV ni a Excel: casi cualquier editor u hoja importa una tabla de Markdown o la convierte. Si el organismo publica el CSV oficial, descárgalo: para la serie completa siempre será mejor que cualquier conversión.

Una tabla con sus notas metodológicas

La tabla dice poco sin la nota al pie que explica el cambio de base o la ruptura de la serie. En lugar de seleccionar solo la rejilla, capturas la página entera: las notas de referencia se convierten en notas [^1] con sus definiciones agrupadas al final del archivo.

Eso cambia el resultado seis meses después: la nota que explica por qué 2021 vale 100 está dentro del mismo archivo que la cifra, y no en una página que quizá ya no responda. La dirección de origen queda en el frontmatter para volver al original cuando haga falta.

Detectar una revisión de datos

Capturaste una tabla en marzo y vuelves a la misma dirección en septiembre, cuando el organismo ha revisado la serie. La segunda captura recibe un sufijo numérico y la de marzo queda intacta.

Comparar los dos archivos de texto enseña qué celdas cambiaron y cuáles no, que es una comprobación difícil de hacer a ojo sobre dos páginas web abiertas en pestañas distintas. La extensión no calcula, no agrega y no comprueba nada: guarda los números tal como estaban.

Frente a las otras formas de sacar una tabla

Con datos hay una vía que casi siempre gana cuando existe, y conviene decirlo antes que nada: el archivo oficial. Lo demás compite entre sí, y esta extensión también.

Cómo se hace ahoraQué obtienesQué cuesta
Descargar el CSV o el XLS del organismoLa serie completa, con sus tipos y su precisiónNo siempre existe, y a veces solo cubre una parte de lo que muestra la página
Copiar y pegar la tabla en la hoja de cálculoRápido cuando la tabla es sencillaUna celda con lista o con enlace parte la fila, y las cabeceras a dos niveles se descolocan
Función de importación de HTML de la hoja de cálculoAutomatizable y repetibleSe rompe con las tablas dibujadas por un script y no ve nada que esté detrás de una sesión iniciada
Captura de pantallaFiel a lo que se veía, con su formatoLas cifras no se pueden copiar ni sumar, y no se compara con la revisión siguiente
Imprimir a PDFUn archivo con la tabla y su contextoLas tablas anchas se cortan por la mitad y el resultado no se vuelve a convertir bien
Clean ClipperLa tabla en Markdown con sus notas metodológicas, la dirección y la fechaNo exporta a CSV, no admite celdas combinadas, no lee gráficos dibujados sobre un lienzo y no calcula nada

Cuando la tabla no llega bien

¿Por qué la tabla salió desplazada?

Casi siempre por celdas combinadas. Markdown no las tiene, así que se aplanan: el contenido se conserva y la combinación visual no, y en una tabla con cabecera a dos niveles eso se lee como filas descolocadas. Cuando la tabla es irregular y de dos columnas, se convierte en líneas Clave: valor, que es más útil que una rejilla rota. Si el organismo publica el archivo oficial, para esa tabla concreta será mejor.

¿Por qué falta la tabla que aparece al aplicar un filtro?

Porque no estaba en la página cuando pulsaste. La extensión lee el DOM en ese instante: lo que un script dibuja después de la captura no existe para ella. Aplica el filtro, espera a que la tabla aparezca en pantalla y captura entonces. Lo mismo vale para las secciones plegadas y para lo que se carga al bajar.

¿Por qué no están las cifras del gráfico?

Porque un gráfico interactivo se dibuja sobre un lienzo y sus cifras nunca llegan a ser texto de la página. Ahí no hay nada que convertir: no es una limitación del recorte, sino que el dato no existe en el DOM.

Muchos sitios publican debajo del gráfico la misma serie en forma de tabla, a veces plegada tras un botón de «ver datos»: esa sí se captura. Si no la hay, la vía es el archivo descargable del propio organismo.

¿Por qué desapareció una tabla que sí estaba en la página?

Porque no era una tabla de contenido. Muchos sitios usan tablas para colocar elementos en pantalla –cabeceras, menús, fichas laterales–, y esas se desenvuelven: se conserva el contenido y no la rejilla, porque reproducirlas como tablas de Markdown llena la nota de rejillas vacías. Si lo que se ha desenvuelto era una tabla de datos maquetada de forma poco convencional, seleccionarla y capturar solo la selección suele dar el resultado correcto.

Lo que no hace

No exporta a CSV ni a Excel: escribe una tabla de Markdown, y de ahí a una hoja de cálculo va un paso más. No admite celdas combinadas, porque Markdown no sabe expresarlas: el contenido se conserva y la combinación visual se pierde. No lee las tablas que un script dibuja sobre un lienzo ni las que viven dentro de una imagen. Y no calcula, no agrega y no comprueba nada: guarda los números tal como estaban en la página.

Añadir a Chrome – gratisGratis del todo: sin cuenta y sin límite de páginas.

Preguntas

¿Qué pasa con una tabla usada solo para maquetar?
Se desenvuelve. Reproducir una rejilla de colocación como tabla de Markdown genera ruido, así que se conserva el contenido y no la rejilla.
¿Se admiten las celdas combinadas?
No, porque Markdown no las tiene. Se aplanan: el contenido se conserva y la combinación visual no, ya que el formato no sabe expresarla.
¿Puedo capturar solo la tabla?
Sí. Selecciónala en la página y captura la selección; el frontmatter con la dirección de origen sigue estando completo.
¿Y las tablas que se cargan al desplegar un filtro?
Se captura lo que hay en la página en ese momento. Despliega primero lo que quieras guardar y luego captura: la extensión lee el DOM ya renderizado.
¿Puedo pasar la tabla a una hoja de cálculo?
Sí, pero con un paso intermedio. La tabla queda en Markdown estándar, que casi cualquier editor u hoja de cálculo importa o convierte.
¿Cuántas tablas sobreviven de verdad?
En el corpus técnico, doce de quince, frente a siete de cada uno de los motores comparados. En el primer corpus la cifra fue más baja para todos: de 56 tablas de origen, 41 estaban en una sola página y eran de maquetación, que ningún motor debería extraer.
¿Se conservan los separadores de miles y los decimales?
Sí, tal como los escribe la página: la extensión no reformatea números ni convierte unidades. Si el sitio publica «1.234,5», eso es lo que llega a la nota.
¿Puedo capturar una tabla que está detrás de una sesión iniciada?
Sí, porque se lee la página que tu navegador ya ha renderizado con tu sesión. Es la diferencia con las funciones de importación de HTML de las hojas de cálculo, que piden la página desde fuera y reciben la versión pública.
¿Qué pasa con las tablas muy anchas?
Llegan enteras: Markdown no tiene ancho de página, así que no se corta nada. Al leerlas conviene un editor que no ajuste la línea, y en la página publicada la tabla se desplaza dentro de su propio contenedor.
¿Sirve para preparar datos para un modelo de lenguaje?
Sí, y por la misma razón: una tabla que llega entera se interpreta bien y una rota produce respuestas equivocadas. El frontmatter añade la dirección y la fecha, que es el contexto que el modelo no puede deducir de las cifras.