Para quién es
Tablas que sobreviven al viaje
Los conversores genéricos de HTML a Markdown se rompen justo con las tablas que importan: las que llevan una lista, un enlace o un ejemplo de código dentro de una celda. Clean Clipper escribe la tabla él mismo y aplana el contenido de la celda en vez de perder la fila. En un corpus técnico de quince tablas conservó doce, frente a siete de cada motor comparado.
La fila que se deshace
Una página de datos vale por su tabla: la serie, la unidad, la periodicidad, la nota al pie que explica el cambio de base. Al capturarla con una herramienta genérica, la fila con una lista dentro de una celda se parte en varias, o la tabla entera sale como un párrafo largo con barras verticales sueltas. Recomponerla a mano cuesta más que volver a la página original.
Después está el problema contrario: las rejillas que no son tablas. Muchos sitios usan tablas para colocar elementos, y un conversor fiel las reproduce como tablas de Markdown vacías de contenido. La nota acaba con tres rejillas de navegación y sin la tabla que buscabas.
Y hay una parte de los datos que no está en el texto de la página en ningún momento. Los gráficos interactivos se dibujan sobre un lienzo, y las cifras viven en una petición que el navegador hizo aparte; las tablas que aparecen al aplicar un filtro no existen hasta que lo aplicas. La extensión lee el DOM tal como está cuando pulsas, así que lo que no se haya dibujado todavía no se captura, y lo que se dibuja sobre un lienzo no se captura nunca.
Qué cambia en la nota
- Serializador propio de tablas GFM en lugar de un plugin genérico
- Doce tablas de quince conservadas en el corpus técnico, frente a siete de cada motor comparado
- Las tablas irregulares de dos columnas pasan a líneas
Clave: valoren vez de a una rejilla rota - Las tablas de maquetación se desenvuelven: se conserva el contenido y no la rejilla
- Una celda con lista, enlace o código se aplana dentro de su celda y la fila no se pierde
- Las cifras, los umbrales y las unidades quedan donde se pueden leer y copiar
- Las notas metodológicas al pie de la tabla se recogen como notas
[^1]al final del archivo, no como anclas sueltas - La dirección de origen y la fecha de publicación viajan en el frontmatter, así que una cifra citada se puede rastrear
| Operación estadística | Periodicidad | Unidad | | --- | --- | --- | | Índice de Precios de Consumo | Mensual | Índice, base 2021 = 100 | | Encuesta de Población Activa | Trimestral | Miles de personas | | Contabilidad Nacional Trimestral | Trimestral | Variación en % | | Cifras de Población | Semestral | Personas |
Cómo capturar una tabla paso a paso
Con datos, el orden de los gestos importa: casi todos los fallos vienen de capturar antes de que la tabla exista en la página. Estos seis pasos evitan justo eso.
- Antes de tocar nada, deja la página en el estado que quieres guardar: aplica el filtro, elige el periodo, despliega las notas metodológicas y baja hasta el final. Se captura lo que hay en el DOM en ese instante, ni más ni menos.
- Si solo te interesa la tabla, selecciónala con el ratón de la primera celda a la última. El interruptor de la parte superior de la ventana indica si vas a guardar la selección o la página entera.
- En los ajustes, deja el clic en el icono en «vista previa». Con tablas conviene comprobar el resultado antes de archivarlo: una fila desplazada se detecta de un vistazo y no cuando ya está en el análisis.
- Pon las imágenes en «omitir». En una página de datos las imágenes son gráficos, y un gráfico no aporta cifras a la nota: se queda como enlace y con el tiempo se rompe.
- Deja activos
title,sourceypublished. La dirección de origen es lo que permite rastrear una cifra hasta la publicación exacta de la que salió, y la fecha distingue una serie revisada de la anterior. - Captura y abre el archivo en tu editor. Desde ahí la tabla en Markdown se copia a una hoja de cálculo o a un cuaderno de análisis: es un paso más, porque no hay exportación directa a CSV ni a Excel.
Ajustes para páginas de datos
La configuración de abajo está pensada para tablas y no para prosa, y por eso se aparta en dos puntos de la que sirve para artículos: las imágenes se omiten y la revisión previa deja de ser opcional.
| Ajuste | Valor | Por qué así con datos |
|---|---|---|
| Clic en el icono | Vista previa | Una fila desplazada por celdas combinadas solo se detecta mirando, y mirar cuesta dos segundos |
| Imágenes | Omitir | En una página de datos las imágenes son gráficos que no aportan cifras, solo enlaces que caducan |
| Frontmatter | `title`, `source`, `published` | `source` permite rastrear una cifra hasta su publicación y `published` distingue una serie revisada de la anterior |
| Plantilla de nombre | `{date}-{domain}-{title}` | Con el organismo en el nombre se ve enseguida si dos archivos son dos fuentes o la misma en dos momentos |
| Captura de selección | Marcar la tabla antes de pulsar | Evita arrastrar quince pantallas de contexto cuando lo que quieres son cuarenta filas |
| Regla por sitio | Organismo estadístico → subcarpeta propia | Separar la fuente oficial de los análisis de terceros evita citar el comentario como si fuera el dato |
| Antes de capturar | Aplicar el filtro y desplegar las notas | Lo que no está en la página en ese instante no entra en la captura |
## Índice de Precios de Consumo. Metodología **Organismo responsable**: Instituto Nacional de Estadística **Periodicidad**: Mensual **Base**: 2021 = 100 **Ámbito poblacional**: Hogares residentes en viviendas familiares **Primer dato disponible**: Enero de 2002 | Grupo | Ponderación (‰) | Variación anual | | --- | --- | --- | | Alimentos y bebidas no alcohólicas | 224,6 | 1,9 % | | Vivienda, agua y electricidad | 141,3 | 3,4 % | | Transporte | 122,8 | −0,7 % | La ficha de arriba estaba maquetada como tabla de dos columnas sin cabecera: se convierte en líneas **Clave**: valor, que se leen mejor que una rejilla rota. La barra de navegación del portal también estaba dentro de una tabla, y esa se desenvuelve: se conserva su contenido y no la rejilla.
Tres casos reales
Llevar una serie oficial a la hoja de cálculo
Estás en la página de una operación estadística y necesitas la tabla que hay en pantalla. Eliges el periodo, esperas a que la tabla se dibuje, la seleccionas y capturas la selección. En la nota aparece con su cabecera y sus filas, en Markdown estándar.
De ahí a la hoja de cálculo va un paso más, porque no hay exportación directa a CSV ni a Excel: casi cualquier editor u hoja importa una tabla de Markdown o la convierte. Si el organismo publica el CSV oficial, descárgalo: para la serie completa siempre será mejor que cualquier conversión.
Una tabla con sus notas metodológicas
La tabla dice poco sin la nota al pie que explica el cambio de base o la ruptura de la serie. En lugar de seleccionar solo la rejilla, capturas la página entera: las notas de referencia se convierten en notas [^1] con sus definiciones agrupadas al final del archivo.
Eso cambia el resultado seis meses después: la nota que explica por qué 2021 vale 100 está dentro del mismo archivo que la cifra, y no en una página que quizá ya no responda. La dirección de origen queda en el frontmatter para volver al original cuando haga falta.
Detectar una revisión de datos
Capturaste una tabla en marzo y vuelves a la misma dirección en septiembre, cuando el organismo ha revisado la serie. La segunda captura recibe un sufijo numérico y la de marzo queda intacta.
Comparar los dos archivos de texto enseña qué celdas cambiaron y cuáles no, que es una comprobación difícil de hacer a ojo sobre dos páginas web abiertas en pestañas distintas. La extensión no calcula, no agrega y no comprueba nada: guarda los números tal como estaban.
Frente a las otras formas de sacar una tabla
Con datos hay una vía que casi siempre gana cuando existe, y conviene decirlo antes que nada: el archivo oficial. Lo demás compite entre sí, y esta extensión también.
| Cómo se hace ahora | Qué obtienes | Qué cuesta |
|---|---|---|
| Descargar el CSV o el XLS del organismo | La serie completa, con sus tipos y su precisión | No siempre existe, y a veces solo cubre una parte de lo que muestra la página |
| Copiar y pegar la tabla en la hoja de cálculo | Rápido cuando la tabla es sencilla | Una celda con lista o con enlace parte la fila, y las cabeceras a dos niveles se descolocan |
| Función de importación de HTML de la hoja de cálculo | Automatizable y repetible | Se rompe con las tablas dibujadas por un script y no ve nada que esté detrás de una sesión iniciada |
| Captura de pantalla | Fiel a lo que se veía, con su formato | Las cifras no se pueden copiar ni sumar, y no se compara con la revisión siguiente |
| Imprimir a PDF | Un archivo con la tabla y su contexto | Las tablas anchas se cortan por la mitad y el resultado no se vuelve a convertir bien |
| Clean Clipper | La tabla en Markdown con sus notas metodológicas, la dirección y la fecha | No exporta a CSV, no admite celdas combinadas, no lee gráficos dibujados sobre un lienzo y no calcula nada |
Cuando la tabla no llega bien
¿Por qué la tabla salió desplazada?
Casi siempre por celdas combinadas. Markdown no las tiene, así que se aplanan: el contenido se conserva y la combinación visual no, y en una tabla con cabecera a dos niveles eso se lee como filas descolocadas. Cuando la tabla es irregular y de dos columnas, se convierte en líneas Clave: valor, que es más útil que una rejilla rota. Si el organismo publica el archivo oficial, para esa tabla concreta será mejor.
¿Por qué falta la tabla que aparece al aplicar un filtro?
Porque no estaba en la página cuando pulsaste. La extensión lee el DOM en ese instante: lo que un script dibuja después de la captura no existe para ella. Aplica el filtro, espera a que la tabla aparezca en pantalla y captura entonces. Lo mismo vale para las secciones plegadas y para lo que se carga al bajar.
¿Por qué no están las cifras del gráfico?
Porque un gráfico interactivo se dibuja sobre un lienzo y sus cifras nunca llegan a ser texto de la página. Ahí no hay nada que convertir: no es una limitación del recorte, sino que el dato no existe en el DOM.
Muchos sitios publican debajo del gráfico la misma serie en forma de tabla, a veces plegada tras un botón de «ver datos»: esa sí se captura. Si no la hay, la vía es el archivo descargable del propio organismo.
¿Por qué desapareció una tabla que sí estaba en la página?
Porque no era una tabla de contenido. Muchos sitios usan tablas para colocar elementos en pantalla –cabeceras, menús, fichas laterales–, y esas se desenvuelven: se conserva el contenido y no la rejilla, porque reproducirlas como tablas de Markdown llena la nota de rejillas vacías. Si lo que se ha desenvuelto era una tabla de datos maquetada de forma poco convencional, seleccionarla y capturar solo la selección suele dar el resultado correcto.
Lo que no hace
No exporta a CSV ni a Excel: escribe una tabla de Markdown, y de ahí a una hoja de cálculo va un paso más. No admite celdas combinadas, porque Markdown no sabe expresarlas: el contenido se conserva y la combinación visual se pierde. No lee las tablas que un script dibuja sobre un lienzo ni las que viven dentro de una imagen. Y no calcula, no agrega y no comprueba nada: guarda los números tal como estaban en la página.