Para quién es
Deja de pagar cuarenta veces el mismo menú
Cuando pegas una página web en un modelo, cada línea de menú duplicada, cada aviso de cookies y cada lista de «lo más leído» ocupa contexto y compite por la atención del modelo. En un corpus de 109 páginas Clean Clipper dejó 102 líneas de navegación duplicadas donde los otros tres motores dejaron 282, 478 y 491. Lo que llega al chat es el artículo, con su dirección de origen y su fecha en el frontmatter.
Ruido que se paga dos veces
Una página de un medio grande trae el menú principal repetido en la cabecera, en el pie y en cada bloque de sección. Al pegarla en un chat, esas líneas entran en el contexto y ocupan sitio como cualquier otro texto, pero además desplazan al artículo: cuanto más ruido, más lejos queda lo que de verdad querías preguntar. Con veinte páginas en la misma conversación, buena parte del presupuesto se va en navegación.
El segundo problema es la confusión. Un modelo que ve «Suscríbete», «Lo más leído» y tres titulares sueltos junto al artículo se los cree parte del texto y los arrastra a la respuesta. Y si en la captura sobreviven etiquetas HTML, el modelo gasta atención en descifrar marcado en lugar de contenido.
El tercero es que se pierde la procedencia. Cuando pegas cinco páginas seguidas sin decir de dónde sale cada una, la conversación se convierte en un bloque indistinto y el modelo acaba atribuyendo una afirmación a la fuente equivocada. La fecha corre la misma suerte: sin ella, una nota de hace cuatro años y la de la semana pasada pesan igual, y ahí es donde nacen las respuestas seguras de sí mismas y desfasadas.
Qué cambia en el contexto
- Cuatro veces menos navegación duplicada que la media de los motores comparados
- Cero etiquetas HTML sobrantes en las 512 páginas medidas
- El frontmatter le da al modelo la dirección de origen y la fecha de publicación de forma explícita
- Un atajo copia la página entera como Markdown, lista para pegar en cualquier chat
- El botón «a la IA» copia y abre la conversación en un solo gesto
- Con las imágenes en «omitir», el Markdown no lleva ni un enlace de imagen
- Cuando en la página no hay artículo, la extensión lo dice en vez de entregarte trescientos enlaces que el modelo se creería
- Toda la conversión ocurre en tu navegador: la extensión no hace ninguna petición de red, ni siquiera al servicio de IA que abras después
Líneas que se repetían en la página y no llegaron a la nota: Portada · España · Internacional · Economía · Deportes × 11 Compartir en Facebook · Compartir en X · Enviar por correo × 8 Lo más leído × 6 Aceptar y continuar × 3 En la nota quedan el título, la fecha, la dirección de origen y el cuerpo.
Cómo preparar una página para tu modelo
El objetivo aquí no es guardar, sino que el texto llegue al chat sin nada que no sea el artículo. Estos seis pasos dejan el atajo listo para copiar y pegar sin abrir ninguna ventana.
- Abre los ajustes de la extensión y pon el clic en el icono en «portapapeles». Así el gesto completo es un clic y un
Ctrl+Ven el chat, sin ventana intermedia que cerrar. - Pon las imágenes en «omitir». Un enlace de imagen es una dirección larga que el modelo lee, cuenta y no puede ver: es el recorte de contexto más barato que hay.
- Deja activos solo
title,sourceypublisheden el frontmatter. Los tres se leen de un vistazo al principio del texto pegado y le dan al modelo el título real, la dirección y la fecha de publicación, que es justo lo que no puede deducir del cuerpo. - Comprueba el atajo Alt+Shift+M en
chrome://extensions/shortcuts. Con el clic puesto en «portapapeles», el atajo copia sin abrir nada: puedes encadenar varias páginas seguidas sin soltar el teclado. - Antes de fiarte del flujo, captura una página del sitio del que vayas a sacar más material y ábrela una vez en la vista de lectura. Ahí se ve si queda alguna línea de navegación y si el cuerpo llegó entero.
- Cuando quieras copiar y abrir el chat en un solo gesto, usa el botón «a la IA» de la ventana de captura. Copia al portapapeles y abre la pestaña de la conversación; el envío lo haces tú, porque la extensión no manda nada por su cuenta.
Ajustes para gastar menos contexto
Cada valor de esta tabla quita algo que el modelo pagaría sin recibir nada a cambio. Están ordenados de más a menos ahorro por ajuste.
| Ajuste | Valor | Por qué así para un modelo |
|---|---|---|
| Clic en el icono | Portapapeles | El destino natural es el chat, no el disco: un clic y un pegado, sin ventana que cerrar |
| Imágenes | Omitir | Un enlace de imagen son decenas de caracteres que el modelo procesa y no puede ver |
| Frontmatter | `title`, `source`, `published` | Le dan al modelo la procedencia y la fecha de forma explícita, que es lo único que no puede deducir del cuerpo |
| Campo `author` | Desactivado | Rara vez cambia una respuesta y en cambio invita al modelo a hablar de quién escribe en lugar de qué dice |
| Atajo de teclado | Alt+Shift+M | Permite encadenar varias páginas seguidas: capturar, pegar, cambiar de pestaña, repetir |
| Regla por sitio | Dominios con muchas imágenes → «omitir» | Los sitios ilustrados son los que más contexto malgastan; la regla lo resuelve sin que decidas cada vez |
| Vista de lectura | Revisar el primer recorte de cada sitio | Un vistazo confirma si ese sitio deja restos de navegación, y solo hace falta hacerlo una vez por dominio |
Sin artículo. Caracteres dentro de etiquetas de enlace 64 % (umbral: 25 %) Líneas de menos de 25 caracteres 71 % Párrafos de texto seguido 0 En esta dirección no hay artículo que extraer: es un tablón de titulares. Entregarlo como Markdown daría al modelo trescientos enlaces con aspecto de contenido, y una respuesta construida sobre eso parece fundamentada sin serlo. Abre la noticia concreta y captura ahí.
Tres casos reales
Preguntar sobre un informe largo sin agotar la ventana
Tienes delante un informe de treinta páginas en la web y quieres preguntarle cosas concretas. Pegar la dirección no sirve de mucho: muchos modelos no llegan a la página, y los que llegan reciben la versión que se le sirve a un bot. Pulsas Alt+Shift+M y el informe entero va al portapapeles como Markdown.
Lo que se pega en el chat es el cuerpo con sus encabezados y sus tablas, más tres líneas de frontmatter con el título, la dirección y la fecha de publicación. Las tablas importan más de lo que parece: en el corpus técnico sobrevivieron doce de quince, frente a siete de cada motor comparado, y una tabla rota es una pregunta que el modelo contesta mal.
Cinco páginas de documentación en una sola conversación
Estás resolviendo un problema que cruza tres bibliotecas. Capturas cinco páginas de referencia una detrás de otra y las pegas en la misma conversación, cada una precedida de su source. El modelo puede citar por dirección cuál dice qué, en lugar de mezclar las cinco en una respuesta sin costuras.
El ahorro es medible: en las 109 páginas del primer corpus quedaron 102 líneas de menú duplicadas donde los otros tres motores dejaron 282, 478 y 491. Con cinco páginas encima de la mesa, esa diferencia es la que decide si cabe también tu propio código en la misma conversación.
Montar a mano un corpus para búsqueda local
Quieres un índice consultable de las cincuenta páginas que de verdad usas, no de un sitio entero. Capturas cada una a una carpeta, con el frontmatter completo, y ahí termina la parte de la extensión: no hay rastreo, ni programación, ni cola de descargas.
Lo que obtienes son archivos .md con metadatos en YAML, que es el formato de entrada que casi cualquier indexador entiende sin conversión previa. El campo extraction te dice de cada archivo si el cuerpo salió del DOM o de los datos estructurados, y eso permite revisar primero los dudosos en lugar de fiarte del lote entero.
Frente a las otras formas de dar contexto
Cada vía tiene su momento, y ninguna es gratis. La última fila es esta extensión, con lo que cuesta dicho igual de claro.
| Cómo se hace ahora | Qué obtienes | Qué cuesta |
|---|---|---|
| Pegar la dirección y que el modelo la abra | Cero esfuerzo | Muchos modelos no llegan a la página; los que llegan reciben la versión servida a un bot, no la que estás leyendo con tu sesión abierta |
| Copiar y pegar desde el navegador | El texto, rápido | Arrastra el menú, el aviso de cookies y los titulares laterales, que ocupan contexto y compiten con el artículo |
| Imprimir a PDF y subirlo | Un archivo que casi cualquier chat acepta | El PDF conserva la maquetación en columnas, que se lee mal al convertirla a texto, y sube igualmente los menús |
| Captura de pantalla | Sirve cuando lo importante es lo visual | El texto hay que reconocerlo, las tablas se degradan y una página larga son quince imágenes |
| Otra extensión de «chatear con esta página» | Un solo clic, sin pegar nada | El texto pasa por un servicio ajeno y no siempre se sabe cuál ni qué guarda |
| Clean Clipper | Markdown sin navegación, con dirección y fecha explícitas, copiado en local | Es manual y de una página cada vez; y no todo el ruido desaparece: quedaron 102 líneas duplicadas en el corpus, no cero |
Cuando el contexto sale mal
¿Por qué queda alguna línea de menú en la captura?
Porque el recorte es muy bueno, no perfecto, y así está medido: 102 líneas de navegación duplicadas en 109 páginas, frente a las 282, 478 y 491 de los otros tres motores. Lo que sobrevive suele ser navegación que el sitio maqueta como texto normal dentro del propio artículo, indistinguible de una lista corriente. Si te molesta en un dominio concreto, un vistazo a la vista de lectura te dice si merece la pena borrar dos líneas al pegar.
¿Por qué la extensión dice «sin artículo» en una página que sí tiene texto?
Porque una cuarta parte o más del texto está dentro de enlaces. Ese umbral es lo que separa un artículo de un tablón de titulares, y las páginas de recopilación, los índices y las portadas lo cruzan aunque contengan párrafos.
La consecuencia es deliberada: para un modelo, trescientos enlaces con forma de contenido son peores que no recibir nada, porque producen respuestas que parecen fundamentadas. Entra en la pieza concreta y captura ahí. Un artículo largo con muchas citas no cae en el umbral, porque se admite una excepción cuando el bloque contiene más de unos 1200 caracteres de texto real.
¿Por qué falta la parte final del artículo?
Porque no estaba en la página cuando pulsaste. La extensión lee el DOM en ese instante, así que lo que se carga al bajar, lo que vive en pestañas cerradas y los comentarios plegados no existen para ella. Baja hasta el final, despliega lo que quieras conservar y entonces captura: la lectura tarda decenas de milisegundos y el tiempo aparece en la esquina de la ventana.
¿Por qué el campo published llegó vacío?
Porque esa página no declara fecha en sus metadatos, y rellenarla con la de hoy sería inventarla. Se buscan JSON-LD datePublished, article:published_time, citation_date, time[datetime] y marcas de tiempo Unix, y dateModified se descarta a propósito porque es la fecha de la última edición, no la de publicación. Si la fecha te importa para la pregunta que vas a hacer, dísela al modelo tú al pegar.
Lo que no hace
No resume, no reescribe y no traduce: el texto llega al modelo tal como estaba en la página. No envía nada por su cuenta a ningún servicio de IA; el botón copia al portapapeles y abre una pestaña, y ahí termina su parte. No recorre varias pestañas por ti ni sigue enlaces. Y en una tienda, un buscador o un tablón de titulares dirá que no hay artículo en lugar de entregarte trescientos enlaces.
Preguntas
¿Por qué no pegar la dirección y dejar que el modelo la abra?
¿La extensión envía algo a un servicio de IA?
¿Puedo quitar las imágenes para ahorrar contexto?
¿Cuánto se ahorra de verdad?
¿Sirve para montar una base de conocimiento o un RAG?
¿Qué frontmatter conviene dejar activo para un modelo?
title, source y published. Los tres se leen al principio del texto pegado y le dan al modelo lo único que no puede deducir del cuerpo: cómo se llama la página, de dónde sale y cuándo se publicó.¿Se puede capturar varias pestañas de una vez?
¿Sirve el Markdown tal cual para un índice vectorial?
# y ##, que es la señal más limpia para cortar por secciones, y el frontmatter YAML entra como metadatos sin conversión previa.¿Qué pasa con las páginas que se leen solo con sesión iniciada?
¿Cómo sé si el texto salió del DOM o de los datos estructurados?
extraction. dom significa que el texto es lo que el navegador mostró de verdad; jsonld-articlebody significa que la página nunca terminó de renderizarse y el cuerpo se leyó de sus datos estructurados, donde a veces falta el formato de los bloques de código.