Clean Clipper Añadir a Chrome – gratis

Para quién es

Deja de pagar cuarenta veces el mismo menú

Cuando pegas una página web en un modelo, cada línea de menú duplicada, cada aviso de cookies y cada lista de «lo más leído» ocupa contexto y compite por la atención del modelo. En un corpus de 109 páginas Clean Clipper dejó 102 líneas de navegación duplicadas donde los otros tres motores dejaron 282, 478 y 491. Lo que llega al chat es el artículo, con su dirección de origen y su fecha en el frontmatter.

Ruido que se paga dos veces

Una página de un medio grande trae el menú principal repetido en la cabecera, en el pie y en cada bloque de sección. Al pegarla en un chat, esas líneas entran en el contexto y ocupan sitio como cualquier otro texto, pero además desplazan al artículo: cuanto más ruido, más lejos queda lo que de verdad querías preguntar. Con veinte páginas en la misma conversación, buena parte del presupuesto se va en navegación.

El segundo problema es la confusión. Un modelo que ve «Suscríbete», «Lo más leído» y tres titulares sueltos junto al artículo se los cree parte del texto y los arrastra a la respuesta. Y si en la captura sobreviven etiquetas HTML, el modelo gasta atención en descifrar marcado en lugar de contenido.

El tercero es que se pierde la procedencia. Cuando pegas cinco páginas seguidas sin decir de dónde sale cada una, la conversación se convierte en un bloque indistinto y el modelo acaba atribuyendo una afirmación a la fuente equivocada. La fecha corre la misma suerte: sin ella, una nota de hace cuatro años y la de la semana pasada pesan igual, y ahí es donde nacen las respuestas seguras de sí mismas y desfasadas.

Qué cambia en el contexto

Lo que se corta antes de que el texto llegue al modeloelmundo.es
Líneas que se repetían en la página y no llegaron a la nota:

  Portada · España · Internacional · Economía · Deportes    × 11
  Compartir en Facebook · Compartir en X · Enviar por correo × 8
  Lo más leído                                              × 6
  Aceptar y continuar                                       × 3

En la nota quedan el título, la fecha, la dirección de origen y el cuerpo.

Cómo preparar una página para tu modelo

El objetivo aquí no es guardar, sino que el texto llegue al chat sin nada que no sea el artículo. Estos seis pasos dejan el atajo listo para copiar y pegar sin abrir ninguna ventana.

  1. Abre los ajustes de la extensión y pon el clic en el icono en «portapapeles». Así el gesto completo es un clic y un Ctrl+V en el chat, sin ventana intermedia que cerrar.
  2. Pon las imágenes en «omitir». Un enlace de imagen es una dirección larga que el modelo lee, cuenta y no puede ver: es el recorte de contexto más barato que hay.
  3. Deja activos solo title, source y published en el frontmatter. Los tres se leen de un vistazo al principio del texto pegado y le dan al modelo el título real, la dirección y la fecha de publicación, que es justo lo que no puede deducir del cuerpo.
  4. Comprueba el atajo Alt+Shift+M en chrome://extensions/shortcuts. Con el clic puesto en «portapapeles», el atajo copia sin abrir nada: puedes encadenar varias páginas seguidas sin soltar el teclado.
  5. Antes de fiarte del flujo, captura una página del sitio del que vayas a sacar más material y ábrela una vez en la vista de lectura. Ahí se ve si queda alguna línea de navegación y si el cuerpo llegó entero.
  6. Cuando quieras copiar y abrir el chat en un solo gesto, usa el botón «a la IA» de la ventana de captura. Copia al portapapeles y abre la pestaña de la conversación; el envío lo haces tú, porque la extensión no manda nada por su cuenta.

Ajustes para gastar menos contexto

Cada valor de esta tabla quita algo que el modelo pagaría sin recibir nada a cambio. Están ordenados de más a menos ahorro por ajuste.

AjusteValorPor qué así para un modelo
Clic en el iconoPortapapelesEl destino natural es el chat, no el disco: un clic y un pegado, sin ventana que cerrar
ImágenesOmitirUn enlace de imagen son decenas de caracteres que el modelo procesa y no puede ver
Frontmatter`title`, `source`, `published`Le dan al modelo la procedencia y la fecha de forma explícita, que es lo único que no puede deducir del cuerpo
Campo `author`DesactivadoRara vez cambia una respuesta y en cambio invita al modelo a hablar de quién escribe en lugar de qué dice
Atajo de tecladoAlt+Shift+MPermite encadenar varias páginas seguidas: capturar, pegar, cambiar de pestaña, repetir
Regla por sitioDominios con muchas imágenes → «omitir»Los sitios ilustrados son los que más contexto malgastan; la regla lo resuelve sin que decidas cada vez
Vista de lecturaRevisar el primer recorte de cada sitioUn vistazo confirma si ese sitio deja restos de navegación, y solo hace falta hacerlo una vez por dominio
Caso difícil: una portada. La extensión se niega en vez de entregar trescientos enlaceselpais.com – portada
Sin artículo.

  Caracteres dentro de etiquetas de enlace   64 %   (umbral: 25 %)
  Líneas de menos de 25 caracteres           71 %
  Párrafos de texto seguido                   0

En esta dirección no hay artículo que extraer: es un tablón de titulares.
Entregarlo como Markdown daría al modelo trescientos enlaces con aspecto
de contenido, y una respuesta construida sobre eso parece fundamentada
sin serlo. Abre la noticia concreta y captura ahí.

Tres casos reales

Preguntar sobre un informe largo sin agotar la ventana

Tienes delante un informe de treinta páginas en la web y quieres preguntarle cosas concretas. Pegar la dirección no sirve de mucho: muchos modelos no llegan a la página, y los que llegan reciben la versión que se le sirve a un bot. Pulsas Alt+Shift+M y el informe entero va al portapapeles como Markdown.

Lo que se pega en el chat es el cuerpo con sus encabezados y sus tablas, más tres líneas de frontmatter con el título, la dirección y la fecha de publicación. Las tablas importan más de lo que parece: en el corpus técnico sobrevivieron doce de quince, frente a siete de cada motor comparado, y una tabla rota es una pregunta que el modelo contesta mal.

Cinco páginas de documentación en una sola conversación

Estás resolviendo un problema que cruza tres bibliotecas. Capturas cinco páginas de referencia una detrás de otra y las pegas en la misma conversación, cada una precedida de su source. El modelo puede citar por dirección cuál dice qué, en lugar de mezclar las cinco en una respuesta sin costuras.

El ahorro es medible: en las 109 páginas del primer corpus quedaron 102 líneas de menú duplicadas donde los otros tres motores dejaron 282, 478 y 491. Con cinco páginas encima de la mesa, esa diferencia es la que decide si cabe también tu propio código en la misma conversación.

Montar a mano un corpus para búsqueda local

Quieres un índice consultable de las cincuenta páginas que de verdad usas, no de un sitio entero. Capturas cada una a una carpeta, con el frontmatter completo, y ahí termina la parte de la extensión: no hay rastreo, ni programación, ni cola de descargas.

Lo que obtienes son archivos .md con metadatos en YAML, que es el formato de entrada que casi cualquier indexador entiende sin conversión previa. El campo extraction te dice de cada archivo si el cuerpo salió del DOM o de los datos estructurados, y eso permite revisar primero los dudosos en lugar de fiarte del lote entero.

Frente a las otras formas de dar contexto

Cada vía tiene su momento, y ninguna es gratis. La última fila es esta extensión, con lo que cuesta dicho igual de claro.

Cómo se hace ahoraQué obtienesQué cuesta
Pegar la dirección y que el modelo la abraCero esfuerzoMuchos modelos no llegan a la página; los que llegan reciben la versión servida a un bot, no la que estás leyendo con tu sesión abierta
Copiar y pegar desde el navegadorEl texto, rápidoArrastra el menú, el aviso de cookies y los titulares laterales, que ocupan contexto y compiten con el artículo
Imprimir a PDF y subirloUn archivo que casi cualquier chat aceptaEl PDF conserva la maquetación en columnas, que se lee mal al convertirla a texto, y sube igualmente los menús
Captura de pantallaSirve cuando lo importante es lo visualEl texto hay que reconocerlo, las tablas se degradan y una página larga son quince imágenes
Otra extensión de «chatear con esta página»Un solo clic, sin pegar nadaEl texto pasa por un servicio ajeno y no siempre se sabe cuál ni qué guarda
Clean ClipperMarkdown sin navegación, con dirección y fecha explícitas, copiado en localEs manual y de una página cada vez; y no todo el ruido desaparece: quedaron 102 líneas duplicadas en el corpus, no cero

Cuando el contexto sale mal

¿Por qué queda alguna línea de menú en la captura?

Porque el recorte es muy bueno, no perfecto, y así está medido: 102 líneas de navegación duplicadas en 109 páginas, frente a las 282, 478 y 491 de los otros tres motores. Lo que sobrevive suele ser navegación que el sitio maqueta como texto normal dentro del propio artículo, indistinguible de una lista corriente. Si te molesta en un dominio concreto, un vistazo a la vista de lectura te dice si merece la pena borrar dos líneas al pegar.

¿Por qué la extensión dice «sin artículo» en una página que sí tiene texto?

Porque una cuarta parte o más del texto está dentro de enlaces. Ese umbral es lo que separa un artículo de un tablón de titulares, y las páginas de recopilación, los índices y las portadas lo cruzan aunque contengan párrafos.

La consecuencia es deliberada: para un modelo, trescientos enlaces con forma de contenido son peores que no recibir nada, porque producen respuestas que parecen fundamentadas. Entra en la pieza concreta y captura ahí. Un artículo largo con muchas citas no cae en el umbral, porque se admite una excepción cuando el bloque contiene más de unos 1200 caracteres de texto real.

¿Por qué falta la parte final del artículo?

Porque no estaba en la página cuando pulsaste. La extensión lee el DOM en ese instante, así que lo que se carga al bajar, lo que vive en pestañas cerradas y los comentarios plegados no existen para ella. Baja hasta el final, despliega lo que quieras conservar y entonces captura: la lectura tarda decenas de milisegundos y el tiempo aparece en la esquina de la ventana.

¿Por qué el campo published llegó vacío?

Porque esa página no declara fecha en sus metadatos, y rellenarla con la de hoy sería inventarla. Se buscan JSON-LD datePublished, article:published_time, citation_date, time[datetime] y marcas de tiempo Unix, y dateModified se descarta a propósito porque es la fecha de la última edición, no la de publicación. Si la fecha te importa para la pregunta que vas a hacer, dísela al modelo tú al pegar.

Lo que no hace

No resume, no reescribe y no traduce: el texto llega al modelo tal como estaba en la página. No envía nada por su cuenta a ningún servicio de IA; el botón copia al portapapeles y abre una pestaña, y ahí termina su parte. No recorre varias pestañas por ti ni sigue enlaces. Y en una tienda, un buscador o un tablón de titulares dirá que no hay artículo en lugar de entregarte trescientos enlaces.

Añadir a Chrome – gratisGratis del todo: sin cuenta y sin límite de páginas.

Preguntas

¿Por qué no pegar la dirección y dejar que el modelo la abra?
Muchos modelos no llegan a la página, y los que llegan suelen recibir la versión que se le sirve a un bot, no la que estás leyendo tú. Capturar guarda exactamente lo que había en tu pantalla, incluido lo que hay detrás de una sesión que ya tenías abierta.
¿La extensión envía algo a un servicio de IA?
Solo si pulsas el botón que lo hace, y aun así lo único que ocurre es que la captura va a tu portapapeles y se abre una pestaña de chat. La extensión en sí no hace ninguna petición de red.
¿Puedo quitar las imágenes para ahorrar contexto?
Sí. Pon las imágenes en «omitir» y el Markdown no contiene ningún enlace de imagen.
¿Cuánto se ahorra de verdad?
Depende de la página, y por eso la medición está publicada. En las 109 páginas del primer corpus quedaron 102 líneas de menú duplicadas frente a 282, 478 y 491 de los otros tres motores.
¿Sirve para montar una base de conocimiento o un RAG?
Sí, con una salvedad: es manual. Capturas las páginas que quieres, una a una, y obtienes archivos Markdown con frontmatter que cualquier indexador lee. No hay rastreo automático.
¿Qué frontmatter conviene dejar activo para un modelo?
title, source y published. Los tres se leen al principio del texto pegado y le dan al modelo lo único que no puede deducir del cuerpo: cómo se llama la página, de dónde sale y cuándo se publicó.
¿Se puede capturar varias pestañas de una vez?
No. La captura es de la pestaña en la que actúas, una cada vez, porque el acceso a la página lo concede tu clic o tu atajo y solo para esa pestaña y esa acción.
¿Sirve el Markdown tal cual para un índice vectorial?
Sí, con el troceado que ya uses. Los encabezados sobreviven como # y ##, que es la señal más limpia para cortar por secciones, y el frontmatter YAML entra como metadatos sin conversión previa.
¿Qué pasa con las páginas que se leen solo con sesión iniciada?
Se capturan igual, porque la extensión lee la página que tu navegador ya ha renderizado con tu sesión. Eso es justo lo que un modelo que abre la dirección por su cuenta no puede ver.
¿Cómo sé si el texto salió del DOM o de los datos estructurados?
Por el campo extraction. dom significa que el texto es lo que el navegador mostró de verdad; jsonld-articlebody significa que la página nunca terminó de renderizarse y el cuerpo se leyó de sus datos estructurados, donde a veces falta el formato de los bloques de código.