Clean Web Clipper Přidat do Chromu – zdarma

Pro koho to je ·

Neplaťte za stejné menu čtyřicetkrát

Každý zdvojený řádek menu, cookie lišta i seznam „čtěte dále“ se v okně modelu počítají jako kontext a přetahují si pozornost. Na korpusu 109 stránek (přímé srovnání) zbylo po Clean Web Clipperu 102 zdvojených řádků navigace tam, kde tři jiné nástroje nechaly 282, 478 a 491, a zbylých HTML značek nula.

Odkud ta čísla jsou: měření s verzemi nástrojů a daty

Co se do okna nevejde

Zkopírovaná webová stránka je z podstatné části navigace. Do chatu se s článkem nastěhuje hlavička, patička, boční panel a stejné menu zopakované u každé sekce, a všechno to zabírá místo, které jste chtěli dát textu. U delší stránky se kvůli tomu do jednoho okna nevejde ani to, kvůli čemu jste ji vkládali.

Horší než objem je to, co ten balast dělá s odpovědí. Model nemá jak poznat, že „Přihlásit se“ a „Čtěte dále“ nejsou obsah, takže je bere vážně – a při shrnutí nebo hledání citátu se opře o popisky odkazů místo o věty. K tomu se často ztratí to jediné, co potřebujete mít jistě: odkud text je a kdy vyšel.

Nejdražší bývá druhé vložení. Konverzace se protáhne, historie se zkrátí a stránku vkládáte znovu – jenže ta se od rána změnila, takže model uvažuje nad trochu jiným textem a ve vlákně o tom nic nestojí. Agent, který stahuje stejnou adresu při každém běhu, má stejný problém, a k tomu limity požadavků a přihlášení, přes které se nedostane. Soubor na disku je pokaždé stejný vstup a přečte se, i když web nejede.

Přidat do Chromu – zdarmaZdarma a bez účtu. Žádný limit stránek.For Chrome on a computer

Co se změní

Co se vloží do chatu: hlavička a text, nic mezi tímcs.wikipedia.org/wiki/Velký_jazykový_model
---
title: "Velký jazykový model – Wikipedie"
source: "https://cs.wikipedia.org/wiki/Velký_jazykový_model"
date: "2023-04-19T11:02:31.000Z"
extraction: "dom"
---

Velký jazykový model je jazykový model tvořený neuronovou sítí s velkým
počtem parametrů, trénovanou na rozsáhlém korpusu textu.

Nastavení pro prompty

Dvě různá nastavení s většinou společných hodnot – jedno pro vkládání do chatu, druhé pro složku, kterou čte agent. Každé zabere zhruba pět minut.

  1. Klikněte pravým tlačítkem na ikonu, otevřete Možnosti a kliknutí na ikonu nastavte na „kopírovat do schránky“. Kratší cesta neexistuje: kliknout, přepnout do chatu, vložit.
  2. Obrázky přepněte na vynechat. Jediná adresa obrázku z CDN umí mít dvě stě znaků parametrů pro změnu velikosti a textovému modelu neřekne nic.
  3. Ve frontmatteru nechte zapnuté source a date a vypněte author a extraction. Dva řádky hlavičky modelu stačí, aby tvrzení přiřadil ke zdroji; zbytek je hlavička, za jejíž odeslání platíte.
  4. Stránku uložte zkratkou Alt+Shift+M a vložte. Když rozšíření odpoví „tady článek není“, nevkládejte ji stejně: ta odpověď znamená, že stránku tvořily hlavně popisky odkazů, a přesně po takovém vstupu model vyjmenuje položky menu jako témata.
  5. Pro agenta místo chatu nastavte cíl na složku, kterou agent už čte, třeba context/ v projektu, a šablonu názvu na {domain}-{title}.
  6. Do té složky uložte šest nebo osm stránek, na kterých úloha opravdu stojí. Agent pak čte místní soubory: nic nestahuje, nenaráží na limity ani na přihlášení, přes které se nedostane, a při každém běhu dostane stejný text.
  7. Pro weby, ze kterých ukládáte nejčastěji, založte pravidlo, třeba reddit.com do vlastní podsložky s vynechanými obrázky. Složka tak zůstane setříděná, aniž byste na to museli myslet.

Nastavení, které zmenší účet za kontext

Každá z těchto hodnot odstraní něco, za jehož přečtení model účtuje. Nejčastěji se chybuje u frontmatteru: přiřazení ke zdroji stojí za dva řádky, ne za pět.

NastaveníHodnotaProč právě tak
Kliknutí na ikonukopírovat do schránkyKliknout, přepnout, vložit: žádný soubor, žádné okno, žádný dialog
ObrázkyvynechatAdresy obrázků jsou dlouhé, textovému modelu nic neříkají a bývají delší než odstavec vedle nich
Frontmattersource a date zapnuté, author a extraction vypnutéDost na přiřazení tvrzení ke zdroji a nic za pole, která model nepoužije
Cílová složka (agent)složka context/ v projektuMístní soubory znamenají žádné stahování, žádné limity a stejný vstup při každém běhu
Šablona názvu{domain}-{title}Agent, který složku prohledává, rozliší dvě stránky „Přehled“
Výběruložit výběr, ne celou stránkuKdyž na otázku odpovídá jeden oddíl, ostatních devět je čistý náklad
Pravidlo pro webreddit.com → podsložka, obrázky vynechatVlákna a referenční materiál patří na jiné hromádky
Nedovykreslená stránka bez data: model dostane obojí přiznanézpravy.aktualne.cz
---
title: "Sněmovna schválila novelu energetického zákona"
source: "https://zpravy.aktualne.cz/domaci/"
date: ""
extraction: "jsonld-articlebody"
---

Novela zavádí sdílení elektřiny mezi odběrnými místy a mění pravidla
pro připojení výroben do sítě.

Tři způsoby použití

Jedna stránka, jedna otázka

Čtete specifikaci a chcete, aby model zkontroloval, jak rozumíte jednomu oddílu. Označíte ho, stisknete Alt+Shift+M a vložíte. Dorazí ten oddíl, řádek source a řádek date: žádná cookie lišta, žádný přepínač verzí, žádný panel „na této stránce“ ani osm sloupců patičky.

Rozdíl se ukáže spíš na odpovědi než na účtu. Model, který dostane stránku i s navigací, zařadí při shrnutí mezi témata položky menu, protože fráze opakovaná v každém oddílu opravdu vypadá jako struktura. Když navigace zmizí, zmizí chyba už u zdroje.

Složka, kterou agent čte místo stahování

Programovací agent potřebuje referenční příručku API jedné knihovny. Uložíte osm stránek do context/, každou pojmenovanou podle domény a názvu. Agent čte místní soubory: nic se nestahuje, nic nenaráží na limity a stránky za vaším přihlášením jsou stejně čitelné jako veřejné.

Navíc zůstanou v klidu. Stažená stránka se může mezi dvěma běhy téže úlohy změnit a v přepisu to nikde nestojí. Uložený soubor se změní, jen když ho uložíte znovu, a starší soubor zůstane vedle k porovnání.

Stránka, na kterou model vůbec nedosáhne

Dokument leží na interní wiki za jednotným přihlášením nebo v předplatném, které platíte. Model, který má adresu stáhnout, dostane přihlašovací obrazovku; model s vyhledávacím nástrojem dostane verzi pro roboty. Rozšíření čte stránku, kterou už prohlížeč vykreslil pro vaši relaci, takže text, který vidíte, je text, který vložíte.

Text stránky přitom váš počítač neopustí a výstřižek se nikam nenahrává. Jde do schránky a tlačítko „do AI chatu“ jen zkopíruje text a otevře kartu; samo nic neodesílá.

Proti jiným cestám, jak dát modelu stránku

Tohle jsou cesty, kterými lidé stránku modelu opravdu předávají. Každý řádek říká, co dostanete a co to stojí – tahle cesta včetně.

ZpůsobCo z toho vyjdeCo to stojí
Vložit adresuJeden řádek v promptuSpousta modelů stránku stáhnout neumí; ty, které umí, mohou dostat verzi pro roboty
Zkopírovat a vložit stránkuVšechno, i s výbavou stránkySrovnatelné výstupy nesly 282 až 491 zdvojených řádků menu, tady 102
Snímek obrazovky do multimodálního modeluStránku, jak vypadalaTokeny za obrázek, žádný řádek se zdrojem ani datem a nic, v čem se dá později hledat
Uložit stránku jako HTMLVěrnou kopii na diskuZnačky v souboru převažují a článek je menšina toho, co posíláte
Režim čtení a pak kopírovatNěkdy čistší textNa některých stránkách se zapne, na jiných ne, a hlavičku se zdrojem ani datem nenese
Clean Web ClipperText článku s dvouřádkovou hlavičkouJedna stránka po druhé; nic neshrnuje, nedělí na části ani nepřevádí na embeddingy

Když se odpověď vrátí špatně

Model shrnul navigaci, ne článek

Přesně tohle udělá s promptem výpisová stránka. Podívejte se, co hlásilo okno: pokud „tady článek není“, leželo víc než zhruba čtvrtina vytažených znaků v popiscích odkazů, což je poznávací znamení rubriky, výsledků hledání nebo e-shopu. Najděte stránku se samotným článkem a uložte tu. Odpověď se změní víc než po jakémkoli přeformulování promptu.

Uložený text je mnohem kratší, než stránka vypadala

Dvě obvyklé příčiny. Buď stránka načítá tělo až při posouvání a ve chvíli uložení existovala jen vykreslená část – nejdřív sjeďte na konec, pak ukládejte. Nebo je oddíl ve sbaleném bloku či neotevřené záložce, která v DOM není, dokud ji neotevřete. Co prohlížeč nevykreslil, nepřečte žádné rozšíření.

Model nemá jaké datum citovat

Stránka žádné neuvedla. Pole zůstane prázdné, místo aby se vyplnilo dneškem, protože sebejisté špatné datum je v kontextu modelu horší než chybějící – model vám ho vrátí jako fakt. Některé korpusy nesou data mnohem vzácněji než jiné: na turecké a české padesátce nejnavštěvovanějších webů je datum vydání opravdu vzácné, a to je vlastnost těch webů, ne extrakce.

Odkazy na obrázky pořád ujídají kontext

Obrázky se ve výchozím stavu nechávají jako odkazy, což je správně pro čtení a špatně pro prompt. Přepněte obrázky na „vynechat“, globálně nebo pravidlem pro web, a v Markdownu nezůstane jediný odkaz na obrázek – žádný zástupný text, žádné prázdné závorky, nic.

Co nedělá

Text nikam neposílá sám od sebe: kopie jde do schránky a chat otevřete vy. Neshrnuje, nezkracuje ani nepřepisuje – počet znaků snižuje jedině tím, že odstraní to, co článek není. Neprochází web a neumí stáhnout deset odkazů najednou. A na výpisové stránce, e-shopu nebo ve výsledcích hledání raději ohlásí „na této stránce není článek“, než aby modelu podal tři sta odkazů.

Přidat do Chromu – zdarmaZdarma a bez účtu. Žádný limit stránek.For Chrome on a computer

Otázky

Proč modelu prostě nedat odkaz, ať si stránku načte sám?
Spousta modelů se na stránku vůbec nedostane a ty, které ano, často dostanou verzi servírovanou robotům, ne tu, kterou čtete vy. Uložení zachytí přesně to, co bylo na vaší obrazovce, včetně obsahu za přihlášením, které už používáte.
Posílá rozšíření něco do AI služby?
Jen když stisknete tlačítko, které to dělá. Text jde do schránky a otevře se karta s chatem; samo rozšíření text stránky nikam neposílá.
O kolik se text zkrátí?
Podle stránky. Šetří se tím, co článek není: opakovaná navigace, bannery, seznamy „čtěte dále“. Věty z těla článku se neškrtají, protože zkracování textu je práce pro model, ne pro clipper.
Dají se vyhodit obrázky, aby se ušetřil kontext?
Ano. Přepněte obrázky na „vynechat“ a ve výsledném Markdownu nezůstane jediný odkaz na obrázek.
Pozná model, odkud text je?
Ano, pokud necháte frontmatter zapnutý. Adresa zdroje i datum vydání jsou v hlavičce jako pole, takže se na ně dá v odpovědi odkázat. Když stránka datum neuvádí, pole zůstane prázdné a model si nemá co domýšlet.
Funguje to s lokálním modelem?
Ano, a nic v rozšíření nepředpokládá opak. Výstřižek se nikam nenahrává, jde do schránky nebo do složky na disku, a co ho potom čte, je čistě vaše věc.
Dělí text na části, převádí ho na embeddingy nebo shrnuje?
Ne. Stránku převede a skončí. Dělení a embeddingy patří do pipeline, kterou si stavíte, a clipper, který by shrnoval, by za vás rozhodoval, které části zdroje model nikdy neuvidí.
Dá mi stejná stránka zítra stejný text?
Jen když bude stránka stejná. Proto se vyplatí soubor si nechat: zapsaný výstřižek se už nemění, takže úloha spuštěná znovu za měsíc čte stejný vstup a starší kopie leží na disku k porovnání.
Přežijí ukázky kódu tak, aby je model přečetl?
Ano, i se značkou jazyka: na technickém korpusu devíti stránek přežila značka ve 73 ohrazeních ze 156, proti 20 a 0 u porovnávaných nástrojů. Značka pochází z třídy, kterou nechal zvýrazňovač webu, takže není nikdy hádaná.
Můžu uložit několik karet do jednoho promptu naráz?
Ne. Není tu dávkový režim ani crawler; ukládá se stránka, na které stojíte. Více stránek uložte postupně do složky a modelu nebo agentovi dejte tu složku.