Pro koho to je ·
Neplaťte za stejné menu čtyřicetkrát
Každý zdvojený řádek menu, cookie lišta i seznam „čtěte dále“ se v okně modelu počítají jako kontext a přetahují si pozornost. Na korpusu 109 stránek (přímé srovnání) zbylo po Clean Web Clipperu 102 zdvojených řádků navigace tam, kde tři jiné nástroje nechaly 282, 478 a 491, a zbylých HTML značek nula.
Odkud ta čísla jsou: měření s verzemi nástrojů a daty
Co se do okna nevejde
Zkopírovaná webová stránka je z podstatné části navigace. Do chatu se s článkem nastěhuje hlavička, patička, boční panel a stejné menu zopakované u každé sekce, a všechno to zabírá místo, které jste chtěli dát textu. U delší stránky se kvůli tomu do jednoho okna nevejde ani to, kvůli čemu jste ji vkládali.
Horší než objem je to, co ten balast dělá s odpovědí. Model nemá jak poznat, že „Přihlásit se“ a „Čtěte dále“ nejsou obsah, takže je bere vážně – a při shrnutí nebo hledání citátu se opře o popisky odkazů místo o věty. K tomu se často ztratí to jediné, co potřebujete mít jistě: odkud text je a kdy vyšel.
Nejdražší bývá druhé vložení. Konverzace se protáhne, historie se zkrátí a stránku vkládáte znovu – jenže ta se od rána změnila, takže model uvažuje nad trochu jiným textem a ve vlákně o tom nic nestojí. Agent, který stahuje stejnou adresu při každém běhu, má stejný problém, a k tomu limity požadavků a přihlášení, přes které se nedostane. Soubor na disku je pokaždé stejný vstup a přečte se, i když web nejede.
Co se změní
- Zhruba čtyřikrát méně zdvojených řádků navigace než průměr tří porovnávaných nástrojů
- Nula zbylých HTML značek – model se nemusí prokousávat cizí syntaxí
- YAML frontmatter dá modelu adresu zdroje a datum vydání natvrdo, ne mezi řádky
- Jedna klávesová zkratka zkopíruje celou stránku jako Markdown, připravený k vložení do libovolného chatu
- Tlačítko „do AI chatu“ zkopíruje text a chat otevře jedním pohybem
- Obrázky se dají přepnout na „vynechat“, takže v textu nezůstane jediný odkaz na obrázek
- Méně útržkovitých řádků: podíl řádků kratších než dvacet pět znaků vyšel 0,221 proti 0,278, 0,262 a 0,263 u porovnávaných nástrojů – krátké řádky jsou většinou popisky odkazů v přestrojení za věty
- Odkazy na reference se mění na poznámky
[^1]na konci souboru, takže číslovaná citace v textu pořád vede ke zdroji, ne do mrtvé kotvy
--- title: "Velký jazykový model – Wikipedie" source: "https://cs.wikipedia.org/wiki/Velký_jazykový_model" date: "2023-04-19T11:02:31.000Z" extraction: "dom" --- Velký jazykový model je jazykový model tvořený neuronovou sítí s velkým počtem parametrů, trénovanou na rozsáhlém korpusu textu.
Nastavení pro prompty
Dvě různá nastavení s většinou společných hodnot – jedno pro vkládání do chatu, druhé pro složku, kterou čte agent. Každé zabere zhruba pět minut.
- Klikněte pravým tlačítkem na ikonu, otevřete Možnosti a kliknutí na ikonu nastavte na „kopírovat do schránky“. Kratší cesta neexistuje: kliknout, přepnout do chatu, vložit.
- Obrázky přepněte na vynechat. Jediná adresa obrázku z CDN umí mít dvě stě znaků parametrů pro změnu velikosti a textovému modelu neřekne nic.
- Ve frontmatteru nechte zapnuté
sourceadatea vypněteauthoraextraction. Dva řádky hlavičky modelu stačí, aby tvrzení přiřadil ke zdroji; zbytek je hlavička, za jejíž odeslání platíte. - Stránku uložte zkratkou
Alt+Shift+Ma vložte. Když rozšíření odpoví „tady článek není“, nevkládejte ji stejně: ta odpověď znamená, že stránku tvořily hlavně popisky odkazů, a přesně po takovém vstupu model vyjmenuje položky menu jako témata. - Pro agenta místo chatu nastavte cíl na složku, kterou agent už čte, třeba
context/v projektu, a šablonu názvu na{domain}-{title}. - Do té složky uložte šest nebo osm stránek, na kterých úloha opravdu stojí. Agent pak čte místní soubory: nic nestahuje, nenaráží na limity ani na přihlášení, přes které se nedostane, a při každém běhu dostane stejný text.
- Pro weby, ze kterých ukládáte nejčastěji, založte pravidlo, třeba
reddit.comdo vlastní podsložky s vynechanými obrázky. Složka tak zůstane setříděná, aniž byste na to museli myslet.
Nastavení, které zmenší účet za kontext
Každá z těchto hodnot odstraní něco, za jehož přečtení model účtuje. Nejčastěji se chybuje u frontmatteru: přiřazení ke zdroji stojí za dva řádky, ne za pět.
| Nastavení | Hodnota | Proč právě tak |
|---|---|---|
| Kliknutí na ikonu | kopírovat do schránky | Kliknout, přepnout, vložit: žádný soubor, žádné okno, žádný dialog |
| Obrázky | vynechat | Adresy obrázků jsou dlouhé, textovému modelu nic neříkají a bývají delší než odstavec vedle nich |
| Frontmatter | source a date zapnuté, author a extraction vypnuté | Dost na přiřazení tvrzení ke zdroji a nic za pole, která model nepoužije |
| Cílová složka (agent) | složka context/ v projektu | Místní soubory znamenají žádné stahování, žádné limity a stejný vstup při každém běhu |
| Šablona názvu | {domain}-{title} | Agent, který složku prohledává, rozliší dvě stránky „Přehled“ |
| Výběr | uložit výběr, ne celou stránku | Když na otázku odpovídá jeden oddíl, ostatních devět je čistý náklad |
| Pravidlo pro web | reddit.com → podsložka, obrázky vynechat | Vlákna a referenční materiál patří na jiné hromádky |
--- title: "Sněmovna schválila novelu energetického zákona" source: "https://zpravy.aktualne.cz/domaci/" date: "" extraction: "jsonld-articlebody" --- Novela zavádí sdílení elektřiny mezi odběrnými místy a mění pravidla pro připojení výroben do sítě.
Tři způsoby použití
Jedna stránka, jedna otázka
Čtete specifikaci a chcete, aby model zkontroloval, jak rozumíte jednomu oddílu. Označíte ho, stisknete Alt+Shift+M a vložíte. Dorazí ten oddíl, řádek source a řádek date: žádná cookie lišta, žádný přepínač verzí, žádný panel „na této stránce“ ani osm sloupců patičky.
Rozdíl se ukáže spíš na odpovědi než na účtu. Model, který dostane stránku i s navigací, zařadí při shrnutí mezi témata položky menu, protože fráze opakovaná v každém oddílu opravdu vypadá jako struktura. Když navigace zmizí, zmizí chyba už u zdroje.
Složka, kterou agent čte místo stahování
Programovací agent potřebuje referenční příručku API jedné knihovny. Uložíte osm stránek do context/, každou pojmenovanou podle domény a názvu. Agent čte místní soubory: nic se nestahuje, nic nenaráží na limity a stránky za vaším přihlášením jsou stejně čitelné jako veřejné.
Navíc zůstanou v klidu. Stažená stránka se může mezi dvěma běhy téže úlohy změnit a v přepisu to nikde nestojí. Uložený soubor se změní, jen když ho uložíte znovu, a starší soubor zůstane vedle k porovnání.
Stránka, na kterou model vůbec nedosáhne
Dokument leží na interní wiki za jednotným přihlášením nebo v předplatném, které platíte. Model, který má adresu stáhnout, dostane přihlašovací obrazovku; model s vyhledávacím nástrojem dostane verzi pro roboty. Rozšíření čte stránku, kterou už prohlížeč vykreslil pro vaši relaci, takže text, který vidíte, je text, který vložíte.
Text stránky přitom váš počítač neopustí a výstřižek se nikam nenahrává. Jde do schránky a tlačítko „do AI chatu“ jen zkopíruje text a otevře kartu; samo nic neodesílá.
Proti jiným cestám, jak dát modelu stránku
Tohle jsou cesty, kterými lidé stránku modelu opravdu předávají. Každý řádek říká, co dostanete a co to stojí – tahle cesta včetně.
| Způsob | Co z toho vyjde | Co to stojí |
|---|---|---|
| Vložit adresu | Jeden řádek v promptu | Spousta modelů stránku stáhnout neumí; ty, které umí, mohou dostat verzi pro roboty |
| Zkopírovat a vložit stránku | Všechno, i s výbavou stránky | Srovnatelné výstupy nesly 282 až 491 zdvojených řádků menu, tady 102 |
| Snímek obrazovky do multimodálního modelu | Stránku, jak vypadala | Tokeny za obrázek, žádný řádek se zdrojem ani datem a nic, v čem se dá později hledat |
| Uložit stránku jako HTML | Věrnou kopii na disku | Značky v souboru převažují a článek je menšina toho, co posíláte |
| Režim čtení a pak kopírovat | Někdy čistší text | Na některých stránkách se zapne, na jiných ne, a hlavičku se zdrojem ani datem nenese |
| Clean Web Clipper | Text článku s dvouřádkovou hlavičkou | Jedna stránka po druhé; nic neshrnuje, nedělí na části ani nepřevádí na embeddingy |
Když se odpověď vrátí špatně
Model shrnul navigaci, ne článek
Přesně tohle udělá s promptem výpisová stránka. Podívejte se, co hlásilo okno: pokud „tady článek není“, leželo víc než zhruba čtvrtina vytažených znaků v popiscích odkazů, což je poznávací znamení rubriky, výsledků hledání nebo e-shopu. Najděte stránku se samotným článkem a uložte tu. Odpověď se změní víc než po jakémkoli přeformulování promptu.
Uložený text je mnohem kratší, než stránka vypadala
Dvě obvyklé příčiny. Buď stránka načítá tělo až při posouvání a ve chvíli uložení existovala jen vykreslená část – nejdřív sjeďte na konec, pak ukládejte. Nebo je oddíl ve sbaleném bloku či neotevřené záložce, která v DOM není, dokud ji neotevřete. Co prohlížeč nevykreslil, nepřečte žádné rozšíření.
Model nemá jaké datum citovat
Stránka žádné neuvedla. Pole zůstane prázdné, místo aby se vyplnilo dneškem, protože sebejisté špatné datum je v kontextu modelu horší než chybějící – model vám ho vrátí jako fakt. Některé korpusy nesou data mnohem vzácněji než jiné: na turecké a české padesátce nejnavštěvovanějších webů je datum vydání opravdu vzácné, a to je vlastnost těch webů, ne extrakce.
Odkazy na obrázky pořád ujídají kontext
Obrázky se ve výchozím stavu nechávají jako odkazy, což je správně pro čtení a špatně pro prompt. Přepněte obrázky na „vynechat“, globálně nebo pravidlem pro web, a v Markdownu nezůstane jediný odkaz na obrázek – žádný zástupný text, žádné prázdné závorky, nic.
Co nedělá
Text nikam neposílá sám od sebe: kopie jde do schránky a chat otevřete vy. Neshrnuje, nezkracuje ani nepřepisuje – počet znaků snižuje jedině tím, že odstraní to, co článek není. Neprochází web a neumí stáhnout deset odkazů najednou. A na výpisové stránce, e-shopu nebo ve výsledcích hledání raději ohlásí „na této stránce není článek“, než aby modelu podal tři sta odkazů.