Pentru cine este
Nu mai plătiți același meniu de zeci de ori
Când o pagină web este lipită într-un model, fiecare linie de meniu duplicată și fiecare banner intră la socoteala contextului și concurează cu textul care vă interesează. Pe un corpus de 109 pagini, Clean Clipper a lăsat 102 linii de navigație repetate, acolo unde celelalte trei motoare au lăsat 282, 478 și 491. Frontmatterul dă pe deasupra adresa sursei și data publicării.
Cât costă o pagină lipită
O pagină web lipită ca atare ajunge la model cu tot ce o înconjura. Meniul principal repetat la fiecare secțiune, bara de cookie-uri, lista „citește și”, subsolul cu treizeci de linkuri juridice: este context pe care îl plătiți și pe care modelul trebuie să îl trieze înainte de a începe lucrul. Într-un document lung, partea aceasta ajunge să împingă afară din fereastră jumătate din textul care conta.
Rezultatul se vede în răspunsuri. Modelul citează o etichetă de meniu ca și cum ar fi titlul unei secțiuni, confundă două articole pentru că lista „citește și” le-a lipit titlurile de text, sau atribuie documentului o dată care era a subsolului. Nici darea adresei în locul textului nu rezolvă nimic: multe modele nu ajung la pagină, iar cele care ajung primesc adesea versiunea servită roboților, nu pe cea pe care ați citit-o dumneavoastră.
A treia pierdere este structura, și se vede cel mai prost. Un tabel lipit turtit pe o singură linie nu mai are coloane, așa că modelul citește cifrele în dreptul altor etichete și răspunde cu convingere greșit – o eroare pe care nu o observați, pentru că nu arată ca o eroare. Pe un corpus de cincisprezece tabele, douăsprezece au trecut întregi aici, față de câte șapte la fiecare motor comparat. La fel cu blocurile de cod: eticheta de limbaj a supraviețuit în 73 de blocuri din 156, față de 20 și 0, iar un model care nu știe dacă citește shell sau SQL începe prin a ghici.
Ce primește modelul
- De aproximativ patru ori mai puține linii de navigație repetate decât media motoarelor comparate
- Zero resturi de etichete HTML pe cele 512 pagini măsurate – modelul nu are de ocolit marcaj rătăcit
- Frontmatterul dă explicit adresa sursei și data publicării, în loc să le lase de ghicit
- O scurtătură copiază pagina întreagă ca Markdown, gata de lipit în orice conversație
- Imaginile pot fi scoase dintr-o setare, ceea ce elimină tot atâtea linkuri inutile
- Pe o pagină fără articol – vitrină, flux, listă de rezultate – extensia o spune, în loc să livreze trei sute de linkuri
- Tabelele ajung ca tabele GFM, deci modelul citește cifrele în dreptul etichetei lor: douăsprezece din cincisprezece pe corpusul tehnic, față de câte șapte
- Câmpul
extractionspune dacă textul vine din DOM sau din datele structurate, ceea ce contează când răspunsul pare să nu semene cu pagina
--- title: "Declarația unică – cine are obligația să o depună" source: "https://www.anaf.ro/anaf/internet/ANAF/asistenta_contribuabili/" extraction: "dom" --- Persoanele fizice care realizează venituri din activități independente, din cedarea folosinței bunurilor sau din străinătate au obligația să depună declarația unică. ## Termene de depunere
Cum se pregătește contextul
Reglajele de mai jos urmăresc un singur lucru: ca tot ce ajunge în conversație să fie text pe care îl veți folosi. Se fac o dată, iar de atunci preluarea este o singură apăsare.
- Instalați extensia și deschideți Opțiuni din meniul pictogramei.
- Puneți ce face clicul pe pictogramă pe „copiază în clipboard”. Pentru o buclă de lucru cu un model, fișierul este pasul în plus; clipboardul este exact ce vă trebuie.
- Puneți imaginile pe „ignoră”. Un link de imagine este text pe care modelul îl citește și din care nu poate scoate nimic, deci este context plătit degeaba.
- La frontmatter lăsați pornite
title,sourceșipublished, oprițiauthor. Primele trei spun modelului ce document citește și din ce zi; semnătura rareori schimbă răspunsul. - Păstrați
extractionpornit. Când răspunsul pare să nu semene cu pagina, câmpul acesta este primul lucru de verificat:jsonld-articlebodyînseamnă că textul a fost citit din datele structurate, care pot fi o versiune anterioară. - Verificați
Alt+Shift+Mînchrome://extensions/shortcuts, ca preluarea să se facă fără mâna de pe tastatură, direct din pagina pe care o citiți.
Setări pentru o buclă cu model
A treia coloană spune ce câștigă contextul din fiecare valoare, nu ce este mai comod în general. Câteva dintre ele sunt exact pe dos față de ce ați alege pentru o arhivă de citit.
| Setare | Valoare | De ce tocmai aceasta |
|---|---|---|
| Clic pe pictogramă | Copiază în clipboard | Textul ajunge direct în conversație, fără fișier intermediar și fără fereastră |
| Imagini | Ignoră | Un link de imagine este context pe care îl plătiți și din care modelul nu scoate nimic |
| Frontmatter | `title`, `source`, `published`, `extraction` | Patru rânduri care spun ce document este, de unde vine, din ce zi și pe ce cale a fost citit |
| Câmpul `author` | Oprit | Rareori schimbă răspunsul, iar când pagina nu îl declară adaugă un rând gol în fiecare conversație |
| Regulă pe site | Documentația → subdosarul `context` | Sursele folosite în mai multe conversații merită păstrate ca fișiere, nu recopiate de fiecare dată |
| Scurtătură | `Alt+Shift+M` | Preluarea fără să părăsiți pagina scurtează bucla la o singură apăsare |
Nu există articol pe această pagină. Peste un sfert din caracterele extrase se aflau în interiorul unor linkuri: este o listă de rezultate, nu un text. Preluarea a fost oprită, ca să nu ajungă în conversație trei sute de titluri de acte și niciun conținut. Deschideți actul care vă interesează și preluați pagina lui.
Trei bucle de lucru
Un text de lege dat unui model, fără ambalajul portalului
Aveți în față forma consolidată a unui articol pe un portal legislativ, cu firul de navigare, sumarul lateral și linkurile „articolul precedent” în jur. Apăsați Alt+Shift+M: în clipboard ajunge textul articolului, cu adresa și data publicării în capul lui, fără nimic din navigație.
Lipiți în conversație și puneți întrebarea. Modelul citează numărul de alineat corect, pentru că alineatele au rămas paragrafe separate, nu s-au contopit; iar când îl întrebați de unde știe, arată adresa din frontmatter, nu o presupunere.
Aceeași sursă, în cinci conversații diferite
O pagină de documentație vă trebuie săptămâna aceasta în mai multe conversații. O preluați o singură dată într-un fișier din dosarul context, cu regula pe site care îi dă subdosarul. De atunci lipiți fișierul, nu pagina.
Avantajul se vede la a treia conversație: toate pornesc de la exact același text, deci răspunsurile se pot compara între ele. Dacă ați fi preluat pagina de fiecare dată, ați fi comparat răspunsuri date pe versiuni ușor diferite ale sursei, fără să știți.
Un tabel de indicatori pus la lucru
Pe o pagină de statistică selectați numai tabelul și preluați selecția. Ajunge în clipboard ca tabel GFM, cu antetul și cu rândurile intacte, inclusiv celulele care conțin o notă între paranteze.
Modelul primește coloane, nu o linie de cifre, deci poate fi întrebat despre un an anume fără să încurce coloanele. O aceeași pagină lipită direct din browser ar fi ajuns ca șir de numere, iar prima greșeală ar fi trecut neobservată.
Față de cum se dă contextul acum
Fiecare rând de mai jos este o practică răspândită, iar primele patru sunt gratuite și la îndemână. A treia coloană spune ce pierdeți cu fiecare, inclusiv cu a noastră.
| Cum se face acum | Ce primește modelul | Cât costă |
|---|---|---|
| Lipiți adresa paginii | Un link, o singură linie | Multe modele nu ajung la pagină, iar cele care ajung văd versiunea servită roboților |
| Copiere și lipire din browser | Textul, cu tot ce îl înconjura | Meniuri, bara de cookie-uri și subsolul intră la socoteala contextului |
| Captură de ecran a paginii | O imagine de citit | Costă mult mai mult decât textul și pierde tot ce nu încape pe ecran |
| Tipărire în PDF, apoi încărcare | Documentul, cu așezare cu tot | Antetele și subsolurile se repetă la fiecare pagină, iar tabelele se rup între foi |
| Clean Clipper | Markdown curat, cu adresa și data în cap | Nu rezumă, nu numără jetoane și nu trimite el nimic – textul trece prin clipboardul dumneavoastră |
Când răspunsul iese ciudat
De ce răspunde modelul despre altceva decât pagina?
Aproape întotdeauna pentru că a primit și ambalajul. O listă „citește și” lipită sub articol aduce titluri de alte texte, iar modelul le tratează ca parte a documentului. De aceea contează cât rămâne din navigație: pe același corpus, 102 linii repetate aici față de 282, 478 și 491. Dacă lipiți dintr-o altă sursă, verificați întâi ce ați lipit – problema este de obicei în intrare, nu în model.
De ce spune extensia „nu există articol”?
Pentru că pagina este alcătuită mai ales din linkuri: o vitrină, un flux, o listă de rezultate. Când peste aproximativ un sfert din caracterele extrase stau în interiorul unor linkuri, preluarea se oprește. Nu este un eșec, ci un refuz: trei sute de titluri lipite într-o conversație costă context și nu răspund la nimic. Deschideți articolul propriu-zis și preluați-l pe el.
De ce nu are documentul dată în frontmatter?
Pentru că pagina nu declară niciuna. Data este citită din metadate, nu căutată prin text, iar când lipsește câmpul rămâne gol. Este alegerea mai sigură: o dată inventată intră în conversație ca un fapt și nimeni nu o mai verifică. Dacă vă trebuie totuși un reper, data preluării o știți din fișier și din dosarul în care l-ați pus.
De ce nu seamănă textul preluat cu ce vedeam pe ecran?
Uitați-vă la câmpul extraction. Dacă scrie jsonld-articlebody, textul a fost citit din datele structurate ale paginii, fiindcă DOM-ul nu ajunsese să conțină articolul. Cele două versiuni pot să difere: uneori copia structurată este o formă anterioară, alteori singura completă. Când valoarea aceasta apare într-un context pe care vă bazați, merită o privire pe original.
Ce nu face
Nu rezumă și nu rescrie: textul articolului este convertit, nu editat, iar sinteza rămâne treaba modelului. Nu trimite el însuși nimic către un serviciu de IA – textul trece prin clipboardul dumneavoastră, iar extensia nu face nicio cerere de rețea. Nu numără jetoane și nu taie textul în fragmente în locul dumneavoastră. Și nu aduce o pagină pe care nu ați deschis-o: nu există crawler și nu există procesare în lot.