Clean Clipper Adaugă în Chrome – gratuit

Pentru cine este

Nu mai plătiți același meniu de zeci de ori

Când o pagină web este lipită într-un model, fiecare linie de meniu duplicată și fiecare banner intră la socoteala contextului și concurează cu textul care vă interesează. Pe un corpus de 109 pagini, Clean Clipper a lăsat 102 linii de navigație repetate, acolo unde celelalte trei motoare au lăsat 282, 478 și 491. Frontmatterul dă pe deasupra adresa sursei și data publicării.

Cât costă o pagină lipită

O pagină web lipită ca atare ajunge la model cu tot ce o înconjura. Meniul principal repetat la fiecare secțiune, bara de cookie-uri, lista „citește și”, subsolul cu treizeci de linkuri juridice: este context pe care îl plătiți și pe care modelul trebuie să îl trieze înainte de a începe lucrul. Într-un document lung, partea aceasta ajunge să împingă afară din fereastră jumătate din textul care conta.

Rezultatul se vede în răspunsuri. Modelul citează o etichetă de meniu ca și cum ar fi titlul unei secțiuni, confundă două articole pentru că lista „citește și” le-a lipit titlurile de text, sau atribuie documentului o dată care era a subsolului. Nici darea adresei în locul textului nu rezolvă nimic: multe modele nu ajung la pagină, iar cele care ajung primesc adesea versiunea servită roboților, nu pe cea pe care ați citit-o dumneavoastră.

A treia pierdere este structura, și se vede cel mai prost. Un tabel lipit turtit pe o singură linie nu mai are coloane, așa că modelul citește cifrele în dreptul altor etichete și răspunde cu convingere greșit – o eroare pe care nu o observați, pentru că nu arată ca o eroare. Pe un corpus de cincisprezece tabele, douăsprezece au trecut întregi aici, față de câte șapte la fiecare motor comparat. La fel cu blocurile de cod: eticheta de limbaj a supraviețuit în 73 de blocuri din 156, față de 20 și 0, iar un model care nu știe dacă citește shell sau SQL începe prin a ghici.

Ce primește modelul

Ce rămâne după scoaterea ambalajului paginiianaf.ro/anaf/internet/ANAF/asistenta_contribuabili
---
title: "Declarația unică – cine are obligația să o depună"
source: "https://www.anaf.ro/anaf/internet/ANAF/asistenta_contribuabili/"
extraction: "dom"
---

Persoanele fizice care realizează venituri din activități independente, din
cedarea folosinței bunurilor sau din străinătate au obligația să depună
declarația unică.

## Termene de depunere

Cum se pregătește contextul

Reglajele de mai jos urmăresc un singur lucru: ca tot ce ajunge în conversație să fie text pe care îl veți folosi. Se fac o dată, iar de atunci preluarea este o singură apăsare.

  1. Instalați extensia și deschideți Opțiuni din meniul pictogramei.
  2. Puneți ce face clicul pe pictogramă pe „copiază în clipboard”. Pentru o buclă de lucru cu un model, fișierul este pasul în plus; clipboardul este exact ce vă trebuie.
  3. Puneți imaginile pe „ignoră”. Un link de imagine este text pe care modelul îl citește și din care nu poate scoate nimic, deci este context plătit degeaba.
  4. La frontmatter lăsați pornite title, source și published, opriți author. Primele trei spun modelului ce document citește și din ce zi; semnătura rareori schimbă răspunsul.
  5. Păstrați extraction pornit. Când răspunsul pare să nu semene cu pagina, câmpul acesta este primul lucru de verificat: jsonld-articlebody înseamnă că textul a fost citit din datele structurate, care pot fi o versiune anterioară.
  6. Verificați Alt+Shift+M în chrome://extensions/shortcuts, ca preluarea să se facă fără mâna de pe tastatură, direct din pagina pe care o citiți.

Setări pentru o buclă cu model

A treia coloană spune ce câștigă contextul din fiecare valoare, nu ce este mai comod în general. Câteva dintre ele sunt exact pe dos față de ce ați alege pentru o arhivă de citit.

SetareValoareDe ce tocmai aceasta
Clic pe pictogramăCopiază în clipboardTextul ajunge direct în conversație, fără fișier intermediar și fără fereastră
ImaginiIgnorăUn link de imagine este context pe care îl plătiți și din care modelul nu scoate nimic
Frontmatter`title`, `source`, `published`, `extraction`Patru rânduri care spun ce document este, de unde vine, din ce zi și pe ce cale a fost citit
Câmpul `author`OpritRareori schimbă răspunsul, iar când pagina nu îl declară adaugă un rând gol în fiecare conversație
Regulă pe siteDocumentația → subdosarul `context`Sursele folosite în mai multe conversații merită păstrate ca fișiere, nu recopiate de fiecare dată
Scurtătură`Alt+Shift+M`Preluarea fără să părăsiți pagina scurtează bucla la o singură apăsare
O pagină de rezultate este refuzată, nu convertitălegislatie.just.ro – pagina de căutare
Nu există articol pe această pagină.

Peste un sfert din caracterele extrase se aflau în interiorul unor linkuri:
este o listă de rezultate, nu un text. Preluarea a fost oprită, ca să nu
ajungă în conversație trei sute de titluri de acte și niciun conținut.

Deschideți actul care vă interesează și preluați pagina lui.

Trei bucle de lucru

Un text de lege dat unui model, fără ambalajul portalului

Aveți în față forma consolidată a unui articol pe un portal legislativ, cu firul de navigare, sumarul lateral și linkurile „articolul precedent” în jur. Apăsați Alt+Shift+M: în clipboard ajunge textul articolului, cu adresa și data publicării în capul lui, fără nimic din navigație.

Lipiți în conversație și puneți întrebarea. Modelul citează numărul de alineat corect, pentru că alineatele au rămas paragrafe separate, nu s-au contopit; iar când îl întrebați de unde știe, arată adresa din frontmatter, nu o presupunere.

Aceeași sursă, în cinci conversații diferite

O pagină de documentație vă trebuie săptămâna aceasta în mai multe conversații. O preluați o singură dată într-un fișier din dosarul context, cu regula pe site care îi dă subdosarul. De atunci lipiți fișierul, nu pagina.

Avantajul se vede la a treia conversație: toate pornesc de la exact același text, deci răspunsurile se pot compara între ele. Dacă ați fi preluat pagina de fiecare dată, ați fi comparat răspunsuri date pe versiuni ușor diferite ale sursei, fără să știți.

Un tabel de indicatori pus la lucru

Pe o pagină de statistică selectați numai tabelul și preluați selecția. Ajunge în clipboard ca tabel GFM, cu antetul și cu rândurile intacte, inclusiv celulele care conțin o notă între paranteze.

Modelul primește coloane, nu o linie de cifre, deci poate fi întrebat despre un an anume fără să încurce coloanele. O aceeași pagină lipită direct din browser ar fi ajuns ca șir de numere, iar prima greșeală ar fi trecut neobservată.

Față de cum se dă contextul acum

Fiecare rând de mai jos este o practică răspândită, iar primele patru sunt gratuite și la îndemână. A treia coloană spune ce pierdeți cu fiecare, inclusiv cu a noastră.

Cum se face acumCe primește modelulCât costă
Lipiți adresa paginiiUn link, o singură linieMulte modele nu ajung la pagină, iar cele care ajung văd versiunea servită roboților
Copiere și lipire din browserTextul, cu tot ce îl înconjuraMeniuri, bara de cookie-uri și subsolul intră la socoteala contextului
Captură de ecran a paginiiO imagine de cititCostă mult mai mult decât textul și pierde tot ce nu încape pe ecran
Tipărire în PDF, apoi încărcareDocumentul, cu așezare cu totAntetele și subsolurile se repetă la fiecare pagină, iar tabelele se rup între foi
Clean ClipperMarkdown curat, cu adresa și data în capNu rezumă, nu numără jetoane și nu trimite el nimic – textul trece prin clipboardul dumneavoastră

Când răspunsul iese ciudat

De ce răspunde modelul despre altceva decât pagina?

Aproape întotdeauna pentru că a primit și ambalajul. O listă „citește și” lipită sub articol aduce titluri de alte texte, iar modelul le tratează ca parte a documentului. De aceea contează cât rămâne din navigație: pe același corpus, 102 linii repetate aici față de 282, 478 și 491. Dacă lipiți dintr-o altă sursă, verificați întâi ce ați lipit – problema este de obicei în intrare, nu în model.

De ce spune extensia „nu există articol”?

Pentru că pagina este alcătuită mai ales din linkuri: o vitrină, un flux, o listă de rezultate. Când peste aproximativ un sfert din caracterele extrase stau în interiorul unor linkuri, preluarea se oprește. Nu este un eșec, ci un refuz: trei sute de titluri lipite într-o conversație costă context și nu răspund la nimic. Deschideți articolul propriu-zis și preluați-l pe el.

De ce nu are documentul dată în frontmatter?

Pentru că pagina nu declară niciuna. Data este citită din metadate, nu căutată prin text, iar când lipsește câmpul rămâne gol. Este alegerea mai sigură: o dată inventată intră în conversație ca un fapt și nimeni nu o mai verifică. Dacă vă trebuie totuși un reper, data preluării o știți din fișier și din dosarul în care l-ați pus.

De ce nu seamănă textul preluat cu ce vedeam pe ecran?

Uitați-vă la câmpul extraction. Dacă scrie jsonld-articlebody, textul a fost citit din datele structurate ale paginii, fiindcă DOM-ul nu ajunsese să conțină articolul. Cele două versiuni pot să difere: uneori copia structurată este o formă anterioară, alteori singura completă. Când valoarea aceasta apare într-un context pe care vă bazați, merită o privire pe original.

Ce nu face

Nu rezumă și nu rescrie: textul articolului este convertit, nu editat, iar sinteza rămâne treaba modelului. Nu trimite el însuși nimic către un serviciu de IA – textul trece prin clipboardul dumneavoastră, iar extensia nu face nicio cerere de rețea. Nu numără jetoane și nu taie textul în fragmente în locul dumneavoastră. Și nu aduce o pagină pe care nu ați deschis-o: nu există crawler și nu există procesare în lot.

Adaugă în Chrome – gratuitGratuit în întregime, fără cont și fără limite.

Întrebări

De ce să nu lipesc adresa și să las modelul să deschidă pagina?
Pentru că multe modele nu ajung la pagină, iar cele care ajung primesc adesea versiunea servită roboților. Preluarea fixează exact ce era pe ecran, inclusiv ce se afla în spatele unei autentificări pe care o foloseați deja.
Trimite extensia ceva către un serviciu de IA?
Nu. Textul pleacă în clipboardul dumneavoastră, iar o filă de chat se deschide dacă apăsați butonul făcut pentru asta; extensia însăși nu face nicio cerere de rețea.
Cât context se economisește?
Depinde de pagină, dar măsurătoarea dă ordinul de mărime: 102 linii de navigație repetate, față de 282, 478 și 491 la celelalte trei motoare, pe același corpus de 109 pagini.
Pot scoate imaginile ca să economisesc context?
Da. Puneți imaginile pe „ignoră” și în Markdown nu mai rămâne niciun link de imagine.
Va ști modelul de unde vine textul?
Da, dacă păstrați frontmatterul. El poartă titlul, adresa sursei și data publicării, în capul fișierului și la vedere.
Numără extensia jetoanele sau taie textul în fragmente?
Nu face niciuna dintre ele. Convertește pagina și se oprește; împărțirea pe fragmente și socoteala jetoanelor rămân în unealta cu care lucrați, care oricum are alte reguli pentru fiecare model.
Rezumă textul înainte de a-l da modelului?
Nu. Corpul articolului este convertit, nu editat: niciun cuvânt nu este adăugat, scos sau mutat. Rezumatul este exact lucrul pe care îl cereți modelului, iar un text prescurtat înainte de întrebare îi ia din start informația.
Merge pe o pagină din spatele autentificării?
Da. Extensia citește pagina pe care browserul a randat-o pentru sesiunea dumneavoastră, deci un document intern se preia ca oricare altul. Nimic din el nu pleacă nicăieri: extensia nu face nicio cerere de rețea.
Pot prelua zece pagini deodată pentru un context mai mare?
Nu. Preluarea este o pagină pe rând, cea pe care vă aflați: nu există crawler și nu există procesare în lot. Pentru un corpus, salvați paginile pe rând într-un dosar și dați-le uneltei dumneavoastră de acolo.
De ce contează câte linii de meniu rămân, dacă modelul le poate ignora?
Pentru că le citește înainte de a le ignora, iar contextul este mărginit. Într-un document lung, partea aceasta împinge afară din fereastră text care conta, și tocmai el lipsește din răspuns. Măsurătoarea dă ordinul de mărime: 102 linii repetate față de 282, 478 și 491 pe același corpus de 109 pagini.