Măsurători · ·
Ce s-a măsurat, pe ce și ce a ieșit
Testat pe 512 pagini: 109 comparate direct cu alte trei motoare și 403 doar cu nucleul nostru. Nicio eroare fatală și nicio etichetă HTML rămasă în vreun articol extras. Corpusul și scripturile vor fi publicate odată cu următoarea rulare; până atunci, pagina aceasta este consemnarea completă a ce a rulat și ce a ieșit.
Prima rulare: 109 pagini, patru motoare comparate direct
Corpusul este format din cele o sută de site-uri cele mai vizitate din lume și din cele o sută cele mai vizitate din Rusia. Domeniile fără conținut editorial – mesagerie, bănci, streaming, portaluri guvernamentale – au fost excluse din start. Paginile au fost preluate cu un browser real, urmând de pe fiecare pagină principală un link către conținut, acolo unde exista unul.
Patru motoare au rulat peste aceleași 109 pagini preluate: Defuddle 0.19.3 cu Turndown 7.2.4 (nucleul clipperului oficial Obsidian Web Clipper), Mozilla Readability 0.6.0 cu același Turndown (nucleul MarkDownload), MarkSnip 5.2.0 – codul lui real, cel livrat, despachetat din versiunea din Chrome Web Store – și Clean Web Clipper 0.1.0.
| Indicator | Defuddle 0.19.3 | Mozilla Readability 0.6.0 | MarkSnip 5.2.0 | Clean Web Clipper 0.1.0 |
|---|---|---|---|---|
| Pagini | 109 | 107 | 107 | 109 |
| Erori fatale | 0 | 2 | 2 | 0 |
| HTML rămas | 532 | 718 | 2 | 0 |
| Linii de meniu duplicate | 491 | 282 | 478 | 102 |
| Proporția liniilor scurte | 0.278 | 0.262 | 0.263 | 0.221 |
| Autori găsiți | 23 | 27 | 28 | 28 |
| Date de publicare găsite | 28 | 13 | 13 | 24 |
| Tabele extrase (din 56) | 3 | 8 | 11 | 5 |
| Proporția textului util | 0.878 | 0.931 | 0.934 | 0.890 |
Unde Clean Web Clipper rămâne în urmă
- Tabele: 5 față de 11 la MarkSnip. 41 din cele 56 de tabele-sursă stau pe o singură pagină și sunt tabele de așezare, nu conținut, pe care niciun motor nu ar trebui să le extragă; diferența reală ține de câteva pagini pe care alegerea rădăcinii ia un bloc prea îngust.
- Proporția textului util: 0,890 față de 0,934. O parte este intenționată – refuză paginile de tip flux pe care alte motoare le întorc –, iar o parte vine din aceeași rădăcină prea îngustă.
- Date de publicare: 24 față de 28 la Defuddle.
- Autori: la egalitate cu cel mai bun, 28 față de 28 la MarkSnip, după ce extragerea autorului a fost refăcută. La prima punctare a acestui corpus erau 20.
A doua rulare: 403 pagini în douăsprezece limbi europene, doar nucleul nostru
Primele cincizeci de site-uri din fiecare dintre cele douăsprezece țări, preluate cu browserul setat pe limba țării, pentru că altfel jumătate dintre ele servesc o pagină în engleză și se măsoară cu totul altceva.
152 din cele 403 pagini au răspuns „nu există articol”: vitrine de magazin, pagini principale de portal și fluxuri, unde nu există articol de extras. Răspunsul este intenționat și de aceea aceste pagini sunt numărate ca testate, nu ca preluate.
| Limba | Pagini | Erori fatale | HTML rămas | Proporția linkurilor |
|---|---|---|---|---|
| Germană | 40 | 0 | 0 | 0.058 |
| Franceză | 39 | 0 | 0 | 0.050 |
| Spaniolă | 40 | 0 | 0 | 0.060 |
| Italiană | 40 | 0 | 0 | 0.036 |
| Poloneză | 30 | 0 | 0 | 0.064 |
| Portugheză | 36 | 0 | 0 | 0.060 |
| Neerlandeză | 37 | 0 | 0 | 0.049 |
| Turcă | 31 | 0 | 0 | 0.042 |
| Ucraineană | 13 | 0 | 0 | 0.054 |
| Cehă | 28 | 0 | 0 | 0.039 |
| Suedeză | 28 | 0 | 0 | 0.036 |
| Română | 41 | 0 | 0 | 0.039 |
Timpul pe preluare: 4 min 38 s
Contorul de pe lessroutinemorelife.com socotește fiecare preluare drept 4 min 38 s. Timpul acesta a fost măsurat manual de proprietar pe peste 1.000 de pagini de conținut variate: copierea textului, lipirea, curățarea, adăugarea titlului și a sursei, apoi verificarea resturilor de marcaj HTML. Au fost calculate și media, și mediana.
Contorul este deci numărul de preluări înmulțit cu acest timp, nu o sumă de cronometrări pentru fiecare preluare. Nu măsoară cât v-ar fi luat dumneavoastră o preluare anume.
Ce înseamnă cifrele
- Erori fatale – motorul a aruncat o eroare pe pagină și nu a întors nimic. O rulare fără erori fatale poate fi totuși plină de meniuri; asta măsoară celelalte rânduri.
- Etichete HTML rămase – cât marcaj brut a supraviețuit în Markdown. Orice peste zero este un defect.
- Linii de meniu duplicate – linii mai lungi de douăsprezece caractere care apar de mai multe ori. Aceasta este navigația repetată în fiecare secțiune.
- Proporția liniilor scurte – ponderea liniilor sub douăzeci și cinci de caractere. O valoare mare înseamnă liste de linkuri preluate, nu text curgător.
- Proporția linkurilor – ponderea caracterelor aflate în etichete de link. O valoare mare înseamnă că a venit și un meniu.
- „Nu există articol” – pagina nu conținea corpul unui articol, așa că extensia a spus-o în loc să întoarcă linkuri. Nu este nici eroare fatală, nici preluare.
Limitele sincere ale acestei măsurători
- Eșantionul ucrainean are 13 pagini, nu 40 – cea mai mare parte a corpusului nu a răspuns din punctul de preluare. Rândul acela este doar orientativ.
- Listele turcești și cehești de top 50 înclină spre magazine și orare, care nu poartă nicio dată de publicare. Este o însușire a corpusului, nu a extragerii.
- Motoarele concurente au rulat numai pe primul corpus. Rularea europeană măsoară doar Clean Web Clipper.
- Paginile pe care toate motoarele au întors sub 500 de caractere au fost excluse: acolo este un captcha sau o blocare, nu o problemă de extragere.
- Ambele rulări sunt instantanee ale unor site-uri vii, făcute la sfârșitul lui august 2026. Aceleași scripturi rulate mai târziu vor da cifre întrucâtva diferite, pe măsură ce acele site-uri se schimbă.