Clean Clipper Dodaj do Chrome – za darmo

Pod maską

Jak to działa i gdzie się zatrzymuje

Nie ma tu magii i nic nie dzwoni do serwera. Cały potok wykonuje się w stronie, na którą właśnie patrzysz, w kilkadziesiąt milisekund.

Znalezienie artykułu

Najpierw rozszerzenie szuka oczywistych kontenerów, w których artykuł zwykle mieszka. Kiedy takiego kontenera nie ma – a na wielu prawdziwych stronach go nie ma – przechodzi do mierzenia gęstości tekstu: który blok zawiera najwięcej tekstu akapitowego, który nie siedzi w odnośnikach. Wygrywa najwęższy blok, w którym wciąż mieści się prawie cały ten tekst.

Blok, którego tekst to w większości etykiety odnośników, jest menu albo listą wpisów, a nie artykułem, i zostaje odrzucony – chyba że mieści ponad tysiąc dwieście znaków prawdziwego tekstu, bo długie artykuły z natury zawierają wiele odnośników.

Usunięcie obwoluty

Potem lecą znane elementy spoza treści: nawigacja, banery, paski udostępniania, komunikaty o ciasteczkach, paginacja, listy „Czytaj także” i paski logotypów. Powtórzone linie są usuwane, bo nawigacja zdublowana w każdej sekcji to największe pojedyncze źródło szumu w zapisanej stronie.

co zostawiają inne clippery

[Przejdź do treści](#main) [Zaloguj się](/login) [Załóż konto](/rejestracja)
[Start](/) [Wiadomości](/wiadomosci) [Sport](/sport) [Kultura](/kultura) [Więcej](/wiecej)

Używamy plików cookie i podobnych technologii, aby ulepszać nasze usługi.
[Akceptuj wszystkie] [Ustawienia]

# Artykuł, po który przyszedłeś

Właściwy pierwszy akapit tekstu.

<div class="promo-inline">

## Czytaj także
[Inny nagłówek](/a) [Jeszcze jeden](/b) [I trzeci](/c)

co ląduje w notatce

# Artykuł, po który przyszedłeś

Właściwy pierwszy akapit tekstu.

Konwersja

Tabele serializuje samo rozszerzenie, a nie uniwersalna wtyczka, bo uniwersalne konwertery łamią się na komórce z listą albo blokiem kodu. Bloki kodu biorą język z własnych znaczników strony. Odnośniki do bibliografii są zbierane w przypisy Markdown, zanim sanityzacja usunie identyfikatory, na których się opierają – kolejność ma znaczenie, a pomyłka po cichu gubi wszystkie przypisy.

Gdzie się zatrzymuje

W sklepie, na liście wpisów i w wynikach wyszukiwania artykułu nie ma. Rozszerzenie sprawdza gotowy Markdown: jeśli ponad ćwierć znaków siedzi w etykietach odnośników, zgłasza „brak artykułu”, zamiast podać Ci trzysta odnośników. Ta odmowa jest celowa i to przez nią liczby znaków są tu niższe niż w narzędziach, które zawsze coś zwracają.

Czego nie robi

Pytania

Ile trwa zapisanie strony?
Kilkadziesiąt milisekund przy zwykłym artykule; bardzo długa strona z setkami przypisów zajmie kilkaset. Czas widać w rogu okna klipu.
Czy działa na aplikacjach jednostronicowych?
Tak. Rozszerzenie czyta DOM już po wyrenderowaniu, więc dokumentacja zbudowana w JavaScripcie zapisuje się taka, jaką widzisz.
Czym jest tryb ekstrakcji jsonld-articlebody?
Niektóre strony wysyłają tekst artykułu w swoich danych strukturalnych, ale nigdy nie kończą go renderować. Kiedy dane strukturalne zawierają wyraźnie więcej tekstu niż DOM, rozszerzenie korzysta z nich i zapisuje, że tak zrobiło.