こんな人に
読んだものを、ずっと開ける形式で残す
ブックマークは変わったり消えたりするページを指し、あとで読むサービスは終了し、買収され、エクスポートを有料にします。クリップはテキストそのもので、提供元も有効期限もない形式で、自分で決めた場所に保存されます。
保存した読みものが消える理由
長く読む習慣のある人なら、一度はライブラリを失ったことがあるはずです。あとで読むサービスが終了し、エクスポートはURL を並べた JSON ファイルで、そのほとんどはすでにリンク切れだった。ノートアプリが形式を変え、古いファイルを開くには古いバージョンが必要になった。2014 年のブックマークのフォルダが、今ではページを開くたびに駐車中のドメインか、誰かのトップページへのリダイレクトになる。
共通しているのは依存です。保存した読みものが、企業がまだ存在すること、アカウントがまだ使えること、1 つのプログラムしか理解しない形式に頼っているなら、それは保管しているのではなく借りているのです。ただのテキストにはそのどの依存もなく、20 年前に書かれたファイルが今でも何の儀式もなく開けるのはまさにそのためです。
人があとで気づく失敗は、保存ではなく取り出しです。誰も検索できないアーカイブは、善意でできた埋め立て地です。ある話題について、ある年に、名前の思い出せないサイトで何かを読んだと分かっていても、入口がありません。ただのテキストはそれを、どんなインターフェースにもできない形で解決します。どの OS のどの道具でも検索でき、10 年分の読みものへの grep 1 回でファイルが見つかり、ファイル自身のヘッダーがどのページで、いつ公開されたかを示します。
クリップのアーカイブはこうなる
- 長持ちするオープンな形式。 YAML の frontmatter 付きのただのテキストで、どのエディタでも
grepでも読めます。 - アカウントなし、アップロードなし。 クリップしたものは自分のディスクに残ります。
- 公開日と出典の URL をテキストと一緒に取得するので、何年経ってもノートが何かを特定できます。
extraction欄が経路を記録します。 描画されたページからならdom、ページ自身の構造化データからならjsonld-articlebodyです。- クリップする量に上限なし。 割り当ても、1 日の上限も、有料プランもありません。
- 名前が重なると番号が付くので、同じページの以前の取得が上書きされることはありません。
- 行単位のテキストは、ソースコードのように圧縮、重複排除、同期、差分ができるので、10 年分の読みもののバックアップはごくわずかな容量で済み、復元に特別な道具もいりません。
- サイト別ルールがドメイン全体を届いた時点で振り分けるので、アーカイブは読んでいるあいだに勝手に整理され、決して来ない片付けの時間を待ちません。
--- title: "Things You Should Never Do, Part I" source: "https://www.joelonsoftware.com/2000/04/06/things-you-should-never-do-part-i/" author: "Joel Spolsky" date: "2000-04-06" extraction: "dom" --- They did it by making the single worst strategic mistake that any software company can make: they decided to rewrite the code from scratch.
アーカイブフォルダの準備
設定全体は、1 つのことを成り立たせるためにあります。クリップは、クリップするかどうかを決めるより安くなければならない。ほかのことはすべてそこから導かれます。
- フォルダを 1 つ選び、それをアーカイブとして扱います。書類を置いている場所の最上位にある
Archiveです。話題ごとではなく 1 つのフォルダにします。話題は検索のためにあり、フォルダの階層は読んでいるその瞬間にしなければならない振り分けの判断だからです。 - 拡張機能のアイコンから オプション を開き、保存先をそこに向け、アイコンをクリックしたとき を「フォルダに保存」にします。ウィンドウも、ダイアログも、判断もなし。習慣全体が、それがキー 1 回で済むことにかかっています。
- ファイル名のテンプレートを
{date}-{domain}-{title}にします。時系列の順番、一目で分かるサイト、そして別々のページの 2 つのクリップが名前で争わないだけの一意性が得られます。 - frontmatter の欄をすべてオンにします。
dateはページ自身の公開日、extractionはテキストの取得方法を記録し、どちらもあとから付け足せない種類のものです。 - いつも読んでいる少数のサイトにサイト別ルールを追加し、それぞれ専用のサブフォルダを持たせます。そうすれば、いちばん多くクリップする資料についてはアーカイブが勝手に整理され、平らなフォルダが最初に扱いにくくなるのはそこだからです。
- フォルダを書類のバックアップ対象に含め、一度だけ、本当に一度だけ、そのバックアップからファイルを復元して開いてみます。誰も復元したことのないアーカイブは仮説です。
- 片付けの時間ではなく、読みながらクリップします。あとで戻ってこようと思ったページこそ、消えているページです。
残すための設定
これらの値は、アーカイブが始めたパソコンより、そしておそらくブラウザより長生きすることを前提にしています。一緒に生き延びなければならない依存は、ここでは何も生まれません。
| 設定 | 値 | ここでこの値にする理由 |
|---|---|---|
| アイコンをクリックしたとき | フォルダに保存 | 習慣はキー 1 回なら続き、3 回なら途絶える |
| 保存先 | 1 つの `Archive` フォルダ | 読むときの話題ごとの振り分けは、3 週目にやらなくなる手順 |
| ファイル名のテンプレート | `{date}-{domain}-{title}` | インデックスなしで、時系列、出どころ、一意性を 1 行で |
| frontmatter | すべての欄をオン | 公開日と抽出の経路は、あとから再構成できない |
| サイト別ルール | よく読むドメイン → サブフォルダ | いちばん多くクリップするサイトから、平らなフォルダは窮屈になる |
| 画像 | リンクとして残す | サイトが壊れれば切れるが、リンクは画像があったことを記録する |
| バックアップ | いつものバックアップにフォルダを含め、一度復元 | テキストは何からでも復元できる。試していないバックアップは思い込み |
Archive/ 2019-08-14-the-website-obesity-crisis.md 2026-01-07-the-website-obesity-crisis.md 2026-01-07-the-website-obesity-crisis-2.md 3 つ目のファイルは、同じ日に行った 2 回目のクリップです。名前が重なると 上書きせずに番号が付きます。2019 年のファイルは今もどのエディタでも開け、 frontmatter には取得元の URL が残っています。
同じ習慣の 3 年間
朝の読書が、いつの間にかアーカイブに
1 週間で長い記事を 6 本、読み終えるたびにキー 1 回でクリップします。ウィンドウは開かず、何も振り分けず、これは残す価値があるかという判断もしません。それが要点で、その判断こそアーカイブができるのを妨げるものだからです。
たまっていくのは、ファイル名が日付、サイト、タイトルを示し、各ファイルの最初の 4 行が URL、著者、公開日を示すフォルダです。何も整理していないのに検索できるのは、名前の付け方が整理を担ったからです。
何年も前に読んだものを見つける
覚えているのはある言い回しだけで、サイトも、年も、著者も覚えていません。アーカイブのフォルダを 1 回検索すればファイルが見つかり、そのヘッダーがページの名前を示します。インデックスは作っておらず、存続していなければならないアプリケーションもなく、検索はネットワークを切ったまま動きました。
これはブックマークのフォルダにはまさにできないことです。ブックマークは何が書いてあったかではなくどこにあったかを保存するので、ブックマークの検索は、ほかの誰かが付けたタイトルにしか一致しません。
サイトは落ち、テキストは残る
何年も読んでいたブログが表示されなくなります。クリップは影響を受けません。テキスト、著者、公開日はディスク上のファイルにあり、source の行は、そこでもう何も応答しなくてもアドレスを記録しています。
正直な例外は画像です。リンクだったので、サイトが壊れれば壊れ、写真に価値があったページはこれでは残せません。それがテキストのアーカイブの取引で、自分のページのうちどれがその取引の割を食う側にあるかを知っておく価値があります。
読みものを残すほかの方法との比較
この表でいちばん強い選択肢はこれではありません。完全な忠実度のアーカイブはもっと多くを残しますが、容量、準備、そして動き続けなければならないものの数でも、もっとコストがかかります。
| 今のやり方 | 得られるもの | コスト |
|---|---|---|
| ブックマーク | 無料のアドレスの一覧 | どこにあるかを保存し、何が書いてあったかは保存しない。10 年前のフォルダは大半が駐車中のドメイン |
| あとで読むサービス | どこでも同期される読みやすい表示 | サービスが存続し、エクスポートを残し、価格を保ち続けなければならない |
| ページを HTML として保存 | アセットとレイアウト付きのページ | 大きく、横断検索しにくく、快適に読むにはブラウザが必要 |
| 自前のアーカイブサーバー | スクリーンショットとアセットを含む完全な忠実度 | 動かすソフトウェア、管理する容量、適用する更新が、いつまでも続く |
| PDF に印刷 | どこでも開ける固定の記録 | フォルダ横断でテキストとして検索できず、差分も取れず、読むたびに 1 ファイル |
| Clean Web Clipper | テキストとメタデータだけを、ずっと | レイアウトなし、画像なし、第三者のタイムスタンプなし。意図してテキストだけ |
何年ものあいだに起きること
古いクリップの画像が切れている
画像はリンクで、指している先のサイトは移転し、リデザインし、消えました。拡張機能はバイナリをダウンロードしないので、クリップのアーカイブはテキストのアーカイブです。写真エッセイ、図、漫画のように画像が要点なら、そのとき別に保存するか、これはそれを残す道具ではないと割り切ってください。
フォルダがほぼ重複したもので埋まっていく
それは名前の重なりのルールが役目を果たしているのです。同じページの 2 回目のクリップは 1 回目を置き換えずに番号が付きます。変わったページの 2 回目の取得のほうが面白いことがよくあるからです。自動で重複を取り除くものはありません。ただのテキストなら、重複を見つけるのはどの定番の道具でも 1 行で済み、2 つを比べるのは差分です。
アーカイブの半分が「Home」や「Untitled」という名前
タイトルはページ自身のメタデータから取り、すべてのページに同じタイトルを付けるサイトもあります。そのためにあるのが、ファイル名のテンプレートの {domain} と {date} です。名前に両方があれば、役に立たないタイトルでもファイルは見つけられます。すでにそうしたものが 100 個あるなら、テキストファイルなので、手かスクリプトで名前を変えれば直り、どちらにしても中身は何も失われません。
どうしてもクリップできないページがある
3 つの種類があります。ブラウザが保護しているページ、つまり chrome:// のアドレスと拡張機能ストアで、そこではどの拡張機能も動作できません。フィード、ストアのトップ、検索結果のような記事の本文がないページで、リンクの一覧として返されずに「記事なし」と報告されます。そしてあなたの環境で描画されなかったもので、埋め込みビューアーの中の内容も含みます。それはクリップが中まで届かない別の文書です。
保存しないもの
保存するのはテキストで、ページではありません。レイアウトも、スクリーンショットも、フォントも、スクリプトも、ダウンロードした画像もありません。画像のリンクは元のサイトを指したままで、そのサイトが壊れれば壊れます。ウェブアーカイブではなく、第三者のタイムスタンプもありません。閲覧履歴を読んだり、ブックマークを一括で取り込んだりもせず、開いているページをクリップします。そしてブラウザが描画したものを取り込むので、あなたの環境で描画されないページは残せません。
よくある質問
拡張機能の保守が終わったらどうなりますか?
画像は保存されますか?
クリップできる量に上限はありますか?
既存のブックマークを一括で取り込めますか?
10 年後もファイルは開けますか?
完全な忠実度のアーカイブも持っておくべきですか?
スマートフォンでアーカイブを読めますか?
.md テキストファイルなので、モバイルのノートアプリ、テキストエディタ、Markdown リーダーで開け、検索もデスクトップと同じように使えます。