こんな人に
書き換えられる前に情報源を保存
ページは編集され、削除されます。クリップは全文、出典の URL、ページ自身が示した公開日を、自分で保管するただのファイルに収めます。閉鎖したり、規約を変えたり、記録を黙って失ったりしうるサービスの中ではありません。
昨日はあったページ
企業が主張を掲載し、あなたがそれを引用し、編集者が原稿を読むころにはその文が黙って書き換えられている。訂正の注記も日時もなく、指し示すものが何もない。あるいはページが丸ごと消えていて、日曜の午後に 4 時間だけ存在したので、公開のアーカイブも捉えていない。
ページが残っていても、あなたが読んだ版がほかの人に配信された版とは限りません。同意の壁、地域ごとの版、A/B テストがあるので、URL はテキストへの安定した参照ではありません。確かに押さえておけるのは、読んだときに画面にあったものを、アドレスとページ自身が示した日付と一緒に保存したものです。
そこで残るのは実務の問題で、取得は一瞬で済まなければ行われません。1 本の記事は 40 ページに触れ、その大半は急いで読まれ、半分は誰も 2 つ目の道具を開いて URL を貼ってサービスの応答を待ったりしない時間帯に読まれます。クリップは数十ミリ秒で、計測した時間はウィンドウの隅に表示されます。その手間なら読んだものはすべて取得でき、結局は関係なかった 39 ページも、関係のあった 1 ページも手元に残ります。
記録に含まれるもの
- 公開日はページ自身のメタデータから読み取ります。 JSON-LD、
article:published_time、time[datetime]からで、本文からではありません。 - 出典の URL がどのノートの frontmatter にもあります。
- 訪問のたびに変わるナビゲーションや宣伝のブロックを除いた、記事の全文。
extraction欄がテキストの取得方法を記録するので、数か月後もノートを検証できます。- ただのファイル。 独自形式も、アカウントも、自分の資料へのアクセスを取り消せるサービスもありません。
- ファイル名のテンプレートにはクリップした日の
{date}を入れられ、公開日は別の欄のままなので、2 つが混同されることはありません。 - 測定した 512 ページで残った HTML タグは一つもないので、CMS に貼り付けた一節に、CMS が描画しようとするマークアップが紛れ込みません。
- Reddit のスレッドはスレッドのまま、各コメントのスコア付きで残ります。 平らなコピー&ペーストで壊れる順位の手がかりです。
--- title: "Regulator opens inquiry into data-sharing arrangement" source: "https://apnews.com/article/…" author: "Staff reporter" date: "2026-03-04T09:12:00.000Z" extraction: "dom" --- The inquiry will examine agreements signed between 2023 and 2025, according to a notice published on Wednesday.
記事に向けた設定
要点は、読む瞬間の取得に手間がかからないことです。下のすべては、その瞬間から判断を取り除き、設定に移すために選んでいます。
- 拡張機能のアイコンから オプション を開き、保存先を記事用のフォルダ
stories/data-sharing/sourcesに向けます。記事ごとに 1 つのフォルダを一度だけ決めておけば、あとで振り分けるものは何もありません。 - アイコンをクリックしたとき を「フォルダに保存」にします。調べものの流れと違い、ニュースの流れではウィンドウを開くべきではありません。戻ってきたときにページがないかもしれないので、確認は取得のあとです。
- ファイル名のテンプレートを
{date}-{domain}-{title}にします。2 週間分の 40 ページが入ったフォルダを並べるときの軸は、取得した日と媒体の 2 つです。 - frontmatter の欄をすべてオンにします。
dateはページが示した公開日、sourceはアドレスバーにあったとおりの URL で、地域ごとの版を識別しうるクエリ文字列も含みます。 chrome://extensions/shortcutsでAlt+Shift+Mが割り当てられていることを確認します。夜 11 時に使われるのはキー操作で、メニューではありません。- 取材に使う議論サイト用のサイト別ルールを追加し、
reddit.comを専用のサブフォルダに入れます。手がかりと公表された情報源が同じ山に積まれなくなります。 - ページについて誰かに連絡する前に、そのページをクリップします。コメントの依頼はページを変えさせる最も確実な方法で、そのあとの取得は間違った版です。
すばやく取得するための設定
どの値も、取得時の確認を少し犠牲にして、取得できたという確実さを得ています。ファイルはあとでゆっくり確認できますが、消えたページは読み直せません。
| 設定 | 値 | ここでこの値にする理由 |
|---|---|---|
| アイコンをクリックしたとき | フォルダに保存 | ページがまだあるその瞬間に、ウィンドウもダイアログも判断もない |
| 保存先 | 記事ごとに 1 つのフォルダ | 出典は記事ごとにまとまり、フォルダなら編集者や弁護士に見せられる |
| ファイル名のテンプレート | `{date}-{domain}-{title}` | 40 の情報源を並べる 2 つの軸が、取得日と媒体 |
| frontmatter | すべての欄をオン | `source` は、地域ごとの版を示すクエリ文字列も含めて URL をそのまま残す |
| 画像 | リンクとして残す | 差し替えられる前にどの写真が使われていたかの唯一の痕跡が、画像の URL であることが多い |
| サイト別ルール | `reddit.com` → サブフォルダ `leads` | 未確認の手がかりと公表された情報源は 1 つの山にすべきではない |
| ショートカット | `Alt+Shift+M` | メニューが必要な取得は、勤務時間外には行われない |
--- 2026-03-04-regulator-opens-inquiry.md +++ 2026-03-25-regulator-opens-inquiry.md @@ -date: "2026-03-04T09:12:00.000Z" +date: "2026-03-04T09:12:00.000Z" @@ -The inquiry will examine agreements signed between 2023 and 2025. +The inquiry will examine agreements signed in 2024. @@ +Updated 25 March: an earlier version misstated the period under review.
3 つの取得
4 時間だけ存在したページ
企業が日曜の午後に声明を公開します。あなたはそれを読み、ショートカットを押し、重要かどうかを決める前にファイルは記事のフォルダにあります。月曜にはページが 404 を返し、公開中に誰も URL を送らなかったので、公開のアーカイブはそれを見ていません。
手元にあるのは、テキスト、アドレス、ページ自身が示した日付です。証明ではありませんが、企業に質問を投げかけるには十分な記録です。このアドレスにこれが公開されていて、こう書かれていた、と。
2 回の取得と差分
通信社の記事を配信された朝にクリップし、3 週間後、同僚に論調が変わったと言われてもう一度クリップします。2 つ目のファイルは 1 つ目を置き換えずに番号が付くので、両方がディスクにあります。
2 つの差分を見ると、調査対象の期間が「2023 年から 2025 年」から「2024 年」に狭まり、末尾に更新の注記が加わっています。どちらの変更も URL からは見えず、ブックマークからは取り戻せませんでした。
手がかりとしてのスレッドを、スレッドのまま
地元のフォーラムのスレッドに、あなたが調べている期間にある施設で働いていた 3 人の名前が出ています。クリップすると、入れ子は入れ子の引用ブロックとして取り込まれ、各コメントがスコアを保つので、皆が同意した返信と誰も同意しなかった返信を今でも見分けられます。
それは判断ではなくルールによって、記事のフォルダではなく leads サブフォルダに入ります。半年後、その区別が、指し示せる出典と、ただ読んだだけの資料の違いになります。
ページを残すほかの方法との比較
これらは代わりというより、保証の種類が違うものです。3 列目をよく読んでください。いちばん強い保証は、この拡張機能が提供するものではありません。
| 今のやり方 | 得られるもの | コスト |
|---|---|---|
| 公開のアーカイブサービス | 誰でも確認できる、独立したタイムスタンプ付きの写し | ネットワークとサービスが必要。ブロックするサイトもあり、読んでいる最中に 2 つ目の道具を使うことになる |
| ページのスクリーンショット | 表示されていたとおりのレイアウト | 検索できるテキストも、画像内の URL も、公開日もない |
| PDF に印刷 | ディスク上のページ形式の写し | 同意のバナー入り、差分が取れず、フォルダ横断で検索できない |
| ページを HTML として保存 | アセットを含む完全なローカルの写し | 重く、読みにくく、2 回の取得の差分は読めたものではない |
| メモの文書にコピー | すばやく文章が手に入る | 付属物もついてきて、URL と日付はついてこない |
| Clean Web Clipper | テキスト、アドレス、示された日付を数秒で | レイアウトもアセットも第三者のタイムスタンプもない。あなたの写しであって証明ではない |
取得したものが予想と違うとき
同意のダイアログの向こうに何も描画されなかった
同意に答えるまで記事をまったく送らないサイトがあり、その場合ページにはどの拡張機能にも読めるものがなく、クリップは「記事なし」と報告します。ダイアログに答え、ページを描画させてからクリップしてください。同意のバー自体は、どちらにしても出力から取り除かれます。取得した版が、そのセッションで、その地域の、あなたに配信された版に限られるのもこのためです。
ライブブログやセクションのトップを拒否される
どちらも大半がリンクのラベルで、拡張機能は抽出した文字の約 4 分の 1 を超える部分がリンクの中にあるページを拒否します。ライブブログでは、サイトが用意していれば個々の投稿のパーマリンクをクリップしてください。セクションのトップでは、一覧ではなく記事をクリップします。一覧こそ、リンク 300 件として届いていたものです。
コメントがない
コメントはページの付属物として切り落とします。例外は 1 つで、Reddit ではスレッドを各コメントのスコア付きで残します。ほかのサイトではコメント欄は周りの宣伝ブロックと区別がつかず、残せばそれも残すことになります。
公開日が予想した日付ではない
欄にはページ自身のマークアップが示す日付が入ります。JSON-LD の datePublished、article:published_time、time[datetime] です。記事を編集するたびにその値を書き換えるサイトでは新しい日付が報告され、拡張機能はページの言うことを疑わずにそのまま繰り返します。取得日がファイル名に別に置かれている理由がもう一つ増えるわけです。
これは何ではないか
ウェブアーカイブではありません。保存するのはテキストとメタデータで、描画されたページではありません。レイアウトも、スクリーンショットも、アセットもなく、いつ取得したかを証明する第三者のタイムスタンプもありません。視覚的で独立した記録にはアーカイブサービスを使ってください。こちらはより速く、ディスクに残り、別の問いに答えます。コメントはページの付属物として切り落とします。例外は Reddit で、スレッドを各コメントのスコア付きで残します。
よくある質問
ウェブアーカイブの代わりになりますか?
クリップは証拠として通用しますか?
コメントも取得しますか?
いつクリップしたかを記録できますか?
{date} に対応しています。公開日は frontmatter の別の欄のままなので、2 つが混同されることはありません。