ご依頼いただいた「①URLの収集」「②ブログ記事の文字情報抽出」「③写真の取得」を、実際の Internet Archive のデータを使って動かしたデモです。文章で説明するより、実物を見ていただいた方が早いと思い、先に動くものを用意しました。
募集文に書かれていた内容を、そのままシステムの要件として落とし込みました。
Wayback Machine にアーカイブされている対象サイトの全URLを、CDX APIを使って網羅的にリストアップします。
収集したURLの中から記事ページを判別し、タイトル・本文テキストを自動で抽出します。
記事内の画像も合わせて取得。アーカイブ上に画像が残っていれば自動で紐付けます。
「①URL取得だけ先に」「②それを使って本文抽出は別工程」という分割にも対応できる設計です。
下のデモで実際に動いている処理です。対象サイトのドメインを差し替えるだけで、そのままご依頼のサイトにも使えます。
Internet Archive の CDX Server API に対象ドメインを問い合わせ、保存されている全スナップショットのURL・日付・ステータスを取得します。
フィード・埋め込み・管理画面などのノイズURLを除外し、実際のブログ記事らしきURLだけを自動でフィルタリングします。
各記事のアーカイブ済みHTMLを解析し、タイトル・本文・画像URLを抽出。CSV/Excel等、扱いやすい形式で出力します。
対象サイトがまだ決まっていなかったため、Internet Archive 公式ブログ(blog.archive.org)を例に、今まさにこの処理を実行して取得したデータをそのまま載せています。
| 日付 | URL | アーカイブ |
|---|
上のURL一覧のうち、実際に本文と画像まで抽出した4記事のサンプルです。「元ページを見る」から、本物の Internet Archive 上のアーカイブページに直接アクセスして確認いただけます。
このデモは実データのみで構成しています。 表示されているURL・日付・本文・画像は、すべてこのデモを作成した時点で Wayback Machine から実際に取得したものです。架空のダミーデータは一切使用していません。「アーカイブを見る」リンクから、ご自身でも本物のページを確認いただけます。
抽出したデータは、そのまま使える形式(CSV / Excel / JSON等)で納品します。下記はCSV出力のイメージです。
| URL | 日付 | タイトル | 本文(抜粋) | 画像URL |
|---|
募集文には対象サイトの指定がなかったため、技術的に確実に動くことを証明する目的で、Wayback Machine 自体を運営している Internet Archive の公式ブログを題材にしました。
同じロジックのまま対象ドメインを差し替えるだけで、奈良原様がご想定の実際のサイトにもそのまま適用できます。写真まで取得できるかどうかはアーカイブされている画像の残り方次第ですが、残っている場合は上記のように自動で紐付けます。
ご希望の納品日(2026年10月19日)から逆算したスケジュール案です。対象サイトのドメインさえ教えていただければ、すぐに着手できます。