奈良原様のご依頼内容にあわせて作成

Wayback Machine から
URL + 記事本文 + 画像を
自動収集するツール

ご依頼いただいた「①URLの収集」「②ブログ記事の文字情報抽出」「③写真の取得」を、実際の Internet Archive のデータを使って動かしたデモです。文章で説明するより、実物を見ていただいた方が早いと思い、先に動くものを用意しました。

—
解析したアーカイブ記録数
—
自動抽出した記事URL数
100%
実データ(捏造・モックなし)
Your Request

ご依頼内容の整理

募集文に書かれていた内容を、そのままシステムの要件として落とし込みました。

01

URL収集

Wayback Machine にアーカイブされている対象サイトの全URLを、CDX APIを使って網羅的にリストアップします。

02

ブログ記事の文字情報抽出

収集したURLの中から記事ページを判別し、タイトル・本文テキストを自動で抽出します。

03

写真の取得(できればベスト)

記事内の画像も合わせて取得。アーカイブ上に画像が残っていれば自動で紐付けます。

04

工程を分けてもOK

「①URL取得だけ先に」「②それを使って本文抽出は別工程」という分割にも対応できる設計です。

How it works

処理の流れ

下のデモで実際に動いている処理です。対象サイトのドメインを差し替えるだけで、そのままご依頼のサイトにも使えます。

01

CDX APIでURLを全件取得

Internet Archive の CDX Server API に対象ドメインを問い合わせ、保存されている全スナップショットのURL・日付・ステータスを取得します。

02

記事ページを自動判別

フィード・埋め込み・管理画面などのノイズURLを除外し、実際のブログ記事らしきURLだけを自動でフィルタリングします。

03

本文・画像を抽出して出力

各記事のアーカイブ済みHTMLを解析し、タイトル・本文・画像URLを抽出。CSV/Excel等、扱いやすい形式で出力します。

Live Result · 実データ

実際に取得したデータ

対象サイトがまだ決まっていなかったため、Internet Archive 公式ブログ(blog.archive.org)を例に、今まさにこの処理を実行して取得したデータをそのまま載せています。

blog.archive.org を対象に実行した結果
LIVE DATA
解析したキャプチャ記録:— 件
記事URLとして抽出:— 件
本文・画像まで抽出済み:— 件(サンプル)
日付URLアーカイブ

抽出された記事の中身(本文・画像つき)

上のURL一覧のうち、実際に本文と画像まで抽出した4記事のサンプルです。「元ページを見る」から、本物の Internet Archive 上のアーカイブページに直接アクセスして確認いただけます。

このデモは実データのみで構成しています。 表示されているURL・日付・本文・画像は、すべてこのデモを作成した時点で Wayback Machine から実際に取得したものです。架空のダミーデータは一切使用していません。「アーカイブを見る」リンクから、ご自身でも本物のページを確認いただけます。

Deliverable

最終的な出力イメージ

抽出したデータは、そのまま使える形式(CSV / Excel / JSON等)で納品します。下記はCSV出力のイメージです。

URL日付タイトル本文(抜粋)画像URL
About this demo

なぜ Internet Archive 公式ブログを使ったのか

募集文には対象サイトの指定がなかったため、技術的に確実に動くことを証明する目的で、Wayback Machine 自体を運営している Internet Archive の公式ブログを題材にしました。

同じロジックのまま対象ドメインを差し替えるだけで、奈良原様がご想定の実際のサイトにもそのまま適用できます。写真まで取得できるかどうかはアーカイブされている画像の残り方次第ですが、残っている場合は上記のように自動で紐付けます。

archive shelves
Next Step

進め方のご提案

ご希望の納品日(2026年10月19日)から逆算したスケジュール案です。対象サイトのドメインさえ教えていただければ、すぐに着手できます。

着手当日
対象ドメイン確定・URL全件収集
+2〜3日
本文・画像の自動抽出
+1日
データ確認・出力形式の調整
10/19まで
納品