抽出

抽出は、クラスター内のすべてのサイトのページを読み込み、正規表現に一致する部分を取り出す機能です。サイトのクラスターが、電話番号、SNSアカウント、住所、プラグイン名など、パターンでキャプチャしたものの表に変わります。

読み込む対象

検索で一致したトップページだけでなく、下層ページも含め、PublicWWWがそれらのサイトについてインデックスしているすべてのページです。「会社概要」ページにしか載っていない連絡先も見つかります。

プリセットと独自のパターン

メールアドレスや電話番号など、よく使われるものにはプリセットがあります。代わりに任意の正規表現を使うこともできます。正規表現は、検索でのsnipexp:と同じように機能します。列に入るのはキャプチャグループの内容で、キャプチャグループのない正規表現では結果が空になります。

|/wp-content/plugins/([\w\d\-\.\_]+)/|

まずは小さなクラスターで試してください。取得するレコード数に上限を設けて、正規表現を試し、調整し、また試すことができるため、パターンが間違っていてもほとんど無駄になりません。それが重要な理由については制限をご覧ください。

結果の取り出し

抽出した表はファイルとしてダウンロードでき、スプレッドシートで開けます。各行はサイトとそこで見つかった内容です。何も一致しなかったサイトも一覧に残るため、抜けている箇所が黙って除外されることなく、ひと目でわかります。

クラスターで検索結果を絞り込む

クラスターは、逆方向のフィルターとしても使えます。独自のドメイン、URL、メールアドレスのリストをアップロードし、検索結果をそのリスト内のサイトだけに、あるいは差分を使ってリスト以外のサイトだけに絞り込めます。

電話番号とメールアドレスの抽出では、2回の検索からスプレッドシートの作成まで、一連の流れを解説しています。

次へ 制限