正規表現

snipexp:は、見つかるサイトを変えない唯一の演算子です。変わるのは、各サイトについて表示される内容です。これを使えば、サイトの一覧をパブリッシャーID、電話番号、プラグイン名の一覧に変えられます。

スニペットには、一致箇所の前後のテキストの代わりに、正規表現でキャプチャした内容が表示されます。

正規表現は区切り文字付きのPCREパターンで指定します。区切り文字には通常|を使います(クエリに含まれることがほとんどないためです)。また、キャプチャグループが少なくとも1つ必要です。取得できるのはグループがキャプチャした内容だからです。フラグは閉じ区切り文字の後に付けます。たとえばiを付けると大文字と小文字を区別しません。キャプチャグループがないとスニペットは空になります。列が空になる原因の多くはこれです。

snipexp:|pubid=(ra\-[\w\d]+)|i

イタリアのピザ店の電話番号

"href=\"tel" site:it pizza snipexp:|\"tel\:([^\"]+)\"|

アフィリエイトのサイトID

"_pop.push([\"siteId" snipexp:|(siteId[\"\']\,\s*(\d+))|i

スニペットは、csvsnippets形式のエクスポートに含まれる内容であり、APIでsnippets=1を指定したときに返される内容でもあります。サイトの集合全体から一度に項目を抽出するには、クラスターを使います。スニペットには別枠の1日の利用枠が適用されます。詳しくは利用枠とレート制限をご覧ください。

次へ 国別ドメイン