Openclaw向けScrapling Web Scraping

アンチボット保護を回避し、動的コンテンツを容易に処理する、Openclaw Skills 用の高性能ウェブスクレイピングスキルです。

zhengxinjipai
v1.0.0
Mar 6, 2026
3
5k
0

インストール&ダウンロード

1. ClawHub CLI

レジストリから直接スキルをインストールする最速の方法です。

npx clawhub@latest install scrapling-web-scraper

2. 手動インストール

スキルフォルダを以下のいずれかの場所にコピーしてください

グローバル
~/.openclaw/skills/
ワークスペース
<project>/skills/

優先順位:ワークスペース > ローカル > バンドル

3. プロンプトのインストール

このプロンプトをOpenClawにコピーするだけで、自動的にインストールされます。

Clawhubを使って scrapling-web-scraper をインストールして。Clawhubがインストールされていない場合は、先にインストールしてください(npm i -g clawhub)。

ダウンロードをご希望ですか?

ZIPアーカイブで生のスキルファイルを取得します。

Scrapling Web Scraping とは?

Scrapling Web Scraping は、Openclaw Skills エコシステム向けに設計された、堅牢なデータ抽出機能を提供する専門ツールです。Cloudflare の保護、JavaScript を多用するシングルページアプリケーション (SPA)、高度なアンチボット検知システムといった、現代のウェブスクレイピングにおける共通の課題に対処します。

このスキルを統合することで、AI エージェントはブロックされることなく、ウェブ上の情報にアクセスして処理できるようになります。生のウェブコンテンツと構造化データの橋渡し役となり、リサーチ、モニタリング、自動化タスクにおいて、低負荷かつ高い成功率で高品質な情報の取得を実現します。

Scrapling Web Scraping のユースケース

  • 保護されたウェブサイトでの Cloudflare およびアンチボットシステムの回避。
  • 動的な JavaScript レンダリングのシングルページアプリケーション (SPA) からのデータ抽出。
  • 基本モードを使用した、保護されていないサイトへの高速な HTTP スクレイピング。
  • 価格やタイトルなどの構造化された情報を対象とした、CSS セレクターによる特定のデータ抽出。

Scrapling Web Scraping の仕組み

  1. ユーザーまたは AI エージェントが、Openclaw Skills のコマンドを介して、ターゲット URL とオプションのパラメータ(モードや CSS セレクターなど)を提供します。
  2. スキルが適切なエンジンを選択します:Basic(HTTP リクエスト)、Stealth(検知不可能なフィンガープリント)、または Dynamic(完全なブラウザ自動化)。
  3. Cloudflare が検知され、ステルスモードが有効な場合、スキルはアクセス権を得るために自動回避プロトコルを開始します。
  4. スクレイパーがページコンテンツを取得し、指定された CSS セレクターを適用して関連するデータフィールドを抽出します。
  5. 最終的な出力は、即時処理のために、生テキストまたは構造化 JSON としてエージェントに返されます。

Scrapling Web Scraping のセットアップ

このスキルを環境に統合するには、以下のインストールと初期化の手順に従ってください:

# Scrapling ライブラリと必要なすべての依存関係をインストールします
pip install "scrapling[all]"

# 動的スクレイピングに必要なブラウザエンジンをダウンロードしてインストールします
scrapling install

注意:このスキルが Openclaw Skills フレームワーク内で正しく動作するには、Python 3.10 以上が必要です。

Scrapling Web Scraping のデータスキーマとタクソノミー

このスキルは、CLI 出力と内部 Python オブジェクトを通じてデータを整理します。JSON 出力フラグを使用する場合、データは次のように構造化されます:

フィールド 説明
URL スクレイピング対象のウェブサイトのアドレス
モード 使用されたスクレイピングエンジン:basic、stealth、または dynamic
コンテンツ ページから抽出された生またはフィルタリングされた HTML コンテンツ
セレクター結果 CSS セレクター使用時に見つかった特定の要素のリスト
ステータス 実行ステータスと HTTP レスポンスコード

Scrapling Web Scraping の高度な機能

  • サイトの複雑さに応じて Basic、Stealth、Dynamic のフェッチを切り替えられるトリプルモードアーキテクチャ。
  • 手動介入なしで現代のウェブアプリケーションファイアウォールを回避するように設計された、ネイティブの Cloudflare ソルバー。
  • 抽出前にすべての非同期 JavaScript コンテンツが完全にレンダーされることを保証する、Dynamic モードでのネットワークアイドル検知。
  • 複雑なマルチステップのデータワークフロー向けに、Openclaw Skills ディレクトリ内にあるカスタムスクレイピングスクリプトのサポート。
  • フィンガープリントや検知を避けるために人間の行動を模倣する、ヘッドレスブラウザの自動化。

SKILL.md


ローディング

関連するOpenclawのスキル

METADATA

Github Stars: 0
forks: 0

特徴*