一款高性能网页抓取工具,旨在绕过反爬保护并将网页内容转换为供 AI 代理使用的整洁 Markdown。
从源直接安装技能的最快方式。
npx clawhub@latest install scrapling-fetch-basic
将技能文件夹复制到以下位置之一
~/.openclaw/skills/ <project>/skills/ 优先级:工作区 > 本地 > 内置
将此提示词复制到 OpenClaw 即可自动安装。
请帮我使用 Clawhub 安装 scrapling-fetch-basic。如果尚未安装 Clawhub,请先安装(npm i -g clawhub)。
获取包含原生技能文件的ZIP压缩包。
Scrapling Fetch Basic 是 Openclaw Skills 生态系统中一款强大的入门级工具,专为高效网页数据提取而设计。它擅长抓取博客、新闻网站和公共公告等静态页面的内容。通过集成先进的智能提取逻辑,它无需手动配置 CSS 选择器即可识别核心文章文本。
该技能通过将复杂的 HTML 自动转换为整洁、结构化的 Markdown,在原始网页数据与 AI 就绪信息之间搭建了无缝桥梁。无论您处理的是标准网站还是受 Cloudflare 保护的页面,该工具都能通过其灵活的运行模式确保高质量的数据检索。
要将其集成到您的工作流中,请确保您已为 Openclaw Skills 设置了必要的环境。安装核心依赖项并使用以下命令:
# 静态页面的基础抓取
python3 scripts/scrapling_fetch.py https://example.com/article
# 为受保护网站使用 Stealth 模式抓取
python3 scripts/scrapling_fetch.py https://protected-site.com --mode stealth
# 以 JSON 格式输出结果用于自动化流水线
python3 scripts/scrapling_fetch.py https://example.com --json
该技能通过优先处理结构化元素来组织数据,以确保内容的完整性。以下是提取逻辑的 schema:
| 特性 | 描述 |
|---|---|
| 输出格式 | Markdown (默认) 或 JSON |
| 字符限制 | 默认 30,000 字符 (可自定义) |
| 选择器层级 | 11 步回退机制 (article > main > .post-content > body) |
| 引擎 | 带有 html2text 转换的 scrapling 核心 |
.entry-content 或 [class*='body'])以从噪声中寻找信号。加载中
一个经过实战检验的 OpenClaw Guardian 确定性正则表达式规则库,包含 56 条规则,在工具层阻断高风险代理行为,无需 LLM 开销。

一个致力于为足球传奇人物 Cristiano Ronaldo C罗 提供实时传记、职业里程碑和社交媒体更新的综合数字助手。








































