适用于 Openclaw 的 HTML Analysis

由 MinerU 提供支持的文档智能技能,用于将复杂的 HTML 文件转换为结构化、层级化的 Markdown 内容。

mzlzyca
v0.4.0
2026年4月3日
0
778
0

安装与下载

1. ClawHub CLI

从源直接安装技能的最快方式。

npx clawhub@latest install html-analysis

2. 手动安装

将技能文件夹复制到以下位置之一

全局模式
~/.openclaw/skills/
工作区
<project>/skills/

优先级:工作区 > 本地 > 内置

3. 提示词安装

将此提示词复制到 OpenClaw 即可自动安装。

请帮我使用 Clawhub 安装 html-analysis。如果尚未安装 Clawhub,请先安装(npm i -g clawhub)。

更倾向于下载?

获取包含原生技能文件的ZIP压缩包。

什么是 HTML Analysis?

html-analysis 技能是为需要解析本地或远程 HTML 文档且不丢失结构完整性的开发人员和研究人员提供的专业工具。通过利用来自 OpenDataLab 的 MinerU 引擎,该技能擅长识别网页中的内容部分、标题、表格和列表,将它们转换为干净的 Markdown,同时保留原始布局逻辑。

与基础爬虫不同,此 Openclaw Skills 集成专注于文档智能。它允许 AI 代理有效地读取和理解网页布局,使其成为内容审计、SEO 分析以及将高质量结构化数据输入到 LLM 工作流中的基本实用工具。

HTML Analysis 应用场景

  • 为 RAG 流水线从本地 HTML 文档中提取结构化数据。
  • 为 SEO 审计分析现有网页的标题层级和内容布局。
  • 将旧版 HTML 内容转换为干净、可读的 Markdown 以进行 CMS 迁移。
  • 使 AI 代理能够准确解释复杂的 Web 结构和数据表。

HTML Analysis 工作原理

  1. 用户提供 HTML 文件的本地路径或远程文档的 URL。
  2. 该技能触发 MinerU extract 命令,利用经过身份验证的 API token。
  3. MinerU 解析 HTML 标签以识别语义块,如标题、列表和表格数据。
  4. 文档智能引擎处理布局,以确保维持阅读顺序和层级结构。
  5. 该技能将最终的结构化 Markdown 输出到指定目录或 stdout 供代理消费。

HTML Analysis 配置指南

首先,通过 npm 或 Go 全局安装必要的 CLI 工具:


HTML Analysis 数据架构与分类体系

该技能组织提取的数据以最大化可读性和机器解析效率:

Component Format Description
Content Markdown 保留的标题、加粗/斜体文本和链接
Tables GFM Tables 用于数据提取的标准 Markdown 表格语法
Metadata YAML/JSON 布局信息和文档层级数据
Output File/Stdout 支持使用 -o 标志直接保存文件

HTML Analysis 高级特性

  • 使用 --language 标志(例如英语、中文)的多语言支持。
  • 通过 crawl 命令为 JavaScript 渲染的页面提供完整的 Web 爬取功能。
  • 识别语义部分而非仅原始标签的深度结构分析。
  • 与 Openclaw Skills 工作流无缝集成,用于多代理文档处理。
  • 支持将远程 URL 直接提取到本地处理流水线中。

SKILL.md


加载中

Openclaw 相关技能

METADATA

Requires
Bins mineru-open-api
Github Stars: 0
forks: 0

精选*