一个用于设计高并发 Python 网络爬虫和健壮数据采集管道的专业框架。
从源直接安装技能的最快方式。
npx clawhub@latest install python-crawler-architect
将技能文件夹复制到以下位置之一
~/.openclaw/skills/ <project>/skills/ 优先级:工作区 > 本地 > 内置
将此提示词复制到 OpenClaw 即可自动安装。
请帮我使用 Clawhub 安装 python-crawler-architect。如果尚未安装 Clawhub,请先安装(npm i -g clawhub)。
获取包含原生技能文件的ZIP压缩包。
这项技能将 AI 智能体转变为资深 Python 爬虫架构师,专注于生产级数据采集系统的设计与实现。它致力于使用现代 Python 标准构建具有弹性、可扩展且易于维护的抓取基础设施。通过将其集成到 Openclaw Skills 工作流中,开发人员可以自动化创建复杂的爬虫,这些爬虫具有 asyncio 异步并发、通过 SQLAlchemy 2.0 实现的结构化数据持久化以及断点续传等高级稳定性功能。
该技能的核心哲学是稳定性和架构完整性。它超越了简单的脚本,提供全栈工程方法,涵盖从分层实体的数据库建模到复杂的反爬虫对策实施。无论您是在处理海量数据集还是严格的速率限制,此技能都提供了确保可靠数据提取所需的模板和逻辑。
要在项目中使用此技能,请使用以下命令安装所需的依赖项:
# 安装核心异步和数据库依赖项
pip install aiohttp sqlalchemy loguru pydantic-settings python-dotenv
# 安装数据库驱动程序(以 PostgreSQL 为例)
pip install psycopg2-binary
创建一个 .env 文件来管理您的配置,如 DATABASE_URL 和 PROXY_LIST,以便在使用 Openclaw Skills 时确保凭据安全。
该技能使用模块化架构组织数据,以确保关注点分离:
| 模块 | 描述 |
|---|---|
| Models | 具有自动时间戳和索引功能的 SQLAlchemy 2.0 ORM 实体。 |
| Crawler Core | 请求处理、proxy 轮换和任务调度的逻辑。 |
| State Management | 基于 JSON 的架构,跟踪 completed_ids 和 progress 以实现容错。 |
| Utils | 用于数据清洗、User-Agent 轮换和速率限制的辅助函数。 |
所有数据库字段生成时都带有描述性注释和适当的 SQL 约束,以确保数据完整性。
加载中







































