一個用於設計高併發 Python 網路爬蟲和健壯數據採集管道的專業框架。
從來源直接安裝技能的最快方式。
npx clawhub@latest install python-crawler-architect
將技能資料夾複製到以下位置之一
~/.openclaw/skills/ <project>/skills/ 優先級:工作區 > 本地 > 內建
將此提示詞複製到 OpenClaw 即可自動安裝。
請幫我使用 Clawhub 安裝 python-crawler-architect。如果尚未安裝 Clawhub,請先安裝(npm i -g clawhub)。
取得包含原生技能檔案的ZIP壓縮檔。
這項技能將 AI 代理轉變為資深 Python 爬蟲架構師,專注於生產級數據採集系統的設計與實現。它致力於使用現代 Python 標準構建具有彈性、可擴展且易於維護的抓取基礎設施。透過將其集成到 Openclaw Skills 工作流中,開發人員可以自動化創建複雜的爬蟲,這些爬蟲具有 asyncio 異步併發、透過 SQLAlchemy 2.0 實現的結構化數據持久化以及斷點續傳等高級穩定性功能。
該技能的核心哲學是穩定性和架構完整性。它超越了簡單的腳本,提供全疊全工程方法,涵蓋從分層實體的資料庫建模到複雜的反爬蟲對策實施。無論您是在處理海量數據集還是嚴格的速率限制,此技能都提供了確保可靠數據提取所需的模板和邏輯。
要在項目中使用此技能,請使用以下命令安裝所需的依賴項:
# 安裝核心異步和資料庫依賴項
pip install aiohttp sqlalchemy loguru pydantic-settings python-dotenv
# 安裝資料庫驅動程序(以 PostgreSQL 為例)
pip install psycopg2-binary
創建一個 .env 文件來管理您的配置,如 DATABASE_URL 和 PROXY_LIST,以便在使用 Openclaw Skills 時確保憑據安全。
該技能使用模組化架構組織數據,以確保關注點分離:
| 模組 | 描述 |
|---|---|
| Models | 具有自動時間戳和索引功能的 SQLAlchemy 2.0 ORM 實體。 |
| Crawler Core | 請求處理、proxy 輪換和任務調度的邏輯。 |
| State Management | 基於 JSON 的架構,跟蹤 completed_ids 和 progress 以實現容錯。 |
| Utils | 用於數據清洗、User-Agent 輪換和速率限制的輔助函數。 |
所有資料庫字段生成時都帶有描述性註釋和適當的 SQL 約束,以確保數據完整性。
加載中







































