Sci-Data-Extractor cho Openclaw

Một công cụ hỗ trợ bởi AI được thiết kế để chuyển đổi các tệp PDF tài liệu khoa học thành dữ liệu Markdown và CSV có cấu trúc, máy có thể đọc được.

jackkuo666
v0.1.0
Feb 26, 2026
0
1.2k
0

Cài đặt & Tải xuống

1. ClawHub CLI

Cách nhanh nhất để cài đặt kỹ năng trực tiếp từ thư viện.

npx clawhub@latest install sci-data-extractor

2. Cài đặt Thủ công

Sao chép thư mục kỹ năng vào một trong những vị trí sau

Toàn cục
~/.openclaw/skills/
Không gian làm việc
<project>/skills/

Ưu tiên: Không gian làm việc > Cục bộ > Gói sẵn

3. Cài đặt Prompt

Sao chép prompt này vào OpenClaw để tự động cài đặt.

Giúp tôi cài đặt sci-data-extractor bằng Clawhub. Nếu Clawhub chưa

Bạn muốn tải xuống?

Nhận các tệp kỹ năng gốc dưới dạng lưu trữ ZIP.

Sci-Data-Extractor là gì?

Sci-Data-Extractor là một công cụ chuyên dụng trong hệ sinh thái Openclaw Skills giúp tự động hóa việc trích xuất thông tin phức tạp từ các bài báo học thuật. Bằng cách kết hợp các công nghệ OCR độ chính xác cao như Mathpix với các Mô hình Ngôn ngữ Lớn tiên tiến như Claude 3.5 Sonnet và GPT-4o, nó cung cấp cho các nhà nghiên cứu một cách đáng tin cậy để số hóa dữ liệu thực nghiệm, công thức và bảng biểu.

Kỹ năng này được xây dựng cho các môi trường nghiên cứu quan trọng, nơi độ chính xác là tối thượng. Nó cho phép người dùng xác định các quy tắc trích xuất tùy chỉnh hoặc sử dụng các mẫu có sẵn để phân tích hàng nghìn trang tài liệu khoa học thành các định dạng có cấu trúc, trở thành nền tảng cho bất kỳ ai tận dụng Openclaw Skills để quản lý dữ liệu kỹ thuật.

Trường hợp sử dụng Sci-Data-Extractor

  • Xây dựng cơ sở dữ liệu động học enzyme bằng cách trích xuất các giá trị Km và Kcat từ các bài báo hóa sinh.
  • Tổng hợp kết quả thực nghiệm, bao gồm kích thước mẫu và giá trị p, để phân tích tổng hợp.
  • Tạo các bảng đánh giá tài liệu có cấu trúc bao gồm DOI, phương pháp luận và các phát hiện chính.
  • Chuyển đổi các công thức toán học phức tạp và bảng biểu trong PDF thành định dạng Markdown sạch sẽ.
  • Tự động hóa việc nhận dạng các cấu trúc protein cụ thể hoặc các hợp chất hóa học bằng cách sử dụng các câu lệnh tùy chỉnh.

Cách thức hoạt động của Sci-Data-Extractor

  1. Người dùng bắt đầu yêu cầu bằng cách cung cấp một tệp PDF khoa học và chọn một mẫu dữ liệu hoặc câu lệnh tùy chỉnh.
  2. Hệ thống sử dụng Mathpix OCR hoặc PyMuPDF để trích xuất văn bản thô, đảm bảo rằng các ký hiệu toán học và bố cục bảng được bảo toàn.
  3. Văn bản được trích xuất được xử lý bởi một LLM đã được cấu hình thông qua khung Openclaw Skills để xác định các trường dữ liệu cụ thể.
  4. AI ánh xạ nội dung vào lược đồ được yêu cầu, đảm bảo các loại dữ liệu và cấu trúc nhất quán.
  5. Kết quả cuối cùng được tạo dưới dạng bảng Markdown hoặc tệp CSV để tích hợp vào quy trình nghiên cứu.

Cài đặt Sci-Data-Extractor

Điều kiện tiên quyết

  • Python 3.8+
  • Mã khóa API cho Anthropic hoặc OpenAI

Các bước cài đặt

  1. Thiết lập môi trường (sử dụng uv để tăng tốc độ):
curl -LsSf https://astral.sh/uv/install.sh | sh
uv venv
source .venv/bin/activate
uv pip install -r requirements.txt
  1. Cấu hình: Sao chép mẫu và thêm thông tin xác thực API của bạn vào tệp .env:
cp .env.example .env
# Thêm EXTRACTOR_API_KEY và EXTRACTOR_MODEL của bạn
  1. Xác nhận:
python extractor.py --help

Lược đồ dữ liệu & Hệ thống phân loại của Sci-Data-Extractor

Kỹ năng này tổ chức thông tin được trích xuất vào các lược đồ chuẩn hóa. Dưới đây là các trường dữ liệu chính cho các mẫu tích hợp sẵn có trong Openclaw Skills:

Mẫu Các trường chính
Động học Enzyme Enzyme, Sinh vật, Cơ chất, Km, Kcat, Nhiệt độ, pH, Đột biến, Đồng cơ chất
Thực nghiệm Thực nghiệm, Điều kiện, Kết quả, Đơn vị, Độ lệch chuẩn, giá trị p
Đánh giá tài liệu Tác giả, Năm, Tạp chí, Tiêu đề, DOI, Phát hiện chính, Phương pháp luận

Đầu ra có thể chuyển đổi giữa --format markdown (mặc định) và --format csv.

Tính năng Nâng cao của Sci-Data-Extractor

  • Câu lệnh tùy chỉnh: Sử dụng ngôn ngữ tự nhiên để xác định các mục tiêu trích xuất duy nhất như mã PDB hoặc các dòng tế bào cụ thể.
  • OCR độ chính xác cao: Tích hợp Mathpix tùy chọn để nhận dạng vượt trội các công thức toán học phức tạp.
  • Hỗ trợ mô hình linh hoạt: Tương thích với Claude 3.5 Sonnet, GPT-4o và các mô hình tương thích API khác.
  • Xử lý phân đoạn: Logic nâng cao để xử lý các tài liệu khoa học dài vượt quá giới hạn token tiêu chuẩn.
  • Xuất hàng loạt: Tạo kết quả trực tiếp vào các tệp CSV sẵn sàng cho nghiên cứu để phân tích dữ liệu ngay lập tức trong quy trình làm việc của Openclaw Skills.

SKILL.md


Đang tải

Các kỹ năng Openclaw liên quan

METADATA

Github Stars: 0
forks: 0

Đặc sắc*