Sci-Data-Extractor para Openclaw

Uma ferramenta movida a IA projetada para transformar PDFs de literatura científica em dados estruturados em Markdown e CSV legíveis por máquina.

jackkuo666
v0.1.0
Feb 26, 2026
0
1.2k
0

Instalar e Baixar

1. ClawHub CLI

A maneira mais rápida de instalar uma habilidade diretamente do registro.

npx clawhub@latest install sci-data-extractor

2. Instalação Manual

Copie a pasta da habilidade para um desses locais

Global
~/.openclaw/skills/
Espaço de trabalho
<project>/skills/

Prioridade: Espaço de Trabalho > Local > Integrado

3. Instalação do Prompt

Copie este prompt para o OpenClaw para instalá-lo automaticamente.

Ajude-me a instalar o sci-data-extractor usando o Clawhub. Se o Clawhub não estiver instalado, instale-o primeiro (npm i -g clawhub).

Prefere baixar?

Obtenha os arquivos originais da habilidade em um arquivo ZIP.

O que é Sci-Data-Extractor?

O Sci-Data-Extractor é uma ferramenta especializada dentro do ecossistema Openclaw Skills que automatiza a extração de informações complexas de artigos acadêmicos. Ao combinar tecnologias de OCR de alta precisão, como o Mathpix, com Modelos de Linguagem Avançados (LLMs), como Claude 3.5 Sonnet e GPT-4o, ele oferece aos pesquisadores uma maneira confiável de digitalizar dados experimentais, fórmulas e tabelas.

Esta habilidade foi desenvolvida para ambientes de pesquisa de alto nível, onde a precisão é fundamental. Ela permite que os usuários definam regras de extração personalizadas ou usem modelos pré-configurados para analisar milhares de páginas de literatura científica em formatos estruturados, tornando-se um pilar para quem utiliza o Openclaw Skills para gerenciamento de dados técnicos.

Casos de uso do Sci-Data-Extractor

  • Construção de bancos de dados de cinética enzimática extraindo valores de Km e Kcat de artigos de bioquímica.
  • Compilação de resultados experimentais, incluindo tamanhos de amostra e valores de p, para meta-análise.
  • Geração de tabelas de revisão de literatura estruturadas, incluindo DOI, metodologia e principais descobertas.
  • Conversão de fórmulas matemáticas complexas e tabelas em PDF para formatos Markdown limpos.
  • Automação da identificação de estruturas proteicas específicas ou compostos químicos usando prompts personalizados.

Como o Sci-Data-Extractor funciona

  1. O usuário inicia uma solicitação fornecendo um PDF científico e selecionando um modelo de dados ou prompt personalizado.
  2. O sistema utiliza Mathpix OCR ou PyMuPDF para extrair o texto bruto, garantindo que as notações matemáticas e os layouts das tabelas sejam preservados.
  3. O texto extraído é processado por um LLM configurado via framework Openclaw Skills para identificar campos de dados específicos.
  4. A IA mapeia o conteúdo para o esquema solicitado, garantindo que os tipos e estruturas de dados sejam consistentes.
  5. A saída final é gerada como uma tabela Markdown ou arquivo CSV para integração em fluxos de trabalho de pesquisa.

Configuração do Sci-Data-Extractor

Pré-requisitos

  • Python 3.8+
  • Chaves de API para Anthropic ou OpenAI

Passos de Instalação

  1. Configuração do Ambiente (usando uv para velocidade):
curl -LsSf https://astral.sh/uv/install.sh | sh
uv venv
source .venv/bin/activate
uv pip install -r requirements.txt
  1. Configuração: Copie o modelo e adicione suas credenciais de API ao arquivo .env:
cp .env.example .env
# Adicione seu EXTRACTOR_API_KEY e EXTRACTOR_MODEL
  1. Validação:
python extractor.py --help

Esquema de Dados e Taxonomia de Sci-Data-Extractor

A habilidade organiza as informações extraídas em esquemas padronizados. Abaixo estão os principais campos de dados para os modelos integrados disponíveis no Openclaw Skills:

Modelo Campos Principais
Cinética Enzimática Enzima, Organismo, Substrato, Km, Kcat, Temp, pH, Mutante, Cosubstrato
Experimento Experimento, Condição, Resultado, Unidade, Desvio Padrão, valor de p
Revisão de Literatura Autor, Ano, Revista, Título, DOI, Descobertas Principais, Metodologia

A saída pode ser alternada entre --format markdown (padrão) e --format csv.

Recursos avançados do Sci-Data-Extractor

  • Prompting Personalizado: Use linguagem natural para definir alvos de extração únicos, como IDs de PDB ou linhagens celulares específicas.
  • OCR de Alta Precisão: Integração opcional com Mathpix para reconhecimento superior de fórmulas matemáticas complexas.
  • Suporte Flexível a Modelos: Compatível com Claude 3.5 Sonnet, GPT-4o e outros modelos compatíveis com API.
  • Processamento Segmentado: Lógica avançada para lidar com documentos científicos longos que excedem os limites padrão de tokens.
  • Exportação em Lote: Gere resultados diretamente em arquivos CSV prontos para pesquisa para análise imediata de dados nos fluxos de trabalho do Openclaw Skills.

SKILL.md


Carregamento

Habilidades relacionadas do Openclaw

METADATA

Github Stars: 0
forks: 0

Apresentou*