Sci-Data-Extractor para Openclaw

Una herramienta impulsada por IA diseñada para transformar PDFs de literatura científica en datos estructurados en Markdown y CSV legibles por máquina.

jackkuo666
v0.1.0
Feb 26, 2026
0
1.2k
0

Instalar y Descargar

1. ClawHub CLI

La forma más rápida de instalar una habilidad directamente desde el registro.

npx clawhub@latest install sci-data-extractor

2. Instalación manual

Copia la carpeta de la habilidad a una de estas ubicaciones

Global
~/.openclaw/skills/
Espacio de trabajo
<project>/skills/

Prioridad: Espacio de trabajo > Local > Integrado

3. Instalación del prompt

Copia este prompt en OpenClaw para instalarlo automáticamente.

Ayúdame a instalar sci-data-extractor usando Clawhub. Si Clawhub no está instalado, instálalo primero (npm i -g clawhub).

¿Prefieres descargar?

Obtén los archivos originales de la habilidad en un archivo ZIP.

¿Qué es Sci-Data-Extractor?

Sci-Data-Extractor es una herramienta especializada dentro del ecosistema Openclaw Skills que automatiza la extracción de información compleja de artículos académicos. Al combinar tecnologías OCR de alta precisión como Mathpix con Modelos de Lenguaje Avanzados como Claude 3.5 Sonnet y GPT-4o, proporciona a los investigadores una forma confiable de digitalizar datos experimentales, fórmulas y tablas.

Esta habilidad está diseñada para entornos de investigación de alto nivel donde la precisión es primordial. Permite a los usuarios definir reglas de extracción personalizadas o usar plantillas preconfiguradas para analizar miles de páginas de literatura científica en formatos estructurados, convirtiéndose en una pieza fundamental para cualquiera que utilice Openclaw Skills para la gestión de datos técnicos.

Casos de uso de Sci-Data-Extractor

  • Creación de bases de datos de cinética enzimática extrayendo valores de Km y Kcat de artículos de bioquímica.
  • Compilación de resultados experimentales, incluyendo tamaños de muestra y valores p, para metanálisis.
  • Generación de tablas estructuradas de revisión de literatura que incluyen DOI, metodología y hallazgos clave.
  • Conversión de fórmulas matemáticas complejas y tablas PDF a formatos Markdown limpios.
  • Automatización de la identificación de estructuras de proteínas específicas o compuestos químicos mediante prompts personalizados.

Cómo funciona Sci-Data-Extractor

  1. El usuario inicia una solicitud proporcionando un PDF científico y seleccionando una plantilla de datos o un prompt personalizado.
  2. El sistema utiliza Mathpix OCR o PyMuPDF para extraer el texto sin procesar, asegurando que se preserven las notaciones matemáticas y los diseños de las tablas.
  3. El texto extraído es procesado por un LLM configurado a través del framework Openclaw Skills para identificar campos de datos específicos.
  4. La IA mapea el contenido al esquema solicitado, asegurando que los tipos de datos y las estructuras sean consistentes.
  5. La salida final se genera como una tabla Markdown o un archivo CSV para su integración en los flujos de trabajo de investigación.

Configuración de Sci-Data-Extractor

Requisitos previos

  • Python 3.8+
  • Claves de API para Anthropic o OpenAI

Pasos de instalación

  1. Configuración del entorno (usando uv para mayor rapidez):
curl -LsSf https://astral.sh/uv/install.sh | sh
uv venv
source .venv/bin/activate
uv pip install -r requirements.txt
  1. Configuración: Copie la plantilla y añada sus credenciales de API al archivo .env:
cp .env.example .env
# Añada su EXTRACTOR_API_KEY y EXTRACTOR_MODEL
  1. Validación:
python extractor.py --help

Esquema de datos y taxonomía de Sci-Data-Extractor

La habilidad organiza la información extraída en esquemas estandarizados. A continuación se muestran los campos de datos principales para las plantillas integradas disponibles en Openclaw Skills:

Plantilla Campos clave
Cinética enzimática Enzima, Organismo, Sustrato, Km, Kcat, Temp, pH, Mutante, Cosustrato
Experimento Experimento, Condición, Resultado, Unidad, Desviación estándar, valor p
Revisión de literatura Autor, Año, Revista, Título, DOI, Hallazgos clave, Metodología

La salida se puede alternar entre --format markdown (predeterminado) y --format csv.

Funciones avanzadas de Sci-Data-Extractor

  • Prompts personalizados: Use lenguaje natural para definir objetivos de extracción únicos como IDs de PDB o líneas celulares específicas.
  • OCR de alta precisión: Integración opcional con Mathpix para un reconocimiento superior de fórmulas matemáticas complejas.
  • Soporte de modelos flexible: Compatible con Claude 3.5 Sonnet, GPT-4o y otros modelos compatibles con API.
  • Procesamiento segmentado: Lógica avanzada para manejar documentos científicos largos que exceden los límites estándar de tokens.
  • Exportación por lotes: Genere resultados directamente en archivos CSV listos para la investigación para el análisis inmediato de datos dentro de los flujos de trabajo de Openclaw Skills.

SKILL.md


Cargando

Habilidades relacionadas de Openclaw

METADATA

Github Stars: 0
forks: 0

Presentado*