Manipulador de Documentos para Openclaw

Um utilitário versátil para extrair texto, metadados e converter vários formatos de documentos, incluindo PDF, Word e Excel.

neckr0ik
v1.0.0
Mar 7, 2026
0
3.8k
0

Instalar e Baixar

1. ClawHub CLI

A maneira mais rápida de instalar uma habilidade diretamente do registro.

npx clawhub@latest install document-handler

2. Instalação Manual

Copie a pasta da habilidade para um desses locais

Global
~/.openclaw/skills/
Espaço de trabalho
<project>/skills/

Prioridade: Espaço de Trabalho > Local > Integrado

3. Instalação do Prompt

Copie este prompt para o OpenClaw para instalá-lo automaticamente.

Ajude-me a instalar o document-handler usando o Clawhub. Se o Clawhub não estiver instalado, instale-o primeiro (npm i -g clawhub).

Prefere baixar?

Obtenha os arquivos originais da habilidade em um arquivo ZIP.

O que é Manipulador de Documentos?

O Manipulador de Documentos é uma habilidade técnica abrangente projetada para agentes de IA interagirem com uma ampla gama de formatos de documentos. Ele fornece as ferramentas necessárias para ler conteúdo de PDFs, arquivos do Microsoft Office, EPUBs e formatos OpenDocument, tornando-se um componente essencial para qualquer fluxo de trabalho de processamento de dados automatizado dentro do ecossistema Openclaw Skills.

Aproveitando utilitários CLI padrão e scripts shell personalizados, esta habilidade permite a extração contínua de texto e metadados, bem como a conversão de formato de alta qualidade. Se você precisa extrair dados de uma planilha complexa ou resumir um relatório acadêmico em PDF, esta habilidade garante que seu agente de IA tenha acesso direto às informações subjacentes sem exigir suítes de software externas pesadas.

Casos de uso do Manipulador de Documentos

  • Extração de texto simples de relatórios em PDF para sumarização automatizada.
  • Recuperação de metadados do documento, como autor, data de criação e contagem de páginas.
  • Conversão de páginas de PDF em imagens de alta resolução para processamento de OCR posterior.
  • Leitura de conteúdo de e-books EPUB ou arquivos RTF para ingestão em base de conhecimento.
  • Processamento de arquivos Office Open XML (DOCX, XLSX, PPTX) via ferramentas de linha de comando para análise rápida de dados.

Como o Manipulador de Documentos funciona

  1. Identificação: A habilidade identifica o formato do documento com base na extensão do arquivo (ex: .pdf, .docx, .epub).
  2. Extração: Ela aciona a ferramenta apropriada, como pdftotext ou unzip, para extrair o conteúdo bruto da estrutura do arquivo.
  3. Recuperação de Metadados: Metadados técnicos são extraídos usando utilitários especializados como pdfinfo para fornecer contexto sobre o arquivo.
  4. Processamento: O texto ou dados extraídos são normalizados e enviados de volta ao agente para sumarização, transformação ou análise lógica posterior.

Configuração do Manipulador de Documentos

Para integrar esta capacidade ao seu ambiente Openclaw Skills, certifique-se de ter os utilitários CLI necessários instalados. No macOS, eles podem ser gerenciados via Homebrew.

# Instalar utilitários de PDF (pdftotext, pdfinfo, pdftoppm)
brew install poppler

# Instalar lynx para renderização de texto EPUB
brew install lynx

Execute os scripts fornecidos diretamente para processamento em lote:

# Extrair texto e metadados de qualquer arquivo suportado
./scripts/extract_document.sh <caminho_do_arquivo>

# Converter páginas de PDF em imagens PNG para processamento visual
./scripts/pdf_to_images.sh <caminho_do_pdf> <diretorio_de_saida> [dpi]

Esquema de Dados e Taxonomia de Manipulador de Documentos

O Manipulador de Documentos processa vários arquivos de entrada e gera saídas estruturadas de texto ou imagem. Os metadados são frequentemente retornados como comentários formatados em JSON para fácil análise.

Componente do Documento Método de Extração Saída Primária
Conteúdo de Texto pdftotext, sed, textutil Texto Simples
Metadados do Arquivo pdfinfo, unzip JSON / Chave-Valor
Visuais de Página pdftoppm Imagens PNG / JPEG
Dados de Planilha unzip + parsing xml Texto Normalizado

Recursos avançados do Manipulador de Documentos

  • Extração granular específica por página para leitura direcionada de grandes documentos PDF.
  • Suporte para formatos OpenDocument (ODT, ODS, ODP) para compatibilidade entre plataformas.
  • Conversão de RTF para HTML ou Texto usando integração com o textutil do macOS.
  • Extração automatizada de strings compartilhadas de arquivos Excel para reconstruir dados de células sem uma GUI.
  • Suporte aprimorado ao fluxo de trabalho para OCR, preparando imagens de documentos para o Tesseract dentro do Openclaw Skills.

SKILL.md


Carregamento

Habilidades relacionadas do Openclaw

METADATA

Github Stars: 0
forks: 0

Apresentou*