Traitement des documents PDF distants et conversion HTML - Workflow n8n

Exploitez ce puissant flux de travail n8n pour convertir le contenu HTML en PDF et extraire précisément du texte à partir de documents PDF locaux et distants à l'aide des nœuds n8n spécialisés et de l'API CustomJS.

Aperçu du workflow

Prêt à automatiser ?

Téléchargez ce modèle de workflow n8n et commencez à l'utiliser instantanément.

À qui s'adresse cette solution ?

Spécialistes de l'automatisation ayant besoin de gérer la génération de documents et l'extraction de texte.
Développeurs recherchant des modèles n8n avancés pour le traitement PDF.
Utilisateurs de l'API CustomJS souhaitant voir des exemples d'utilisation spécifique de leur nœud n8n.
Toute personne recherchant une méthode fiable pour analyser des informations statiques à partir de documents PDF dans une automatisation n8n.

Vue d'ensemble

La gestion des documents PDF est une exigence fréquente dans l'automatisation des processus métier, mais elle nécessite souvent des outils spécialisés. Ce flux de travail n8n complet résout deux défis courants : convertir n'importe quel contenu HTML en un document PDF portable, puis extraire des données textuelles précieuses à la fois des PDF nouvellement générés et des fichiers existants hébergés en externe (via URL). Ce modèle n8n particulier utilise des fonctionnalités de nœuds n8n spécialisés (CustomJS PDF Toolkit) pour obtenir un traitement documentaire fluide. En utilisant ce flux de travail n8n, vous obtenez la capacité de rationaliser des processus tels que l'archivage de documentation, la capture de contenu web et l'ingestion de données à partir de formats PDF complexes.

Fonctionnement

Ce flux de travail n8n commence par un simple Déclencheur Manuel (Manual Trigger), permettant à l'utilisateur d'initier facilement le processus en cliquant sur 'Tester le flux de travail'. La logique principale se divise immédiatement en deux chemins parallèles distincts pour démontrer différents cas d'utilisation du nœud n8n PDF spécialisé :


  1. Chemin 1 : Conversion HTML dynamique et extraction

Le flux passe au nœud n8n 'HTML vers PDF', qui prend une entrée HTML statique (

Hello World

) et la convertit en un objet binaire PDF. Ceci utilise les identifiants de l'API CustomJS.
Le binaire PDF résultant est transmis au premier nœud n8n 'Convertir PDF en Texte'. Ce nœud traite directement le binaire du fichier et extrait le texte, confirmant que le HTML a été converti avec succès et rendu lisible par le flux de travail n8n.


  1. Chemin 2 : Extraction depuis une URL PDF distante

Le chemin parallèle commence par un nœud n8n de type 'Code'. Ce nœud est utilisé pour définir une entrée d'URL PDF distante, simulant une source externe de données PDF requise par le flux de travail n8n.
Les données (le chemin de l'URL) sont ensuite envoyées au nœud n8n 'Convertir PDF en Texte1'. Ce nœud n8n puissant est configuré pour récupérer le PDF depuis l'URL fournie, éliminant le besoin de télécharger le fichier manuellement. Il effectue ensuite l'extraction de texte directement depuis le document distant.

Guide d'installation

Pour installer ce modèle de flux de travail n8n et utiliser son plein potentiel, suivez ces étapes :


  1. Installer le Nœud Custom N8N : Ce flux de travail n8n repose sur un paquet tiers. Vous devez d'abord installer le paquet @custom-js/n8n-nodes-pdf-toolkit dans votre instance n8n.

  2. Importer le Flux de Travail n8n : Copiez les données JSON fournies. Dans votre interface n8n, naviguez vers 'Flux de travail' (Workflows), cliquez sur 'Nouveau' (New), et sélectionnez 'Importer depuis JSON' (Import from JSON).

  3. Configurer les Identifiants : Les instances de nœud n8n 'HTML vers PDF' et 'Convertir PDF en Texte' requièrent des identifiants 'API CustomJS'. Assurez-vous d'avoir configuré une connexion avec la clé API et les détails de service appropriés. Le flux de travail n8n échouera sans ces identifiants.

  4. Tester le Déclencheur n8n : Cliquez sur le nœud déclencheur n8n 'Lors du clic sur ‘Tester le flux de travail’’ et exécutez le flux de travail une fois pour vérifier que les deux chemins d'extraction parallèles s'exécutent avec succès et retournent les données textuelles extraites.

Détails du nœud

Lors du clic sur ‘Tester le flux de travail’ (Déclencheur Manuel) : Le point de déclenchement initial de ce flux de travail n8n de démonstration. Il lance simultanément les deux chemins de traitement de documents.
HTML vers PDF : Un nœud n8n spécialisé qui utilise l'API CustomJS pour transformer une chaîne de code HTML (

Hello World

) en un fichier binaire PDF, qui est ensuite disponible pour les nœuds n8n en aval.
Convertir PDF en Texte : Cette instance du nœud n8n PdfToText est configurée pour prendre la sortie binaire de l'étape 'HTML vers PDF' précédente et extraire tout le contenu textuel brut. Il traite les données internes générées au sein de ce flux de travail n8n.
Code : Ce nœud n8n sert de générateur d'entrée dynamique, créant spécifiquement une charge utile JSON contenant le chemin URL vers un document PDF externe. Cela prépare l'entrée requise par le nœud n8n suivant.

  • Convertir PDF en Texte1 : Cette seconde instance du nœud n8n PdfToText est configurée pour utiliser une ressource de type 'url'. Elle récupère dynamiquement le fichier PDF situé à l'emplacement spécifié (={{ $json.path }}) et extrait les informations textuelles directement depuis la source distante. Cela démontre la flexibilité dans la conception de votre flux de travail n8n.

Workflows n8n associés

Gratuit

Nœuds: 4 Nœuds
Mis à jour: Décembre 26 2025
Voir tout
Créé par

En vedette*