File Extractor
Le File Extractor extrait le contenu de fichiers hétérogènes : PDF (natifs ou scannés), images (JPG, PNG, TIFF) et documents Office (DOCX, XLSX, PPTX). Il détecte la mise en page et produit un contenu structuré prêt à être analysé.
Dans cette page
Objectif — à quoi ça sert
Le File Extractor extrait le contenu de fichiers hétérogènes : PDF (natifs ou scannés), images (JPG, PNG, TIFF) et documents Office (DOCX, XLSX, PPTX). Il détecte la mise en page et produit un contenu structuré prêt à être analysé.
Idéal pour le traitement de commandes, l’audit documentaire, les présentations fournisseurs ou les PDF techniques.
- Multi-format : PDF, images, Word, Excel, PowerPoint.
- Détection de mise en page (layout), reconnaissance de tableaux, listes et sections.
- Import par upload (drag & drop), par URL de fichier ou à la demande du crawler.
Utilisation — comment s'en servir
L’extraction de fichiers se lance depuis le frontoffice, dans Extraction → Manuelle, via l’onglet « Fichier URL » ou « Upload ». On dépose le fichier, on active la synthèse et on démarre.
Côté frontoffice
Frontoffice → Extraction → Manuelle (source « Fichier URL » / « Upload »)
Supporté aussi en API : POST /upload avec le fichier, ou par URL depuis le crawler.
Déposer le fichier
Dans « Extraction Manuelle », choisissez « Fichier URL » (un lien vers le PDF) ou « Upload » (glisser-déposer le fichier).
Configurer la synthèse
Activez la synthèse et choisissez le mode Faits ou Données selon le résultat attendu.
Démarrer et récupérer
« Démarrer » lance le job ; la barre de progression suit l’extraction en temps réel, puis le résultat s’affiche (voir, copier, télécharger).
À l'écran