Web Extractor
Le Web Extractor capture le contenu de pages web statiques et dynamiques (rendues en JavaScript, Single Page Apps). Il navigue dans la page, récupère le texte, les tableaux et la structure pour les transformer en données exploitables — même quand le HTML n’est pas lisible directement.
Dans cette page
Objectif — à quoi ça sert
Le Web Extractor capture le contenu de pages web statiques et dynamiques (rendues en JavaScript, Single Page Apps). Il navigue dans la page, récupère le texte, les tableaux et la structure pour les transformer en données exploitables — même quand le HTML n’est pas lisible directement.
Parfait pour indexer une page produit, un article, une documentation ou un site référencé par le crawler.
- Rendu complet : les contenus chargés par JavaScript sont bien capturés.
- Texte, tableaux et structure : le format de sortie est harmonisé et réutilisable.
- Fonctionne pour une page isolée ou dans la continuité d’un crawler.
Utilisation — comment s'en servir
L’extraction web se lance depuis le frontoffice, dans Extraction → Manuelle. On sélectionne la source « Web », on colle l’URL, on active la synthèse et on démarre.
Côté frontoffice
Frontoffice → Extraction → Manuelle (source « Web »)
Le point d’entrée quotidien pour extraire une page web à la volée.
Choisir la source Web
Dans « Extraction Manuelle », cliquez sur l’onglet « Web » et collez l’URL de la page.
Configurer la synthèse
Activez la synthèse et choisissez le modèle LLM ; réglez le mode Faits ou Données.
Démarrer
Cliquez sur « Démarrer » : le job s’exécute et le résultat est consultable (voir, copier, télécharger).
À l'écran