N nooloom · guide d'utilisation
Capture de contenu web

Web Extractor

Le Web Extractor capture le contenu de pages web statiques et dynamiques (rendues en JavaScript, Single Page Apps). Il navigue dans la page, récupère le texte, les tableaux et la structure pour les transformer en données exploitables — même quand le HTML n’est pas lisible directement.

En un coup d'œil
Frontoffice : Frontoffice → Extraction → Manuelle (source « Web »)

Objectif — à quoi ça sert

Le Web Extractor capture le contenu de pages web statiques et dynamiques (rendues en JavaScript, Single Page Apps). Il navigue dans la page, récupère le texte, les tableaux et la structure pour les transformer en données exploitables — même quand le HTML n’est pas lisible directement.

Quand l'utiliser ?

Parfait pour indexer une page produit, un article, une documentation ou un site référencé par le crawler.

  • Rendu complet : les contenus chargés par JavaScript sont bien capturés.
  • Texte, tableaux et structure : le format de sortie est harmonisé et réutilisable.
  • Fonctionne pour une page isolée ou dans la continuité d’un crawler.

Utilisation — comment s'en servir

L’extraction web se lance depuis le frontoffice, dans Extraction → Manuelle. On sélectionne la source « Web », on colle l’URL, on active la synthèse et on démarre.

Côté frontoffice

Frontoffice → Extraction → Manuelle (source « Web »)

Le point d’entrée quotidien pour extraire une page web à la volée.

Choisir la source Web

Dans « Extraction Manuelle », cliquez sur l’onglet « Web » et collez l’URL de la page.

Configurer la synthèse

Activez la synthèse et choisissez le modèle LLM ; réglez le mode Faits ou Données.

Démarrer

Cliquez sur « Démarrer » : le job s’exécute et le résultat est consultable (voir, copier, télécharger).

À l'écran

app.novaretail.example/…/workflow-generic
Extraction manuelle (source Web)
L’écran « Extraction Manuelle » : à l’étape 1 « Source », choisissez « Web », « Fichier URL » ou « Upload » ; à l’étape 2, réglez la synthèse (mode Faits ou Données) ; à l’étape 3, activez éventuellement le router. Le cadre rouge 1 entoure le titre, les encarts 1-2-3 décrivent les étapes du formulaire.
app.novaretail.example/backoffice/crawlers/…
Crawler (source web multi-pages)
Pour une extraction multi-pages, le crawler confie chaque page retenue au Web Extractor.