N nooloom · guide d'utilisation
Exploration intelligente du web

Crawler

Le Crawler explore le web à votre place. Il part d’une URL de départ, parcourt les pages, suit les liens sur plusieurs niveaux de profondeur et score chaque ressource avec l’IA pour ne retenir que ce qui compte vraiment. C’est le point d’entrée de toute chaîne d’acquisition de contenu.

En un coup d'œil
Backoffice : Backoffice → Acquisition → Crawlers / Planifications

Objectif — à quoi ça sert

Le Crawler explore le web à votre place. Il part d’une URL de départ, parcourt les pages, suit les liens sur plusieurs niveaux de profondeur et score chaque ressource avec l’IA pour ne retenir que ce qui compte vraiment. C’est le point d’entrée de toute chaîne d’acquisition de contenu.

Quand l'utiliser ?

Idéal pour la veille concurrentielle, l’indexation d’un site, la collecte de fiches fournisseurs ou la documentation interne.

  • Découvre automatiquement des ressources liées à votre sujet, sans les lister à la main.
  • Évalue la pertinence de chaque page (scoring IA) avant de décider de l’extraire.
  • Respecte robots.txt et limite le nombre de pages / la profondeur pour rester maître du périmètre.
  • Alimente ensuite les Web/File Extractors pour transformer les pages en connaissances.

Utilisation — comment s'en servir

Le Crawler se configure dans le backoffice, dans l’onglet Crawlers. Chaque crawler porte une URL de départ, un périmètre (pages max, profondeur, délai) et un prompt d’évaluation qui guide le scoring. Une fois créé, vous pouvez le lancer manuellement ou le planifier en cron.

Côté backoffice

Backoffice → Acquisition → Crawlers / Planifications

C’est ici que vous définissez la source, le périmètre et le prompt de scoring.

Créer un crawler

Backoffice → Acquisition → Crawlers → « Créer un crawler ». Donnez-lui un nom, l’URL de départ et le prompt d’évaluation.

Régler le périmètre

Limitez maxPages, maxDepth et sameDomain pour borner l’exploration.

Lancer ou planifier

Lancez-le à la demande, ou créez une planification cron depuis l’onglet « Planifications ».

À l'écran

app.novaretail.example/backoffice/crawlers
Liste des crawlers
La liste des crawlers de l’organisation (Nova Retail) — le compteur indique les exécutions passées.
app.novaretail.example/backoffice/crawlers/…
Édition d’un crawler
La configuration d’un crawler : URL de départ, prompt d’évaluation et périmètre de crawl. Le cadre rouge 2 pointe l’URL de départ, le 3 le prompt d’évaluation.
app.novaretail.example/backoffice/schedules
Planifications cron
Les planifications cron : « Veille concurrentielle » (tous les jours à 6h, 96 exécutions) et « Catalogue fournisseurs » (hebdomadaire le lundi à 2h, 12 exécutions).